Domain-aware conversational open question answering for resource-constrained languages


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: İngilizce

Öğrenci: EMRAH BUDUR

Danışman: TUNGA GÜNGÖR

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Çok sayıda modern konuşma uygulamasının pazara girişi sadece kullanıcıların konuşmalı etkileşimler aracılığıyla bilgi arama talebini artırmakla kalmamış aynı zamanda Yapay Zeka destekli Sohbet Uygulamaları alanındaki araştırmalardaki yeniliklere de ivme kazandırmıştır. Alanında önemli ilerlemelere rağmen, bu ilerlemeler genellikle İngilizce dilinde sınırlı kalmıştır. Bu kısıtlama, gelişmiş modellerin büyük miktarda etiketlenmiş veri kümesine ihtiyaç duymasından kaynaklanmaktadır ve bu da sınırlı kaynaklara sahip dilleri göz ardı etmektedir. Bu tezde üç adımlı sistemli bir yaklaşımı takip ederek, Türkçe gibi kaynak kısıtlı dillerde güçlü Yapay Zeka destekli SSC sistemleri oluşturmanın zorluklarına değinmeyi, Yapay Zeka destekli Serbest Soru Cevap Sistemler (SSC) konusunda İngilizce ve kaynak kısıtlı diller arasındaki mesafeyi kapatmayı amaçlıyoruz. İlk adım olarak, İngilizce Doğal Dil Çıkarımı (DDÇ) veri kümelerini Türkçe'ye çevirmek için sinirsel makine çeviri (SMÇ) araçlarını kullanarak kaynak kısıtlı diller için sentetik veri kümeleri oluşturmak amacıyla uygun maliyetli bir yöntem öneriyoruz. İkinci adımda bu yaklaşımı Soru Cevaplama (QA) alanına genişleterek, sadece birkaç yüz etiketli örnekle bile kaynak kısıtlı diller için Serbest Soru Cevaplamanın (SSC) mümkün olduğunu gösteriyoruz. Son olarak, karşılıklı konuşma sinyallerini ve DDÇ modeli ile güçlendirilmiş bir Alan Dışı (OOD) algılayıcıyı da dahil ederek, gerçek dünya kullanım senaryolarıyla daha iyi uyum sağlayan bir Yapay Zeka destekli SSC sistemi olan BİRİ'yi geliştiriyoruz.