Deep learning-based preprocessing tools for Turkish natural language processing
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye
Tezin Onay Tarihi: 2024
Tezin Dili: İngilizce
Öğrenci: BUSE AK
Danışman: TUNGA GÜNGÖR
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Türkçede etkili doğal dil işleme (NLP) uygulamalarına olan talep artmaya devam ettikçe Türkçeye özel metin ön işleme araçlarına olan ihtiyaç da artıyor. Geliştirilen metin ön işleme araçları, ham verilerden bilgi çıkarılmasında önemli bir rol oynamaktadır. Herhangi bir doğal dil uygulamasının ilk adımı olan bu araçlar, metin özetleme, soru cevaplama ve makine çevirisi gibi karmaşık görevlerin verimliliğini artırır. Bu tezde Türkçe için özel olarak tasarlanmış derin öğrenme tabanlı ön işleme araçlarının geliştirilmesi ve değerlendirilmesi anlatılmaktadır. Geliştirilen derin öğrenmeye dayalı araçlar, Türkçe için mevcut kural tabanlı yaklaşımların sorunlarını ele almaktadır. Bu tezde, Uzun Kısa Süreli Bellek (LSTM) ağları ve transformers ile ön işleme araçları geliştirilmiştir. Bu mimarilerin en büyük avantajı doğal dilin sıralı akışına etkili bir şekilde uyum sağlayabilmeleridir. Bu tezde, bir ¨on işlemenin olası bileşenleri olarak tokenizasyon, cümle bölme, Türkçe karakterleştirme, sesli harf restorasyonu, part-of-speech(POS) etiketleme, yazım düzeltme ve morfolojik analiz-belirsizliği giderme gibi Türkçe ön işleme görevlerinde LSTM'lerin ve transformers mimarilerinin performansı detaylıca incelenmiştir.