Deep learning-based preprocessing tools for Turkish natural language processing


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: İngilizce

Öğrenci: BUSE AK

Danışman: TUNGA GÜNGÖR

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Türkçede etkili doğal dil işleme (NLP) uygulamalarına olan talep artmaya devam ettikçe Türkçeye özel metin ön işleme araçlarına olan ihtiyaç da artıyor. Geliştirilen metin ön işleme araçları, ham verilerden bilgi çıkarılmasında önemli bir rol oynamaktadır. Herhangi bir doğal dil uygulamasının ilk adımı olan bu araçlar, metin özetleme, soru cevaplama ve makine çevirisi gibi karmaşık görevlerin verimliliğini artırır. Bu tezde Türkçe için özel olarak tasarlanmış derin öğrenme tabanlı ön işleme araçlarının geliştirilmesi ve değerlendirilmesi anlatılmaktadır. Geliştirilen derin öğrenmeye dayalı araçlar, Türkçe için mevcut kural tabanlı yaklaşımların sorunlarını ele almaktadır. Bu tezde, Uzun Kısa Süreli Bellek (LSTM) ağları ve transformers ile ön işleme araçları geliştirilmiştir. Bu mimarilerin en büyük avantajı doğal dilin sıralı akışına etkili bir şekilde uyum sağlayabilmeleridir. Bu tezde, bir ¨on işlemenin olası bileşenleri olarak tokenizasyon, cümle bölme, Türkçe karakterleştirme, sesli harf restorasyonu, part-of-speech(POS) etiketleme, yazım düzeltme ve morfolojik analiz-belirsizliği giderme gibi Türkçe ön işleme görevlerinde LSTM'lerin ve transformers mimarilerinin performansı detaylıca incelenmiştir.