TR-MTEB: A comprehensive benchmark and embedding model suite for Turkish sentence representations
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye
Tezin Onay Tarihi: 2025
Tezin Dili: İngilizce
Öğrenci: MEHMET SELMAN BAYSAN
Danışman: TUNGA GÜNGÖR
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bu çalışmada, Türkçe cümle temsil modellerini değerlendirmek üzere tasarlanmış, görev çeşitliliği yüksek ilk büyük ölçekli ölçüt seti olan TR-MTEB geliştirilmiştir. Sınıflandırma, kümeleme, ikili sınıflandırma, bilgi getirme, iki dilli metin eşleştirme ve anlamsal metin benzerliği olmak üzere altı temel görevi kapsayan TR-MTEB, hem özgün Türkçe veri kümelerini hem de özenle seçilmiş makine çevirisi kaynaklarını içeren toplam 26 yüksek kaliteli veri kümesini bir araya getirmektedir. Model geliştirmeyi desteklemek amacıyla, 50'nin üzerinde açık veri kümesinden türetilmiş ve anlamsal uyumu sağlamak için çok aşamalı filtreleme uygulanmış 34,2 milyon cümle çiftinden oluşan bir Türkçe cümle korpusu oluşturulmuştur.Bu derlem kullanılarak, \texttt{BERTurk} tabanlı iki tek dilli Türkçe cümle temsil modeli eğitilmiştir: biri Cached-MNRL yöntemiyle karşıtlık temelli ön eğitim ile hazırlanmış, diğeri ise TR-MTEB görevleri üzerinde ince ayar yapılmış bir modeldir. Bu modeller, çok dilli karşılaştırmalı modellerden çok daha az veri ve hesaplama kaynağıyla eğitilmelerine rağmen, tüm görevlerde Türkçe BERT tabanlı modeli geride bırakmış; özellikle sınıflandırma ve benzerlik görevlerinde benzer performans sergilemiş, ancak çapraz dilli hizalama konusunda mevcut sınırlamaları da ortaya koymuştur. Tüm veri kümeleri, modeller ve kodlar açık olarak paylaşılmış olup, Türkçe doğal dil işleme ve düşük kaynaklı dil temsilleri alanında yeniden üretilebilirliği ve ileri araştırmaları teşvik etmeyi amaçlamaktadır.