TR-MTEB: A comprehensive benchmark and embedding model suite for Turkish sentence representations


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2025

Tezin Dili: İngilizce

Öğrenci: MEHMET SELMAN BAYSAN

Danışman: TUNGA GÜNGÖR

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu çalışmada, Türkçe cümle temsil modellerini değerlendirmek üzere tasarlanmış, görev çeşitliliği yüksek ilk büyük ölçekli ölçüt seti olan TR-MTEB geliştirilmiştir. Sınıflandırma, kümeleme, ikili sınıflandırma, bilgi getirme, iki dilli metin eşleştirme ve anlamsal metin benzerliği olmak üzere altı temel görevi kapsayan TR-MTEB, hem özgün Türkçe veri kümelerini hem de özenle seçilmiş makine çevirisi kaynaklarını içeren toplam 26 yüksek kaliteli veri kümesini bir araya getirmektedir. Model geliştirmeyi desteklemek amacıyla, 50'nin üzerinde açık veri kümesinden türetilmiş ve anlamsal uyumu sağlamak için çok aşamalı filtreleme uygulanmış 34,2 milyon cümle çiftinden oluşan bir Türkçe cümle korpusu oluşturulmuştur.Bu derlem kullanılarak, \texttt{BERTurk} tabanlı iki tek dilli Türkçe cümle temsil modeli eğitilmiştir: biri Cached-MNRL yöntemiyle karşıtlık temelli ön eğitim ile hazırlanmış, diğeri ise TR-MTEB görevleri üzerinde ince ayar yapılmış bir modeldir. Bu modeller, çok dilli karşılaştırmalı modellerden çok daha az veri ve hesaplama kaynağıyla eğitilmelerine rağmen, tüm görevlerde Türkçe BERT tabanlı modeli geride bırakmış; özellikle sınıflandırma ve benzerlik görevlerinde benzer performans sergilemiş, ancak çapraz dilli hizalama konusunda mevcut sınırlamaları da ortaya koymuştur. Tüm veri kümeleri, modeller ve kodlar açık olarak paylaşılmış olup, Türkçe doğal dil işleme ve düşük kaynaklı dil temsilleri alanında yeniden üretilebilirliği ve ileri araştırmaları teşvik etmeyi amaçlamaktadır.