A Unified Turkic Idiom Understanding Benchmark: Idiom Detection and Semantic Retrieval Across Five Turkic Languages
2nd Workshop on Natural Language Processing for Turkic Languages, SIGTURK 2026, Rabat, Fas, 29 Mart 2026, ss.38-51, (Tam Metin Bildiri)
- Yayın Türü: Bildiri / Tam Metin Bildiri
- Doi Numarası: 10.18653/v1/2026.sigturk-1.4
- Basıldığı Şehir: Rabat
- Basıldığı Ülke: Fas
- Sayfa Sayıları: ss.38-51
- Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
- Boğaziçi Üniversitesi Adresli: Evet
Özet
Idiomatic expressions are culturally grounded, semantically opaque, and challenging for multilingual natural language processing systems. Despite the large speaker population of Turkic languages, resources for monolingual and cross-lingual idiom understanding remain scarce. We introduce the first unified benchmark for idiom understanding across Turkish, Azerbaijani, Turkmen, Gagauz, and Uzbek, featuring token-level idiom span annotations. We evaluate seven models for idiom identification and nine embedding models for semantic retrieval under multiple fine-tuning schemes. Our benchmark enables systematic analysis of how idiomatic meanings are shared, transformed, or diverge across Turkic languages.