A comprehensive analysis of using wordnet, part-of-speech tagging, and word sense disambiguation in text categorization


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2012

Tezin Dili: İngilizce

Öğrenci: KEREM ÇELİK

Danışman: TUNGA GÜNGÖR

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Dijital ortamdaki metinler ve yapay öğrenme tekniklerindeki büyük artış, metinleri otomatik sınıflandırma çalışmalarının artmasına neden oldu. Metin sınıflandırma, temel olarak, öğrenme modellerini kullanarak, daha önceden görülmemiş dökümanları önceden belirlenmiş sınıflara atamaktır. Geleneksel metin sınıflandırma, herbir dökümanı, istatistiksel olarak inceleyerek belirli bir dizi haline getirmeyi hedefler ve ardından, metinleri sınıflandırmak için yapay öğrenme tekniklerini kullanır.Bu tez kapsamında, geleneksel metin sınıflandırma yöntemlerine ek olarak, metinlerde bulunan kelimeleri türlerine gore gruplandırıyoruz ve her bir türün sınıflandırma başarısındaki katkısını hem ayrı ayrı hem beraberce değerlendiriyoruz.Bunların yanı sıra, metinlere WordNet kullanarak, anlamsal özniteliklerden(semantic features) olan; eş anlamı(synonym), genel anlamı(hypernym), özel anlamı(hyponym), parça anlamı(meronyms) ve konuyu(topic) ekliyoruz. Bu sayede metinlere anlam(semantic) eklemiş oluyoruz. Bu aşamada yaşanılacak sorunlardan bir tanesi, bu anlamlar için anlam belirsizliği(ambiguity) oluşmasıydı. Bu problemi geliştirdiğimiz bir yöntem ile ortadan kaldırmaya çalıştıkBu tezdeki temel amacımız, anlamsal özniteliklerin metin sınıflandırmaya olan katkılarını araştırmak ve bu sayede sınıflandırmadaki doğruluk başarısını arttırmaktır.