Improving text classification performance with the analysis of lexical dependencies and class-based feature selection


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2010

Tezin Dili: İngilizce

Öğrenci: LEVENT ÖZGÜR

Danışman: TUNGA GÜNGÖR

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Bu tezde, metin sınıflandırma problemi için öznitelik çıkarımı ve öznitelik seçimi konuları üzerine çok yönlü çözümlemeler yapılmaktadır. Sınıflandırmanın çözümünde daha küçük boyutta öznitelik çözüm vektörü kullanarak daha başarılı sonuçlara ulaşmak hedeflenmiştir. Öznitelik çıkarımı konusunda, 36 değişik sözcüksel bağımlılık incelenmiş ve geleneksel sözcük-torbası dizisine en uygun halde eklenmiştir. Öznitelik seçimi ise iki aşamalıdır. İlk aşamada budama uygulaması yapılmış ve veri kümesi özelliklerine ve öznitelik çeşitlerine (sözcük, bağımlılık ve bağımlılık bileşenleri) göre en uygun budama düzeyleri bulunmuştur. İkinci adımda veri kümesi tabanlı ve sınıf tabanlı öznitelik seçimi yaklaşımları karşılaştırılmış; sonrasında budama işlemi, en başarılı olduğu tespit edilen sınıf tabanlı öznitelik seçimi ile geliştirilmiştir. Tezin son deneyinde; en başarılı bağımlılık tipleri, iki aşamalı öznitelik seçimi ile beraber kullanılmaktadır.Başarı değerlendirmesi için, metin sınıflandırma problemlerinde kullanımı herkesçe kabul edilen iki ölçüm ve ek olarak üç değişik önemlilik testi uygulanmaktadır. Belirtilen değerlendirme ölçütlerine göre, önerilen her yeni yöntem, başarıyı önemli ölçüde arttırmaktadır. Bu duruma paralel olarak; sözcüksel bağımlılıkların en uygun kullanımını, iki aşamalı öznitelik seçiminin en başarılı düzeniyle birleştirdiğimiz son deney, genel olarak en başarılı sonucu vermektedir. Bu çalışma, bilgimiz dahilinde, metin sınıflandırmada ve genelde metin temelli problemlerde sözcüksel bağımlılıkların ve iki aşamalı öznitelik seçiminin çözümlemesi ve eniyilenmesi ile ilgili ilk detaylı çalışmadır.