A corpus-based concatenative speech synthesis system for Turkish


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Boğaziçi Üniversitesi, FEN BİLİMLERİ ENSTİTÜSÜ, FEN BİLİMLERİ ENSTİTÜSÜ, Türkiye

Tezin Onay Tarihi: 2004

Tezin Dili: İngilizce

Öğrenci: HAŞİM SAK

Danışman: TUNGA GÜNGÖR

Özet:

ÖZET TÜRKÇE İÇİN KORPUS TABANLI BIRLEŞTIRMELI KONUŞMA SENTEZLEME SİSTEMİ Konuşma sentezi yazılı metnin makine tarafından üretilmiş sentetik konuşmaya çevrilmesi işlemidir. Birleştirmeli konuşma sentezleme sistemleri sentezlemeyi daha önceden kaydedilmiş ses parçalarını birleştirerek yapar. Korpus tabanlı metotlar (parça seçme) birleştirilecek ses parçalarım seçmek için geniş bir ses parçası veritabanı kul lanırlar. Bu tez kulağa doğal insan sesi gibi gelen, anlaşılabilir korpus tabanlı bir leştirmeli bir konuşma sentezleme sistemi geliştirmek için harcadığımız emeğin bir sonucudur. Tasarlanan sistem metin normalizasyonu, metin analizi ve isteğe bağlı kul lanılan nakledilen vurgu ön birimlerini içerir. Parça seçme algoritması veritabanmdaki parçaların oluşturduğu ağda Viterbi algoritması ile en iyi patikanın bulunmasına daya nır. Arka uç harmonik kodlama ses modeli ve üst üste getirip ekleme yöntemini kul lanarak ses dalga formunu oluşturur. Bu çalışmada farklı parça büyüklükleri, örneğin heceler, fonemler ve yarım fonemler denenmiştir. Konuşma korpusu tasarımı ve kayıt metinlerinin seçilmesinde kullanılan metotlar açıklanmıştır. Sesi modellemek ve ses dal gası oluşturmak için harmonik kodlama yöntemine dayanan bir ses modeli geliştirilmiş tir. Harmonik kodlama, ses veritabanmı 3 kat sıkıştırmayı sağlamıştır. Parça seçmede spektral süreksizlik ve vurgusal uyumsuzluk objektif maliyet ölçekleri kullanan Viterbi algoritması yazılmıştır. Türkçe fonem seti oluşturulmuştur. Türkçe için metinden foneme çevrim üzerinde çalışılmış ve de kök kelimelerin okunuşlarını içeren bir sözlük hazırlanmıştır. Basit bir metin normalizasyon modülü yazılmıştır. Parça seçmede vur gunun önemini araştırmak için nakledilen vurgu kullanan ve vurgu modeli kullanmayan sistemler karşılaştırılmıştır. Sentetik konuşma kalitesini değerlendirmek için öznel din leme testleri yapılmıştır. Sonuç olarak MOS benzeri bir derecelendirmede 4.2 puan alan bir Türkçe konuşma sentezleme sistemi geliştirilmiştir.