Makine öğrenmesi yöntemleriyle Türkçe'deki farklı aksanların sınıflandırılması
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Kocaeli Üniversitesi, Fen Bilimleri Enstitüsü, YAZILIM MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2025
Tezin Dili: Türkçe
Öğrenci: SÜMEYRA BAŞ
Danışman: Hakan Gündüz
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Bütün verilerin dijital ortamlarda tutulmasıyla birlikte, sesli iletişim araçlarının kullanımı önemli hâle gelmiştir. Ses verilerinin analizi ve işlenmesi, teknolojik gelişmelerin önemli bir aşamasıdır. Farklı aksanların tespitine yönelik çalışmalar, bu alandaki araştırmalar arasında dikkat çekmektedir. Ses verileri, makine öğrenmesi yöntemleri ile analiz edilerek konuşmanın metne doğru aktarılması sağlanabilir. Ses dalgaları işlenerek anlamlı öznitelikler çıkarılmaktadır. Bu öznitelikler üzerinde öğrenme algoritmaları ile konuşmanın metne dönüştürülmesi sağlanmaktadır. Bu çalışmada, Türkçe konuşma verileri kullanılarak Karadeniz, Ege, Doğu Anadolu ve İç Anadolu aksanının tespiti hedeflenmiştir. Ses kayıtları TRT yayınları, YouTube videoları, Spotify podcast'leri gibi Türkçe aksanlı yayın yapan dijital ortamlardan toplanmıştır. Ses dosyaları sessizlik tespiti kullanılarak segmentlere ayrılmış ve WAV formatında kaydedilmiştir. Python kütüphaneleri ile sessizlik eşiği ve minimum sessizlik süresi gibi parametreler tanımlanarak segmentasyon yapılmıştır. 2.455 adet ses verisi işlenerek MFCC öznitelikleri çıkartılmıştır. Ayrıca, fbank ve logfbank fonksiyonları ile de model doğrulukları karşılaştırılmıştır. Farklı makine öğrenmesi algoritmalarını kullanarak Türkçe aksan sınıflandırması gerçekleştirilmiştir. Ses verileri ile RF, KNN ve SVM ile modeller oluşturulmuştur. Veri seti, eğitim ve test setlerine bölünerek, modeller hiperparametrelerle eğitilmiş ve doğruluk oranları hesaplanmıştır. Tüm modellerde doğruluk oranı, sınıflandırma raporu ve karışıklık matrisi ile sonuçlar detaylı şekilde sunulmuştur. Analizler sonucunda, RF modeli %91,44, KNN modeli %95,92 ve SVM modeli %96,74 doğruluk oranlarına ulaşmıştır. Sonuçlar, aksan tespiti konusunda SVM modelinin en iyi performansı sergilediğini göstermiştir. Bu çalışma, aksan tespitine yönelik geliştirilen modellerin doğruluk oranlarını artırmak adına bir adımdır. İlerleyen süreçte, makine öğrenmesi modelleri üzerinde detaylı parametre optimizasyonları yapılması ve nitelik seçme yöntemlerinin geliştirilmesi planlanmaktadır.