Yazılım geliştirme süreçlerinde büyük dil modelleri ile hata şiddetinin tahmin edilmesi


Tezin Türü: Yüksek Lisans

Tezin Yürütüldüğü Kurum: Kocaeli Üniversitesi, Fen Bilimleri Enstitüsü, YAZILIM MÜHENDİSLİĞİ ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2026

Tezin Dili: Türkçe

Öğrenci: REŞİT DEMİR

Danışman: Hakan Gündüz

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Yazılım projelerinin karmaşıklığı arttıkça, hataların manuel olarak sınıflandırılması zaman alıcı bir hal alıyor ve hata yapma riskini önemli ölçüde arttırmaktadır. Hata şiddetinin doğru tahmini, bakım maliyetlerinin düşürülmesi ve kaynakların verimli kullanımı açısından kritik önem taşımaktadır. Bu çalışmada, yazılım hata şiddetini otomatik olarak belirlemek amacıyla büyük dil modelleri ve statik kod metriklerini birleştiren hibrit bir yöntem geliştirilmiştir. Bu araştırmada, gerçek dünya yazılım projelerinden elde edilen verilerden oluşturulan eğitim veri seti ve bağımsız test veri seti kullanılmıştır. Metinsel verilerin işlenmesinde TF-IDF ve CodeBERT tabanlı vektör temsillerinden, yapısal analizde ise karmaşıklık ve bakım yapılabilirlik gibi statik kod metriklerinden yararlanılmıştır. Veri setindeki sınıf dengesizliğini gidermek amacıyla "Critical" sınıfı "High" sınıfı ile birleştirilerek üçlü bir sınıflandırma yapısı oluşturulmuştur. Lojistik Regresyon, Destek Vektör Makineleri ve Gradient Boosting algoritmalarını içeren çok katmanlı bir topluluk (ensemble) mimarisi kurulmuştur. Deneysel analizler sonucunda, metin ve kod özelliklerinin birlikte kullanıldığı hibrit yaklaşımın, yalnızca sayısal metriklere dayalı temel çizgi modele kıyasla Macro-F1 değerini 0,482'den 0,557'ye yükselttiği ve en iyi yapılandırmada (Ensemble_Tuned) Macro-F1'in 0,693 seviyesine ulaştığı gözlemlenmiştir. Özellikle yüksek öncelikli hataların tespitinde önerilen yöntemin etkinliği ortaya konulmuştur. Sonuç olarak bu tez, hata şiddeti tahmini probleminde büyük dil modeli temsilleri ile statik kod metriklerini birleştiren pratik bir hibrit çerçeve sunmaktadır. Çalışmanın katkıları, gerçek dünya veri setleri üzerinde çok kaynaklı özellik öznitelik birleştirme (füzyon) yöntemi ile hata şiddetinin tahmin edilmesi, sınıf dengesizliğini gidermeye yönelik etiket birleştirme stratejisinin uygulanması, farklı algoritmaları bütünleştiren ensemble mimarisiyle yüksek öncelikli hataların tespit performansının artırılması şeklinde özetlenebilir. Bu yaklaşımın, yazılım bakım süreçlerinde hata önceliklendirme yükünü azaltarak daha hızlı ve tutarlı karar mekanizmalarına zemin hazırlayacağı öngörülmektedir.