Bulanık çıkarsama sistemleri ile veri madenciliği yöntemlerinin sınıflama performansının benzetim çalışması ile karşılaştırılması ve sağlık alanında uygulanması
Tezin Türü: Yüksek Lisans
Tezin Yürütüldüğü Kurum: Ankara Üniversitesi, Sağlık Bilimleri Enstitüsü, BİYOİSTATİSTİK ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2017
Tezin Dili: Türkçe
Öğrenci: İREM KAR
Danışman: SERDAL KENAN KÖSE
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Sınıflandırma, veri setinde her gözlem için hedef sınıfı doğru tahmin etmeyi amaçlayan veri madenciliğinin en önemli araştırma konularından birisidir. Sınıflandırma işleminde sistemin eğitim verisi üzerinden öğrenmesi ve benzer bir veri seti ile karşılaşması halinde o verinin ait olacağı sınıfı tahmin etmesi sağlanır. Bilgisayar sistemlerinde öğrenme iki şekilde olabilir: veriden öğrenme ve uzmandan öğrenme. Elde veri olması halinde makine öğrenmesi yöntemleri ile gerekli çıkarsamaları yapmak olası iken, elde veri olmadığı durumlarda uzman görüşünden yararlanan yöntemlere başvurulmalıdır. Bu tez çalışmasında uzmandan öğrenen bulanık çıkarsama sistemleri ile veriden öğrenen veri madenciliği yöntemlerinin farklı örnek büyüklüklerinde (100, 250, 500, 1000) sınıflandırma performansları karşılaştırılmıştır. Karşılaştırmada kullanılan veri madenciliği algoritmaları literatürde sıklıkla karşılaşılan sınıflandırıcılar olan, Yapay Sinir Ağları, Random Forest ve Destek Vektör Makinesi'dir. Değerlendirmelerde, sınıflandırma performans ölçütleri olarak doğruluk, kesinlik, duyarlılık ve F-ölçütü kullanılmıştır. Bu çalışmada, University of California Irvine (UCI) makine öğrenmesi veritabanında yer alan kalp hastalığı verisinin özellikleri korunarak değişken önemine göre belirlenen 6 bağımsız değişken (cinsiyet, göğüs ağrı tipi, maksimum kalp atım hızı, egzersizin neden olduğu anjin, oldpeak ve ana damar sayısı) için üretilen veriler kullanılmıştır. Çalışma sonucunda, veri madenciliği yöntemlerinden biri olan Yapay Sinir Ağları ve Bulanık Çıkarsama Sistemleri benzer sonuçlar vermiştir ve Random Forest ve Destek Vektör Makinesi yöntemlerine göre daha iyi sınıflama performansı göstermişlerdir.