Veri madenciliğinde hibrit model yaklaşımı
Tezin Türü: Doktora
Tezin Yürütüldüğü Kurum: Ankara Üniversitesi, Sağlık Bilimleri Enstitüsü, BİYOİSTATİSTİK VE TIP BİLİŞİMİ ANABİLİM DALI, Türkiye
Tezin Onay Tarihi: 2021
Tezin Dili: Türkçe
Öğrenci: BATUHAN BAKIRARAR
Danışman: ATİLLA HALİL ELHAN
Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu
Özet:Son yıllarda, tıp disiplinlerinde toplanan veri miktarı giderek artmaktadır. Dijital teknolojideki gelişmeler, toplanan verilerin boyutu, karmaşıklığı ve miktarında, yani tıbbi raporlarda ve ilgili görüntülerde benzeri görülmemiş bir büyümeye yol açmıştır. Dünya çapında her yıl milyarlarca sağlık kaydı işlemi yapılmaya başlanmıştır. Özellikle, sinir ağları, istatistiksel modelleme, evrimsel algoritmalar ve görselleştirme araçları gibi veri madenciliği algoritmalarındaki son gelişmeler, her türlü ham verinin üst düzey bilgiye dönüştürülmesini mümkün kılmıştır. Ancak asıl sorun, her yöntemin veri yapısı, şekli ve geçerliliği ile ilgili kendi yaklaşımına sahip olmasıdır. Bu sınırlama sınıflandırma sistemlerinin performansını etkiler. Sonuç olarak, hibrit bir veri madenciliği yaklaşımına duyulan ihtiyaç, veri madenciliği topluluğu tarafından kabul görmektedir ve bu konuda son yıllarda yapılan çalışma sayısı gittikçe artmaktadır. Hibrit veri madenciliği, her bir tekniğin gücünü kullanmak ve birbirlerinin zayıflıklarını telafi etmek için çeşitli veri madenciliği tekniklerinin etkili bir kombinasyonu olarak tanımlanmaktadır. Bu çalışmanın amacı, son teknoloji veri madenciliği algoritmalarını ve uygulamalarını sunmak ve tıbbi verilerin kümelenmesi ve sınıflandırılması için yeni bir hibrit veri madenciliği yaklaşımı önermektir. Ayrıca çalışmada, denetimli ve denetimsiz öğrenme yöntemlerinin dengeli ve dengesiz veri setlerinde, farklı örneklem büyüklüklerinde ve farklı değişkenler arası ilişkiler olması durumunda performans ölçütlerinin hesaplanması ve bu ölçütlerin hibrit modelden elde edilen ölçütler ile karşılaştırılması amaçlanmıştır. Çalışmada çeşitli senaryolar baz alınarak üretilen simüle veri setleri ve UCI veri tabanından alınan hepatit ve meme kanseri veri setleri kullanılmıştır. Sık kullanılan ve veri setlerinde en iyi performansa sahip denetimli öğrenme algoritmalarından Karar Ağaçları, Destek Vektör Makinesi, Random Forest, Naive Bayes ve K-en yakın komşu'nun yanı sıra Lojistik Regresyon ve Yapay Sinir Ağları algoritmaları, denetimsiz öğrenme algoritmalarından ise K-ortalama kullanılmıştır. Ayrıca kullanılan denetimli ve denetimsiz öğrenme algoritmaları birleştirilerek hibrit modeller oluşturulmuştur. Simüle veri setlerinde bağımsız değişkenler arası korelasyon ve örneklem büyüklüğü arttıkça MKK değerlerinin de arttığı görülmüştür. Ayrıca dengesiz veri setlerinde bağımsız değişkenler arası korelasyon arttıkça düşük örnekleme sahip gruba ait performans ölçütlerinde de gözle görülür bir artış gözlemlenmiştir. Gerçek veri setleri incelendiğinde de durumun benzer olduğu görülmektedir. Anahtar Sözcükler: Hibrit Model, Veri Madenciliği, Performans Ölçütleri