Ar-Ge ve tasarım merkezlerinin istatistiksel olarak değerlendirilmesi: Veri madenciliği yöntemleri ile hibrit karar verme


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Ankara Üniversitesi, Fen Bilimleri Enstitüsü, İSTATİSTİK ANABİLİM DALI, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: Türkçe

Öğrenci: GÖZDE ULU METİN

Danışman: Özlem Türkşen

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

Veri-bilgi keşfi sürecinde işlenmiş veriden anlamlı bilgilerin elde edilmesi amacıyla veri madenciliği yöntemleri uygulanır. Elde edilen bilgilere dayalı kararların alınması stratejik karar verme süreçlerinde önemli bir role sahiptir. Bu tez çalışmasında, karar verme süreçlerine istatistiksel bakış açısı kazandırmak amacıyla veri madenciliği sınıflandırma yöntemleri ile hibrit karar verme yaklaşımı önerilmiştir. Çalışmada yapılan tüm analizler için Python 3.11.3 programı ve kütüphaneleri kullanılmıştır. İşlenmiş veri setindeki değişkenlerin farklı önem derecelerine sahip olduğu göz önünde bulundurularak değişkenler Analitik Hiyerarşi Süreci (AHP) yöntemiyle subjektif olarak, ENTROPY ve CRITIC yöntemleriyle objektif olarak ağırlıklandırılmıştır. Ağırlıklandırılmış veri setine veri madenciliği sınıflandırma yöntemlerinden Lojistik Regresyon (Logistic Regression-LR) analizi, k-En Yakın Komşu (k-Nearest Neighbour-kNN) algoritması, Destek Vektör Makineleri (Support Vector Machines-SVM) ve Rastgele Orman (Random Forest-RF) algoritması uygulanmıştır. Sınıflandırma yöntemlerinin performansı, 5-kat çapraz doğrulama ile elde edilen doğruluk, kesinlik, duyarlılık, F1-Skor ve AUC performans ölçütleri kullanılarak hesaplanmıştır. Elde edilen değerlere göre sınıflandırma yöntemlerinin tercih sıralaması, çok ölçütlü karar verme yöntemleri (TOPSIS, COPRAS, CODAS, EDAS, MABAC ve GRA) ile belirlenmiştir. Çalışmada önerilen hibrit karar verme yaklaşımının uygulanabilirliğinin gösterilmesi amacıyla Ar-Ge ve Tasarım merkezlerine ait gerçek veri seti kullanılmıştır. Üç farklı yöntem ile ağırlıklandırılmış gerçek veri seti için RF algoritmasının öncelikli olarak tercih edilebilir olduğu sonucuna ulaşılmıştır. Sonuçların genelleştirilebilmesi amacıyla çeşitli senaryolar ile simülasyon çalışması yapılmıştır. Simülasyon ile üretilen veri setlerinde gerçek veri setine benzer olarak değişkenler, subjektif olarak ağırlıklandırılıp uygulamalar yapılmıştır. Önerilen hibrit karar verme yaklaşımına göre, hem gerçek veri seti hem de simülasyon uygulamaları için RF algoritmasının diğer veri madenciliği yöntemlerinden daha iyi sınıflandırma performansına sahip olduğu görülmüştür.