Türkiye’de İngiliz Yarış Atlarının Kazanç Durumlarına Etkili Faktörlerin Sınıflamaya Dayalı Bazı Makine Öğrenmesi Algoritmaları ile İncelenmesi


Tezin Türü: Doktora

Tezin Yürütüldüğü Kurum: Ankara Üniversitesi, Veteriner Fakültesi, Zootekni ve Hayvan Besleme Bölümü, Türkiye

Tezin Onay Tarihi: 2024

Tezin Dili: Türkçe

Öğrenci: Volkan TÜRKMEN

Danışman: Doğukan Özen

Açık Arşiv Koleksiyonu: AVESİS Açık Erişim Koleksiyonu

Özet:

At yarışı endüstrisi, yarattığı ekonomik kazanç ve istihdam ile birlikte oldukça önemli bir sanayi dalıdır. Endüstrinin sürdürülebilirliği ve büyümesi, yarış atı yetiştiriciliğinin gelişmesi ve iyi safkanların yetiştirilmesine bağlıdır. Yarış atlarının kazançları, yarış endüstrisinde bir atın başarı seviyesinin en önemli göstergelerinden biridir. Bir atın kazancı, sadece o atın yarış kariyerini değil, aynı zamanda yetiştiriciliğinden sağlanan ekonomik getirileri de doğrudan etkiler. Bu durum, yarış endüstrisinde yatırım kararlarından seleksiyon stratejilerine kadar geniş bir yelpazede önemli sonuçlar doğurma potansiyelindedir. Bu çalışmada, sınıflandırmaya dayalı k-EYK, C5.0, RO ve GAM makine öğrenmesi (MÖ) algoritmaları yardımı ile Türkiye'deki safkan İngiliz atlarının yarış hayatı boyunca elde ettiği kazanca etkili olabilecek faktörleri belirlemek ve bu faktörleri içeren bir tahmin modeli geliştirmek amaçlanmıştır. Bu amaçla iki ve üç sınıflı kazanç değişkenini içeren iki farklı veri seti ile iki farklı veri bölme tekniği kullanılmıştır. Araştırmanın materyalini Türkiye Jokey Kulübü'nün düzenli olarak tutmuş olduğu kamuya açık kayıtlar oluşturmuştur. Çalışmada her bir at bağımsız bir birey olarak kabul edilmiştir. 2007-2020 yılları aralığında doğup 30 Haziran 2022 tarihi itibariyle yarış hayatı sonlanmış ve bu tarihe kadar düzenlenen yarışlara en az bir kez katılan 14.233 adet safkan İngiliz yarış atı çalışmaya dahil edilmiştir. Yapılan çalışmada, üç sınıflı kazanç değişkeni, hem orijinal, hem de rastgele aşırı örnekleme yöntemi (RAÖ) kullanılarak dengelenmiş hali ile; iki sınıflı kazanç değişkeni ise orijinal hali ile modele alınmış ve %70-%30, %75-%25 ve %80-%20 eğitim ve test veri setlerine bölünmüştür. Veri setleri 10 katlı çapraz doğrulama yöntemi 10 tekrarlı olarak yürütülerek algoritmalar için hiper parametre en iyilemesi yapılmıştır. Ayrılan test veri seti ile tahmin modeli test edilmiştir. Çalışmada performans değerlendirme ölçütü olarak, doğruluk, dengeli doğruluk, seçicilik ve negatif tahmin değeri ortalaması ile kesinlik, anma ve F1 skorunun makro ortalaması, MKK/ÇSMKK, G-ortalama ve EAKA kullanılmıştır. Çalışma sonucunda karşılaştırılan modellerin içerisinde en yüksek doğruluk oranı %80-20 eğitim test veri seti ayrımı ile gerçekleşmiştir. İki sınıflı ve üç sınıflı dengelenmiş test veri setlerinde en yüksek doğruluk oranları sırasıyla GAM ve RO algoritmaları ile elde edilmiştir. Çalışmada elde edilen sınıflandırma tahmin modellerinde, farklı önem derecelerinde "Yarışa Başlama Yaşı", "Koşu Sayısı", "Koşu Parkuru", "Baba Kazanç Durumu", "Anne Kazanç Durumu", "Sahiplik Durumu" ve "Cinsiyet" özniteliklerinin yarış hayatı boyunca elde edilen kazanca etki eden önemli birer faktör oldukları belirlenmiştir. Bu çalışma, aynı zamanda iki sınıflı sınıflandırıcıların üç sınıflılara göre daha iyi tahmin performansı sergilediklerini, RAÖ ile dengelenmiş verilerin dengelenmemişlerden birçok performans ölçütü yönünden daha iyi performans sergilediğini göstermiştir. Çok sınıflı tahmin problemlerinin çözümünde hızlı ve etkili çözümler sunan k-EYK algoritmasının kullanımının etkinliği görülmüştür. Dengeli ve dengesiz veri setlerinde çok sınıflı sınıflandırıcı performansını değerlendirirken doğruluk oranlarının yanında, F1 skoru, G-ortalama ve ÇSMKK değerleri ile karışıklık matrisinin de beraber düşünülmesi gerektiği ancak EAKA ölçütünün kullanımında daha dikkatli olunması gerektiği görülmüştür.