Topluluk Öğrenme Algoritmalarından Yükseltme Algoritması İle Gögüs Kanserinin Tahmini Üzerine Bir Vaka Çalışması: A Case Study on the Prediction of Breast Cancer Using Boosting Algorithm from Ensemble Learning Algorithms

Giriş Topluluk (ensemble) öğrenme algoritmaları tahmine dayalı analitik çalışmalarda en başarılı yaklaşımlardan biridir. Bu algoritmalar somut bir problemi çözmek için bir araya gelen modeller setinden oluşmaktadır. Amaç modeller setinin ürettiği tahminleri birleştirerek doğruluğu (accuracy) artırmaktır. Topluluk algoritmaları kendi içerisinde üç grupta ele alınır. Torbalama (Bagging: Bootsrap Aggregating) Yükseltme (Boosting) AdaBoost Gradient Boosting XGBoost LightGBM İstif…

Topluluk Öğrenme Algoritmalarından Torbalama Algoritması İle Konut Fiyatlarının Tahmini Üzerine Bir Vaka Çalışması: A Case Study on the Prediction of Housing Prices Using Bagging Algorithm from Ensemble Learning Algorithms

Giriş Topluluk (ensemble) öğrenme algoritmaları tahmine dayalı analitik çalışmalarda en başarılı yaklaşımlardan biridir. Bu algoritmalar somut bir problemi çözmek için bir araya gelen modeller setinden oluşmaktadır. Amaç modeller setinin ürettiği tahminleri birleştirerek doğruluğu (accuracy) artırmaktır. Topluluk algoritmaları kendi içerisinde üç grupta ele alınır. Torbalama (Bagging: Bootsrap Aggregating) Artırma (Boosting) İstif (Stacking) Topluluk (ensemble) öğrenme algoritmalarından…

Düşük Doğurganlık Türkiye İçin Tehdit Mi Oluşturuyor?

Bilindiği üzere Türkiye İstatistik Kurumu (TÜİK) yakın zamanda Türkiye için önemli nüfus göstergelerinden biri olan toplam doğurganlık hızlarını açıkladı. Bir kadının doğurganlık dönemini içine alan 15 ile 49 yaş arasında doğurabileceği ortalama çocuk sayısını gösteren toplam doğurganlık hızı ürkütücü seviyelere düştü. Gelişmiş ülkelerde bir neslin yenilenme düzeyi eşik değeri 2,10 seviyesi olarak görülmektedir. Diğer bir…

Prediction of Size of the COVID-19 Pandemic Using Wavelength Models: Cases of Turkey and World [Dalgaboyu Modelleri Kullanarak COVID-19 Pandemisinin Büyüklüğünün Tahmini: Türkiye ve Dünya Vakaları]

Başta Koronavirüs (COVID-19) olmak üzere diğer salgınların büyüklüğünü ortaya koymak için dalga boylarını ölçmeye yönelik geliştirdiğim sayısal modeller ön incelemeden geçerek Yale üniversitesi destekli medRxiv (Medical Archive)’de 11.4.2020 tarihinde yayınlanmıştı. Geliştirilen modellerin makalesine aşağıdaki linki tıklayarak ulaşabilirsiniz. https://www.medrxiv.org/content/10.1101/2020.04.07.20056432v1.article-info Makalenin adı: Bulut T. New Epidemiological Model Suggestions Revealing Size of Epidemics Based on the COVID-19 Pandemic Example: Wavelength…

Doğurganlık Hızı Fırsat Mı Tehdit Mi?

Bilindiği üzere Türkiye İstatistik Kurumu (TÜİK) yakın zamanda Türkiye için önemli nüfus göstergelerinden biri olan toplam doğurganlık hızlarını açıkladı. Bir kadının doğurganlık dönemini içine alan 15 ile 49 yaş arasında doğurabileceği ortalama çocuk sayısını gösteren toplam doğurganlık hızı ürkütücü seviyelere düştü. Gelişmiş ülkelerde bir neslin yenilenme düzeyi eşik değeri 2,10 seviyesi olarak görülmektedir. Diğer bir…

Topluluk Öğrenme Algoritmalarından Torbalama Algoritması İle Gögüs Kanserinin Tahmini Üzerine Bir Vaka Çalışması: A Case Study on the Prediction of Breast Cancer Using Bagging Algorithm from Ensemble Learning Algorithms

Giriş Topluluk (ensemble) öğrenme algoritmaları tahmine dayalı analitik çalışmalarda en başarılı yaklaşımlardan biridir. Bu algoritmalar somut bir problemi çözmek için bir araya gelen modeller setinden oluşmaktadır. Amaç modeller setinin ürettiği tahminleri birleştirerek doğruluğu (accuracy) artırmaktır. Topluluk algoritmaları kendi içerisinde üç grupta ele alınır. Torbalama (Bagging: Bootsrap Aggregating) Artırma (Boosting) İstif (Stacking) Topluluk (ensemble) öğrenme algoritmalarından…

Türkiye’deki COVID-19 Pandemisinin Büyüklüğü: Size of the Covid-19 Pandemics in Turkey

Dünyayı derinden etkileyen koronavirüs pandemisinin mevcut durumdaki büyüklüğünü ortaya koymaya yönelik geliştirdiğim epidemiyolojik dalga boyu modelleri Yale Üniversitesi destekli Uluslararası Tıp Arşivinde ön baskı olarak yayınlanmıştır. Bu modeller kullanılarak Türkiye’deki koronavirüs salgınının büyüklüğü dalga boyu uzunluğu olarak hesaplanmıştır. Analizde kullanılan vaka sayılarına ilişkin veri seti Sağlık Bakanlığı resmi web sitesinden edinilmiştir. Elde edilen bulgular Şekil…

Temel Bileşenler Analizi Üzerine Bir Vaka Çalışması: A Case Study on Principal Component Analysis (PCA)

Büyük veri setleri birçok disiplinde giderek yaygınlaşmaktadır. Bu tür veri kümelerini yorumlamak için, verilerdeki bilgilerin çoğu korunacak şekilde boyutsallıklarını yorumlanabilir bir şekilde önemli ölçüde azaltmak için yöntemlere ihtiyaç vardır. Bu amaç için birçok teknik geliştirilmiştir, ancak temel bileşenler analizi (PCA) en eski ve en yaygın kullanılanlardan biridir. Fikri basittir – mümkün olduğunca çok ‘değişkenliği’ korunurken…

R Programlama Diliyle Sınıflandırma Problemlerinin Çözümünde Karar Ağacı Algoritmaları Üzerine Bir Vaka Çalışması: A Case Study on Decision Tree Algorithms in Solving Classification Problems with R Programming Language

Giriş Günümüzde veri madenciliği uygulamalarının yaygınlaşması ve büyük veri kavramının öne çıkmasıyla birlikte analiz metotları da değişmiştir. Bugüne kadar genellikle bulut (cloud) veri tabanları üzerindeki veri setleri indirilerek analize konu ediliyordu. Ancak gelişen teknoloji veri madenciliği yöntemlerinde de önemli değişiklikler ve bazı soruları beraberinde getirmiştir. Bu sorulardan bazıları şöyledir: Online veya offline olarak dokümanlarda analize…

R Programlama Diliyle Sınıflandırma Problemlerinin Çözümünde Küme Algoritmaları Üzerine Bir Vaka Çalışması: A Case Study on Cluster Algorithms in Solving Classification Problems with R Programming Language

Giriş Küme geçmeden önce temel kavramları açıklamak konunun anlaşılması açısından önem taşıdığından ilk olarak kısaca bu kavramlara yer verilmiştir. Küme, benzer özellikleri içinde barındıran topluluk olarak tanımlanabilir. Bu topluluk insan, hayvan, bitki topluluğu olabileceği gibi nesnelerin oluşturduğu topluluk da olabilir. Benzer özellikler taşıyan bu topluluklar diğer kümelerden farklılaşır. Kümeleme (clustering) analizini ise benzer özelliklere sahip…

R Programlama Diliyle Regresyon Problemlerinin Çözümünde Rastgele Orman Algoritması Üzerine Bir Vaka Çalışması: A Case Study on Random Forest (RF) Algorithm in Solving Regression Problems with R Programming Language

Giriş Rastgele Orman (RF) algoritması , 2001 yılında Breiman tarafından karar ağaçlarının bir kombinasyonu olarak önerilmiştir. RF en iyi “her ağaç, bağımsız olarak örneklenen ve ormandaki tüm ağaçlar için aynı dağılıma sahip rastgele bir vektörün değerlerine bağlı olacak şekilde ağaç belirleyicilerinin kombinasyonu” olarak tanımlanan bir topluluk makine öğrenme algoritmasıdır. Topluluk algoritması gerek regresyon gerekse sınıflandırma…

R Programlama Diliyle Sistematik Örnekleme Üzerine Bir Vaka Çalışması: A Case Study on Systematic Sampling with R Programming Language

Giriş Daha önce basit tesadüfi örnekleme (simple random sampling) üzerine burada çalışmalar yapılmıştı. İlgilenecekler için aşağıda yararlanılan kaynaklar kısmında bu çalışmaların linklerine yer verilmiştir. Bu çalışmada ise örnek bir uygulama üzerinden ve olabildiğince yalın bir dille sistematik örnekleme yapılacak ve R programlama dili kullanılacaktır. Ancak R programlama dili bilmeyenler için Microsoft Excel kullanarak sistematik örnekleme…