İstatistik etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster
İstatistik etiketine sahip kayıtlar gösteriliyor. Tüm kayıtları göster

18 Kasım 2017 Cumartesi

Adım Adım Veri Bilimi - 3 (Temel İstatistik Kavramları)

Gelişmiş ve kullanıcı dostu haline gelmiş ürünler sayesinde veri analizi çalışmalarını sürdürmek her geçen gün daha kolay olmaktadır. Ürünlerin konforu veri analizi yapan kişilerin işlerini kolaylaştırmakla kalmayıp daha fazlasını yapabilmeleri için cesaret vermektedir.

Bu iyi bir şey. Ancak bazen bu rahatlık rehavete ve dikkatsizliğe dönüşebiliyor. Özellikle temel istatistiksel kavramlara yabancılaşma sonucu bu araçlar yanlış kullanılabiliyor. Hatalı çıktılar yıllarca fark edilmeden hatalı kararlar verilmesine sebep olabiliyor. Sonuç olarak telafisi mümkün olmayan zararlar ortaya çıkabiliyor. Araçların doğru kullanılabilmesi için temel dinamiklere hakim olmak şart. Diğer türlü hata yapmak kaçınılmaz olur.

Bir çalışmanın bilimsel olabilmesi için matematiksel (istatistiksel) bazı temellere dayandırılması gerekir. Veri Bilimi (Data Science) çalışmaları da bilimsel yöntemlerle sürdürüldüğü için Veri Bilimcilerinin (Data Scientist) matematiksel (istatistiksel) temel kavramlara hakim olması gerekir.

Bu sebeple Adım Adım Veri Bilimi serimizde bir takım temel İstatistik kavramlarına yer verelim istedim.

Bu konu ile ilişkili olan ve İstatistik biliminin tanımını yaptığımız "Adım Adım Veri Bilimi - 2 ( İstatistik Nedir?)" isimli şu makaleye bir göz atmanızı öneririm:

Serideki bu kısmın önemini daha rahat anlayabilmek için bir soru üzerinde düşünelim istiyorum.

Soru: Bir yatırımım olsun. Ana para miktarı önemli değil. Ancak yine de somutlaştırmak için 100 tl ana param olsun diyelim. Yıl yıl gelir yüzdelerini ve ana paradaki artışı aşağıdaki tabloda görebilirsiniz. Merak ettiğim şey şu; yıllık ortalama yüzde kaç gelir elde ediyorum?


Günlük hayatta sıkça karşılaşabildiğimiz kolay bir soru. Cevabı üzerinde biraz düşünün. Yıllık ortalama yüzde kaç gelir elde ediyorum?

Kolay bir soru olduğu için hızlıca hesaplayabiliriz. Yıl yıl %10, %50, %30 gelir elde ediyorsam, bu durumda üçüncü yılın sonunda yılda ortama (10+50+30) / 3 yani %90/3 sonuç olarak %30 yıllık ortalama gelir elde ediyorum demektir. Yani bildiğimiz aritmetik ortalama aldık.

Kolay bir soru ama yine de sağlamasını da yapalım istiyorum. Bulduğumuz bu yıllık ortalamayı ana paraya uygulayalım. Yıl yıl gelirim şöyle olur:


Fakat o da ne? Olması gerekenden farklı bir sonuç elde ettim. İlginç değil mi? ortalamayı uyguladığımda üçüncü yılın sonunda, gerçekten elde ettiğim gelirden daha fazlası ile karşılaştım. 214.5 elde etmeliydim, 219.7 ile karşılaştım. Sağlamasını yaptığımda işlemin hatalı olduğunu gördüğüme göre bir yerde hata yaptım demektir. Acaba nerede?

Burada aritmetik ortalama kullandık. Hatalı oldu. O halde farklı bir ortalama deneyelim. Mesela az duyduğumuz, belki de normal hayatta hiç kullanmayacağımızı düşündüğümüz bir ortalamaya bakalım. Geometrik ortalamaya ...


Geometrik ortalama yıllık ortalama %28.9 'luk gelirim olduğunu söylüyor. Yıl yıl bu oran üzerinden sağlamasını yaptığımda üçüncü yılın sonunda gerçekten elde ettiğim gelirimle karşılaşıyorum. yani 214.5 ile. Sağlaması geometrik ortalamanın doğru olduğunu gösteriyor. Harika! 

Bu sonuç bir çok kişi tarafından beklenmediktir. Zaten benim dikkat çekmek istediğim şey de tam olarak budur. Temel istatistiksel kavramlara yabancılaşmış kişilerin veri analizi sırasında buna benzer beklenmedik hatalar yapma ihtimali çok yüksektir. Burada rehavetle verilmiş aritmetik ortalama kararı değil, temel kavramlara hakimiyet sonucu verilmiş geometrik ortalama kararı isabetli sonucu vermektedir. 

Bir çok ortalama çeşidi mevcut. Hangisinin tam olarak nerede kullanıldığını ilerleyen yazılarda ihtiyaç oldukça açıklarız. Biz konuya daha temelden girelim ve veri analizi için gerekli temel istatistiksel kavramları ele alalım. Kavramları literatürdeki sıkıcı tanımları ile ifade etmek istemiyorum. Mümkün olduğunca sezgisel ve kullanışlı tanımlarla kavramları ele alalım istiyorum. Önce veri dediğimiz şeyi tanıyalım.

Veri Nedir?


Veri dediğimiz şey sayılar, kelimeler, ölçümler, gözlemler veya kısaca bir şeyi tanımlayan olgulardır.

Verileri nitel ve nicel olarak 2 gruba ayırabiliriz:


  1. Nitel (Qualitative): Bir şeyi tanımlamak, açıklamak için kullanılan bilgidir. Bu türden bilgiler daha çok tabloda tutulabilen kurallı bir yapıda değil de çeşitli biçimlerde tutulabilen serbest yapıda olur. İlgili konudaki gözlemler, dokümanlar, röportajlar vs. kaynakları oluşturur. Mesela "eğlenceli bir tatildi" ifadesi bu türden bir bilgidir.
  2. Nicel (Quantitative): Bir şeyi saymak ve ölçmek için kullanılan bilgidir. Bu türden bilgiler genelde tabloda tutulabilen bir yapıda olur. Nicel verileri iki grupta inceleyebiliriz:
    • Kesikli (Discrete): Sayılabilen, sayılması mantıklı taneli olan şeyler hakkındaki veriler bu gruba girer. Mesela bir ekibin çalışan sayısı 5 kişi olsun. Buradaki kişi sayısı olan 5 kesikli veridir. Ekibi iki grubu ayıralım dediğimizde bu gruplar 2,5 kişilik olamaz. Ara değerler yoktur.
    • Sürekli (Continuous): Ölçülebilen, ölçülmesi mantıklı olan şeyler hakkındaki veriler bu gruba girer. Mesela çalışanların evle iş yeri arası uzaklıkları sürekli veridir. Ara değerlerin tümü mantıklıdır. Ancak bazı durumlarda sürekli veriler kesikli veriler olarak ifade edilebilir. Mesela evle iş yeri arası uzaklığını bazı kriterlere bakarak yakın ve uzak diye iki gruba ayırabiliriz. Böylece bu konudaki veri artık sürekli değil kesikli olur.


Verileri hareketine göre 2 gruba ayırabiliriz:

  1. Yığın Veri (Batch Data): Bu türden veriler ile çalışmak görece daha kolaydır. Genelde konu hakkındaki tüm veri bir arada bulunur. Bu veri kümesi belli bir zaman diliminde bir araya getirilmiştir ve bir bütün olarak analiz edilir. Geleneksel veritabanlarındaki veriler bu kapsamda değerlendirilir. Mesela rapor yapmak için hazırladığınız tablolardaki veriler bir yığın halindedir. Durağandır.
  2. Akan Veri (Stream Data): Bu türden veriler ile çalışmak görece daha karmaşıktır. Verileri yakalamak ve analiz etmek için özel teknik ve araçlar gerekmektedir. Geleneksel yöntemlerin dışına çıkmak gerekir. Kaynaktan parça parça ve neredeyse sürekli olarak üretilir. Analiz genelde gerçek zamanlı olarak yapılır. Mesela bir binadaki sıcaklık sensörlerinden gelen veriler bu türden verilerdir. Durağan değildir. Hareket halindedir. Üstelik bazen geleneksel yöntemlerle yakalanamayacak kadar da hızlı akar.


Verileri yapısına göre 3 gruba ayırabiliriz:

  1. Yapılandırılmamış (Unstructured): Resim, düz metin, video, ses gibi serbest yapıda olan verilerdir. Kendi içinde bir takım standartları olsa da geleneksel yöntemlerle yakalamak, tutmak, işlemek ve değer üretmek pek mümkün değildir.
  2. Yarı Yapılandırılmış (Semi Structured): csv, xml, json, yaml gibi belli kurallara uyan kısmen serbest yapıdaki verilerdir. Her bir kayıt aynı genel kurala uysa da bir birinden farklı tipte ve derinlikte olabilir.
  3. Yapılandırılmış (Structured): Tablo yapısında tutulabilen verilerdir. Veri satır ve sütunların kesişimlerinde tutulur. Her satırda aynı sırada ve aynı tipte kolonlar yer alır. Bildiğimiz tablo mantığı yani. Hemen yeri gelmişken söyleyeyim. Bir araştırmaya göre şirketlerin kendisi hakkında ulaşabileceği verilerin sadece %20'si bu yapıdadır. Günümüzün trend konusu, geriye kalan %80 'lik dilimden, yani yukarıdaki ilk iki türdeki yapıdan değer üretmektir.


Bir önceki yazımızda bahsettiğimiz Betimsel İstatistik (Descriptive Statistics) teknikleri özellikle yapısal veriler üzerinde çalışma ile ilgili çözümler sunar. İlk etapta bu tekniklere odaklanacağız.

İstatistiksel çalışmanın temeli hakkındaki şu bilgileri önemine binaen, önceki yazımdan buraya aynen alıyorum:

İstatistiksel çalışmalarda bazen hakkında veri toplamak istediğimiz grubun tüm üyelerine erişebiliriz. Bazen de zaman, maliyetler vs. gibi bir çok nedenden dolayı grup üyelerinin tümüne ulaşmak mümkün olmayabilir. Bu durumda tüm üyelerine ulaşamadığımız gruba en çok benzeyen küçük bir grup üzerinde çalışmak ve çıkan sonuçlardaki hatayı göz ardı ederek tüm grup hakkında fikir edinmeyi ummak zorunda kalırız. 
İstatistiksel çalışmalarda çoğunlukla küçük bir grup üzerinde yapılan analizlerden elde edilen sonuçlara bakılarak büyük bir grup hakkında karara varılması amaçlanır. Büyük grup olarak nitelendirdiğimiz kitle (ana kütle) hakkında merak ettiğimiz soruların cevabını bu kitleyi (ana kütleyi) en iyi ifade eden küçük grupta yani örneklemde ararız. Sonra bulgularımızı genele yayar, kitleyi anlamak için kullanırız.  
Örneklem üzerinden kitle (ana kütle) hakkında fikir edinme yöntemleri oldukça kullanışlıdır. Mesela bu sayede ülkedeki tüm hayvanları yemeden et kalitesi hakkında fikir edinebiliyoruz. Çok şükür! 
Örneklem seçerken çok dikkatli olmak gerekir. Örneklem kitleyi en iyi ifade edecek şekilde seçilmelidir. Hem örneklem seçimi sırasında hem de veri toplarken ön yargıdan (biased) ve veri toplama sürecini sekteye uğratacak yaklaşımlardan (mesela uzun anketler) uzak durmak gerekir. Kitleyi temsil etmeyecek küçük belirgin bir gruptan çeşitli yönlendirmeler ve kısıtlı cevap seçeneklerine mahkum ederek elde edilen veriler çöptür ve yapılan analizler çöp olur.  
Örneklem seçimi rassal (rastgele) veya kitleyi ifade edecek şekilde iradi (istemli) olarak yapılabilir. Seçilen örneklemlerden veri toplanırken amaca uymayan ve sonucu etkileyen faktörlerin devrede olup olmadığı kontrol edilmelidir.
Yazının tümüne şu linkten ulaşabilirsiniz:

Anakütle veya örneklem hakkında topladığımız veriler aşağıdakine benzer bir tablo formatında olabilir. Bu durumda tablodaki her bir satıra "Birim" (Observation) her bir kolona "Değişken"  (Variable) değişkenin aldığı her bir değere de "Şık" (Value) adı verilir.


Topladığımız bu veriler üzerinde daha rahat çalışmak için bir takım düzenlemeler yapabiliyoruz. Elde etiğimiz veri kümesinin karakteristiğini anlayabilmek için de bir takım teknikler kullanıyoruz.

Bu yazımızda verinin tanımına ve farklı açılardan nasıl incelendiğine bir göz attık. Bir sonraki yazımızda bu düzenlemelerin ve tekniklerin bazılarının neler olduğuna odaklanacağız.






1 Nisan 2017 Cumartesi

Adım Adım Veri Bilimi - 2 ( İstatistik Nedir?)

Bu konuda yerli ve yabancı, çeşitli derinliklerde bir çok kaynak bulmak mümkün. Bizim amacımız; İstatistik konusuna, Veri Bilimi serimize ışık tutacak nitelikte pratiğe dönük ve mümkün olduğunca teknik terimlerden uzak bir giriş yapmaktır. İlerleyen bölümlerde gerek gördükçe teferruata girebiliriz.

Bir önceki R dünyasına giriş konulu yazımıza şu linkten ulaşabilirsiniz:

İstatistik Nedir?


Bir birine benzeyen iki farklı tanımdan söz edebiliriz;

Bunlardan ilki günlük hayatta kullanılan ".... istatistikleri" ifadesi ile ilgilidir. Mesela "Spor İstatistikleri", "Nüfus İstatistikleri" vs. böyledir. Bu ifadelerde geçen istatistik kelimesi bize, belirtilen konuda sistemli bir şekilde toplanan sayısal verilerin var olduğunu anlatır.

İkinci tanım ise İstatistiğin bilimsel uğraşı ile ilgilidir. Bu bakış açısı ile temel olarak istatistik, çeşitli sorulara cevaplar üretmek ve bir takım çıkarımlar sonucunda kararlar verebilmek için kullanılan bilimsel yöntemlerin işletildiği süreci ifade eder diyebiliriz.

İstatistiksel bir çalışmada temelde şu adımlar atılır:
  • Araştırma konusu belirlemek ve çalışma için makul bir çerçeve tasarlamak.
  • Araştırma konusu hakkında bilgi toplamak için ön yargısız, anlamlı ve kaliteli veri kaynakları edinmek.
  • Toplanan verileri tasnif etmek ve sayılar veya görsellerle (grafikler vs.) özetlemek.
  • Verileri analiz etmek ve sonuçları yorumlamak.
  • Sonuçlara ne kadar güvenilebileceğini ölçmek.
  • Küçük bir örnek grubundan (örneklem) elde edilen sonuçları genele yaymak.
  • Özellikler arası ilişkileri, nedensellikleri, verideki eğilimleri ve desenleri ortaya çıkararak geleceğe ilişkin tahminlerde bulunmak.

Veri Toplama Yöntemleri


İstatistiksel çalışmalar veriye dayalı olduğu için veri toplama aşamasının kalitesi sonuçların kalitesini belirler. Unutmayalım; GIGO (Garbage In Garbage Out) yani çöp giren çöp çıkar. 

İstatistiksel çalışmalarda bazen hakkında veri toplamak istediğimiz grubun tüm üyelerine erişebiliriz. Bazen de zaman, maliyetler vs. gibi bir çok nedenden dolayı grup üyelerinin tümüne ulaşmak mümkün olmayabilir. Bu durumda tüm üyelerine ulaşamadığımız gruba en çok benzeyen küçük bir grup üzerinde çalışmak ve çıkan sonuçlardaki hatayı göz ardı ederek tüm grup hakkında fikir edinmeyi ummak zorunda kalırız.

İstatistiksel çalışmalarda çoğunlukla küçük bir grup üzerinde yapılan analizlerden elde edilen sonuçlara bakılarak büyük bir grup hakkında karara varılması amaçlanır. Büyük grup olarak nitelendirdiğimiz kitle (ana kütle) hakkında merak ettiğimiz soruların cevabını bu kitleyi (ana kütleyi) en iyi ifade eden küçük grupta yani örneklemde ararız. Sonra bulgularımızı genele yayar, kitleyi anlamak için kullanırız. 

Örneklem üzerinden kitle (ana kütle) hakkında fikir edinme yöntemleri oldukça kullanışlıdır. Mesela bu sayede ülkedeki tüm hayvanları yemeden et kalitesi hakkında fikir edinebiliyoruz. Çok şükür!

Örneklem seçerken çok dikkatli olmak gerekir. Örneklem kitleyi en iyi ifade edecek şekilde seçilmelidir. Hem örneklem seçimi sırasında hem de veri toplarken ön yargıdan (biased) ve veri toplama sürecini sekteye uğratacak yaklaşımlardan (mesela uzun anketler) uzak durmak gerekir. Kitleyi temsil etmeyecek küçük belirgin bir gruptan çeşitli yönlendirmeler ve kısıtlı cevap seçeneklerine mahkum ederek elde edilen veriler çöptür ve yapılan analizler çöp olur. 

Örneklem seçimi rassal (rastgele) veya kitleyi ifade edecek şekilde iradi (istemli) olarak yapılabilir. Seçilen örneklemlerden veri toplanırken amaca uymayan ve sonucu etkileyen faktörlerin devrede olup olmadığı kontrol edilmelidir.

Veri toplamak için temelde 2 yöntem kullanılır:
  • Anketler (Survey): Anketler anlaşılır, yeterli, yapılabilir ve tamamlanabilir nitelikte olmalıdır. Sorular sunulurken kasıtlı, hataya açık ve yetersiz yönlendirmeler yapılmamalıdır.
  • Deney - Gözlem (Experiment): Örneklemin ürettiği verileri toplarken sonuçları etkileyebilecek durumlar ve karakteristik özelliklere dikkat etmek gerekir. Bir örneklem üzerinde deney yaparken deneyin başarılı, mantıklı ve sağlıklı olup olmadığını kontrol edebilmek için bir de kontrol grubu kullanılmalıdır. Mesela bir ilacın etkisini araştırırken deney grubundan elde edilen sonuçlarla birlikte, ilaç verilmeyen kontrol grubundaki sonuçları da değerlendirmek gerekir.

İstatistiksel Veri Analizi Yöntemleri


Veri analizi konusunu geçmişin tahlili ve geleceğin tahmini olarak en tepeden ikiye ayırabiliriz. Bir miktar daha detaya inersek; bazen geçmiş verilerimize baktığımızda neler olup bittiğini (Descriptive Analytics), olayların sebebini (Diagnostic Analytics) anlamayı amaçlarız. Bazen de geçmiş verilerden faydalanarak neler olacağını (Predictive Analytics) veya gelecekte olmasını arzu ettiğimiz şeyleri gerçekleştirmek için neler yapmamız gerektiğini (Prescriptive Analytics) tahmin etmeye çalışırız.


Sonuç olarak topladığımız verileri iki temel amaç için istatistiksel analize tabi tutarız:
  • Betimsel İstatistik (Descriptive Statistics): Bu analiz çalışmasının amacı sayılar ve görsellerle toplanan örneklem verilerini betimlemektir. Sonuç olarak toplanan verileri temsil eden ortalama, standart sapma, ortanca vs. gibi çeşitli sayısal özetler ve histogram, bar, pasta grafiği gibi çeşitli görseller hazırlanır. (Bu konuda Microsoft'un SSRS, Excel, Power BI, Microsoft R Open vs. ürünlerinden faydalanabilirsiniz. )
  • Çıkarımsal İstatistik (Inference Statistics): Bu analiz çalışmasının amacı veri içerisindeki eğilimleri, ilişkileri, desenleri ortaya çıkarmak, bir takım olasılıkları hesaplamak ve çeşitli tahminlemeler yapmaktır. İlişkili olma ve nedensellik (Association and Causation), hipotez testleri (Hypothesis Tests) ve veri madenciliği (Data Mining) bu tür istatistiksel çalışmaların kapsamına girer. (Bu konuda Microsoft'un SSAS, Excel, Azure ML, Microsoft R Open, R Server vs. ürünlerinden faydalanabilirsiniz.)

İstatistiğin Güvenilirliği


İstatistiksel yöntemler bilimseldir. İstatistiğin temelinde Matematik vardır. Matematik ise son derece güvenilirdir, yalan söylemez ve evrenseldir. Fakat istatistiksel çalışmalar doğası gereği çeşitli paradokslar içerir. Olasılıklar, güven aralıkları ve kabuller üzerine inşa edilmiş yöntemlerle çevrilidir. Bunun üzerine bir de bilerek veya bilmeyerek yapılan hatalı çıkarımları, ön yargılı çalışmaları, araştırma konusundaki ölçülemeyen noktaları ve hesaplama hatalarını da eklersek istatistikten mutlak doğru beklenemez. Belki elde edilen sonuçlar karar verebilmek için bir takım fikirler verir diyebiliriz. Elde edilen sonuçlar karar verme konusunda avantaj sağlar diyebiliriz. Ancak istatistiksel çıkarımları tümüyle doğru kabul etmek yanıltabilir.

Bu nokta ile ilgili olan Simpson paradoksu konulu yazımıza bir göz atmak isteyebilirsiniz:

19. yüzyılda Benjamin Disraeli'nin dediği gibi "Üç türlü yalan bulunmaktadır: yalanlar, kuyruklu yalanlar ve istatistikler."

30 Kasım 2016 Çarşamba

R Dili ile Lorenz Eğrisi Çizmek ve Gini Katsayısını Hesaplamak

Gini katsayısı, Lorenz eğrisini kullanır ve bir dağılımın eşitsizliğini ifade eder. Gini katsayısı 0 ile 1 arasında bir sayıdır. Bu sayı 0'a yaklaştıkça eşit bir dağılım görürüz.

Genelde gelir dağılımının eşitsizlik derecesini ifade etmek için kullanılır. Bu konuda yazmış olduğum ayrıntılı yazıya bir göz atmanızı tavsiye ederim. Çünkü bu yazı onun devamı niteliğinde olacak.

Yazıma şuradan erişebilirsiniz:

Bir Dağılımın Eşitsizlik Ölçüsü - Gelir Dağılımı (Gini Coefficient, Lorenz Curve)
http://www.abdullahkise.com/2016/11/bir-daglmn-esitsizlik-olcusu-gelir.html

Bu yazımızda Gini katsayısının R ile nasıl hesaplandığına odaklanacağız.

Eğer R için gerekli ortamınız kurulu değilse ve R hakkında güzel bir giriş yapmak isterseniz şu yazıma bir göz atmanızı tavsiye ederim:

Adım Adım Veri Bilimi - 1 (R Dünyasına Giriş)
http://www.abdullahkise.com/2016/10/adm-adm-veri-bilimi-1-r-dunyasna-giris.html

Hangi R ortamını kurduğunuz çok önemli değil. Biz Microsoft R Open (MRO) kurulumu üzerinde çalışacağız.

Gini katsayısını hesaplamak için çeşitli yöntemler kullanmak mümkün. Özetle formül şöyleydi:


Ancak integral hesabı yapmak veya hataya açık yöntemleri denemek yerine R paketleriyle kolayca doğrudan sonuç alabilirsiniz. Bu konuda 2 paket öneriyorum. Hakkındaki ayrıntılı bilgilere şu linklerden erişebilirsiniz:


Biz Ineq paketi üzerinden ilerleyelim. Şu adımları atıyoruz:

# Gerekli R paketini indirip kuralım - "ineq"
install.packages("ineq")

# kütüphaneyi ortamımızda kullanmak üzere yükleyelim.
library(ineq)

# Gelir örneğini bir vector şeklinde verelim. Önceki yazımızda bu veri kümesini kullanmıştık.
# vector 1 satırlık matris olarak kabul edilebilir. Aynı veri tipinden elemanlar içerir.
# vector c(1,2,3) şeklinde tanımlanır.
gelirler = c ( 1300, 1500, 2000, 5000, 7000, 8000, 10000, 20000, 60000, 80000 )
# gelirler değişkenine vector atadık

# Gelirlerin grafiğini çizelim.
plot(gelirler)


# Gelirlerin Lorenz Eğrisini çizelim.
# Çizgi rengi için col, Koordinat başlıkları için xlab,ylab parametrelerini kullandık
plot(Lc(gelirler), col = "red", xlab = "Kümülatif Nufus %", ylab = "Kümülatif Gelir %")


# Gini katsayısını hesaplayalım.
ineq(gelirler, type = "Gini")
# Output:   [1] 0.6282341

Bir de projenin tamamını görmek için ekran görüntüsüne bakalım:


Sonuç olarak Gini katsayısı 0.6 çıktı. Bir hayli eşit olmayan dağılıma sahibiz. 

Sizler de farklı veri kümelerinin dağılımlarındaki eşitsizliği bu şekilde inceleyebilirsiniz. Hatta bir adım daha ileri gidip veri kümelerini dosyadan okuyabilir paketlerin dokümantasyonlarına bakarak gelişmiş çalışmalar yapabilirsiniz.

14 Kasım 2016 Pazartesi

Bir Dağılımın Eşitsizlik Ölçüsü - Gelir Dağılımı (Gini Coefficient, Lorenz Curve)

Sayılar bir şeyin niceliği hakkında kesin sonuçlar sunar. Sayılar arasındaki fark, yani değişim olmuş veya olacaklar hakkında bazı fikirler verir. Sayıların oranları nicelikler üzerinde daha rahat düşünme imkanı sağlar. Değişim oranları ise niceliğin trendini (eğilimini) görmemizi ve ortaya çıkacak değişimin gücünü idrak etmemizi kolaylaştırır.

Örneğin; Bir bölgenin toplam geliri o bölgenin ne kadar zengin olduğunu gösterir. Anlamlıdır. Bu zenginliğin bölge halkı tarafından nasıl paylaşıldığını bilmek ise farklı bir heyecan uyandırır. Gelir dağılımındaki eşitsizlik durumu bölge hakkında çok çarpıcı bilgiler sunar. Mesela restoranımızın yeni şubesini nerede açmalıyız? sorusunun cevabını bulmak için bu bilgiden faydalanabiliriz. Servet, bölge halkına eşit şekilde mi dağılmış, yoksa bir kaç kişinin elinde mi tutuluyor? Bunu bilmek kesinlikle yeni şubemizin yerini belirlemede etkili olacaktır. İşte bu tarz çarpıcı bilgileri ortaya çıkarabilmek için bir takım sayıların oranlarından faydalanırız.

Bu yazımızda bir dağılımdaki eşitsizliğin derecesini ölçmemizi sağlayan oranlara odaklanıyoruz. İstatistikçiler bu oranları kullanarak bir yığın sayı hakkında çarpıcı çıkarımlar yapabilmektedir.

Bir Dağılımdaki Eşitsizliğin Görünümü


1905 yılında Max Otto Lorenz gelir dağılımının görüntüsünü, iki ekseninde yüzde değerler bulunan bir grafik (dik koordinat sistemi) üzerindeki eğri ile ifade etmiştir. Bu eğriye Lorenz Eğrisi (Lorenz Curve) denir. 

Yukarıdaki ekonomi örneği üzerinden gidersek; Dik koordinat sisteminde x eksenine en fakirden en zengine sıralanmış nüfusun kümülatif yüzdelik dilimleri yerleştirilir. İlk %20, ilk %40, ilk %60...%100 gibi. y eksenine ise gelirin kümülatif yüzdelik dilimleri yerleştirilir. Gelirin %20'si, %40'ı....%100'ü gibi. 

Sonra nüfusun yüzde kaçı gelirin yüzde kaçına sahip olduğu grafik üzerinde işaretlendiğinde ortaya bir eğri çıkar. Ortaya çıkan bu Lorenz Eğrisi gelir dağılımı hakkında bazı çıkarımlar yapma imkanı verir.

Aşağıdaki kalın gri çizgi ile ayrılmış iki örneği inceleyelim;

Gini Katsayısı - Lorenz Eğrisi - Abdullah Kise
Resmi büyütmek için tıklayın (resmi)

Örnekleri incelediğimizde; (0,0) ve (100,100) noktalarının birleşimi olan 45 derecelik turuncu doğrunun mükemmel eşitliği ifade ettiğini görebiliriz. Çünkü doğru boyunca nüfusun %20'si gelirin %20'sine, %40'ı gelirin %40'ına vs. sahip olduğunu söyleyebiliriz. Bu durumda grafiğin (0,0),(100,0), (100,100) noktalarının birleşimi ile oraya çıkan çizginin ise mükemmel eşitsizliği ifade ettiğini söyleyebiliriz. Bu çizgiyi aşağıdaki grafikte kırmızı renk ile ön plana çıkardık.

Bu durumda matematiksel olarak şunu söylemek mümkün. Lorenz Eğrisi mükemmel eşitlik çizgisine yaklaştıkça gelir dağılımı daha eşit hale gelir. Lorenz Eğrisi mükemmel eşitsizlik çizgisine yaklaştıkça da dağılım giderek eşit olmaktan uzaklaşır.

Peki, bizim gelir dağılımımızın ne kadar eşit olduğunu nasıl ifade edebiliriz?

Dağılımdaki Eşitsizliğin Ölçüsü


1912 yılında İtalyan istatistikçi Corrado Gini bir dağılımın eşitsizliğini ölçebilmek için Gini Katsayısını (Gini Coefficient) geliştirdiğini duyurmuştur. Gini katsayısı Lorenz Eğrisinden faydalanır. Bir takım hesaplar sonucunda 0 ile 1 arasında bir sayı çıkar ve bu sayı eşitsizliğin büyüklüğünü ifade eder.

Aslında mantık çok basit; Lorenz Eğrisinin üst kısmında kalan alan mükemmel eşitliğe ne kadar uzak olduğumuzu ifade eder. Bu alan küçüldükçe daha eşit bir dağılım elde ederiz. Tam da bu fikirle yola çıktığımızda bu alanın mükemmel eşitlik altındaki alana oranı bize Gini Katsayısını verir. 

Gini Katsayısı - Lorenz Eğrisi - Abdullah Kise


G ile gri alanı, S ile sarı alanı ifade edelim. Basitçe şu alan hesabı ile Gini Katsayısını elde edebiliriz;


Lorenz Eğirisi bir eğri olabileceği için alan hesabında integral kullanmak gerekebilir. Eğriyi L(x) diye isimlendirdiğimiz bir fonksiyon ile ifade edersek. Gini katsayısı şu şekilde hesaplanır.



Hataya açık başka pratik yöntemler de mevcut. Onlara burada değinmeyeceğim. Daha sonraki yazılarımızda bir takım senaryolar için hesaplamalar yapacağız. Şimdilik hesap kısmı için bu kadarı ile yetinelim.

Gini Katsayısı ve Lorenz Eğrisi Ne Anlatır Ne Anlatmaz?


Gini katsayısı 0 ile 1 arasında değişen bir sayıdır. Bu katsayı ne kadar zengin olunduğunu ifade etmez. Mevcut zenginliğin nasıl paylaşıldığını ifade eder. Eşitsizlik derecesini ifade eden bu sayı 0'a yaklaştıkça daha eşit bir dağılım görürüz.

İlk resimde de görüldüğü üzere Lorenz Eğrisi mükemmel eşitlik çizgisine sağdaki düşük toplam gelir örneğinde daha yakın. Doğal olarak Gini Katsayısı sağdaki durumda 0'a daha yakın. Tersi de olabilirdi. Sonuç olarak Gini katsayısı toplam gelir hakkında bilgi vermez. Oranlar üzerinden hesaplama yapıldığı için toplam gelir bu katsayıyı etkilemez. Tabi ki sosyolojik olarak toplam gelirin artması dar gelirlilerin kazancını da etkileyebilir. Ancak matematiksel olarak bunu göz ardı ederiz.

Gerçek hayatta da örneğimize benzer sonuçlarla karşılaşmak mümkün. Dünya Gini Katsayılarına baktığımızda 2008 yılında yapılan bir ölçümde Afganistan'ın katsayısı 0,27 görünürken, en yakın 2007 yılında yapılan bir ölçümde Amerika Birleşik Devletlerinin katsayısı 0,45 olduğu tespit edilmiş. Sanırım servet az iken paylaşmak daha kolay oluyor gerçeğinin bir yansıması bu.

Dünya gelir dağılımın ne kadar eşit olduğunu bilmek istersiniz diye düşünüyorum.

Dünya Gelir Dağılımındaki Eşitsizlik Değerleri (Gini Katsayıları)


İşte 2000'li yılların sonlarına doğru ülkelerin vergilendirmeden önceki Gini katsayıları:

Gini Katsayısı - Lorenz Eğrisi - Abdullah Kise

Yukarıdaki raporu Power BI ile yaptım. Ham veriye ve bir takım raporlara şu linkten erişebilirsiniz:

Gini Katsayısı ve Lorenz Eğrisi sadece ekonomide değil, sosyoloji, ekoloji ve mühendislik gibi daha bir çok alanda karşımıza çıkmaktadır. Siz de bu mantıktaki herhangi bir dağılımın eşitsizlik durumunu açığa çıkarmak için Gini Katsayısını ve Lorenz Eğrisini kullanabilirsiniz. Mesela kaynak-iş yükü optimizasyonunu yapabilmek için iş yükünün kaynaklara nasıl dağıtıldığını görmek isteyebilirsiniz.

İstatistik eğlencelidir!

Sonraki yazılarımızda R dilini kullanarak bir dağılımın Lorenz Eğrisinin ve Gini Katsayısının nasıl elde edilebileceğini inceleyeceğiz.