Örnek sorular
Ml Data PreparationZorluk 2
Bir veri setinde bir feature kabaca 0-1 arasında, diğeri ise kabaca 0-1.000.000 arasında değer alıyor. Mesafe ya da gradyan tabanlı bir model eğitilmeden önce bu durum giderilmezse en olası sonuç nedir?
- aEksik değerler yüzünden eğitim başarısız olur
- bKategorik sütunlar yanlış sırayla encode edilir
- cTest setindeki bilgi eğitime sızar
- dBüyük ölçekli feature modele baskın gelir✓
Açıklama:Feature'lar çok farklı sayısal ölçeklerde olduğunda, geniş aralıklı olan feature genelde mesafe hesaplamalarına ya da gradyan büyüklüklerine baskın gelir ve küçük ölçekli feature'ın sinyalini bastırır. Bu, bu tür modeller eğitilmeden önce feature'ları karşılaştırılabilir aralıklara ölçeklemenin temel gerekçesidir.
Ml Data PreparationZorluk 2
Bir veri setinde 'city' sütununda Istanbul, Ankara, Izmir gibi değerler var. Yeni bir mühendis bunları alfabetik olarak tam sayıya eşliyor (Ankara=0, Istanbul=1, Izmir=2) ve bunları, sayısal girdileri sıralı/sürekli kabul eden bir modele doğrudan veriyor. Buradaki temel risk nedir?
- aModel, şehirler arasında yanlış bir sıra çıkarabilir✓
- bModel, encoding'in sırasız olduğunu otomatik algılar
- cBu eşlemeden sonra kategori sayısı azalır
- dMetin sütunları hiçbir modelde encode edilemez
Açıklama:Sırasız kategorilere keyfi sıralı tam sayılar atamak, gerçekte olmayan bir büyüklük/sıra hissi yaratır (örn. Izmir'in Ankara'nın 'iki katı' olduğunu ima etmek gibi) ve girdiyi sıralı/sürekli kabul eden modelleri yanıltabilir. Encoding seçimi, kategorik değişkenin gerçekten doğal bir sırası olup olmadığına saygı göstermelidir.
Ml Data PreparationZorluk 2
Bir mühendis, bir feature için ölçekleme parametrelerini (örn. min/max ya da ortalama/varyans) tüm veri seti üzerinden hesaplıyor, ardından veriyi train ve test olarak bölüyor. Bu işlem sırasının sorunu nedir?
- aBu şekilde hesaplanan parametreler her zaman hatalıdır
- bTest setinin istatistikleri eğitim ölçeklemesine sızar✓
- cKategorik sütunların encode edilmesi imkansız olur
- dEğitim seti her zaman istenenden küçük çıkar
Açıklama:Herhangi bir veriden türetilen istatistiği (ölçekleme parametreleri, imputation değerleri, encoding) bölme işleminden önce tüm veri üzerinde fit etmek, test setindeki bilginin modelin eğitim sırasında gördüğü şeyi etkilemesine izin verir — klasik bir data leakage biçimidir. Çözüm, bu tür dönüşümleri yalnızca eğitim bölümü üzerinde fit edip validation/test'e uygulamaktır.
Ml Data PreparationZorluk 3
Bir kredinin temerrüde düşüp düşmeyeceğini tahmin eden bir modelde 'days_since_last_payment_before_default' adlı bir feature var; bu feature yalnızca gerçekten temerrüde düşen krediler için doludur (null değildir) ve temerrüt olayından sonra kaydedilen kayıtlardan hesaplanmıştır. Bu feature'ı kullanmanın temel sorunu nedir?
- aKullanışlı olamayacak kadar çok eksik değeri var
- bSayısal gibi görünen kategorik bir feature'dır
- cDiğer feature'larla aynı aralığa ölçeklenmesi gerekir
- dTarget leakage'dır — ancak sonuçtan sonra bilinir✓
Açıklama:Bir feature'ın yalnızca hedef sonuç zaten gerçekleştiği için dolu olması (ve sonuç-sonrası kayıtlardan türetilmesi), klasik bir target leakage örneğidir: model, gerçek bir tahmin anında var olmayan bilgiye dayanmayı öğrenir, bu da gerçekçi olmayan derecede güçlü offline metriklere ama production'da çöken performansa yol açar.
Ml Data PreparationZorluk 2
Bir veri seti rastgele train ve test olarak bölünüyor, fakat satırların yaklaşık %8'inin veri setindeki başka satırların birebir kopyası olduğu ve bunların bir kısmının bölmenin her iki tarafına da düştüğü ortaya çıkıyor. Bu durumun yarattığı temel risk nedir?
- aKopyalar sayesinde eğitim çok daha hızlı olur
- bTest seti otomatik olarak mükemmel stratifiye olur
- cModel, ezberlediği satırlar üzerinde değerlendirilir✓
- dKopyalanan satırların sayısal değil kategorik olması gerekir
Açıklama:Aynı (ya da neredeyse aynı) kayıtlar bölmenin her iki tarafında da bulunduğunda, model esasen zaten görmüş olduğu veri üzerinde değerlendirilebilir; bu da test metriklerini şişirir ve modelin gerçekten yeni veriye ne kadar iyi genelleştiğine dair yanlış bir izlenim verir. Bölmeden önce tekrarları temizlemek standart bir önlemdir.
Ml Data PreparationZorluk 2
Aşağıdakilerden hangisi bir makine öğrenmesi sürecinde 'data leakage'ın ne anlama geldiğini en iyi özetler?
- aTahmin anında olmayacak bilginin eğitimi çarpıtması✓
- bTahminlerin beklenenden yavaş sunulması
- cBir veri setinin depolama kapasitesini aşması
- dBir feature'ın dağılımının çalıştırmalar arası hafifçe kayması
Açıklama:Data leakage genel olarak, gerçek bir tahmin anında mevcut olmayacak bilginin (gelecek veri, hedeften türetilmiş sinyaller, test seti istatistikleri, tekrarlanan kayıtlar) eğitime ya da değerlendirmeye sızdığı her durumu kapsar ve gereğinden fazla iyimser, güvenilmez metrikler üretir.