Örnek sorular
Cml Linear Logistic InternalsZorluk 1
scikit-learn'ün LinearRegression sınıfı katsayıları fit ederken aslında hangi büyüklüğü minimize eder?
- aTahminler ile gözlenen hedef değerler arasındaki farkların mutlak değer toplamını
- bTahminler ile gözlenen hedef değerler arasındaki farkların karelerinin toplamını✓
- cEğitim matrisinin herhangi bir satırında oluşan en büyük tek mutlak artığı
- dArtık kareler toplamına öğrenilen katsayıların karelerinin toplamını eklenmiş hâlini
Açıklama:LinearRegression sıradan en küçük kareler problemini çözer: artık kareler toplamını en küçük yapan katsayı vektörünü seçer. Mutlak artıkları minimize etmek en küçük mutlak sapma regresyonudur, en büyük artığı minimize etmek minimax bir uyumdur, kare katsayı terimi eklemek ise Ridge'in yaptığı şeydir. Kare almak, çözümün doğrusal bir sistemle kapalı formda bulunabilmesini sağlayan şeydir.
Cml Linear Logistic InternalsZorluk 2
Lojistik regresyonda, girdi feature'larının düz bir doğrusal fonksiyonu olarak modellenen büyüklük hangisidir?
- aSıfır ile bir aralığında tutulan, pozitif sınıfa ait olma olasılığının kendisi
- bSatırın feature uzayında fit edilen karar sınırına olan uzaklığının karesi
- cSatırın pozitif sınıfa ait olma bahis oranının (odds) doğal logaritması✓
- dEğitim setinin tamamında gözlenen pozitif etiketlerin negatiflere oranı
Açıklama:Logit bağlantısı, kesişim artı ağırlıklı feature toplamının log(p / (1 - p)) değerine eşit olması demektir; sigmoid ise bu bağlantının tersidir ve doğrusal skoru olasılığa geri taşır. Olasılığın kendisini doğrusal modellemek, tahminlerin sıfır-bir aralığının dışına çıkmasına izin verirdi; bağlantı fonksiyonunun çözdüğü sorun tam olarak budur. Eğitim setindeki sınıf dengesi ise verinin bir özelliğidir, doğrusal kısmın tahmin ettiği bir şey değil.
Cml Linear Logistic InternalsZorluk 2
Fit edilmiş ikili bir LogisticRegression modelinde coef_ = [[0.5]] ve intercept_ = [-1.0]. x = 2.0 için predict_proba pozitif sınıfa hangi değeri döner?
- a0.500✓
- b0.269
- c0.731
- d0.881
Açıklama:Doğrusal öngörücü 0.5 * 2.0 - 1.0 = 0.0 olur ve sıfırın sigmoid değeri tam olarak 0.5'tir, yani satır karar sınırının üzerindedir. Diğer değerler sırasıyla -1.0, +1.0 ve +2.0 doğrusal öngörücülerine karşılık gelir; bunlar için farklı bir feature değeri veya farklı bir kesişim gerekirdi.
Cml Linear Logistic InternalsZorluk 2
scikit-learn 1.6'da LogisticRegression sınıfının C hiperparametresi tam olarak neyi kontrol eder?
- aPenaltı ağırlığının kendisidir; C küçüldükçe katsayılar penaltısız uyuma daha yakın kalır
- bPenaltı ağırlığının tersidir; C küçüldükçe katsayılar daha sert biçimde küçültülür✓
- cTek bir katsayının fit sırasında ulaşabileceği mutlak değeri üstten sınırlar
- dÇözücünün durup sonuç dönmeden önce veri üzerinde kaç geçiş yapacağını belirler
Açıklama:scikit-learn amaç fonksiyonunu C çarpı toplam log-loss artı kare norm terimi olarak yazar; yani C veriye uyum kısmının önünde durur ve 1/lambda gibi davranır. C'yi düşürmek penaltıya göreli olarak daha fazla ağırlık verir ve katsayıları sıfıra doğru çeker. Bu estimator'da katsayı başına bir kırpma yoktur, iterasyon bütçesi ise max_iter parametresinde tutulur.
Cml Linear Logistic InternalsZorluk 2
Bir ekip arkadaşı, scikit-learn 1.6'da LogisticRegression() çağrısının argümansız hâlinin düz bir maksimum olabilirlik uyumu verdiğini söylüyor. Gerçekte ne fit ediliyor?
- aPenaltısız bir uyum; çünkü bu sürümde penalty argümanı zaten varsayılan olarak None'dır
- bL1 penaltılı bir uyum; çünkü varsayılan lbfgs çözücüsü küçük ağırlıkları sıfıra iter
- cİki sınıf dengeliyse penaltısız, dengesizse penaltılı bir uyum yapılır
- dL2 penaltılı bir uyum; çünkü varsayılan penalty 'l2' ve varsayılan C 1.0'dır✓
Açıklama:scikit-learn 1.6'daki varsayılanlar penalty='l2', C=1.0 ve solver='lbfgs' şeklindedir; yani siz açıkça penalty=None geçmedikçe düzenlileştirme açıktır. Bu bilinçli bir kütüphane tercihidir ve klasik istatistik paketlerindeki penaltısız gelenekten ayrılır. Sınıf dengesi penaltıyı hiçbir zaman açıp kapatmaz, lbfgs ise L1 penaltısını zaten fit edemez.
Cml Linear Logistic InternalsZorluk 1
LinearRegression katsayılarını tek adımda çözerken LogisticRegression yinelemeli bir çözücü çalıştırmak zorundadır. Bu farkı ne zorunlu kılar?
- aHedefi sayı değil sınıf etiketidir, etiketler üzerinde tanımlı bir matris formülü yoktur
- bTürevlerini sıfıra eşitlemek katsayılara göre doğrusal olmayan bir denklem takımı verir✓
- cAmaç fonksiyonunun birden çok yerel minimumu vardır, çözücü en iyisini arayarak bulmalıdır
- dKare norm penaltısı türevlenebilir olmadığından gradyanlar yaklaşıklanmak zorundadır
Açıklama:En küçük kareler karesel bir fonksiyonun türevini alır; durağanlık koşulları katsayılarda doğrusal çıkar ve tek bir doğrusal sistem cevabı döner. Lojistik olabilirlik ise katsayıları bir sigmoid'in içine koyar, aynı koşullar doğrusal olmayan biçimde çıkar ve hiçbir düzenleme katsayıları yalnız bırakamaz; çözücü bu yüzden optimuma doğru yürümek zorundadır. Bu yürüyüş yine de güvenilirdir, çünkü amaç fonksiyonu dışbükeydir ve birden çok değil tek bir optimumu vardır. Hedefin kategorik olması tek başına kapalı formu engellemez, kare norm penaltısı da pürüzsüz biçimde türevlenebilir.