yoklateknik mülakat

ML Engineer Ml Problem Framing Mülakat Soruları

75 doğrulanmış ML Engineer Ml Problem Framing mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Ml Problem FramingZorluk 1
Bir veri seti neden genellikle ayrı train, validation ve test setlerine bölünür?
  • aEğitim döngüsünü hızlandırmak için veriyi küçük parçalar halinde işlemek amacıyla
  • bModeli bir parçada eğitmek, kararları başka parçada ayarlamak, tarafsız bir son ölçüm almak
  • cProjede diskte saklanması gereken toplam veri miktarını azaltmak için
  • dModelin desenleri daha güvenilir ezberlemesi için her örneği iki kez görmesini sağlamak için
Açıklama:Train seti model parametrelerini fit eder, validation seti test setine dokunmadan karar almak (hangi model, hangi ayar) için kullanılır, test seti ise hiçbir karara etki etmediği için genelleme hakkında tarafsız bir son ölçüm verir. (a) ve (c) depolama/hız yan etkilerini anlatır, gerçek nedeni değil. (d) yanlıştır: aynı veriye tekrar tekrar maruz kalmak ezberlemeyi (overfitting) riske atar — bölmenin tam olarak tespit etmeye çalıştığı şey budur.
Ml Problem FramingZorluk 1
ML problem çerçevelemede "baseline model" (temel model) nedir?
  • aEkibin problem için teknik olarak inşa edebileceği en karmaşık model mimarisi
  • bZaten production'a alınmış ve yeni bir aday tarafından değiştirilmekte olan model
  • cDaha karmaşık bir modeli yargılamak için referans noktası olarak kullanılan basit, ucuza kurulabilen bir kural
  • dTüm deneyleme ve hyperparameter tuning bittikten sonra seçilen nihai model versiyonu
Açıklama:Baseline kasıtlı olarak basittir (bir kural, çoğunluk sınıfı tahmini, basit bir doğrusal model) — böylece hızlıca kurulur ve bir referans skor verir. Sonrasında gelen her daha karmaşık model, ek maliyetini ve karmaşıklığını haklı çıkarmak için bunu geçmelidir. (a) fikrin tam tersidir (baseline'lar basittir, en gösterişli seçenek değil). (b) baseline'ı mevcut production modeliyle karıştırır; bu farklı bir kavramdır (yenilmesi gereken şampiyon, mutlaka basit olması gerekmez). (d) başlangıç referans noktasını değil, seçilen nihai modeli anlatır.
Ml Problem FramingZorluk 2
Bir ekip baseline kurmayı atlayıp doğrudan karmaşık bir modele geçiyor ve seçtikleri metrikte %82'ye ulaşıyor. Bu neden risklidir?
  • aBir referans skor olmadan %82'nin iyi mi, vasat mı yoksa basit bir kuraldan biraz mı iyi olduğu yargılanamaz
  • bKarmaşık modeller her zaman baseline'lardan daha düşük skorlar, bu yüzden %82 neredeyse kesin pipeline'da bir hatadır
  • cBaseline atlamak yalnızca regresyon problemlerinde risklidir, bunun gibi sınıflandırma problemlerinde değil
  • dRisklidir çünkü karmaşık modellerin eğitimi daha uzun sürer, bunun metrik değeriyle bir ilgisi yoktur
Açıklama:Bir metrik değeri ancak bir şeye göreceli olarak yorumlanabilir: basit bir kural (çoğunluk sınıfını tahmin et), basit bir sezgisel kural ya da önceki bir model. Eğer çoğunluk sınıfı tahmini bu veride zaten %80 skorluyorsa, karmaşık model maliyetine rağmen neredeyse hiçbir şey katmamıştır. (b) yanlış bir iddiadır — karmaşık modellerin daha düşük skorlayacağının hiçbir garantisi yoktur. (c) yanlıştır: risk her ML problem tipi için geçerlidir. (d) eğitim maliyetini, skorun kendisinin iyi olup olmadığını bilmeme sorunuyla karıştırır.
Ml Problem FramingZorluk 1
Bir sınıflandırma probleminde "accuracy" (doğruluk) metriği neyi ölçer?
  • aPozitif tahmin edilenlerin gerçekten pozitif olma oranını
  • bGerçek pozitiflerin modelin başarıyla tespit ettiği oranını
  • cModelin pozitif örnekleri negatif örneklerin üzerinde sıralayabilme yeteneğini
  • dTüm tahminlerin (pozitif ve negatif) gerçek etiketle eşleşen oranını
Açıklama:Accuracy = (doğru tahminler) / (toplam tahminler), her iki sınıfı da sayar. (a) precision'ı anlatır. (b) recall'u anlatır. (c) AUC-ROC'un arkasındaki sıralama fikrini anlatır, accuracy'yi değil. Accuracy her tahmini sınıftan bağımsız aynı şekilde ele alır — sınıflar dengesiz olduğunda yanıltıcı hale gelmesinin nedeni tam olarak budur.
Ml Problem FramingZorluk 2
Sade bir dille, "precision" bir sınıflandırıcı için neyi cevaplar?
  • aGerçekten pozitif olan tüm örneklerden model kaçını yakaladı?
  • bModelin pozitif olarak işaretlediği tüm örneklerden kaçı gerçekten pozitif?
  • cTüm olası karar eşiklerinde model iki sınıfı ne kadar iyi ayırıyor?
  • dToplamda, pozitif ve negatif birlikte, kaç tahmin doğruydu?
Açıklama:Precision = doğru pozitifler / (doğru pozitifler + yanlış pozitifler): modelin pozitif dediği şeyler arasından ne kadarının doğru olduğu. (a) recall'u anlatır (gerçek pozitiflerin kapsanma oranı). (c) AUC-ROC gibi eşikten bağımsız bir sıralama ölçüsünü anlatır. (d) accuracy'yi anlatır. Precision özellikle bir pozitif alarm çaldığında ona güvenip güvenemeyeceğinizle ilgilidir.
Ml Problem FramingZorluk 2
Sade bir dille, "recall" bir sınıflandırıcı için neyi cevaplar?
  • aModelin pozitif olarak işaretlediği her şeyden ne kadarı gerçekten pozitifti?
  • bTahmin edilen sınıflar gerçek sınıf dağılımına göre ne kadar dengeli?
  • cGerçekten pozitif olan tüm örneklerden model kaçını gerçekten buldu?
  • dModelin tahminleri aynı girdi üzerinde tekrarlanan çalıştırmalarda ne kadar tutarlı?
Açıklama:Recall = doğru pozitifler / (doğru pozitifler + yanlış negatifler): gerçekten pozitif olan her şeyden modelin ne kadarını yakalayabildiği. (a) precision'ı anlatır. (b) recall'un tanımıyla ilgisi olmayan bir sınıf-dengesi özelliğini anlatır. (d) çalıştırmadan çalıştırmaya kararlılığı anlatır, bu tamamen farklı bir konudur (recall değil, reprodüksiyon).

600 soruluk ML Engineer bankasında kendini sına.

Mülakata başla