yoklateknik mülakat

ML Engineer Senior Mülakat Soruları

395 doğrulanmış ML Engineer Senior mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Ml Data PreparationZorluk 3
Bir kredinin temerrüde düşüp düşmeyeceğini tahmin eden bir modelde 'days_since_last_payment_before_default' adlı bir feature var; bu feature yalnızca gerçekten temerrüde düşen krediler için doludur (null değildir) ve temerrüt olayından sonra kaydedilen kayıtlardan hesaplanmıştır. Bu feature'ı kullanmanın temel sorunu nedir?
  • aKullanışlı olamayacak kadar çok eksik değeri var
  • bSayısal gibi görünen kategorik bir feature'dır
  • cDiğer feature'larla aynı aralığa ölçeklenmesi gerekir
  • dTarget leakage'dır — ancak sonuçtan sonra bilinir
Açıklama:Bir feature'ın yalnızca hedef sonuç zaten gerçekleştiği için dolu olması (ve sonuç-sonrası kayıtlardan türetilmesi), klasik bir target leakage örneğidir: model, gerçek bir tahmin anında var olmayan bilgiye dayanmayı öğrenir, bu da gerçekçi olmayan derecede güçlü offline metriklere ama production'da çöken performansa yol açar.
Ml Data PreparationZorluk 3
10.000 kayıtlık bir dolandırıcılık tespiti veri setinde yalnızca 150 dolandırıcılık vakası (%1,5) var. Herhangi bir önlem alınmadan sıradan rastgele bir %80/%20 bölme kullanılırsa en olası sorun nedir?
  • aTest setinin dolandırıcılık oranı %1,5'ten uzaklaşabilir
  • bTrain tam 120, test tam 30 dolandırıcılık vakası alır
  • cSınıflar dengesiz olduğu için model hiç eğitilemez
  • d%80/%20 oranı otomatik olarak %50/%50'ye döner
Açıklama:Nadir bir sınıf söz konusu olduğunda, sıradan rastgele bölme şans eseri, genel veri setinden belirgin biçimde farklı bir sınıf oranına sahip ya da çok az pozitif örnek içeren bir test seti üretebilir; bu da üzerinde hesaplanan her metriği gürültülü ve güvenilmez kılar. Stratified bölme oranı train ve test arasında tutarlı tutar, ancak kesin sayılar yine de yuvarlamaya bağlıdır ve otomatik olarak belirli bir sayıya sabitlenmez.
Ml Data PreparationZorluk 3
Bir feature'ın değerlerinin çoğu için ortalaması 50, standart sapması 5. Bir değer ise 300. Bu değer ortalamadan yaklaşık kaç standart sapma uzaktadır ve bu ne anlama gelir?
  • aYaklaşık 2, tamamen tipik bir değer
  • bYaklaşık 5, ortalamanın biraz altında
  • cYaklaşık 50, araştırılmaya değer aşırı bir outlier
  • dStandart sapma tek bir değeri değerlendiremez
Açıklama:(300 - 50) / 5 = 50, yani değer ortalamadan yaklaşık 50 standart sapma uzakta — bu, tipik eşiklere kıyasla (genelde sadece 2-3 standart sapma bile dikkate değer sayılır) son derece büyük bir sapmadır. Bu, değeri nasıl ele alacağınıza karar vermeden önce gerçek bir nadir vaka mı yoksa veri hatası mı olduğunu araştırmanız için güçlü bir sinyaldir.
Ml Data PreparationZorluk 3
Bir veri setinde A ve B adlı iki sayısal feature arasında 0,98 korelasyon katsayısı var. Bir mühendis ikisini de tutup tutmayacağına karar vermek istiyor. En makul sonuç nedir?
  • a0,98, feature'ların ilgisiz olduğu anlamına gelir
  • b0,98 gerçek dünya feature'ları için imkansızdır
  • cFeature'lar birbiriyle neredeyse redundant'tır
  • d0,98, bir sütunun tamamen eksik olması gerektiği anlamına gelir
Açıklama:0,98 korelasyon katsayısı, iki feature'ın neredeyse mükemmel şekilde birlikte hareket ettiğini, yani birinin diğerinden büyük ölçüde tahmin edilebildiğini gösterir. Bu durumda ikisini de tutmak genelde çok az ek tahmin değeri katar ve redundancy ile karmaşıklığı artırır; bu yüzden birini kaldırmak ya da birleştirmek yaygın, makul bir seçimdir.
Ml Data PreparationZorluk 3
Bir mühendis eğitimden önce ham bir veri seti üzerinde şu adımları planlıyor: (1) eksik değerleri doldur, (2) sayısal feature'ları ölçekle, (3) train/test olarak böl, (4) modeli eğit. Kıdemli bir meslektaşı adım sıralamasını riskli buluyor. Ne değişmeli?
  • aHiçbir şey, verilen sıra zaten güvenli
  • b4. adım 3. adımdan önce çalışmalı
  • c1 ve 2. adımlar tamamen kaldırılmalı
  • dÖnce böl, sonra 1-2. adımları yalnızca train'e fit et
Açıklama:İmputation ya da ölçekleme istatistiklerini bölmeden önce tüm veri seti üzerinde fit etmek, test bölümündeki bilginin bu hesaplanan değerleri etkilemesine izin verir — ince bir data leakage biçimidir. Güvenli sıralama: önce böl, sonra veriden türetilen her dönüşümü yalnızca eğitim bölümü üzerinde fit et ve zaten fit edilmiş dönüşümü test bölümüne değiştirmeden uygula.
Ml Deployment ServingZorluk 3
Bir ödeme sistemi her işlemi tamamlanmadan önce, birkaç yüz milisaniye içinde onaylamalı veya reddetmelidir. Burada batch yerine online inference'ın gerekli olmasının nedeni nedir?
  • aÇünkü online inference her veri kümesinde batch inference'tan daha yüksek doğruluk garanti eder
  • bÇünkü batch inference hiçbir kullanım durumunda günde birden fazla çalıştırılamaz
  • cÇünkü karar, işlem devam edebilmeden önce, o işleme özel ve senkron biçimde gerekiyor
  • dÇünkü batch inference sayısal girdi özelliklerini hiç desteklemez
Açıklama:Karar, şu anda gerçekleşen belirli bir işlemi kilitliyor; bu yüzden o tek istek için senkron biçimde üretilmelidir. İşlem henüz var olmadığından yanıtı önceden hesaplamak mümkün değildir.

600 soruluk ML Engineer bankasında kendini sına.

Mülakata başla