yoklateknik mülakat

ML Engineer Junior Mülakat Soruları

394 doğrulanmış ML Engineer Junior mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Ml Data PreparationZorluk 1
Bir makine öğrenmesi pipeline'ında 'feature engineering' (öznitelik mühendisliği) en iyi şekilde neyi tanımlar?
  • aHam kayıtları tek bir tabloya toplamak
  • bGirdi değişkenlerini oluşturmak ya da dönüştürmek
  • cEğitim sırasında modelin parametrelerini ayarlamak
  • dGörülmemiş veri üzerinde doğruluğu ölçmek
Açıklama:Feature engineering, modelin tükettiği girdi değişkenlerini (ham ya da türetilmiş) şekillendirmekle ilgilidir; eğitim algoritmasının kendisi ya da sonrasındaki değerlendirme ile ilgili değildir. İyi feature'lar çoğu zaman algoritma seçiminden daha çok fark yaratır.
Ml Data PreparationZorluk 2
Bir veri setinde bir feature kabaca 0-1 arasında, diğeri ise kabaca 0-1.000.000 arasında değer alıyor. Mesafe ya da gradyan tabanlı bir model eğitilmeden önce bu durum giderilmezse en olası sonuç nedir?
  • aEksik değerler yüzünden eğitim başarısız olur
  • bKategorik sütunlar yanlış sırayla encode edilir
  • cTest setindeki bilgi eğitime sızar
  • dBüyük ölçekli feature modele baskın gelir
Açıklama:Feature'lar çok farklı sayısal ölçeklerde olduğunda, geniş aralıklı olan feature genelde mesafe hesaplamalarına ya da gradyan büyüklüklerine baskın gelir ve küçük ölçekli feature'ın sinyalini bastırır. Bu, bu tür modeller eğitilmeden önce feature'ları karşılaştırılabilir aralıklara ölçeklemenin temel gerekçesidir.
Ml Data PreparationZorluk 2
Bir veri setinde 'city' sütununda Istanbul, Ankara, Izmir gibi değerler var. Yeni bir mühendis bunları alfabetik olarak tam sayıya eşliyor (Ankara=0, Istanbul=1, Izmir=2) ve bunları, sayısal girdileri sıralı/sürekli kabul eden bir modele doğrudan veriyor. Buradaki temel risk nedir?
  • aModel, şehirler arasında yanlış bir sıra çıkarabilir
  • bModel, encoding'in sırasız olduğunu otomatik algılar
  • cBu eşlemeden sonra kategori sayısı azalır
  • dMetin sütunları hiçbir modelde encode edilemez
Açıklama:Sırasız kategorilere keyfi sıralı tam sayılar atamak, gerçekte olmayan bir büyüklük/sıra hissi yaratır (örn. Izmir'in Ankara'nın 'iki katı' olduğunu ima etmek gibi) ve girdiyi sıralı/sürekli kabul eden modelleri yanıltabilir. Encoding seçimi, kategorik değişkenin gerçekten doğal bir sırası olup olmadığına saygı göstermelidir.
Ml Data PreparationZorluk 1
Bir feature'ı sabit bir aralığa (örn. 0-1) ölçeklemek ile ortalaması sıfır, varyansı bir olacak şekilde ölçeklemek arasındaki kavramsal fark nedir?
  • aBiri sadece metne, diğeri sadece sayıya uygulanır
  • bİkisi tamamen aynı dönüşümdür
  • cBiri aralığa sıkıştırır, diğeri ortalamaya göre merkezler
  • dBiri aykırı değerleri temizler, diğeri önce temizlenmesini ister
Açıklama:Sabit bir aralığa ölçekleme ile ortalama/birim varyansa göre merkezleme, ikisi de feature'ları karşılaştırılabilir bir ölçeğe getirme yoludur ama farklı büyüklükler (min/max aralığı vs. ortalama/varyans) hesaplarlar ve aykırı değerler karşısında farklı davranabilirler.
Ml Data PreparationZorluk 2
Bir mühendis, bir feature için ölçekleme parametrelerini (örn. min/max ya da ortalama/varyans) tüm veri seti üzerinden hesaplıyor, ardından veriyi train ve test olarak bölüyor. Bu işlem sırasının sorunu nedir?
  • aBu şekilde hesaplanan parametreler her zaman hatalıdır
  • bTest setinin istatistikleri eğitim ölçeklemesine sızar
  • cKategorik sütunların encode edilmesi imkansız olur
  • dEğitim seti her zaman istenenden küçük çıkar
Açıklama:Herhangi bir veriden türetilen istatistiği (ölçekleme parametreleri, imputation değerleri, encoding) bölme işleminden önce tüm veri üzerinde fit etmek, test setindeki bilginin modelin eğitim sırasında gördüğü şeyi etkilemesine izin verir — klasik bir data leakage biçimidir. Çözüm, bu tür dönüşümleri yalnızca eğitim bölümü üzerinde fit edip validation/test'e uygulamaktır.
Ml Data PreparationZorluk 3
Bir kredinin temerrüde düşüp düşmeyeceğini tahmin eden bir modelde 'days_since_last_payment_before_default' adlı bir feature var; bu feature yalnızca gerçekten temerrüde düşen krediler için doludur (null değildir) ve temerrüt olayından sonra kaydedilen kayıtlardan hesaplanmıştır. Bu feature'ı kullanmanın temel sorunu nedir?
  • aKullanışlı olamayacak kadar çok eksik değeri var
  • bSayısal gibi görünen kategorik bir feature'dır
  • cDiğer feature'larla aynı aralığa ölçeklenmesi gerekir
  • dTarget leakage'dır — ancak sonuçtan sonra bilinir
Açıklama:Bir feature'ın yalnızca hedef sonuç zaten gerçekleştiği için dolu olması (ve sonuç-sonrası kayıtlardan türetilmesi), klasik bir target leakage örneğidir: model, gerçek bir tahmin anında var olmayan bilgiye dayanmayı öğrenir, bu da gerçekçi olmayan derecede güçlü offline metriklere ama production'da çöken performansa yol açar.

600 soruluk ML Engineer bankasında kendini sına.

Mülakata başla