yoklateknik mülakat

ML Engineer Cml Distance Clustering Dimreduction Mülakat Soruları

75 doğrulanmış ML Engineer Cml Distance Clustering Dimreduction mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Cml Distance Clustering DimreductionZorluk 1
scikit-learn'de KNeighborsClassifier.fit(X, y) gerçekte ne yapar?
  • aEğitim kümesini bir komşu-arama indeksine yerleştirir ve hiçbir parametre kestirmez
  • bEğitim satırlarında kareli hatayı küçülterek her feature için bir ağırlık kestirir
  • cHer sınıf etiketi için bir merkez hesaplar ve tahmin için yalnızca bu merkezleri tutar
  • dFeature uzayını saf bölgelere özyinelemeli bölerek bir eşik kuralları kümesi kurar
Açıklama:k-en-yakın-komşu tembel (lazy) bir öğrenicidir: fit yalnızca eğitim satırlarını ezberler, isteğe bağlı olarak KD-tree ya da ball-tree içine yerleştirir. Katsayı, merkez ya da bölme kuralı türetilmez; bu yüzden eğitim neredeyse bedava, buna karşılık her tahmin komşu arama maliyetini öder.
Cml Distance Clustering DimreductionZorluk 2
Bir k-en-yakın-komşu sınıflandırıcısında n_neighbors büyüdükçe karar sınırı nasıl davranır?
  • ak, girdi feature sayısını geçer geçmez tam olarak doğrusallaşır
  • bDaha tırtıklı hâle gelir, çünkü her sorguda daha kalabalık bir komşu kurulu oy verir
  • cDaha düzgün hâle gelir; bu varyansı düşürür, bias'ı yükseltir
  • dBiçimi aynı kalır, yalnızca sorgu başına tahmin gecikmesi k ile birlikte artar
Açıklama:Her tahmin k komşunun oyunu ortalar, dolayısıyla büyük k daha geniş bir bölgeyi ortalar ve sınır ince ayrıntısını kaybeder. Yöntemin klasik bias-varyans dengesi budur: k=1 her tekil etiketi izler, çok büyük k ise her yerde çoğunluk sınıfını söylemeye yaklaşır.
Cml Distance Clustering DimreductionZorluk 2
Wine veri kümesinde bir KNeighborsClassifier(n_neighbors=5) ölçeklemesiz 0.69, önünde StandardScaler ya da MinMaxScaler varken her iki durumda da yaklaşık 0.95 alıyor. Yine de iki ölçekleyici altında 178 satırın 125'i farklı bir beşli komşu kümesine düşüyor. İkisi neden ayrışıyor?
  • aMinMaxScaler sütunları korelasyonlu bırakır, StandardScaler ise önce bu korelasyonu kaldırır
  • b[0, 1] aralığına eşlemek her değerin işaretini atar; kareli fark ise tam olarak buna dayanır
  • cİkisi başlangıç noktasını farklı yere koyar ve kayan bir başlangıç en yakın satırları değiştirir
  • dBiri sütunu standart sapmasına, diğeri aralığına böler; sütun ağırlıkları böylece farklılaşır
Açıklama:İki dönüşüm de ham birim sorununu ortadan kaldırır; doğruluğun iki durumda da aynı yere oturmasının sebebi budur. Ama karşılaştırılabilirlik tek bir şey değildir: tek bir uzak uç değer taşıyan bir sütunun aralığı geniş, standart sapması ise ölçülüdür, dolayısıyla min-max o sütunu standartlaştırmadan çok daha sert sıkıştırır. Her sütun kareli toplama iki yöntemde farklı bir ağırlıkla girer ve ortaya çıkan komşu listeleri beş yerin ortalama 4.06'sında örtüşür.
Cml Distance Clustering DimreductionZorluk 2
Bir ekip kNN sınıflandırıcısını weights='uniform''dan weights='distance''a çeviriyor ve tahminler çoğunlukla sınıf sınırına yakın sorgu noktalarında değişiyor. Bu değişiklik neyi değiştirdi?
  • aOrtalama komşu mesafesinden daha uzaktaki komşular artık oylamadan tümüyle çıkarılıyor
  • bk komşunun her biri artık 1/d ile orantılı ağırlıkla oy veriyor
  • ck artık her sorgu noktası için çevredeki eğitim satırlarının yerel yoğunluğundan hesaplanıyor
  • dMetrik Minkowski'den, fit sırasında öğrenilen ağırlıklı bir mesafeye geçiyor
Açıklama:Uniform ağırlıkta k komşunun hepsi eşit sayılır; yoğun bir bölgenin hemen dışındaki bir sorgu, diğer sınıfın biraz daha uzaktaki noktalarınca oylamada geçilebilir. Ters-mesafe ağırlığı aynı k komşuyu korur ama en yakınların baskın olmasını sağlar; sınır noktalarının kaymasının sebebi tam olarak budur.
Cml Distance Clustering DimreductionZorluk 2
Bu kod parçası ne yazdırır (scikit-learn 1.6)?

from sklearn.metrics import pairwise_distances
a = [[0, 0]]
b = [[3, 4]]
print(pairwise_distances(a, b, metric="minkowski", p=1)[0, 0],
      pairwise_distances(a, b, metric="minkowski", p=2)[0, 0])
  • a12.0 5.0
  • b5.0 7.0
  • c7.0 7.0
  • d7.0 5.0
Açıklama:p=1 ile Minkowski, Manhattan mesafesidir: |3| + |4| = 7. p=2 ile Öklid mesafesidir: karekök(9 + 16) = 5. Bir metriği diğerine çeviren şey p üssüdür ve kNN'i kutudan çıktığı gibi Öklid yapan da varsayılan p=2 değeridir.
Cml Distance Clustering DimreductionZorluk 1
KMeans hangi büyüklüğü küçültür ve dolayısıyla inertia_ özniteliği neyi bildirir?
  • aAtanmış tüm örnekler üzerinden hesaplanan ortalama silhouette katsayısı
  • bHer örneğin atandığı merkeze kareli mesafesinin tüm örnekler üzerinden toplamı
  • cKüme başına bir Gauss bileşeni varsayımı altında gözlenen verinin log-olabilirliği
  • dEğitilmiş merkezlerin her çifti arasındaki ikili mesafelerin toplamı
Açıklama:k-means'in amacı küme-içi kareler toplamıdır (WCSS) ve fit sonrası inertia_ tam olarak bu değeri tutar. Ölçüt bir ortalamaya olan kareli Öklid mesafelerinin toplamı olduğu için algoritmanın tamamı sıkışık, kabaca küresel gruplara eğilim devralır.

1050 soruluk ML Engineer bankasında kendini sına.

Mülakata başla