yoklateknik mülakat

ML Engineer Dl Sequence Attention Mülakat Soruları

75 doğrulanmış ML Engineer Dl Sequence Attention mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Dl Sequence AttentionZorluk 1
T uzunluğunda bir dizi üzerinde açılan (unrolled) sade bir yinelemeli ağda, tekrarlı ağırlık matrisleri T adım boyunca nasıl kullanılır?
  • aHer adım için ayrı bir tekrarlı matris öğrenilir, bu yüzden uzun dizi orantılı olarak daha çok parametre ister
  • bYalnızca girdi izdüşümü paylaşılır; dizinin her adımı için taze bir tekrarlı matris ayrılır
  • cAynı matrisler her adımda yeniden kullanılır, bu yüzden parametre sayısı dizi uzunluğundan bağımsızdır
  • dMatrisler batch boyunca paylaşılır ama dizinin her adımında başlatıcıdan yeniden örneklenir
Açıklama:Yineleme, tek bir hücre fonksiyonunun tekrar tekrar uygulanması demektir; dolayısıyla aynı girdi-gizli ve gizli-gizli matrisleri her adımda iş görür. Eğitilmiş aynı ağın istediği uzunlukta diziyi işleyebilmesinin sebebi tam olarak budur; yinelemeli bir katmanı büyüten şey de girdinin uzaması değil, gizli durumun genişlemesidir.
Dl Sequence AttentionZorluk 2
PyTorch 2.8. lstm = nn.LSTM(input_size=6, hidden_size=10, batch_first=True) ve x şekli (3, 7, 6). output, (h_n, c_n) = lstm(x) çağrısından sonra output ve h_n şekilleri nedir?
  • aoutput (3, 7, 10) ve h_n (1, 3, 10)
  • boutput (3, 7, 6) ve h_n (3, 10)
  • coutput (7, 3, 10) ve h_n (3, 1, 10)
  • doutput (3, 10) ve h_n (3, 7, 10)
Açıklama:Katman her zaman adımı için bir gizli vektör üretir; batch_first=True ile yığılmış çıktı batch ve zaman eksenlerini korur, öznitelik eksenini hidden_size ile değiştirir. Son durum ayrıca döndürülür ve önce katman-yön ekseniyle indekslenir; tek yönlü tek katmanda bu eksen 1 uzunluğundadır.
Dl Sequence AttentionZorluk 3
PyTorch 2.8'de nn.LSTM(input_size=8, hidden_size=16) kuruyor ve parametreleri üzerinde p.numel() topluyorsunuz. Hangi sayıyı elde edersiniz ve neden?
  • a416, çünkü (16, 8) şeklinde bir ağırlık bloğu artı (16, 16) şeklinde biri artı bir bias hücreyi kapatır
  • b832, çünkü iki gate'in her biri tam bir girdi ve tekrarlı izdüşüm ile bias'larını ister
  • c1664, çünkü dört gate'in her biri girdi izdüşümü, tekrarlı izdüşüm ve iki bias vektörü ister
  • d1600, çünkü dört gate girdi ve tekrarlı izdüşüm ister ama hücre tek bir bias vektörü tutar
Açıklama:Katman dört gate ön-aktivasyonunu tek blokta paketler; ağırlıklar (416, 8) ve (416, 16) şeklindedir ve PyTorch girdi ile tekrarlı taraf için 416 uzunluğunda iki ayrı bias vektörü tutar. Bu da 4(168 + 1616 + 2*16) = 1664 eder; modül üzerinde doğrudan ölçüldü.
Dl Sequence AttentionZorluk 2
Aynı girdi ve gizli boyutlarda bir GRU'nun parametre sayısı bir LSTM'inkiyle nasıl karşılaştırılır ve oranı hangi yapısal olgu açıklar?
  • aEşittirler, çünkü GRU aynı dört gate'i kullanır ama girdi ve forget gate'ini birbirine bağlar
  • bGRU'da dörtte üçü kadardır, çünkü dört yerine üç gate'li blok vardır
  • cGRU'da yarısı kadardır, çünkü hem cell state'i hem output gate'ini atar
  • dGRU'da daha fazladır, çünkü belleği gizli duruma katmak fazladan bir izdüşüm ister
Açıklama:LSTM dört gate'li ön-aktivasyon bloğu hesaplar, GRU üç blok hesaplar ve her blok aynı girdi izdüşümü, tekrarlı izdüşüm ve bias maliyetini taşır. Girdi 10, gizli 20 ile ölçüldüğünde GRU 1920, LSTM 2560 çıktı; tam olarak üçe dört oranı.
Dl Sequence AttentionZorluk 2
Aynı dizi üzerinde çalışan iki katmanlı bir yinelemeli yığın kuruluyor. t adımında ikinci katman girdi olarak neyi alır?
  • aBirinci katmanın son gizli durumunu; bu durum ikinci katmanın her adımına değişmeden yayınlanır
  • bBirinci katmanın t adımındaki gizli çıktısını; derinlik ile zaman ayrı eksenler olarak kalır
  • cYine t adımındaki ham girdiyi; iki katman yalnızca son durumları birleştirilirken buluşur
  • dBirinci katmanın 0'dan t'ye kadarki tüm çıktılarının birleştirilmişini; bu yüzden genişlik t ile büyür
Açıklama:Yığın, alttaki katmanın adım başına çıktı dizisine uygulanan derinlik yönünde bir yinelemedir; ikinci katman, birincinin adım başına bir girdi tüketmesi gibi adım başına bir vektör tüketir. İki katmanlı bir modülü iki ayrı tek katmanlı modül olarak yeniden kurup birincinin çıktı dizisini ikinciye vermek, yığılmış modülün çıktısını float toleransında yeniden üretti.
Dl Sequence AttentionZorluk 3
PyTorch 2.8. Bir self-attention katmanının sorgu ve anahtar izdüşümleri ayrı ve öğrenilmiş. 10 token'lık bir girdi için ölçekli skorlara softmax uygulayıp ağırlık matrisine bakıyorsunuz. Bir satırdaki en büyük ağırlığın köşegende, yani token'ın kendi konumunda olması ne sıklıkta beklenir?
  • aHer zaman, çünkü bir vektörün kendisiyle nokta çarpımı satırının tutabileceği en büyük değerdir
  • bGenellikle, çünkü bir token'ın sorgusu ile anahtarı tek bir vektörün iki görüntüsüdür ve ilişkili kalır
  • cHiçbir zaman, çünkü bir token kendi anahtar kümesinin dışında tutulur ve kendini okuyamaz
  • dBaşka herhangi bir sütundan daha sık değil; sorgu ile anahtar token'ın farklı görüntüleridir
Açıklama:Bir token'ın sorgusu ile anahtarı onun iki farklı doğrusal görüntüsüdür; dolayısıyla köşegendeki skor birbiriyle ilgisiz iki vektörün sıradan bir nokta çarpımıdır ve yapısal bir üstünlük taşımaz. 10 token ve 16 genişlikle beş rastgele çekilişte köşegen, satır maksimumunu 10 satırın 0 ile 2'sinde tuttu ve ortalama köşegen ağırlığı düzgün dağılım değeri olan 0.1 civarında kaldı; ham token vektörleri hem sorgu hem anahtar olarak verildiğinde ise maksimum 10 satırın hepsinde köşegene düştü, sezginin kaynağı da budur.

1500 soruluk ML Engineer bankasında kendini sına.

Mülakata başla