yoklateknik mülakat

AI Engineer Embeddings Vector Search Mülakat Soruları

75 doğrulanmış AI Engineer Embeddings Vector Search mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Embeddings Vector SearchZorluk 1
Bir AI uygulamasında embedding en temel haliyle nedir?
  • aBir metnin ya da başka bir verinin anlamını temsil eden sayısal bir vektör.
  • bDepolama verimliliği için tutulan, orijinal dokümanın sıkıştırılmış bir yedeği.
  • cİki dokümanın birebir aynı olup olmadığını hızlıca kontrol etmek için kullanılan bir hash değeri.
  • dGirdi metninin tokenize edilmesiyle oluşturulan, tam kelime konumlarının bir index'i.
Açıklama:Embedding'ler metni (ya da görsel/ses gibi başka verileri) anlamca birbirine yakın girdilerin vektör uzayında birbirine yakın düştüğü bir sayısal vektöre dönüştürür. Hash (c) tam eşleşen kopyaları yakalamak içindir, anlamı ölçmez; bu yüzden embedding'in sağladığı benzerlik aramasını sağlayamaz.
Embeddings Vector SearchZorluk 1
Bir ekip neden yalnızca keyword eşleşmesine güvenmek yerine arama için embedding kullanabilir?
  • aEmbedding'ler genelde keyword aramadan daha az sonuç döner, bu da sunucu yükünü azaltır.
  • bEmbedding'ler, ortak kelime olmasa bile sorgunun anlamca ilişkili içeriği bulmasını sağlar.
  • cEmbedding'ler getirilen her dokümanın sorgu string'ini birebir içerdiğini garanti eder.
  • dEmbedding'ler, index'lemeden sonra orijinal metni saklama gereğini ortadan kaldırır.
Açıklama:Semantik arama tam token eşleşmesi yerine anlamı karşılaştırır, bu yüzden keyword aramanın tamamen kaçıracağı ilişkili içerikleri de gösterebilir. (c) şıkkı embedding tabanlı aramanın davranışının tam tersini anlatır — birebir string eşleşmesi şart koşulmaz.
Embeddings Vector SearchZorluk 2
Bir kullanıcı 'araba tamircisi' araması yapıyor ve sorguda hiç birlikte geçmese bile 'oto servis' geçen sonuçları da bekliyor. Bu senaryoya en uygun retrieval yaklaşımı hangisidir?
  • aSorgu ile doküman arasında yalnızca birebir eşleşen token'ları kullanan keyword (lexical) arama.
  • bYalnızca sorgu kelimelerinin doküman içinde kaç kez tekrarlandığına göre sıralayan bir arama.
  • cKelimelerin birebir eşleşmesi yerine anlamı karşılaştıran, embedding tabanlı semantik arama.
  • dSorgu ile dokümanın birebir aynı bir alt string paylaşmasını şart koşan bir arama.
Açıklama:'Araba tamircisi' ile 'oto servis' hiçbir ortak token paylaşmasa da anlamca yakın olduğundan, embedding tabanlı benzerlik araması bu ikisini anlam üzerinden bağlayabilir. (a), (b) ve (d) gibi lexical yaklaşımların hepsi burada bulunmayan birebir kelime örtüşmesine dayanır.
Embeddings Vector SearchZorluk 2
İki embedding vektörü karşılaştırılırken cosine similarity ne ölçer?
  • aİki vektörün aynı değere sahip olduğu boyutların tam sayısını.
  • bİki vektörün diskte saklanırken kapladığı bellek boyutu farkını.
  • cİki orijinal metin girdisi arasında örtüşen token sayısını.
  • dİki vektör arasındaki açıyı; büyüklükten bağımsız olarak yönlerinin ne kadar benzer olduğunu gösterir.
Açıklama:Cosine similarity, iki vektör arasındaki açıya dayanır; bu yüzden vektör uzunluğundan bağımsız olarak yön benzerliğini yakalar. (a) ve (c) şıkları cosine similarity'nin hesaplamadığı, ilgisiz kavramları (birebir değer eşleşmesi, token örtüşmesi) anlatır.
Embeddings Vector SearchZorluk 3
Junior bir mühendis şu benzerlik fonksiyonunu yazıyor:
score = dot(query_vec, doc_vec)

Bu hesaplamadan önce vektörler normalize edilmiyor. Bu ne tür bir soruna yol açabilir?
  • aİki vektörün boyutu farklı olduğunda dot product bir runtime hatası fırlatır.
  • bBüyüklüğü daha fazla olan vektörler, anlamca daha ilgili olmasalar bile daha yüksek skor alarak sıralamayı bozabilir.
  • cSonuç, vektör uzunluğundan bağımsız olarak her zaman cosine similarity değerine eşit olur.
  • dİki metin anlamca ilgisiz olduğunda skor her zaman negatif çıkar.
Açıklama:Ham dot product vektör uzunluğuna duyarlıdır; bu yüzden embedding'i büyük büyüklükte çıkan dokümanlar, daha küçük büyüklükteki gerçekten ilgili dokümanları skorla geçebilir. (c) şıkkı bunun tersini anlatır: normalize edilmemiş dot product yalnızca her iki vektör de zaten birim uzunluktaysa cosine similarity'ye eşit olur.
Embeddings Vector SearchZorluk 2
İki embedding vektörü arasında Euclidean distance ne ölçer?
  • aVektör uzayındaki iki nokta arasındaki, hem yön hem büyüklüğü içeren düz çizgi mesafesini.
  • bİki vektörün aynı işarete sahip olduğu boyutların oranını.
  • cVektörleri üreten iki orijinal metin arasında ortak geçen kelime sayısını.
  • dİki vektör arasındaki, büyüklüğü tamamen göz ardı eden açıyı.
Açıklama:Euclidean distance, iki nokta arasındaki geometrik düz çizgi mesafesidir; bu yüzden cosine similarity'nin aksine yalnızca yönden değil vektörlerin büyüklüğünden de etkilenir. (d) şıkkı aslında Euclidean distance'ı değil, cosine similarity'yi tarif eder.

2025 soruluk AI Engineer bankasında kendini sına.

Mülakata başla