yoklateknik mülakat

AI Engineer Rag Retrieval Search Mülakat Soruları

75 doğrulanmış AI Engineer Rag Retrieval Search mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Rag Retrieval SearchZorluk 1
RAG için retrieval'da, dense (embedding tabanlı) retrieval ile sparse (keyword/BM25) retrieval arasındaki temel fark nedir?
  • aDense yalnızca kısa dökümanlarda, sparse yalnızca uzun dökümanlarda çalışır.
  • bDense anlama göre, sparse tam terim örtüşmesine göre eşleşir.
  • cDense hiç index gerektirmez, sparse her zaman graph index gerektirir.
  • dDense sonuçları alfabetik, sparse dosya boyutuna göre sıralar.
Açıklama:Dense retrieval, query ve döküman embedding'lerini semantik bir vektör uzayında karşılaştırır; bu yüzden ortak kelime olmasa bile eş anlamlı ya da yeniden ifade edilmiş metinler eşleşebilir. Sparse retrieval (ör. BM25) dökümanları tam token örtüşmesine göre, terim nadirliği ve frekansıyla ağırlıklandırarak skorlar; bu yüzden terimin birebir geçmesi gerekir. (a), (c) ve (d) bu iki yöntemin relevance'ı gerçekte nasıl hesapladığıyla ilgisi olmayan ayrımlar tarif eder.
Rag Retrieval SearchZorluk 1
Genel hatlarıyla, BM25 skorlama fonksiyonu bir dökümanı bir sorgu için sıralarken neyi tartar?
  • aTerim frekansı, terim nadirliği (IDF) ve döküman uzunluğu.
  • bDökümanın index'e ne zaman eklendiği ve inbound link sayısı.
  • cİki öğrenilmiş dense vektör arasındaki kosinüs açısı.
  • dSorguyu göz ardı ederek dökümandaki toplam benzersiz kelime sayısı.
Açıklama:BM25; terim frekansını (bir sorgu teriminin dökümanda ne sıklıkla geçtiği), inverse document frequency'yi (korpus genelinde daha nadir terimler daha fazla ağırlık alır) ve döküman uzunluğu normalizasyonunu (böylece uzun dökümanlar sadece terimi daha çok tekrarlayarak kazanmaz) birleştirir. (b) recency/link tabanlı sıralama sinyallerini tarif eder, BM25 ile ilgisizdir. (c) dense vektör benzerliğini tarif eder, sparse skorlama değil. (d) sorguyu tamamen göz ardı eder, BM25 bunu yapmaz.
Rag Retrieval SearchZorluk 2
4 dökümanlık bir korpus (boşlukla token'lanmış) BM25Okapi ile index'leniyor ve "what does error x401 mean" sorgusu her birine karşı skorlanıyor:
doc0: "restart the service after updating the configuration file"
doc1: "error code x401 means the authentication token has expired"
doc2: "authentication tokens can expire and usually require a refresh"
doc3: "server logs show timeout errors during periods of high load"

bm25.get_scores(query) çalıştırıldığında gerçek skorlar [0.0, 1.6946, 0.0, 0.0] çıkıyor. doc1 diğerlerinden neden bu kadar yüksek skor alıyor?
  • aBM25 her zaman index'e ilk eklenen dökümanı kayırır.
  • bdoc1 en kısa döküman ve BM25 kısa dökümanları kayırır.
  • cdoc1, nadir sorgu token'ı "x401"i tek başına içeriyor.
  • dDiğer dökümanlar stopword içerdiği için tokenizer'ca reddedildi.
Açıklama:"x401" sorguda geçiyor ve bu korpusta yalnızca doc1'de var, bu da ona yüksek bir inverse-document-frequency ağırlığı kazandırıyor; doc2 semantik olarak aynı konuyla ilgili (kimlik doğrulama token'ının süresi dolması) ama yüksek IDF'li tam sorgu token'larını paylaşmıyor, bu yüzden 0 skor alıyor. (a) yanlış — BM25'te ekleme sırası diye bir kavram yok. (b) gerçek ama ikincil bir faktör (BM25'te uzunluk normalizasyonu vardır), ama burada belirleyici faktör tek başına uzunluk değil, tam nadir-terim eşleşmesidir. (d) tokenizasyonu yanlış tarif ediyor — stopword'ler skoru düşürür, dökümanları tamamen sıfırlamaz.
Rag Retrieval SearchZorluk 2
İki aday döküman, semantik eksenler [auth, error, server, refresh] boyunca 4-boyutlu oyuncak embedding olarak temsil ediliyor:
query = [0.90, 0.10, 0.00, 0.60]
doc1  = [0.85, 0.90, 0.00, 0.10]   # tam hata kodunu içeriyor, zayıf refresh sinyali
doc2  = [0.95, 0.05, 0.00, 0.90]   # yeniden ifade, kod yok, güçlü auth+refresh sinyali

Gerçek kosinüs benzerliği hesaplandığında cos(query, doc1) ≈ 0.6782 ve cos(query, doc2) ≈ 0.9841 çıkıyor. Bu, dense retrieval hakkında burada bize ne söylüyor?
  • aNormalize vektörlerde kosinüs benzerliği 0.9'u geçemez.
  • bdoc1'de mutlaka bir yazım hatası var, çünkü daha düşük skor aldı.
  • cHiçbir döküman ilgili değil, çünkü hiçbir skor 1'e yakın değil.
  • ddoc2'nin semantik profili query ile daha yakın hizalanır.
Açıklama:Kosinüs benzerliği, mevcut tam token'lardan bağımsız olarak vektörler arasındaki açıyı ölçer; burada doc2'nin profili (güçlü auth + refresh, query'nin baskın sinyalleriyle eşleşiyor) query ile doc1'in profilinden daha yakın hizalanıyor, doc1 gerçek hata kodunu içeren döküman olsa bile. Bu, dense retrieval'ın belirli bir nadir terimin varlığına göre değil, genel semantik hizalanmaya göre sıraladığını gösterir. (a) yanlış bir kısıtlama — kosinüs benzerliği doğal olarak 1.0'a kadar çıkabilir. (b) ve (c) sayıların ne gösterdiğini yanlış yorumluyor.
Rag Retrieval SearchZorluk 3
Aynı sorgu için BM25 (soru 3), "x401" içeren doc1'i 1.6946 skorla birinci sıraya koyarken doc2 0.0 alıyor. Semantik olarak karşılaştırılabilir bir çift üzerinde dense kosinüs benzerliği (soru 4) çalıştırıldığında ise yeniden-ifade dökümanı (0.9841) tam-kod dökümanının (0.6782) önüne geçiyor. Bu ayrışma, iki yöntemi birleştirmek hakkında ne gösteriyor?
  • aİki skorlama implementasyonundan biri mutlaka bug içeriyor.
  • bFarklı sinyaller ölçülür, anlaşmazlık beklenir; hybrid'in nedeni budur.
  • cBM25, dense retrieval lehine tamamen terk edilmeli.
  • dBM25 skorları ve kosinüs benzerlikleri doğrudan karşılaştırılabilir.
Açıklama:Her iki skorlama çalışması da kendi bakış açısında doğru — sadece farklı türde relevance'ları ölçüyorlar. BM25 tam nadir-terim örtüşmesini ödüllendirir, dense embedding'ler genel semantik yakınlığı ödüllendirir. Hiçbiri "yanlış" değil; tam olarak bu tür anlaşmazlık, hybrid retrieval'ın motivasyonudur — hybrid, her iki sıralamayı birleştirerek her iki sinyalden birinde güçlü olan bir dökümanın yüzeye çıkmasını sağlar. (a) anlaşmazlığın bir bug ima ettiğini yanlış varsayar. (c) tek bir örnekten desteklenmeyen bir sonuç çıkarır. (d) kritik bir hatadır — BM25 ve kosinüs benzerliği farklı, karşılaştırılamaz ölçeklerde yaşar, fusion yöntemlerinin ham skor yerine rank pozisyonu kullanmasının nedeni tam olarak budur.
Rag Retrieval SearchZorluk 2
Bir retrieval çalışması şu sıralı döküman ID listesini döndürüyor: ["d7", "d3", "d1", "d9", "d2"]. Sorgu için tek ilgili döküman "d1", 3. sırada yer alıyor. recall@k'yı gerçekten hesaplamak recall@1 = 0.0, recall@2 = 0.0, recall@3 = 1.0 veriyor. Bu, top-k'nin recall üzerindeki etkisi hakkında somut olarak neyi gösteriyor?
  • aİlgili döküman ilk sırada değilse recall@k tanımsızdır.
  • bk arttıkça recall düştü, yani daha fazla sonuç durumu kötüleştirdi.
  • cRecall, k ilgili dökümanın rankına ulaşana kadar 0 kalır, sonra 1'e sıçrar.
  • dBu recall@k aslında precision'ı ölçüyor, recall'ı değil.
Açıklama:recall@k, ilgili döküman(lar)ın top-k sonuçları içinde herhangi bir yerde bulunup bulunmadığını sorar; d1 3. sırada olduğundan top-1 ve top-2 onu kaçırır (recall 0), top-3 (ve ötesi) onu içerir (recall 1). k'yı artırmak yalnızca daha fazla aday ekleyip hiçbirini çıkarmadığından, recall@k, k'de monoton olarak azalmayandır (sabit kalır ya da artar). (a) yanlış — recall@k 0'da bile iyi tanımlıdır. (b) sayıları yanlış okuyor, sayılar azalmıyor artıyor. (d) recall'ı precision ile karıştırıyor; precision aynı zamanda arasına kaç alakasız döküman karıştığını da hesaba katar, bu örnek bunu test etmiyor.

2025 soruluk AI Engineer bankasında kendini sına.

Mülakata başla