Örnek sorular
Evaluation TestingZorluk 1
Bir LLM'e temperature > 0 ile aynı soruyu iki kez soruyorsun ve ikisi de makul ama farklı ifade edilmiş iki cevap alıyorsun. Bu durum LLM çıktısını değerlendirmeyi geleneksel yazılımdan neden daha zor kılar?
- aÇünkü non-determinism sadece yaratıcı yazım görevlerini etkiler, olgusal soru-cevapta neredeyse hiç etkisi yoktur
- bÇünkü LLM'ler sabit bir prompt için her zaman birebir aynı çıktıyı üretir, bu yüzden değerlendirme geleneksel yazılımdan daha basittir
- cÇünkü tek bir çalıştırmanın çıktısı, denemeler arasında modelin tipik kalitesini güvenilir şekilde temsil etmez✓
- dÇünkü random seed'i bir kez sabitlemek, sonrasında tüm modeller ve sağlayıcılar genelinde çıktıyı tamamen deterministik yapar
Açıklama:Çıktı her çalıştırmada değişebildiği için tek bir örnek tipik kaliteyi temsil etmez; değerlendirme birden fazla örnekleme ya da paraphrase'e tolere eden judge tabanlı skorlamayı gerektirir (c). Non-determinism olgusal soru-cevabı da etkiler, sadece yaratıcı görevleri değil (a yanlış). Temperature > 0'da LLM'ler her seferinde birebir aynı çıktıyı üretmez, bu yüzden bu nedenle daha basit değildir (b yanlış). Seed kontrolü her sağlayıcı/modelde değişkenliği tamamen ortadan kaldırmayı garanti etmez (d yanlış).
Evaluation TestingZorluk 1
Bir LLM uygulamasını değerlendirme bağlamında 'golden set' (eval set) nedir?
- aBeklenen çıktılarla eşleştirilmiş, temsili girdilerden oluşan sabit bir koleksiyon; kaliteyi tutarlı ölçmek için kullanılır✓
- bKullanıcı geri bildirimi olumlu olduğunda otomatik olarak kaydedilen, en yüksek skorlu prodüksiyon isteklerinin kümesi
- cHer yanıtın döndürülmeden önce karşı kontrol edildiği yasaklı kelime ve ifadeler listesi
- dHer deployment öncesinde canlı trafikten taze çekilen rastgele bir örneklem, böylece test verisi hep güncel kalır
Açıklama:Golden set, bilinen beklenen çıktılara sahip, değişiklikler arasında tekrar kullanılan seçilmiş sabit bir benchmark'tır (a). Otomatik kaydedilen olumlu geri bildirim istekleri (b) örtük bir feedback log'unu tanımlar, seçilmiş bir eval set değil. Yasaklı kelime listesi (c) bir guardrail/filtre öğesidir, değerlendirme benchmark'ı değil. Her seferinde taze rastgele trafik çekmek (d) tutarlı önce/sonra karşılaştırması için gereken sabit referansı ortadan kaldırır.
Evaluation TestingZorluk 1
Bir modelin bir dokümandan tek bir yapılandırılmış değeri (ör. sipariş ID'si) çıkardığı bir görevde, çıktıları 'exact match' ile puanlamanın önemli bir sınırlaması nedir?
- aSadece İngilizce yazılmış çıktılarda çalışır, başka herhangi bir dilde hata verir
- bÖnce çıktının ikinci bir LLM'e gönderilip incelenmesi olmadan hesaplanamaz
- cAnlamlı bir skor üretmesi için golden set'in en az bir milyon örnek içermesi gerekir
- dDeğer özünde doğru olsa bile, biçimlendirmede farklılık gösteren (ör. fazladan boşluk, baştaki sıfırlar) her çıktıya 0 puan verir✓
Açıklama:Exact match, değer işlevsel olarak doğru olsa bile yüzeysel biçimlendirme farklarına karşı kırılgandır; genellikle normalizasyon ya da daha esnek eşleşme gerektirir (d). Exact match düz bir string karşılaştırmasıdır, dilden bağımsızdır (a yanlış) ve ikinci bir LLM çağrısı gerektirmez (b yanlış). Küçük golden set'lerde de sorunsuz çalışır; minimum örnek sayısı şartı yoktur (c yanlış).
Evaluation TestingZorluk 1
Bir LLM uygulaması için 'offline evaluation' ile 'production monitoring' arasındaki temel pratik fark nedir?
- aOffline evaluation her zaman bir insan tarafından yapılır, production monitoring ise her zaman tamamen otomatiktir
- bOffline evaluation, yayınlamadan önce sabit bir test kümesine karşı çalışır; production monitoring ise yayından sonra canlı trafiği gözlemler✓
- cOffline evaluation sadece latency ve maliyeti kontrol eder, production monitoring ise sadece doğruluğu kontrol eder
- dProduction monitoring kurulduktan sonra offline evaluation gereksiz hale gelir, çünkü canlı trafik zamanla offline testin kapsayacağı her durumu kapsar
Açıklama:Temel ayrım zamanlama ve veri kaynağıdır: offline eval sabit, yayın-öncesi bir test kümesi kullanır; production monitoring yayından sonra canlı trafiği sürekli izler (b). Hiçbiri tanım gereği sadece insan ya da sadece otomatik değildir (a yanlış). İkisi de kurguya göre doğruluk, latency ya da maliyeti izleyebilir (c yanlış). Production monitoring, offline testin bilinçli olarak hedeflediği belirli edge case'lerin kapsanacağını garanti etmez, bu yüzden offline eval değerini korur (d yanlış).
Evaluation TestingZorluk 1
LLM uygulamalarının değerlendirilmesinde 'LLM-as-judge' terimi neyi ifade eder?
- aDeğerlendirilen sistemin çıktılarını puanlamak için, bir rubric ya da referans cevap eşliğinde ayrı bir LLM çağrısı kullanmak✓
- bBir model sağlayıcısının kendi modelinin, üzerine kurulan her uygulamanın güvenliğini onaylaması gerektiğine dair yasal bir zorunluluk
- cDeğerlendirilen modelin, tek bir geçişte kendi doğruluk yüzdesini tahmin etmesini isteyen bir teknik
- dKullanıcının tatmin edici bir cevap almadan önce prompt'unu kaç kez yeniden yazmak zorunda kaldığını sayan bir metrik
Açıklama:LLM-as-judge, çıktıları belirli kriterlere göre puanlamak/sıralamak için (genellikle ayrı) bir LLM çağrısı kullanmak demektir (a). Böyle bir sağlayıcı-onayı zorunluluğu yoktur, uydurmadır (b). Kendi doğruluğunu tahmin etmek (c) farklı ve genelde güvenilmez bir tekniktir, başka bir çıktıyı kritere göre yargılamak değildir. Yeniden yazma sayısını saymak (d) ayrı bir kullanım metriğidir, çıktı kalitesini yargılamakla ilgisizdir.
Evaluation TestingZorluk 1
Prodüksiyonda kullanılan bir prompt template'i değiştirdikten sonra, değişikliği yayınlamadan önce bilinen test case'lerden oluşan bir suite'i yeniden çalıştırmak neden iyi bir pratiktir?
- aÇünkü prompt değişiklikleri, model sağlayıcısından yazılı onay alınmadan yayınlanamaz
- bÇünkü test case'lerini yeniden çalıştırmak, herhangi bir case başarısız olursa prompt'u otomatik olarak önceki sürüme geri döndürür
- cDeğişiklik başka bir şeyi hedeflemiş olsa bile, daha önce doğru çalışan davranışın geriye gitmiş olabileceği durumları yakalamak için✓
- dYeni prompt'un eskisine kıyasla tükettiği token sayısını azaltmak için
Açıklama:Regression testing, yeni değişikliğin ne düzeltmeyi amaçladığından bağımsız olarak, önceden çalışan davranışta istenmeyen bozulmaları yakalamak için vardır (c). Böyle bir sağlayıcı onayı zorunluluğu yoktur, uydurmadır (a). Suite'i çalıştırmak yalnızca sonuçları gözlemler; ayrı bir tooling olmadan kendiliğinden geri dönüş yapmaz (b yanlış). Token sayısı ayrı bir maliyet konusudur, regression testing'in amacı değildir (d yanlış).