Örnek sorular
Dl Losses Output LayersZorluk 1
Bir sınıflandırıcının son katmanı ham skor vektörü üretir ve softmax sınıf boyutu boyunca uygulanır. Ortaya çıkan vektör hakkında ne garanti edilir?
- aHer giriş (-1, 1) aralığındadır ve girişlerin toplamı sıfırdır.
- bEn büyük ham skor tam olarak 1, diğer bütün girişler tam olarak 0 olur.
- cHer giriş kesin olarak 0 ile 1 arasındadır ve sınıf boyutu boyunca girişlerin toplamı 1'dir; dolayısıyla vektör sınıflar üzerinde kategorik bir dağılım olarak okunabilir.✓
- dHer giriş, ham skorun ham skorlar toplamına bölümüne eşittir.
Açıklama:Softmax her skorun üstelini alır, bu her girişi kesin pozitif yapar, sonra bu üstellerin toplamına böler ve toplamı 1'e zorlar. Üstel fonksiyon pozitif ve sonlu olduğu için matematiksel olarak hiçbir giriş tam olarak 0 ya da 1 olamaz; float32'de ise maksimumun yeterince altında kalan bir skor 0.0'a yuvarlanır ve komşusunu 1.0'da bırakır. Maksimuma sabit 1 atayan yaklaşım argmax/one-hot'u tarif eder, softmax'ı değil; ham skorları toplamlarına bölmek ise negatif skorlarda bozulan farklı bir normalizasyondur.
Dl Losses Output LayersZorluk 2
PyTorch 2.8'de CPU üzerinde torch.softmax(torch.tensor([2.0, 1.0, 0.0]), dim=0) çalıştırıyorsunuz. Basılan çıktıya en yakın olan hangisidir?
- a[0.333, 0.333, 0.333], üç sınıf üzerinde düzgün dağılım
- b[0.500, 0.333, 0.167], yani ham skorların bir fazlasıyla orantılı
- c[0.667, 0.333, 0.000], yani doğrudan ham skorların kendisiyle orantılı
- d[0.665, 0.245, 0.090]✓
Açıklama:Softmax exp(2), exp(1) ve exp(0) değerlerini hesaplar; bunlar 7.389, 2.718 ve 1.000'dir ve her biri 11.107 olan toplamlarına bölünür. Sonuç yaklaşık 0.665, 0.245 ve 0.090 olur. Komşu skorlar tam olarak 1 fark ettiği için komşu olasılıkların oranı e, yani yaklaşık 2.718'dir; doğru vektörü tanımanın en hızlı yolu budur.
Dl Losses Output LayersZorluk 2
İki logit vektörü aynı softmax'a veriliyor: [1.0, 2.0, 3.0] ve [51.0, 52.0, 53.0]. İki olasılık vektörü nasıl karşılaştırılır ve bu cevap uygulama açısından neden önemlidir?
- aİkinci vektör çok daha sivridir, çünkü büyük ham skorlar olasılık kütlesinin daha fazlasını en büyük girişe yığar ve diğerlerini sıfıra doğru sıkıştırır.
- bİkincisi daha düzdür, çünkü üsteller doygunluğa ulaşır.
- cYalnızca son ondalıkta ayrışırlar, çünkü kayan nokta büyük üstelleri yuvarlar.
- dÖzdeştirler: her skora aynı sabiti eklemek softmax'ı değiştirmez ve uygulamalar tam da bu nedenle satır maksimumunu çıkarır.✓
Açıklama:Sabit eklemek her üsteli aynı çarpanla çarpar ve bu çarpan pay ile paydada sadeleşir, dolayısıyla olasılıklar değişmez. Yalnızca skorlar arasındaki farklar önemlidir, mutlak seviyeleri değil. Kütüphane uygulamaları üstel almadan önce satır maksimumunu çıkarır; böylece en büyük üs sıfırda kalır ve toplam taşmaz.
Dl Losses Output LayersZorluk 3
Bir talep modeli günlük sipariş sayısını tahmin ediyor. Başı tek bir doğrusal birim ve ham çıktısı z, beklenen oranın logaritması olarak okunuyor; eğitim exp(z) − y·z biçimindeki Poisson negatif log-olabilirliğini minimize ediyor. y = 4 siparişin olduğu bir günde baş şu anda z = 0.5 üretiyor. Bu örneğin kaybının z'ye göre gradyanı neye eşittir ve başı hangi yöne iter?
- a2·(exp(z) − y)·exp(z), burada −7.75, çünkü oran ile sayım arasındaki kareli hata üstel bağlantı üzerinden zincirlenir.
- bexp(z) − y, burada −2.35; dolayısıyla exp(z) oranı gözlenen sayıma ulaşana kadar baş yukarı itilir.✓
- c1 − y/exp(z), burada −1.43, çünkü logaritmik bağlantı güncellemeyi farka değil sayım/oran oranına bağlar.
- dz − log(y), burada −0.89, çünkü log bağlantısı amacı log ölçeğinde düz bir artığa çevirir.
Açıklama:exp(z) − y·z ifadesinin z'ye göre türevi exp(z) − y'dir, yani tahmin edilen oran eksi gözlenen sayım; bu da tam olarak exp(z) = y olduğunda durağandır. PyTorch 2.8'de doğrulandı: log_input=True ile F.poisson_nll_loss, z = 0.5 ve y = 4 için -0.3513 ve autograd gradyanı olarak -2.3513 raporladı; bu da exp(0.5) - 4'tür. Log-girdili biçim sabit log(y!) terimini düşürür, raporlanan değerin hiçbir sorun yokken negatif çıkabilmesinin sebebi budur; bağlantı ise tahmin edilen oranı çıktıda hiçbir kırpma olmadan pozitif tutar.
Dl Losses Output LayersZorluk 2
Bir fotoğraf etiketleme modeli, bir görüntüye 12 etiketin herhangi bir alt kümesini iliştirmek zorunda; tek bir fotoğraf meşru şekilde aynı anda 'plaj', 'gün batımı' ve 'insan' taşıyabilir. Bu göreve hangi çıktı katmanı ve kayıp uyar?
- aEtiket başına bir çıktı birimi ve her birinde bağımsız sigmoid, etiket başına ikili çapraz entropi ile eğitilir; böylece birden fazla etiket ortak bir bütçe için yarışmadan aynı anda güvenle açık olabilir.✓
- bEtiket başına bir çıktı birimi ve etiketler üzerinde softmax, kategorik çapraz entropi ile eğitilir.
- cDeğeri en güçlü etiketin indeksine yuvarlanan tek bir çıktı birimi.
- dEtiket başına bir çıktı birimi ve softmax, ardından her olasılığa 0.5 eşiği uygulanır.
Açıklama:Softmax 12 çıktıyı toplamlarını 1'e zorlayarak birbirine bağlar; bir etiketin güvenini artırmak zorunlu olarak diğerlerini düşürür ve bu, çok etiketli bir problem için yanlış yapısal varsayımdır. Etiket başına bir sigmoid birimi her etiketi kendi evet/hayır kararına çevirir ve ikili çapraz entropi bu kararların her birini ayrı ayrı skorlar; alt-küme değerli bir etiketin gerçek yapısı da budur. Softmax'ı 0.5'te eşiklemek durumu daha da kötüleştirir, çünkü 12 yarışan sınıfla neredeyse hiçbir şey 0.5'i aşamaz.
Dl Losses Output LayersZorluk 1
Bir ağ, görüntüyü birbirini dışlayan 10 kategoriden birine sınıflandırıyor. Sondan bir önceki öznitelik vektörü 256 girişli ve kayıp nn.CrossEntropyLoss. Son nn.Linear katmanı ne olmalı?
- a
nn.Linear(256, 10), kategori başına bir ham logit üretir.✓ - b
nn.Linear(256, 9), çünkü bir kategori diğer dokuzdan ima edilir ve onu eklemek fazlalık olur. - c
nn.Linear(256, 10) ve ardından nn.Softmax(dim=1), böylece kriter düzgün olasılıklar alır. - d
nn.Linear(256, 1), çünkü çapraz entropi tamsayı etiketle karşılaştıracağı tek bir skora ihtiyaç duyar.
Açıklama:Çapraz entropi, 10 kategori üzerinde bir dağılım kurup hedef indeksi seçebilmek için sınıf başına bir skora ihtiyaç duyar; bu da katmanın 256'dan 10'a olmasını gerektirir (bias dâhil 2570 parametre). Kriter ham skorları tüketir ve normalizasyonu kendi yapar, dolayısıyla önüne açık bir softmax katmanı koymak arayüzün beklediği şey değildir. Bir sınıfı düşürüp dokuz çıktı bırakmak, kriterin o kategoriyi hiç skorlayamaması demektir; o kategori asla tahmin edilemez.