Örnek sorular
Dl Initialization OptimizersZorluk 1
Tam bağlı bir gizli katman, içindeki her birim tam olarak aynı ağırlık vektörünü ve aynı bias'ı alacak şekilde başlatılıyor. Ardından düz gradyan inişiyle eğitim yapılıyor. Eğitim ilerledikçe bu gizli birimlere ne olur?
- aHer birim yavaşça farklı bir ağırlık vektörüne kayar, çünkü eğitim boyunca görülen mini-batch'ler adımdan adıma değişir.
- bSürekli aynı gradyanı alırlar, dolayısıyla katman çok kez kopyalanmış tek bir birim gibi davranır.✓
- cYalnızca ilk birim öğrenmeye devam eder; geri kalanlar başlangıç değerlerinde donmuş kalır.
- dDoğrusal olmayan fonksiyon uygulanır uygulanmaz birimler ayrışır, çünkü ReLU her birimin ön-aktivasyonuna farklı tepki verir.
Açıklama:Gelen ağırlıkları aynı olan birimler her girdi için aynı ön-aktivasyonu hesaplar; kayıp her birinin özdeş bir fonksiyonu olur ve geri yayılım onlara özdeş kısmi türevler verir. Özdeş parametre artı özdeş gradyan, sonsuza kadar özdeş güncelleme demektir; katmanın tüm çıktı uzayı tek bir yöne çöker ve fazladan genişlik hiçbir şey kazandırmaz.
Dl Initialization OptimizersZorluk 2
PyTorch 2.8 ile CPU'da, Linear(3,4) -> ReLU -> Linear(4,1) yapısındaki iki katmanlı bir MLP'de bütün ağırlık matrisleri ve bütün bias'lar tam olarak sıfıra ayarlanıyor. Bir batch ileri geçiriliyor, MSE kaybı hesaplanıyor ve backward() çağrılıyor. Hangi parametreler sıfırdan farklı bir gradyan alır?
- aHer iki ağırlık matrisi de, çünkü girdi batch'inin kendisi sıfırdan farklıdır ve ilk katmana olduğu gibi ulaşır.
- bİkinci katmanın ağırlığı ve bias'ı, çünkü kayıp doğrudan o katmanın çıktısından hesaplanır.
- cAğdaki bütün bias'lar; sıfır gradyanda takılı kalan tek tensörler iki ağırlık matrisidir.
- dYalnızca çıkış katmanının bias'ı; hataya hâlâ açık olan tek parametre odur.✓
Açıklama:Gizli aktivasyonlar relu(0) = 0 olduğundan, ikinci ağırlık matrisinin gradyanı bu aktivasyonlardan kurulur ve sıfırlanır. İlk katmana ulaşması gereken gradyanın ise ikinci ağırlık matrisi üzerinden geri yolculuk etmesi gerekir; o da sıfır olduğu için gradyan yine sıfırlanır. Gradyanı doğrudan ham hatanın kendisi olan tek parametre çıkış bias'ıdır; bu yüzden tamamen sıfır bir ağ o sabit noktadan hiç ayrılmaz.
Dl Initialization OptimizersZorluk 1
Xavier (Glorot) başlatması, bir katmanın ağırlıklarını varyansı katmanın şekline bağlı bir dağılımdan çeker. Bu varyansın hedeflediği büyüklük hangisidir?
- aYaklaşık olarak 2 bölü fan_in ile fan_out toplamı; böylece ileri sinyal ile geri sinyal arasında uzlaşma sağlanır.✓
- bYaklaşık olarak 2 bölü yalnızca fan_in; yani her birimin ön-aktivasyon değerine toplanan gelen bağlantıların sayısı kadar bir büyüklük.
- cYaklaşık olarak batch boyutunun tersi; böylece batch büyüdükçe varyans küçülür.
- dYaklaşık olarak 1 bölü fan_in ile fan_out çarpımı; bu da toplam ağırlık enerjisini sabit tutar.
Açıklama:Glorot türetmesi bir yandan aktivasyon varyansının ileri yönde korunmasını ister ki bu 1/fan_in'i gerektirir, bir yandan da gradyan varyansının geri yönde korunmasını ister ki bu 1/fan_out'u gerektirir. Katman kare değilse ikisi birden sağlanamaz, bu yüzden kural 2/(fan_in + fan_out) uzlaşmasını alır. Batch boyutu türetmeye hiç girmez; o katmanın değil veri hattının bir özelliğidir.
Dl Initialization OptimizersZorluk 2
He (Kaiming) başlatması, ardından ReLU gelen bir katman için yaklaşık 2/fan_in varyansı kullanır; aynı türetme aktivasyon olmadan yapılsaydı 1/fan_in isterdi. Buradaki fazladan 2 katsayısı nereden gelir?
- aReLU'nun pozitif tarafta eğiminin 2 olmasından; bu eğim içinden geçen sinyali ikiye katlar.
- bTek bir geri yayılım adımında rol alan iki ağırlık matrisinden: biri ileri geçiş, diğeri geri geçiş için.
- cReLU, simetrik bir ön-aktivasyon dağılımının kabaca yarısını sıfırlar ve katman çıktısının kare ortalamasını yarıya düşürür; ağırlıklar bunu telafi etmek için büyütülür.✓
- dKatman çıktısına ikinci bir bağımsız varyans kaynağı ekleyen bias vektörünü telafi eder.
Açıklama:Sıfır ortalamalı bir z ön-aktivasyonu için relu(z)'nin kare ortalaması tam olarak z'nin kare ortalamasının yarısıdır; çünkü dağılımın negatif yarısı sıfıra düşer, pozitif yarısı olduğu gibi geçer. Düzeltme yapılmazsa sinyalin ikinci momenti her katmanda yarıya iner ve derinlikle geometrik olarak söner. Ağırlık varyansını iki katına çıkarmak bunu geri kazandırır; 2/fan_in kuralının yaptığı tam olarak budur.
Dl Initialization OptimizersZorluk 2
Katman başına 256 birimli, 12 katmanlı bir ReLU ağı He yerine Xavier ile başlatılıyor ve ilk ileri geçişte aktivasyonların kare ortalaması katman katman ölçülüyor. Bu ölçüm nasıl bir örüntü gösterir?
- aKare ortalama her katmanda kabaca yarıya iner, öyle ki en derin katmanda girdi değerinin çok küçük bir kesridir.✓
- bKare ortalama derinlikle düzenli olarak büyür ve her katmanda kabaca ikiye katlanır; çünkü Xavier doğrultulmuş birimler için fazla agresiftir.
- cKare ortalama katmandan katmana değişmez; çünkü Xavier ile He yalnızca geri geçişte farklıdır.
- dKare ortalama ilk birkaç katmanda sabit kalır, sonra yığının derin kısmında ReLU doygunlaşmaya başladığı anda sınırsız biçimde büyümeye geçer.
Açıklama:Kare bir katmanda Xavier, doğrultulmuş bir katmanın ihtiyaç duyduğunun tam yarısı olan 1/fan_in ağırlık varyansını verir; üstüne ReLU ikinci momentin yarısını atar. İki etki katman başına yaklaşık yarı katsayısında birleşir ve bu derinlikte geometrik bir sönümdür. On iki katman üzerinde yapılan ölçüm girdinin birkaç kat altına iner; derin doğrultulmuş yığınların daha büyük He ölçeğini istemesinin nedeni budur.
Dl Initialization OptimizersZorluk 1
Düz stokastik gradyan inişinde bir parametreye uygulanan güncelleme, eksi öğrenme oranı çarpı o parametrenin gradyanıdır. Diğer her şey sabitken öğrenme oranı ikiye katlanırsa bu tek güncellemeye ne olur?
- aUzunluğu ikiye katlanır ve işareti döner, çünkü güncelleme bir çıkarma işlemidir.
- bUzunluğu değişmez ama gradyanın en dik koordinatına doğru döner.
- cUzunluğu dörde katlanır, çünkü kayıp adım boyutunun karesel bir fonksiyonudur.
- dUzunluğu ikiye katlanır, yönü değişmez.✓
Açıklama:Düz SGD, negatif gradyanı tek bir skalerle ölçekler; yani öğrenme oranı adımın yalnızca ne kadar uzağa gittiğini belirler, nereye baktığını asla belirlemez. Pozitif bir skaleri ikiye katlamak büyüklüğü ikiye katlar, yönü olduğu gibi bırakır. Kaybın karesel davranışı parametre güncellemesinin büyüklüğünde değil, kaybın ne kadar değiştiğinde ortaya çıkar.