[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"me":3,"catalog:tr:ml-engineer\u002Fti-checkpointing-fault-tolerance":4,"config":211},null,{"field_key":5,"field_name":6,"seniority":7,"topic_key":8,"topic_name":9,"spec_key":7,"spec_name":7,"locale":10,"cell_total":11,"field_total":12,"seniorities":13,"topics":17,"specs":112,"samples":126},"ml-engineer","ML Engineer","","ti-checkpointing-fault-tolerance","Ti Checkpointing Fault Tolerance","tr",75,2400,[14,15,16],"junior","mid","senior",[18,21,24,27,30,33,36,39,42,45,48,51,54,57,60,63,66,69,72,75,78,81,84,87,90,93,96,97,100,103,106,109],{"key":19,"name":20,"count":11},"cml-distance-clustering-dimreduction","Cml Distance Clustering Dimreduction",{"key":22,"name":23,"count":11},"cml-gradient-boosting-mechanics","Cml Gradient Boosting Mechanics",{"key":25,"name":26,"count":11},"cml-linear-logistic-internals","Cml Linear Logistic Internals",{"key":28,"name":29,"count":11},"cml-probabilistic-models-calibration","Cml Probabilistic Models Calibration",{"key":31,"name":32,"count":11},"cml-svm-kernels-margins","Cml Svm Kernels Margins",{"key":34,"name":35,"count":11},"cml-trees-randomforest-internals","Cml Trees Randomforest Internals",{"key":37,"name":38,"count":11},"dl-architecture-layers","Dl Architecture Layers",{"key":40,"name":41,"count":11},"dl-initialization-optimizers","Dl Initialization Optimizers",{"key":43,"name":44,"count":11},"dl-losses-output-layers","Dl Losses Output Layers",{"key":46,"name":47,"count":11},"dl-normalization-regularization","Dl Normalization Regularization",{"key":49,"name":50,"count":11},"dl-sequence-attention","Dl Sequence Attention",{"key":52,"name":53,"count":11},"dl-training-dynamics-backprop","Dl Training Dynamics Backprop",{"key":55,"name":56,"count":11},"fe-binning-discretization","Fe Binning Discretization",{"key":58,"name":59,"count":11},"fe-categorical-encoding-mechanics","Fe Categorical Encoding Mechanics",{"key":61,"name":62,"count":11},"fe-interactions-basis-expansion","Fe Interactions Basis Expansion",{"key":64,"name":65,"count":11},"fe-numeric-transforms-distributions","Fe Numeric Transforms Distributions",{"key":67,"name":68,"count":11},"fe-temporal-cyclical-features","Fe Temporal Cyclical Features",{"key":70,"name":71,"count":11},"fe-text-highcardinality-features","Fe Text Highcardinality Features",{"key":73,"name":74,"count":11},"ml-data-preparation","Ml Data Preparation",{"key":76,"name":77,"count":11},"ml-deployment-serving","Ml Deployment Serving",{"key":79,"name":80,"count":11},"ml-experimentation-reproducibility","Ml Experimentation Reproducibility",{"key":82,"name":83,"count":11},"ml-model-selection-tuning","Ml Model Selection Tuning",{"key":85,"name":86,"count":11},"ml-model-training-evaluation","Ml Model Training Evaluation",{"key":88,"name":89,"count":11},"ml-monitoring-drift","Ml Monitoring Drift",{"key":91,"name":92,"count":11},"ml-problem-framing","Ml Problem Framing",{"key":94,"name":95,"count":11},"ml-scaling-performance","Ml Scaling Performance",{"key":8,"name":9,"count":11},{"key":98,"name":99,"count":11},"ti-cluster-scheduling-resources","Ti Cluster Scheduling Resources",{"key":101,"name":102,"count":11},"ti-distributed-strategies-sync","Ti Distributed Strategies Sync",{"key":104,"name":105,"count":11},"ti-input-pipeline-throughput","Ti Input Pipeline Throughput",{"key":107,"name":108,"count":11},"ti-throughput-profiling-bottlenecks","Ti Throughput Profiling Bottlenecks",{"key":110,"name":111,"count":11},"ti-training-determinism-numerics","Ti Training Determinism Numerics",[113,117,120,123],{"key":114,"name":115,"count":116},"classical-ml","Classical ML",450,{"key":118,"name":119,"count":116},"deep-learning","Deep Learning",{"key":121,"name":122,"count":116},"feature-engineering","Feature Engineering",{"key":124,"name":125,"count":116},"training-infrastructure","Training Infrastructure",[127,145,158,172,185,198],{"id":128,"topic":9,"difficulty":129,"body":130,"options":131,"correct_key":136,"explanation":144},"01a05d13-8bef-7b7a-8b1b-34f651abea8c",2,"Bir ekip checkpoint'leri yalnızca `torch.save(model.state_dict(), path)` ile kaydediyor, sonra eğitimi bu dosyayı taze kurulmuş bir modele ve taze kurulmuş bir `SGD(momentum=0.9)` optimizer'a yükleyerek devam ettiriyor. Resume sonrası önce ne bozulur?",[132,135,138,141],{"key":133,"text":134},"a","Model'in forward pass'i resume edilen ilk batch'te hemen NaN çıktı üretir.",{"key":136,"text":137},"b","Optimizer'ın henüz momentum tampon değeri yok; resume'un ilk adımları momentum'u sıfırdan yeniden kurar.",{"key":139,"text":140},"c","Hiçbir şey bozulmaz; SGD momentum'u optimizer'da değil model parametrelerinin içinde saklanır.",{"key":142,"text":143},"d","Loss fonksiyonu resume sonrası sessizce farklı bir reduction moduna geçer.","Taze bir `SGD` optimizer'ın `state_dict()['state']` alanı en az bir `.step()` çağrılana kadar boştur; bu yüzden momentum sıfırdan yeniden birikmek zorundadır — çökme öncesi momentum tampon değerleri hiç kaydedilmemiştir çünkü yalnız `model.state_dict()` diske yazılmıştı.",{"id":146,"topic":9,"difficulty":129,"body":147,"options":148,"correct_key":139,"explanation":157},"01a05d13-8c31-7d1d-8502-d0345c9b5f73","Bir iş, öğrenme oranını 12.000. adıma kadar 0.1'den 0.025'e düşüren bir `StepLR` scheduler ile eğitiliyor. Yalnızca model ve optimizer durumu kaydedilmişti. Çökme sonrası tamamen yeni bir `StepLR` örneğiyle resume edildiğinde eğitim hangi öğrenme oranından devam eder?",[149,151,153,155],{"key":133,"text":150},"0.025, çünkü optimizer'ın `param_groups`'u — scheduler'dan bağımsız olarak — son uygulanan öğrenme oranını hatırlar.",{"key":136,"text":152},"0.0125, çünkü scheduler resume edilen ilk adımda oranı bir kez daha yarıya indirir.",{"key":139,"text":154},"0.1, scheduler'ın taban öğrenme oranı — çünkü yeni bir `StepLR` `last_epoch=0` ile başlar.",{"key":142,"text":156},"0.0, çünkü kaydedilmemiş bir scheduler yeniden ısıtılana kadar varsayılan olarak sıfır öğrenme oranı verir.","Yeni kurulan bir `StepLR` her zaman `last_epoch=0` ile başlar; bu yüzden optimizer'ın kurucusuna verilen taban öğrenme oranını uygular. Scheduler'ın kendi durumu (adım sayacı) checkpoint'lenmediği için, iş taban orandan itibaren decay takvimini sessizce baştan başlatır.",{"id":159,"topic":9,"difficulty":160,"body":161,"options":162,"correct_key":133,"explanation":171},"01a05d13-8c3d-7811-99b8-786b569ce022",1,"```python\nopt = torch.optim.SGD(model.parameters(), lr=0.1, momentum=0.9)\nprint(len(opt.state_dict()['state']))\n```\nBu satır `opt` kurulduktan hemen sonra, hiç `.step()` çağrılmadan çalışıyor. Ne yazdırır?",[163,165,167,169],{"key":133,"text":164},"0",{"key":136,"text":166},"Modeldeki parametre tensörlerinin sayısı.",{"key":139,"text":168},"1, çünkü `state` kurulumdan hemen sonra tek bir toplu girdi tutar.",{"key":142,"text":170},"Bir hata, çünkü `state_dict()` ilk optimizasyon adımından önce çağrılamaz.","Bir optimizer'ın `state` sözlüğü tembel doldurulur — momentum tampon değerleri gibi girdiler yalnızca bir parametre ilk kez `.step()` ile güncellendiğinde oluşturulur. Kuruluşun hemen ardından bu sözlük boştur, dolayısıyla `len(...)` 0 verir.",{"id":173,"topic":9,"difficulty":160,"body":174,"options":175,"correct_key":142,"explanation":184},"01a05d13-8c41-7580-a21e-bf26a58cb7ec","Aşağıdakilerden hangisi gerçekten `torch.amp.GradScaler`'ın `state_dict()`'i içinde saklanır?",[176,178,180,182],{"key":133,"text":177},"Eğitim başladığından beri gözlenen tüm loss değerlerinin tam listesi.",{"key":136,"text":179},"En son backward pass'te hesaplanan her gradyan tensörünün bir kopyası.",{"key":139,"text":181},"Optimizer'ın her parametre grubu için öğrenme oranı.",{"key":142,"text":183},"Şu anki loss-scale faktörü, artı büyüme\u002Fgeri çekilme faktörleri ve bir büyüme-aralığı adım sayacı.","`GradScaler.state_dict()`, `{'scale', 'growth_factor', 'backoff_factor', 'growth_interval', '_growth_tracker'}` gibi küçük bir sözlük döndürür — mevcut ölçekleme faktörünü ve bir sonraki ölçek büyütmesine ne kadar yakın olunduğunu izler; gradyanları ya da loss geçmişini değil.",{"id":186,"topic":9,"difficulty":129,"body":187,"options":188,"correct_key":136,"explanation":197},"01a05d13-8c45-74f6-85bb-dcf7d8b85b66","Bir model checkpoint'i yalnızca ağırlıkları ve optimizer durumunu kaydediyor, RNG durumunu değil. Çökme sonrası eğitim aynı adımdan, başlangıçta taze bir `torch.manual_seed(123)` çağrısıyla devam ettiriliyor; amaç çökme öncesiyle aynı dropout maskelerini ve artırmaları yeniden üretmek. Gerçekte ne olur?",[189,191,193,195],{"key":133,"text":190},"RNG dizisi tam olarak yeniden üretilir, çünkü başlangıçta tohumlamak bir koşunun herhangi bir sonraki noktasındaki diziyi yeniden üretir.",{"key":136,"text":192},"RNG dizisi hemen sapar, çünkü yeniden tohumlamak üreteci sıfırdan yeniden başlatır.",{"key":139,"text":194},"PyTorch, RNG durumunu otomatik olarak `model.state_dict()` içinde saklar ve geri yükler; bu yüzden bu bir sorun değildir.",{"key":142,"text":196},"Model `.train()` modundayken dropout maskeleri RNG durumundan bağımsız olarak belirlenmiştir.","Aynı taban tohumla yeniden tohumlamak, diziyi sıfır konumundan tekrar oynatır — çökme öncesi üretecin binlerce önceki çekimden sonra ulaştığı noktadan değil. Bu yüzden resume edilen koşunun dropout maskeleri ve artırmaları, çökme öncesinde gelecek olanlarla artık örtüşmez.",{"id":199,"topic":9,"difficulty":129,"body":200,"options":201,"correct_key":133,"explanation":210},"01a05d13-8c4c-7532-9299-74882b14087a","Bir checkpoint yazma rutini önce `torch.save(state, path + \".tmp\")` çağırıyor, ancak bu hatasız tamamlandıktan SONRA `os.replace(path + \".tmp\", path)` çağırıyor. Neden doğrudan `torch.save(state, path)` çağırmak yerine geçici bir yola yazıp yeniden adlandırılıyor?",[202,204,206,208],{"key":133,"text":203},"Süreç yazma sırasında ölürse, geçici dosya yarım kalır — `path`'teki dosya dokunulmamış kalır.",{"key":136,"text":205},"Bu gereklidir çünkü `torch.save` aynı yoldaki mevcut bir dosyanın üzerine yazamaz.",{"key":139,"text":207},"Yazımı hızlandırır, çünkü bir dosyayı yeniden adlandırmak — tam bir yeniden yazımın aksine — aynı bayt sayısını iki kez yazmaktan daha hızlıdır.",{"key":142,"text":209},"Yalnızca GPU tensörlerini kaydederken gereklidir; CPU tensörleri bu riski taşımadan her zaman doğrudan nihai yola kaydedilebilir.","Aynı dosya sisteminde bir yeniden adlandırma (`os.replace`) neredeyse anlıktır ve ya tamamen başarır ya da hiç gerçekleşmez — bu yüzden `path` her zaman ya eski, tam checkpoint'e ya da yeni, tam checkpoint'e işaret eder, asla yarım yazılmış bir dosyaya değil. Doğrudan `path`'e yazmak, süreç kayıt sırasında ölürse orada yarım kalmış, okunamaz bir dosya bırakma riski taşır.",{"fields":212,"seniorities":436,"interview_shapes":437,"locales":442,"oauth":444,"question_count":447,"coach_enabled":448,"jd_match_enabled":448},[213,238,258,275,299,312,331,350,372,391,406,428],{"key":214,"name_tr":215,"name_en":215,"sort":160,"specializations":216},"backend","Backend",[217,220,223,226,229,232,235],{"key":218,"name":219,"field":214},"general","Genel",{"key":221,"name":222,"field":214},"go","Go",{"key":224,"name":225,"field":214},"python","Python",{"key":227,"name":228,"field":214},"java","Java",{"key":230,"name":231,"field":214},"csharp","C#\u002F.NET",{"key":233,"name":234,"field":214},"nodejs","Node.js",{"key":236,"name":237,"field":214},"php","PHP",{"key":239,"name_tr":240,"name_en":240,"sort":129,"specializations":241},"frontend","Frontend",[242,243,246,249,252,255],{"key":218,"name":219,"field":239},{"key":244,"name":245,"field":239},"javascript","JavaScript",{"key":247,"name":248,"field":239},"typescript","TypeScript",{"key":250,"name":251,"field":239},"react","React",{"key":253,"name":254,"field":239},"vue","Vue",{"key":256,"name":257,"field":239},"angular","Angular",{"key":259,"name_tr":260,"name_en":260,"sort":261,"specializations":262},"fullstack","Fullstack",3,[263,264,265,266,267,268,269,270,271,272,273,274],{"key":218,"name":219,"field":259},{"key":221,"name":222,"field":214},{"key":224,"name":225,"field":214},{"key":227,"name":228,"field":214},{"key":230,"name":231,"field":214},{"key":233,"name":234,"field":214},{"key":236,"name":237,"field":214},{"key":244,"name":245,"field":239},{"key":247,"name":248,"field":239},{"key":250,"name":251,"field":239},{"key":253,"name":254,"field":239},{"key":256,"name":257,"field":239},{"key":276,"name_tr":277,"name_en":277,"sort":278,"specializations":279},"devops-cloud","DevOps \u002F Cloud",4,[280,281,284,287,290,293,296],{"key":218,"name":219,"field":276},{"key":282,"name":283,"field":276},"aws","AWS",{"key":285,"name":286,"field":276},"gcp","GCP",{"key":288,"name":289,"field":276},"azure","Azure",{"key":291,"name":292,"field":276},"kubernetes","Kubernetes",{"key":294,"name":295,"field":276},"terraform","Terraform",{"key":297,"name":298,"field":276},"linux","Linux",{"key":300,"name_tr":301,"name_en":301,"sort":302,"specializations":303},"ai-engineer","AI Engineer",5,[304,305,306,309],{"key":218,"name":219,"field":300},{"key":224,"name":225,"field":300},{"key":307,"name":308,"field":300},"llm-rag","LLM\u002FRAG",{"key":310,"name":311,"field":300},"mlops","MLOps",{"key":313,"name_tr":314,"name_en":315,"sort":316,"specializations":317},"database","Veritabanı","Database",6,[318,319,322,325,328],{"key":218,"name":219,"field":313},{"key":320,"name":321,"field":313},"postgresql","PostgreSQL",{"key":323,"name":324,"field":313},"mysql","MySQL",{"key":326,"name":327,"field":313},"mongodb","MongoDB",{"key":329,"name":330,"field":313},"redis","Redis",{"key":332,"name_tr":333,"name_en":334,"sort":335,"specializations":336},"mobile","Mobil","Mobile",7,[337,338,341,344,347],{"key":218,"name":219,"field":332},{"key":339,"name":340,"field":332},"ios-swift","iOS (Swift)",{"key":342,"name":343,"field":332},"android-kotlin","Android (Kotlin)",{"key":345,"name":346,"field":332},"flutter","Flutter",{"key":348,"name":349,"field":332},"react-native","React Native",{"key":351,"name_tr":352,"name_en":353,"sort":354,"specializations":355},"security","Güvenlik","Security",8,[356,357,360,363,366,369],{"key":218,"name":219,"field":351},{"key":358,"name":359,"field":351},"appsec","AppSec",{"key":361,"name":362,"field":351},"offensive-pentest","Offensive \u002F Pentest",{"key":364,"name":365,"field":351},"cloud-security","Cloud Security",{"key":367,"name":368,"field":351},"devsecops","DevSecOps",{"key":370,"name":371,"field":351},"blue-team-incident","Blue Team \u002F Incident",{"key":373,"name_tr":374,"name_en":375,"sort":376,"specializations":377},"qa-test-automation","QA \u002F Test Otomasyonu","QA \u002F Test Automation",9,[378,379,382,385,388],{"key":218,"name":219,"field":373},{"key":380,"name":381,"field":373},"test-automation","Test Automation",{"key":383,"name":384,"field":373},"sdet","SDET",{"key":386,"name":387,"field":373},"performance-testing","Performance Testing",{"key":389,"name":390,"field":373},"mobile-qa","Mobile QA",{"key":392,"name_tr":393,"name_en":393,"sort":394,"specializations":395},"data-engineer","Data Engineer",10,[396,397,400,403],{"key":218,"name":219,"field":392},{"key":398,"name":399,"field":392},"pipelines-etl","Pipelines \u002F ETL",{"key":401,"name":402,"field":392},"streaming","Streaming",{"key":404,"name":405,"field":392},"warehousing","Warehousing",{"key":407,"name_tr":408,"name_en":409,"sort":410,"specializations":411},"game-dev","Oyun Geliştirme","Game Development",11,[412,413,416,419,422,425],{"key":218,"name":219,"field":407},{"key":414,"name":415,"field":407},"unity-csharp","Unity (C#)",{"key":417,"name":418,"field":407},"unreal-cpp","Unreal (C++)",{"key":420,"name":421,"field":407},"gameplay","Gameplay",{"key":423,"name":424,"field":407},"graphics-rendering","Graphics \u002F Rendering",{"key":426,"name":427,"field":407},"multiplayer-netcode","Multiplayer \u002F Netcode",{"key":5,"name_tr":6,"name_en":6,"sort":429,"specializations":430},12,[431,432,433,434,435],{"key":218,"name":219,"field":5},{"key":114,"name":115,"field":5},{"key":121,"name":122,"field":5},{"key":118,"name":119,"field":5},{"key":124,"name":125,"field":5},[14,15,16],{"junior":438,"mid":440,"senior":441},{"questions":439,"median_sec":3},20,{"questions":439,"median_sec":3},{"questions":439,"median_sec":3},[10,443],"en",[445,446],"google","github",28950,true]