Örnek sorular
Reliability Incident SreZorluk 1
Site Reliability Engineering (SRE) disiplininin temel amacı nedir?
- aTüm operasyon işlerini, her release'i dağıtımdan önce test eden ayrı bir QA ekibiyle değiştirmek.
- bOperasyon problemlerine yazılım mühendisliği yaklaşımları uygulamak; güvenilirlik ile değişim hızını dengelemek.✓
- cOperatörlerin her adımda tam kontrolü koruyabilmesi için altyapı değişikliklerini her zaman manuel dağıtmak.
- dHer data center'a yedekli donanım ekleyerek her servisin %100 uptime'a ulaşmasını garanti etmek.
Açıklama:SRE (Google'ın popülerleştirdiği haliyle) operasyonu bir mühendislik problemi olarak ele alır: otomasyon, ölçülebilir güvenilirlik hedefleri ve error budget kullanılarak güvenilirlik ile release hızı dengelenir. (a) QA fonksiyonunu tarif eder, SRE'yi değil. (c) SRE'nin otomasyon-öncelikli anlayışıyla çelişir. (d) gerçekçi değildir ve SRE'nin gerçek amacı değildir — mükemmel availability ne ulaşılabilir ne de maliyet-etkindir.
Reliability Incident SreZorluk 1
SRE terminolojisinde bir SLI (Service Level Indicator) neyi ölçer?
- aServisin request latency veya error rate gibi bir yönünün niceliksel ölçümünü.✓
- bBir servis hedefini karşılayamadığında şirketin müşterilere ödediği sözleşmesel cezayı.
- cBir ekibin belirli bir çeyrekte sahip olmasına izin verilen maksimum incident sayısını.
- dBelirli bir hafta hangi mühendisin on-call olduğunu belirleyen dahili sıralamayı.
Açıklama:SLI, servis davranışını tanımlamak için kullanılan somut, ölçülebilir bir metriktir (latency, error rate, throughput vb.). (b) SLI'dan çok bir SLA ceza maddesine yakın bir şeyi tarif eder. (c) ve (d) standart SRE terminolojisi olmayan, ilgisiz uydurma kavramlardır.
Reliability Incident SreZorluk 2
Bir SLO (Service Level Objective) tipik olarak bir SLA'dan (Service Level Agreement) nasıl farklıdır?
- aSLO müşterilerle imzalanan yasal bir belgedir, SLA ise yalnızca mühendislik ekibi içinde kullanılır.
- bSLO yalnızca güvenlik olaylarına uygulanır, SLA ise diğer tüm servis kesintilerini kapsar.
- cSLO, bir ekibin hedeflediği dahili güvenilirlik hedefidir; SLA ise genellikle sözleşmesel sonuçları olan, dışa dönük bir taahhüttür.✓
- dSLO maliyet verimliliğini ölçer, SLA ise ekibin yeni özellikleri ne kadar hızlı dağıtabildiğini ölçer.
Açıklama:SLO'lar (genellikle SLA'dan daha sıkı olan) mühendislik kararlarına yön veren dahili hedeflerdir; SLA'lar ise karşılanmadığında finansal veya sözleşmesel sonuçlar doğurabilen, müşteriye dönük dış taahhütlerdir. (a) rolleri tersine çevirir. (b) ve (d) her iki kavrama da uymayan kapsamlar uydurur.
Reliability Incident SreZorluk 2
Bir ekibin SLO'su aylık %0.1 error budget'a izin veriyor ve ekip, sorunlu bir rollout sonrası ayın daha ilk iki haftasında bunun %90'ını tüketmiş durumda. SRE yaklaşımına en uygun tepki nedir?
- aBudget tüketimini görmezden gelmek; zira SLO'lar genelde trendden bağımsız olarak yalnızca çeyrek sonunda gözden geçirilir.
- bSistemde o zamandan beri neler değiştiğine bakmaksızın hemen bir yıl önceki sürüme geri dönmek.
- cEkip hedefini yeniden tutturmuş gibi görünsün diye gelecek ayın SLO hedefini yükseltmek.
- dError budget toparlanana kadar ek riskli release'leri yavaşlatıp güvenilirlik çalışmalarına öncelik vermek.✓
Açıklama:Error budget'ın tüm amacı release hızına dair karar vermeye yardımcı olmaktır: budget neredeyse tükendiğinde ekip odağını daha fazla risk almaktan istikrara kaydırmalıdır. (a) budget'ın vermek istediği sinyali görmezden gelir. (b) gerçek nedenle ilgisiz, aşırı bir tepkidir. (c) altta yatan güvenilirlik sorununu çözmek yerine metriği manipüle eder.
Reliability Incident SreZorluk 1
Bir servis %99.9 ("üç dokuz") availability vaat ediyor. Bu, yılda yaklaşık ne kadar downtime'a karşılık gelir?
- aYılda yaklaşık 5 dakika.
- bYılda yaklaşık 8-9 saat.✓
- cYılda yaklaşık 3-4 gün.
- dYılda yaklaşık 36 gün.
Açıklama:%99.9 availability yılda %0.1 downtime'a izin verir; bu da yaklaşık 8.76 saate karşılık gelir (365 gün x 0.001). (a) bunun yerine %99.999'a ("beş dokuz") karşılık gelir. (c) ve (d) üç dokuz için çok fazla downtime'dır ve çok daha düşük availability yüzdelerine denk gelirdi.
Reliability Incident SreZorluk 2
A ekibi, tespitten sonra ortalama 20 dakikada incident çözüyor. B ekibi ise ortalama 2 saatte çözüyor ama zaten nadiren incident yaşıyor. Burada A ekibinin güçlü yanını özellikle hangi metrik yakalar?
- aMTTR (Mean Time To Recovery); bir incident başladıktan sonra servisin ne kadar hızlı toparlandığını ölçer.✓
- bMTBF (Mean Time Between Failures); incident'ların baştan ne sıklıkla yaşandığını ölçer.
- cSLA compliance rate; o dönemde sözleşmesel bir anlaşmaya uyulup uyulmadığını ölçer.
- dError budget burn rate; izin verilen güvenilmezliğin bir dönemde ne kadar hızlı tüketildiğini ölçer.
Açıklama:A ekibinin avantajı bir şey bozulduğunda hızlı toparlanmasıdır ve bunu tam olarak MTTR yakalar. (b) bunun yerine B ekibinin güçlü yanını (daha az arıza) tarif eder. (c) ve (d) da gerçek metriklerdir ama hiçbiri özellikle toparlanma hızını izole etmez.