Örnek sorular
Data Partitioning ScalingZorluk 1
Veri mühendisliğinde "partitioning" (bölümleme) temel düzeyde ne anlama gelir?
- aBir tabloyu yalnızca yetkili kullanıcıların okuyabilmesi için şifrelemek
- bDisk alanını azaltmak için bir tabloyu sıkıştırmak
- cVeriyi bir kolonun değerine göre daha küçük parçalara bölmek✓
- dKolonları bir adlandırma kuralına uyacak şekilde yeniden adlandırmak
Açıklama:Partitioning, bir veri setini genellikle bir kolonun değer aralığına veya kategorisine göre daha küçük parçalara (partition) böler, böylece veri fiziksel veya mantıksal olarak gruplanmış olur.
Data Partitioning ScalingZorluk 2
Partitioning genellikle sorgu performansına neden yardımcı olur?
- aArtık gerekli olmayan eski satırları otomatik olarak siler
- bBir sorgu ihtiyaç duymadığı partition'ları taramayı atlayabilir✓
- cTutarlılık için her sorgunun tüm veri setini taramasını zorunlu kılar
- dTüm kolonları tek bir sabit veri tipine dönüştürür
Açıklama:Bir sorgunun filtresi partition anahtarıyla örtüştüğünde, motor eşleşen satır içeremeyecek partition'ları atlayabilir; bu da taranan veri miktarını azaltıp sorguyu hızlandırır.
Data Partitioning ScalingZorluk 2
Partitioning bağlamında "partition anahtarı" (partition key) nedir?
- aBir satırı tüm tablo genelinde benzersiz tanımlamak için kullanılan birincil anahtar
- bDeğeri bir satırın partition'ını belirleyen kolon✓
- cPartition içeriğini korumak için kullanılan şifreleme anahtarı
- dİlk partition'ın saklandığı fiziksel diskin adı
Açıklama:Partition anahtarı, değerleri satırların hangi partition'a gruplanacağına karar veren kolon (veya kolon kombinasyonu)dur; örneğin bir tarih kolonu ya da bölge kolonu.
Data Partitioning ScalingZorluk 2
Bir partition anahtarı seçerken makul temel bir kriter aşağıdakilerden hangisidir?
- aHiçbir sorgu filtresinde kullanılmayan bir kolon olmalı
- bHer zaman veriyle ilgisi olmayan rastgele üretilmiş bir değer olmalı
- cTüm veri setinde yalnızca tek bir olası değeri olan bir kolon olmalı
- dSorgu filtrelerinde sık kullanılan ve veriyi makul ölçüde eşit dağıtan bir kolon✓
Açıklama:İyi bir partition anahtarı sorgu filtrelerinde sık kullanılır (böylece pruning işe yarar) ve satırları çoğunu tek bir partition'da toplamadan dağıtır.
Data Partitioning ScalingZorluk 1
Partitioning bağlamında "data skew" (veri çarpıklığı) nedir?
- aVerinin yanlış kolon tipinde saklanması
- bBir tabloda hiç partition anahtarı tanımlanmamış olması
- cBir partition'ın diğerlerinden çok daha büyük veya yoğun olması✓
- dSorgu sonuçlarının istenenden farklı bir sıralama düzeninde dönmesi
Açıklama:Data skew, satırların partition'lar arasında eşit dağılmaması durumunda ortaya çıkar; bu yüzden bir veya birkaç partition diğerlerinden çok daha fazla veri veya trafik taşır.
Data Partitioning ScalingZorluk 2
Bir veri seti ülkeye göre partition'lanmış. Tüm satırların %90'ı tek büyük bir ülkeye ait, geri kalanı ise 40 küçük ülkeye dağılmış durumda. Bu neye örnektir?
- aPartition pruning'in doğru çalışmasına
- bData skew'e, çünkü bir partition verinin çoğunu barındırıyor✓
- cİyi dengelenmiş bir partitioning tasarımına
- dDevam eden bir repartitioning işlemine
Açıklama:Tek bir ülke partition'ı satırların büyük çoğunluğunu barındırdığı için, o partition diğerlerine kıyasla orantısız derecede büyüktür — bu data skew'dir.