yoklateknik mülakat

Data Engineer Data Partitioning Scaling Mülakat Soruları

75 doğrulanmış Data Engineer Data Partitioning Scaling mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Data Partitioning ScalingZorluk 1
Veri mühendisliğinde "partitioning" (bölümleme) temel düzeyde ne anlama gelir?
  • aBir tabloyu yalnızca yetkili kullanıcıların okuyabilmesi için şifrelemek
  • bDisk alanını azaltmak için bir tabloyu sıkıştırmak
  • cVeriyi bir kolonun değerine göre daha küçük parçalara bölmek
  • dKolonları bir adlandırma kuralına uyacak şekilde yeniden adlandırmak
Açıklama:Partitioning, bir veri setini genellikle bir kolonun değer aralığına veya kategorisine göre daha küçük parçalara (partition) böler, böylece veri fiziksel veya mantıksal olarak gruplanmış olur.
Data Partitioning ScalingZorluk 2
Partitioning genellikle sorgu performansına neden yardımcı olur?
  • aArtık gerekli olmayan eski satırları otomatik olarak siler
  • bBir sorgu ihtiyaç duymadığı partition'ları taramayı atlayabilir
  • cTutarlılık için her sorgunun tüm veri setini taramasını zorunlu kılar
  • dTüm kolonları tek bir sabit veri tipine dönüştürür
Açıklama:Bir sorgunun filtresi partition anahtarıyla örtüştüğünde, motor eşleşen satır içeremeyecek partition'ları atlayabilir; bu da taranan veri miktarını azaltıp sorguyu hızlandırır.
Data Partitioning ScalingZorluk 2
Partitioning bağlamında "partition anahtarı" (partition key) nedir?
  • aBir satırı tüm tablo genelinde benzersiz tanımlamak için kullanılan birincil anahtar
  • bDeğeri bir satırın partition'ını belirleyen kolon
  • cPartition içeriğini korumak için kullanılan şifreleme anahtarı
  • dİlk partition'ın saklandığı fiziksel diskin adı
Açıklama:Partition anahtarı, değerleri satırların hangi partition'a gruplanacağına karar veren kolon (veya kolon kombinasyonu)dur; örneğin bir tarih kolonu ya da bölge kolonu.
Data Partitioning ScalingZorluk 2
Bir partition anahtarı seçerken makul temel bir kriter aşağıdakilerden hangisidir?
  • aHiçbir sorgu filtresinde kullanılmayan bir kolon olmalı
  • bHer zaman veriyle ilgisi olmayan rastgele üretilmiş bir değer olmalı
  • cTüm veri setinde yalnızca tek bir olası değeri olan bir kolon olmalı
  • dSorgu filtrelerinde sık kullanılan ve veriyi makul ölçüde eşit dağıtan bir kolon
Açıklama:İyi bir partition anahtarı sorgu filtrelerinde sık kullanılır (böylece pruning işe yarar) ve satırları çoğunu tek bir partition'da toplamadan dağıtır.
Data Partitioning ScalingZorluk 1
Partitioning bağlamında "data skew" (veri çarpıklığı) nedir?
  • aVerinin yanlış kolon tipinde saklanması
  • bBir tabloda hiç partition anahtarı tanımlanmamış olması
  • cBir partition'ın diğerlerinden çok daha büyük veya yoğun olması
  • dSorgu sonuçlarının istenenden farklı bir sıralama düzeninde dönmesi
Açıklama:Data skew, satırların partition'lar arasında eşit dağılmaması durumunda ortaya çıkar; bu yüzden bir veya birkaç partition diğerlerinden çok daha fazla veri veya trafik taşır.
Data Partitioning ScalingZorluk 2
Bir veri seti ülkeye göre partition'lanmış. Tüm satırların %90'ı tek büyük bir ülkeye ait, geri kalanı ise 40 küçük ülkeye dağılmış durumda. Bu neye örnektir?
  • aPartition pruning'in doğru çalışmasına
  • bData skew'e, çünkü bir partition verinin çoğunu barındırıyor
  • cİyi dengelenmiş bir partitioning tasarımına
  • dDevam eden bir repartitioning işlemine
Açıklama:Tek bir ülke partition'ı satırların büyük çoğunluğunu barındırdığı için, o partition diğerlerine kıyasla orantısız derecede büyüktür — bu data skew'dir.

600 soruluk Data Engineer bankasında kendini sına.

Mülakata başla