yoklateknik mülakat

Warehousing Data Engineer Mülakat Soruları

450 doğrulanmış Warehousing Data Engineer mülakat sorusu — cevaplarıyla çöz, açıklamalarıyla öğren, gerçek simülasyonda kendini test et.

Gerçek simülasyonu dene →

Örnek sorular

Wh Bigquery Execution Slots CostZorluk 1
BigQuery'de bir 'slot' nedir?
  • aTek bir sorguya ayrılmış fiziksel bir GPU çekirdeği
  • bSorgu çalıştırmak için kullanılan sanal bir hesaplama birimi
  • cBir günlük alınan veriyi tutan bir depolama bölümü
  • dBir stored procedure'e geçirilen adlandırılmış bir parametre
Açıklama:Slot, BigQuery'nin SQL sorgularını ve diğer job tiplerini çalıştırmak için otomatik olarak ayırdığı sanal hesaplama kapasitesi birimidir. Fiziksel bir çekirdek, depolama bölümü ya da stored procedure parametresi değildir.
Wh Bigquery Execution Slots CostZorluk 1
BigQuery'nin on-demand faturalama modelinde bir sorgunun ücreti neye göre belirlenir?
  • aİşlenen (taranan) bayt miktarına göre
  • bSorgunun o an kullandığı slot sayısına göre
  • cSorgunun bitmesi için geçen gerçek zamana göre
  • dSorgunun döndürdüğü satır sayısına göre
Açıklama:On-demand faturalamada ücret, sorgunun işlediği veri hacmine (bayt) göre hesaplanır; kullanılan slot sayısına, çalışma süresine ya da dönen satır sayısına göre değil.
Wh Bigquery Execution Slots CostZorluk 2
BigQuery'nin capacity-based (reservation) faturalama modelinde müşteri neyin ücretini öder?
  • aOn-demand faturalamadaki gibi, sorgu başına taranan bayt miktarının
  • bKullanımdan tamamen bağımsız, sabit bir aylık ücretin
  • cİş yükleri için ayrılan bir slot havuzu
  • dYalnızca sorgu sonuç kümesinin kapladığı depolamanın
Açıklama:Capacity-based (reservation) modelde müşteri, bir reservation'a ayrılan slot havuzunun ücretini öder; bu, tek bir sorgunun kaç bayt taradığından bağımsızdır -- on-demand'in tam tersi bir faturalama esasıdır.
Wh Bigquery Execution Slots CostZorluk 2
SELECT * FROM orders;
-- vs
SELECT order_id, total_amount FROM orders;

Her iki sorgu da WHERE koşulu olmadan orders tablosunun tamamını tarıyor. İkinci sorgu neden tipik olarak birincisinden daha az bayt işler?
  • aİkinci sorgu, birincisinde olmayan örtük bir LIMIT uygular
  • bBigQuery'nin kolonsal depolaması yalnızca referans edilen kolonları okur
  • cBigQuery, SELECT * sorgularını kolon bazlı sorgulara göre daha az agresif cache'ler
  • dİkinci sorgu daha az slot'ta çalışır, bu da faturalanan baytı azaltır
Açıklama:BigQuery veriyi kolon kolon saklar, bu yüzden bir sorgu yalnızca referans ettiği kolonları okur. SELECT * her kolonu okurken, iki kolon seçmek yalnızca o iki kolonu okur -- bu yüzden daha az bayt işlenir.
Wh Bigquery Execution Slots CostZorluk 2
events tablosu clustered ya da partitioned değil. SELECT * FROM events LIMIT 10 çalıştırıyorsun. Aynı sorguyu LIMIT olmadan çalıştırmayla kıyaslandığında, BigQuery kaç bayt işler?
  • aLIMIT taramayı erken durdurduğu için, kabaca 10 satırlık bayt
  • bSıfır bayt, çünkü LIMIT herhangi bir veri okunmadan önce uygulanır
  • c10'un toplam satır sayısına bölümüyle orantılı bayt
  • dTarama açısından LIMIT'siz haliyle birebir aynı miktarda veri
Açıklama:Clustered olmayan bir tabloda LIMIT, veri zaten okunduktan sonra uygulanır; bu yüzden taranan baytı azaltmaz. Sorgu, çıktıyı 10 satıra kırpmadan önce yine tüm satırlar için referans edilen kolonları okur.
Wh Bigquery Execution Slots CostZorluk 2
logs tablosunda partitioning ya da clustering tanımlı değil. SELECT message FROM logs WHERE severity = 'ERROR' çalıştırıyorsun. Aynı kolonu seçen ama WHERE koşulu olmayan bir sorguyla kıyaslandığında taranan bayta ne olur?
  • aTaranan bayt esasen aynı kalır, çünkü partition ya da clustering pruning'i devre dışı
  • bTaranan bayt ciddi şekilde düşer, çünkü WHERE her zaman depolama seviyesinde pruning yapar
  • cTaranan bayt sıfıra düşer, çünkü filtre depolama okunmadan önce değerlendirilir
  • dTaranan bayt artar, çünkü WHERE koşulunu değerlendirmek ek bir tam tablo geçişi ekler
Açıklama:Partitioning veya clustering olmadan BigQuery'nin filtreye göre blok atlayacak bir depolama-seviyesi yolu yoktur. WHERE'i değerlendirmek için gereken severity kolonu ve seçilen message kolonu her satır için okunur, eşleşmeyenler ancak sonradan elenir.

1950 soruluk Data Engineer bankasında kendini sına.

Mülakata başla