[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"me":3,"catalog:tr:ml-engineer\u002Ffe-text-highcardinality-features":4,"config":191},null,{"field_key":5,"field_name":6,"seniority":7,"topic_key":8,"topic_name":9,"spec_key":7,"spec_name":7,"locale":10,"cell_total":11,"field_total":12,"seniorities":13,"topics":17,"specs":94,"samples":105},"ml-engineer","ML Engineer","","fe-text-highcardinality-features","Fe Text Highcardinality Features","tr",75,1950,[14,15,16],"junior","mid","senior",[18,21,24,27,30,33,36,39,42,45,48,51,54,57,60,63,66,69,70,73,76,79,82,85,88,91],{"key":19,"name":20,"count":11},"cml-distance-clustering-dimreduction","Cml Distance Clustering Dimreduction",{"key":22,"name":23,"count":11},"cml-gradient-boosting-mechanics","Cml Gradient Boosting Mechanics",{"key":25,"name":26,"count":11},"cml-linear-logistic-internals","Cml Linear Logistic Internals",{"key":28,"name":29,"count":11},"cml-probabilistic-models-calibration","Cml Probabilistic Models Calibration",{"key":31,"name":32,"count":11},"cml-svm-kernels-margins","Cml Svm Kernels Margins",{"key":34,"name":35,"count":11},"cml-trees-randomforest-internals","Cml Trees Randomforest Internals",{"key":37,"name":38,"count":11},"dl-architecture-layers","Dl Architecture Layers",{"key":40,"name":41,"count":11},"dl-initialization-optimizers","Dl Initialization Optimizers",{"key":43,"name":44,"count":11},"dl-losses-output-layers","Dl Losses Output Layers",{"key":46,"name":47,"count":11},"dl-normalization-regularization","Dl Normalization Regularization",{"key":49,"name":50,"count":11},"dl-sequence-attention","Dl Sequence Attention",{"key":52,"name":53,"count":11},"dl-training-dynamics-backprop","Dl Training Dynamics Backprop",{"key":55,"name":56,"count":11},"fe-binning-discretization","Fe Binning Discretization",{"key":58,"name":59,"count":11},"fe-categorical-encoding-mechanics","Fe Categorical Encoding Mechanics",{"key":61,"name":62,"count":11},"fe-interactions-basis-expansion","Fe Interactions Basis Expansion",{"key":64,"name":65,"count":11},"fe-numeric-transforms-distributions","Fe Numeric Transforms Distributions",{"key":67,"name":68,"count":11},"fe-temporal-cyclical-features","Fe Temporal Cyclical Features",{"key":8,"name":9,"count":11},{"key":71,"name":72,"count":11},"ml-data-preparation","Ml Data Preparation",{"key":74,"name":75,"count":11},"ml-deployment-serving","Ml Deployment Serving",{"key":77,"name":78,"count":11},"ml-experimentation-reproducibility","Ml Experimentation Reproducibility",{"key":80,"name":81,"count":11},"ml-model-selection-tuning","Ml Model Selection Tuning",{"key":83,"name":84,"count":11},"ml-model-training-evaluation","Ml Model Training Evaluation",{"key":86,"name":87,"count":11},"ml-monitoring-drift","Ml Monitoring Drift",{"key":89,"name":90,"count":11},"ml-problem-framing","Ml Problem Framing",{"key":92,"name":93,"count":11},"ml-scaling-performance","Ml Scaling Performance",[95,99,102],{"key":96,"name":97,"count":98},"classical-ml","Classical ML",450,{"key":100,"name":101,"count":98},"deep-learning","Deep Learning",{"key":103,"name":104,"count":98},"feature-engineering","Feature Engineering",[106,124,138,151,164,177],{"id":107,"topic":9,"difficulty":108,"body":109,"options":110,"correct_key":115,"explanation":123},"01a04b40-df05-7bd2-b38b-085dd5e263b6",3,"scikit-learn 1.6 ile:\n\n```python\nfrom sklearn.feature_extraction.text import CountVectorizer\nv = CountVectorizer(tokenizer=str.split)\nprint(v.fit(['Buy A now', 'buy a NOW']).get_feature_names_out())\n```\n\nAynı iki belge varsayılan bir CountVectorizer altında ['buy' 'now'] bildiriyor. Burada ekrana ne basılır?",[111,114,117,120],{"key":112,"text":113},"a","['buy' 'now'] — verilen tokenizer parçalarını yine token desenine teslim eder, desen tek harflik olanı atar.",{"key":115,"text":116},"b","['a' 'buy' 'now'] — token deseni devre dışıdır; zira küçük harfe çevirme takastan sağ çıkar, uzunluk filtresi çıkmaz.",{"key":118,"text":119},"c","['A' 'Buy' 'NOW' 'a' 'buy' 'now'] — verilen tokenizer metin işleme zincirinin tamamını, büyük-küçük harf dahil devralır.",{"key":121,"text":122},"d","['Buy A now' 'buy a NOW'] — str.split'e korpus verilir, böylece her belge bütün hâlde tek bir token olur.","Özel bir tokenizer yalnız regex adımının yerine geçer ve scikit-learn token_pattern'in kullanılmayacağını uyarı olarak bile bildirir; diğer tüm aşamalar yerinde kalır. Ön işleme belgeyi callable görmeden önce küçük harfe çevirmeye devam eder, bir durak listesi de callable'ın döndürdüğüne yine uygulanırdı; görünen tek değişiklik tek karakterlik parçanın artık elenmemesidir.",{"id":125,"topic":9,"difficulty":126,"body":127,"options":128,"correct_key":112,"explanation":137},"01a04b40-df07-7141-92e2-42a8fe34d162",2,"Bir ekip 'dog bites man' ve 'man bites dog' cümlelerini varsayılan bir CountVectorizer ile indeksliyor ve hiçbir sınıflandırıcının ikisini ayıramamasına şaşırıyor. Sayım matrisi bu iki satır için gerçekte ne içerir?",[129,131,133,135],{"key":112,"text":130},"İkisi de [1, 1, 1] olan özdeş iki satır: unigram sayımı konum bilgisi tutmaz.",{"key":115,"text":132},"Tek sütunda ayrışan iki satır; çünkü vectorizer her token'ın ilk konumunu da saklar.",{"key":118,"text":134},"Yalnızca binary=True verildiğinde özdeş iki satır; ham sayımlarda satırlar farklı olurdu.",{"key":121,"text":136},"Farklı sütun kümeleri üzerinde iki satır; çünkü sözlük her belge için yeniden kurulur.","Bag-of-words temsili her sözlük teriminin kaç kez geçtiğini kaydeder, başka hiçbir şey tutmaz; bu yüzden aynı token'ların her permütasyonu aynı vektöre düşer. Komşuluğu geri kazanmak için tek token'dan geniş, birden fazla token'ı kapsayan feature'lar gerekir.",{"id":139,"topic":9,"difficulty":126,"body":140,"options":141,"correct_key":118,"explanation":150},"01a04b40-df08-7904-8e45-a3c3b403a598","scikit-learn 1.6 ile:\n\n```python\nfrom sklearn.feature_extraction.text import CountVectorizer\nv = CountVectorizer(ngram_range=(1, 2))\nX = v.fit_transform(['red blue red'])\nprint(X.shape, X.toarray())\n```\n\nEkrana ne basılır?",[142,144,146,148],{"key":112,"text":143},"(1, 2) [[2 1]] — yalnız unigram üretilir; bigram için ayrı bir analyzer ayarı gerekir.",{"key":115,"text":145},"(1, 3) [[1 2 1]] — tekrar eden token, komşu çiftlerden birini kendi içinde eritir.",{"key":118,"text":147},"(1, 4) [[1 1 2 1]] — iki unigram artı iki farklı komşu çift.",{"key":121,"text":149},"(1, 5) [[1 1 2 1 1]] — iki geçişten 'red red' de bir bigram olarak üretilir.","(1, 2) aralığı unigram ve bigram'ları birlikte üretir. Burada unigram'lar 'blue' ve 'red', komşu çiftler ise 'red blue' ve 'blue red'; alfabetik sıralandığında dört sütun 'blue', 'blue red', 'red', 'red blue' olur ve yalnız 'red' iki kez sayılır.",{"id":152,"topic":9,"difficulty":126,"body":153,"options":154,"correct_key":112,"explanation":163},"01a04b40-df09-77d7-b3e8-f739d49b3dd9","'buy now buy now buy' belgesi iki kez vektörleştiriliyor: bir kez CountVectorizer(), bir kez CountVectorizer(binary=True) ile. Varsayılan çalıştırma [3, 2] satırını üretiyor. İkincisi ne üretir ve neden?",[155,157,159,161],{"key":112,"text":156},"[1, 1] — mevcut olan her terim, kaç kez geçtiğine bakılmaksızın 1 olarak kaydedilir.",{"key":115,"text":158},"[0.6, 0.4] — birden büyük sayımlar belgenin token uzunluğuna bölünür.",{"key":118,"text":160},"Yine [3, 2] — binary yalnızca saklanan dtype'ı tamsayıdan boolean'a çevirir, değerler aynı kalır.",{"key":121,"text":162},"[3, 0] — yalnız en yüksek sayıma sahip terim tutulur, kalanlar sıfırlanır.","binary bayrağı tokenizasyondan sonra sıfır olmayan her sayımı bire kırpar, böylece satır frekansı değil varlığı taşır. Sözlük ve sütun yerleşimi hiç değişmez; yalnız saklanan değerler değişir, bu yüzden matris hâlâ iki sütunludur.",{"id":165,"topic":9,"difficulty":108,"body":166,"options":167,"correct_key":121,"explanation":176},"01a04b40-df09-7efe-835c-46f5ac751c3c","Bir mühendis 'A-1', 'B-2', 'C-7' gibi kısa ürün kodlarından oluşan bir sütunu varsayılan bir CountVectorizer'a veriyor ve ValueError: empty vocabulary alıyor. Varsayılan tokenizer'ın hangi özelliği bunu açıklar?",[168,170,172,174],{"key":112,"text":169},"Varsayılan analyzer, sözlük kurulmadan önce üç token'dan kısa belgeleri eler.",{"key":115,"text":171},"Tire işareti belge ayırıcı sayılır, böylece her kod iki boş belge olarak okunur.",{"key":118,"text":173},"Ön işlemede rakamlar atılır ve geriye kalan tek harfler gömülü durak kelime listesine düşer.",{"key":121,"text":175},"Varsayılan token deseni en az iki kelime karakteri ister, tek karakterlik her parça elenir.","CountVectorizer'ın varsayılan token_pattern değeri (?u)\\b\\w\\w+\\b'dir ve yalnız iki ya da daha fazla kelime karakterinden oluşan dizileri eşler. Tire her kodu tek harf ile tek rakama böler, ikisi de eşleşemeyecek kadar kısadır; tokenizasyondan hiçbir şey çıkmaz ve sözlük boş kalır.",{"id":178,"topic":9,"difficulty":179,"body":180,"options":181,"correct_key":115,"explanation":190},"01a04b40-df0a-7a5e-bda0-95a89417c682",1,"Bir ürün kataloğunda aynı marka 'Apple', 'apple' ve 'APPLE' olarak yazılmış. Üzerinde varsayılan bir CountVectorizer fit ediliyor. Bu üç yazım kaç sözlük girdisi üretir?",[182,184,186,188],{"key":112,"text":183},"Üç tane — büyük-küçük harf token'ın parçasıdır, yalnız aksan temizleme birleştirebilirdi.",{"key":115,"text":185},"Bir tane; küçük harfe çevirme varsayılan olarak açıktır ve üçünü aynı token'a indirir.",{"key":118,"text":187},"İki tane; tümü büyük yazım baş harfi büyük biçime katlanır, küçük yazım ayrı girdi kalır.",{"key":121,"text":189},"Bir tane, ama yalnız binary=True da verilirse; aksi hâlde her yazım kendi sütununu alır.","Varsayılan ön işleme adımı, token deseni uygulanmadan önce belgeyi küçük harfe çevirir; böylece üç varyant aynı dizgeye dönüşür ve tek sütunu paylaşır. lowercase=False verilseydi ayrı kalırlar ve üç ayrı sözlük girdisi oluştururlardı.",{"fields":192,"seniorities":414,"interview_shapes":415,"locales":420,"oauth":422,"question_count":425,"coach_enabled":426,"jd_match_enabled":426},[193,218,238,254,278,291,310,329,351,370,385,407],{"key":194,"name_tr":195,"name_en":195,"sort":179,"specializations":196},"backend","Backend",[197,200,203,206,209,212,215],{"key":198,"name":199,"field":194},"general","Genel",{"key":201,"name":202,"field":194},"go","Go",{"key":204,"name":205,"field":194},"python","Python",{"key":207,"name":208,"field":194},"java","Java",{"key":210,"name":211,"field":194},"csharp","C#\u002F.NET",{"key":213,"name":214,"field":194},"nodejs","Node.js",{"key":216,"name":217,"field":194},"php","PHP",{"key":219,"name_tr":220,"name_en":220,"sort":126,"specializations":221},"frontend","Frontend",[222,223,226,229,232,235],{"key":198,"name":199,"field":219},{"key":224,"name":225,"field":219},"javascript","JavaScript",{"key":227,"name":228,"field":219},"typescript","TypeScript",{"key":230,"name":231,"field":219},"react","React",{"key":233,"name":234,"field":219},"vue","Vue",{"key":236,"name":237,"field":219},"angular","Angular",{"key":239,"name_tr":240,"name_en":240,"sort":108,"specializations":241},"fullstack","Fullstack",[242,243,244,245,246,247,248,249,250,251,252,253],{"key":198,"name":199,"field":239},{"key":201,"name":202,"field":194},{"key":204,"name":205,"field":194},{"key":207,"name":208,"field":194},{"key":210,"name":211,"field":194},{"key":213,"name":214,"field":194},{"key":216,"name":217,"field":194},{"key":224,"name":225,"field":219},{"key":227,"name":228,"field":219},{"key":230,"name":231,"field":219},{"key":233,"name":234,"field":219},{"key":236,"name":237,"field":219},{"key":255,"name_tr":256,"name_en":256,"sort":257,"specializations":258},"devops-cloud","DevOps \u002F Cloud",4,[259,260,263,266,269,272,275],{"key":198,"name":199,"field":255},{"key":261,"name":262,"field":255},"aws","AWS",{"key":264,"name":265,"field":255},"gcp","GCP",{"key":267,"name":268,"field":255},"azure","Azure",{"key":270,"name":271,"field":255},"kubernetes","Kubernetes",{"key":273,"name":274,"field":255},"terraform","Terraform",{"key":276,"name":277,"field":255},"linux","Linux",{"key":279,"name_tr":280,"name_en":280,"sort":281,"specializations":282},"ai-engineer","AI Engineer",5,[283,284,285,288],{"key":198,"name":199,"field":279},{"key":204,"name":205,"field":279},{"key":286,"name":287,"field":279},"llm-rag","LLM\u002FRAG",{"key":289,"name":290,"field":279},"mlops","MLOps",{"key":292,"name_tr":293,"name_en":294,"sort":295,"specializations":296},"database","Veritabanı","Database",6,[297,298,301,304,307],{"key":198,"name":199,"field":292},{"key":299,"name":300,"field":292},"postgresql","PostgreSQL",{"key":302,"name":303,"field":292},"mysql","MySQL",{"key":305,"name":306,"field":292},"mongodb","MongoDB",{"key":308,"name":309,"field":292},"redis","Redis",{"key":311,"name_tr":312,"name_en":313,"sort":314,"specializations":315},"mobile","Mobil","Mobile",7,[316,317,320,323,326],{"key":198,"name":199,"field":311},{"key":318,"name":319,"field":311},"ios-swift","iOS (Swift)",{"key":321,"name":322,"field":311},"android-kotlin","Android (Kotlin)",{"key":324,"name":325,"field":311},"flutter","Flutter",{"key":327,"name":328,"field":311},"react-native","React Native",{"key":330,"name_tr":331,"name_en":332,"sort":333,"specializations":334},"security","Güvenlik","Security",8,[335,336,339,342,345,348],{"key":198,"name":199,"field":330},{"key":337,"name":338,"field":330},"appsec","AppSec",{"key":340,"name":341,"field":330},"offensive-pentest","Offensive \u002F Pentest",{"key":343,"name":344,"field":330},"cloud-security","Cloud Security",{"key":346,"name":347,"field":330},"devsecops","DevSecOps",{"key":349,"name":350,"field":330},"blue-team-incident","Blue Team \u002F Incident",{"key":352,"name_tr":353,"name_en":354,"sort":355,"specializations":356},"qa-test-automation","QA \u002F Test Otomasyonu","QA \u002F Test Automation",9,[357,358,361,364,367],{"key":198,"name":199,"field":352},{"key":359,"name":360,"field":352},"test-automation","Test Automation",{"key":362,"name":363,"field":352},"sdet","SDET",{"key":365,"name":366,"field":352},"performance-testing","Performance Testing",{"key":368,"name":369,"field":352},"mobile-qa","Mobile QA",{"key":371,"name_tr":372,"name_en":372,"sort":373,"specializations":374},"data-engineer","Data Engineer",10,[375,376,379,382],{"key":198,"name":199,"field":371},{"key":377,"name":378,"field":371},"pipelines-etl","Pipelines \u002F ETL",{"key":380,"name":381,"field":371},"streaming","Streaming",{"key":383,"name":384,"field":371},"warehousing","Warehousing",{"key":386,"name_tr":387,"name_en":388,"sort":389,"specializations":390},"game-dev","Oyun Geliştirme","Game Development",11,[391,392,395,398,401,404],{"key":198,"name":199,"field":386},{"key":393,"name":394,"field":386},"unity-csharp","Unity (C#)",{"key":396,"name":397,"field":386},"unreal-cpp","Unreal (C++)",{"key":399,"name":400,"field":386},"gameplay","Gameplay",{"key":402,"name":403,"field":386},"graphics-rendering","Graphics \u002F Rendering",{"key":405,"name":406,"field":386},"multiplayer-netcode","Multiplayer \u002F Netcode",{"key":5,"name_tr":6,"name_en":6,"sort":408,"specializations":409},12,[410,411,412,413],{"key":198,"name":199,"field":5},{"key":96,"name":97,"field":5},{"key":103,"name":104,"field":5},{"key":100,"name":101,"field":5},[14,15,16],{"junior":416,"mid":418,"senior":419},{"questions":417,"median_sec":3},20,{"questions":417,"median_sec":3},{"questions":417,"median_sec":3},[10,421],"en",[423,424],"google","github",28500,true]