scikit-learn 1.6 ile:
Aynı iki belge varsayılan bir CountVectorizer altında ['buy' 'now'] bildiriyor. Burada ekrana ne basılır?
from sklearn.feature_extraction.text import CountVectorizer
v = CountVectorizer(tokenizer=str.split)
print(v.fit(['Buy A now', 'buy a NOW']).get_feature_names_out())Aynı iki belge varsayılan bir CountVectorizer altında ['buy' 'now'] bildiriyor. Burada ekrana ne basılır?
- a['buy' 'now'] — verilen tokenizer parçalarını yine token desenine teslim eder, desen tek harflik olanı atar.
- b['a' 'buy' 'now'] — token deseni devre dışıdır; zira küçük harfe çevirme takastan sağ çıkar, uzunluk filtresi çıkmaz.✓
- c['A' 'Buy' 'NOW' 'a' 'buy' 'now'] — verilen tokenizer metin işleme zincirinin tamamını, büyük-küçük harf dahil devralır.
- d['Buy A now' 'buy a NOW'] — str.split'e korpus verilir, böylece her belge bütün hâlde tek bir token olur.
Açıklama:Özel bir tokenizer yalnız regex adımının yerine geçer ve scikit-learn token_pattern'in kullanılmayacağını uyarı olarak bile bildirir; diğer tüm aşamalar yerinde kalır. Ön işleme belgeyi callable görmeden önce küçük harfe çevirmeye devam eder, bir durak listesi de callable'ın döndürdüğüne yine uygulanırdı; görünen tek değişiklik tek karakterlik parçanın artık elenmemesidir.