Data Science и Machine LearningNLPПредобработка текста
Готовим следующую карточку…
СобеседованиеСредняя
Вопрос

В корпусе встречаются визуально одинаковые слова, но модель считает их разными токенами. Какой этап предобработки стоит проверить первым, почему простого приведения к нижнему регистру недостаточно и какой риск несёт агрессивная Unicode-нормализация?

Смахните карточку влево, чтобы повысить рейтинг, или вправо, чтобы понизить.