Готовим следующую карточку…
СобеседованиеСредняя
Вопрос
В корпусе встречаются визуально одинаковые слова, но модель считает их разными токенами. Какой этап предобработки стоит проверить первым, почему простого приведения к нижнему регистру недостаточно и какой риск несёт агрессивная Unicode-нормализация?
