Готовим следующую карточку…
СобеседованиеСредняя
Вопрос
В продакшене к большой целевой LLM добавили маленькую черновую модель для speculative decoding. Объясните, как это может ускорить генерацию, не меняя распределение токенов целевой модели, и при каком поведении черновой модели выигрыш почти исчезнет.
