Speculative Decoding против Multi-Token Prediction! Есть ли польза?
Загружено: 2026-08-25
Просмотров: 2036
Описание:
Спекулятивное декодирование и предсказание нескольких токенов — это два приёма, которые ускоряют вывод LLM на локальной модели без изменения ни одного выходного токена. Вот как работает цикл «черновик и проверка», почему ваша видеокарта ограничена памятью, а не вычислительными ресурсами, два флага в llama.cpp, которые его включают, почему тот же приём даёт +65% при использовании унифицированной памяти и только +23% на карте с 6 ГБ памяти и разгрузкой, а также три случая, когда это замедляет работу.
... Ознакомьтесь с Dynamous AI: https://dynamous.ai/?code=646a60
Получите скидку 10% здесь 👉 https://shorturl.smartcode.diy/dynamo...
⚡ HOSTINGER — НАДЕЖНЫЙ ХОСТИНГ ДЛЯ ВАШИХ ПРОЕКТОВ (СКИДКА 10%)
Независимо от того, запускаете ли вы портфолио, сторонний проект, потоки n8n или ИИ-агентов — я использую Hostinger для быстрого и доступного VPS + веб-хостинга.
Получите скидку 10% здесь 👉 https://hostinger.com/DIYSMARTCODE
(Партнерская ссылка — для вас это ничего не стоит, но канал поддерживается.)
----
Разделы
0:00 Спекулятивное декодирование: те же флаги, +65% против +23%
0:18 Вывод LLM ограничен памятью, а не вычислительными ресурсами
1:01 Пропускная способность памяти, деленная на размер модели = токены в секунду
1:29 Черновик, проверка, фиксация: как работает спекулятивное декодирование
2:39 Многотокенное предсказание (MTP): дополнительные головы, одна контрольная точка
3:04 Ускорение локального LLM: унифицированная память против гибридной разгрузки
3:53 Смесь экспертов нарушает амортизацию проверки
4:28 Когда спекулятивное декодирование замедляет работу и во сколько обходится MTP
5:39 N-граммовый черновик с блокировкой: +25% В разделе «Код, ничего о прозе»
6:15 Настройка llama.cpp: флаги -md и --spec-draft-n-max
6:43 Вердикт: Спекулятивное декодирование или предсказание нескольких токенов сегодня вечером
Что вы увидите в этом 7-минутном разборе:
→ Почему 14-битная модель с 4-битным разрешением считывает примерно 9 ГБ весов на токен, и как это влияет на количество токенов в секунду
→ Потолок пропускной способности ÷ размер модели, рассчитанный на реальных числах (900 ГБ/с на 9 ГБ = около 100 токенов/с, в лучшем случае)
→ Как небольшая черновая модель угадывает четыре токена, а большая модель проверяет все четыре за один прямой проход
→ Почему выборка с отбрасыванием делает спекулятивное декодирование без потерь, а не приближением
→ Почему черновая модель должна использовать тот же токенизатор, что и целевая модель, и что происходит с коэффициентом принятия, когда этого не происходит
→ Как предсказание нескольких токенов (MTP) полностью удаляет вторую контрольную точку с дополнительными блоками прогнозирования
→ Почему унифицированная память обеспечивает +40% до +65% при уровне принятия до 92,8%, в то время как карта на 6 ГБ с разгрузкой системной памяти обеспечивает +23% при 84%
→ Почему плотная модель амортизирует проверку по каждому созданному токену, а смесь экспертов — нет
→ Во сколько вам все еще обходится MTP: около 900 МБ видеопамяти на блок прогнозирования при контексте 64k и на 14–30% более медленная обработка подсказок на CUDA
→ Добавление генерации n-грамм: +25% к генерации кода и почему она рушится при обработке прозы
→ Точные флаги llama.cpp: -md для модели черновика, --spec-draft-n-max для глубины угадывания
→ Три случая сбоя: пакетная обработка, плохое принятие и ограниченный объем видеопамяти
Бенчмарки в этом видео (унифицированная память против разгрузки, показатели принятия, MoE) (асимметрия, затраты на KV-кэш и обработку подсказок, стекирование n-грамм) взяты из Codacus:
• One llama.cpp Update Made Local AI 65% Faster
llama.cpp: https://github.com/ggml-org/llama.cpp
Документация по спекулятивному декодированию vLLM: https://docs.vllm.ai/en/latest/featur...
Оригинальная статья о спекулятивном декодировании (Leviathan et al.): https://arxiv.org/abs/2211.17192
Какая из них работает на вашем компьютере сегодня вечером: отдельная черновая модель или многотокенное предсказание?
#СпекулятивноеДекодирование #МногоТокеновоеПредсказание #LLMInference #LocalLLM #llamacpp #Ollama #LMStudio #vLLM #AIInference #GPUInference #Пропускная способностьПамять #Квантование #Qwen #Llama #OpenSourceAI #LocalAI #AICoding #DevTools #МашинноеОбучение #ГлубокоеОбучение #TransformerModels #ТокеныВСекунду #AIExplained #DIYSmartCode
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: