ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Speculative Decoding против Multi-Token Prediction! Есть ли польза?

ai

ai coding

artificial intelligence

Автор:

Загружено: 2026-08-25

Просмотров: 2036

Описание: Спекулятивное декодирование и предсказание нескольких токенов — это два приёма, которые ускоряют вывод LLM на локальной модели без изменения ни одного выходного токена. Вот как работает цикл «черновик и проверка», почему ваша видеокарта ограничена памятью, а не вычислительными ресурсами, два флага в llama.cpp, которые его включают, почему тот же приём даёт +65% при использовании унифицированной памяти и только +23% на карте с 6 ГБ памяти и разгрузкой, а также три случая, когда это замедляет работу.

... Ознакомьтесь с Dynamous AI: https://dynamous.ai/?code=646a60
Получите скидку 10% здесь 👉 https://shorturl.smartcode.diy/dynamo...

⚡ HOSTINGER — НАДЕЖНЫЙ ХОСТИНГ ДЛЯ ВАШИХ ПРОЕКТОВ (СКИДКА 10%)

Независимо от того, запускаете ли вы портфолио, сторонний проект, потоки n8n или ИИ-агентов — я использую Hostinger для быстрого и доступного VPS + веб-хостинга.

Получите скидку 10% здесь 👉 https://hostinger.com/DIYSMARTCODE

(Партнерская ссылка — для вас это ничего не стоит, но канал поддерживается.)
----

Разделы
0:00 Спекулятивное декодирование: те же флаги, +65% против +23%
0:18 Вывод LLM ограничен памятью, а не вычислительными ресурсами
1:01 Пропускная способность памяти, деленная на размер модели = токены в секунду
1:29 Черновик, проверка, фиксация: как работает спекулятивное декодирование
2:39 Многотокенное предсказание (MTP): дополнительные головы, одна контрольная точка
3:04 Ускорение локального LLM: унифицированная память против гибридной разгрузки
3:53 Смесь экспертов нарушает амортизацию проверки
4:28 Когда спекулятивное декодирование замедляет работу и во сколько обходится MTP
5:39 N-граммовый черновик с блокировкой: +25% В разделе «Код, ничего о прозе»
6:15 Настройка llama.cpp: флаги -md и --spec-draft-n-max
6:43 Вердикт: Спекулятивное декодирование или предсказание нескольких токенов сегодня вечером

Что вы увидите в этом 7-минутном разборе:

→ Почему 14-битная модель с 4-битным разрешением считывает примерно 9 ГБ весов на токен, и как это влияет на количество токенов в секунду
→ Потолок пропускной способности ÷ размер модели, рассчитанный на реальных числах (900 ГБ/с на 9 ГБ = около 100 токенов/с, в лучшем случае)
→ Как небольшая черновая модель угадывает четыре токена, а большая модель проверяет все четыре за один прямой проход
→ Почему выборка с отбрасыванием делает спекулятивное декодирование без потерь, а не приближением
→ Почему черновая модель должна использовать тот же токенизатор, что и целевая модель, и что происходит с коэффициентом принятия, когда этого не происходит
→ Как предсказание нескольких токенов (MTP) полностью удаляет вторую контрольную точку с дополнительными блоками прогнозирования
→ Почему унифицированная память обеспечивает +40% до +65% при уровне принятия до 92,8%, в то время как карта на 6 ГБ с разгрузкой системной памяти обеспечивает +23% при 84%
→ Почему плотная модель амортизирует проверку по каждому созданному токену, а смесь экспертов — нет
→ Во сколько вам все еще обходится MTP: около 900 МБ видеопамяти на блок прогнозирования при контексте 64k и на 14–30% более медленная обработка подсказок на CUDA
→ Добавление генерации n-грамм: +25% к генерации кода и почему она рушится при обработке прозы
→ Точные флаги llama.cpp: -md для модели черновика, --spec-draft-n-max для глубины угадывания
→ Три случая сбоя: пакетная обработка, плохое принятие и ограниченный объем видеопамяти

Бенчмарки в этом видео (унифицированная память против разгрузки, показатели принятия, MoE) (асимметрия, затраты на KV-кэш и обработку подсказок, стекирование n-грамм) взяты из Codacus:
   • One llama.cpp Update Made Local AI 65% Faster  

llama.cpp: https://github.com/ggml-org/llama.cpp
Документация по спекулятивному декодированию vLLM: https://docs.vllm.ai/en/latest/featur...
Оригинальная статья о спекулятивном декодировании (Leviathan et al.): https://arxiv.org/abs/2211.17192

Какая из них работает на вашем компьютере сегодня вечером: отдельная черновая модель или многотокенное предсказание?

#СпекулятивноеДекодирование #МногоТокеновоеПредсказание #LLMInference #LocalLLM #llamacpp #Ollama #LMStudio #vLLM #AIInference #GPUInference #Пропускная способностьПамять #Квантование #Qwen #Llama #OpenSourceAI #LocalAI #AICoding #DevTools #МашинноеОбучение #ГлубокоеОбучение #TransformerModels #ТокеныВСекунду #AIExplained #DIYSmartCode

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Speculative Decoding против Multi-Token Prediction! Есть ли польза?

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]