Multi-Token Prediction: почему ваша видеокарта запускает LLM в 3 раза быстрее
Автор: Devsplainers
Загружено: 2026-05-08
Просмотров: 934
Описание:
Многотокенное предсказание (MTP) позволяет одной потребительской видеокарте генерировать в 3 раза больше токенов за один проход — без нового оборудования и потери качества. В этом видео подробно объясняется, как это работает, в чём его преимущества и недостатки.
MTP — это форма спекулятивного декодирования, встроенная непосредственно в модель во время обучения. Дополнительные облегченные блоки предсказания генерируют несколько токенов одновременно, а полная модель проверяет их за один цикл загрузки весов. На структурированном коде процент принятия достигает 90% — превращая RTX 3090 с ограниченной пропускной способностью в машину с производительностью 50 т/с на модели с 27 битами памяти.
Мы рассматриваем узкое место в пропускной способности памяти, которое делает стандартную генерацию токенов такой медленной, цикл генерации и проверки, который устраняет этот разрыв, реальные результаты бенчмарков для кодовых/чатовых/творческих нагрузок, а также ограничения, о которых вам следует знать (модели MoE, высокая параллельность, небольшие модели).
00:00 — Модель размером 27 байт при скорости обработки 50 токенов/сек на 3090
00:42 — Узкое место в пропускной способности памяти
01:40 — Как работает предсказание нескольких токенов
02:45 — Цикл черновика и проверки
03:58 — Результаты бенчмарков по типам рабочих нагрузок
05:15 — Модели, фреймворки и аппаратная поддержка
06:37 — В чем недостатки MTP
07:48 — Что это значит для локального вывода
Рассмотренные модели: DeepSeek V3, Qwen 3.5/3.6, Gemma 4
Рассмотренные фреймворки: llama.cpp, vLLM, TensorRT-LLM, Ollama
— Ссылки —
Статья о Meta MTP (Gloeckle et al.): https://arxiv.org/abs/2404.19737
Ограничение скорости света при спекулятивном декодировании: https://arxiv.org/abs/2512.11718
Технический отчет DeepSeek V3: https://arxiv.org/abs/2412.19437
Поддержка MTP в llama.cpp (PR #22673): https://github.com/ggml-org/llama.cpp...
Бенчмарк спекулятивного декодирования Qwen 3.6 MoE (thc1006): https://github.com/thc1006/qwen3.6-sp...
Что такое многотокенное предсказание? MTP обучает языковую модель с несколькими выходными головками, каждая из которых предсказывает свой будущий токен. Во время вывода эти головки действуют как встроенная система черновиков для спекулятивного декодирования — генерируя несколько токенов-кандидатов, которые полная модель проверяет за один проход. В результате вывод на потребительских GPU происходит в 2-3 раза быстрее без изменения качества выходных данных. Ускорение достигается за счет более эффективного использования вычислительных ресурсов графического процессора, которые в противном случае простаивали бы во время передачи данных в память.
#MultiTokenPrediction #SpeculativeDecoding #LocalLLM
Больше объяснений от разработчиков → / @devsplainers
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: