ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Multi-Token Prediction: почему ваша видеокарта запускает LLM в 3 раза быстрее

multi token prediction

multi-token prediction

MTP

speculative decoding

speculative decoding explained

how speculative decoding works

speculative decoding llm

llama.cpp speculative decoding

ollama speculative decoding

llm inference speed

faster llm inference

local llm speed

llm tokens per second

deepseek v3 mtp

qwen mtp

gemma 4 mtp

gpu memory bandwidth

run llm locally

local ai

consumer gpu llm

draft and verify

rtx 3090 llm

apple silicon llm

devsplainers

Автор: Devsplainers

Загружено: 2026-05-08

Просмотров: 934

Описание: Многотокенное предсказание (MTP) позволяет одной потребительской видеокарте генерировать в 3 раза больше токенов за один проход — без нового оборудования и потери качества. В этом видео подробно объясняется, как это работает, в чём его преимущества и недостатки.

MTP — это форма спекулятивного декодирования, встроенная непосредственно в модель во время обучения. Дополнительные облегченные блоки предсказания генерируют несколько токенов одновременно, а полная модель проверяет их за один цикл загрузки весов. На структурированном коде процент принятия достигает 90% — превращая RTX 3090 с ограниченной пропускной способностью в машину с производительностью 50 т/с на модели с 27 битами памяти.

Мы рассматриваем узкое место в пропускной способности памяти, которое делает стандартную генерацию токенов такой медленной, цикл генерации и проверки, который устраняет этот разрыв, реальные результаты бенчмарков для кодовых/чатовых/творческих нагрузок, а также ограничения, о которых вам следует знать (модели MoE, высокая параллельность, небольшие модели).

00:00 — Модель размером 27 байт при скорости обработки 50 токенов/сек на 3090
00:42 — Узкое место в пропускной способности памяти
01:40 — Как работает предсказание нескольких токенов
02:45 — Цикл черновика и проверки
03:58 — Результаты бенчмарков по типам рабочих нагрузок
05:15 — Модели, фреймворки и аппаратная поддержка
06:37 — В чем недостатки MTP
07:48 — Что это значит для локального вывода

Рассмотренные модели: DeepSeek V3, Qwen 3.5/3.6, Gemma 4
Рассмотренные фреймворки: llama.cpp, vLLM, TensorRT-LLM, Ollama

— Ссылки —
Статья о Meta MTP (Gloeckle et al.): https://arxiv.org/abs/2404.19737
Ограничение скорости света при спекулятивном декодировании: https://arxiv.org/abs/2512.11718
Технический отчет DeepSeek V3: https://arxiv.org/abs/2412.19437
Поддержка MTP в llama.cpp (PR #22673): https://github.com/ggml-org/llama.cpp...
Бенчмарк спекулятивного декодирования Qwen 3.6 MoE (thc1006): https://github.com/thc1006/qwen3.6-sp...

Что такое многотокенное предсказание? MTP обучает языковую модель с несколькими выходными головками, каждая из которых предсказывает свой будущий токен. Во время вывода эти головки действуют как встроенная система черновиков для спекулятивного декодирования — генерируя несколько токенов-кандидатов, которые полная модель проверяет за один проход. В результате вывод на потребительских GPU происходит в 2-3 раза быстрее без изменения качества выходных данных. Ускорение достигается за счет более эффективного использования вычислительных ресурсов графического процессора, которые в противном случае простаивали бы во время передачи данных в память.

#MultiTokenPrediction #SpeculativeDecoding #LocalLLM

Больше объяснений от разработчиков →    / @devsplainers  

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Multi-Token Prediction: почему ваша видеокарта запускает LLM в 3 раза быстрее

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]