ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Одно обновление llama.cpp ускорило локальный ИИ на 65%

mtp

multi-token prediction

llama.cpp

llama.cpp mtp

local AI

local AI speedup

speculative decoding

qwen 3.6

qwen 35b

qwen mtp

moe offload

moe inference

local llm speed

mac local AI

m5 macbook pro AI

nvidia local ai

ngram speculation

free ai speedup

unsloth qwen

codacus

codaucs

Автор: Codacus

Загружено: 2026-05-19

Просмотров: 28231

Описание: Одно обновление llama.cpp позволило ускорить работу локального ИИ на MacBook Pro на 65% — и на 23% на бюджетной видеокарте с использованием того же самого флага.

Эта функция называется Multi-Token Prediction (MTP) и недавно была добавлена ​​в llama.cpp. И в зависимости от того, зависит ли ваша система от производительности процессора или видеокарты, прирост скорости может быть огромным.

В этом видео:
— Что на самом деле делает MTP / Multi-Token Prediction
— ​​Почему локальный вывод ИИ внезапно стал намного быстрее
— Тесты MacBook Pro (+65%)
— Тесты бюджетных GPU + MoE offload (+23%)
— Почему одно и то же обновление llama.cpp ведет себя по-разному на разном оборудовании
— Тестирование Qwen 3.6 MTP GGUF
— Объяснение спекулятивного декодирования ngram-mod
— Лучшие флаги llama.cpp для скорости локального LLM

Результаты:
• MacBook Pro (Metal, dense 27B): ускорение в 1,65 раза, 92,8% принятия черновиков
• Бюджетный GPU + MoE offload (35B-A3B): ускорение в 1,23 раза, 84,4% принятия черновиков

Одно и то же семейство моделей. Одно и то же обновление llama.cpp. Совершенно другое поведение масштабирования.

Если вы используете локальный ИИ, llama.cpp, Qwen, модели MoE или самостоятельно размещенные LLM-модели, это обновление вам важно.

━━━━━━━━━━━━━━━━━━━━━━
🕒 ГЛАВЫ
━━━━━━━━━━━━━━━━━━━━━━━

0:00 Локальный ИИ стал быстрее
0:44 Что на самом деле делает MTP
1:54 Результат для MacBook Pro — +65%
3:04 Результат для бюджетной видеокарты — +23%
4:46 Почему разница в результатах
6:28 Спекулятивное декодирование ngram-mod
7:29 Лучшие настройки (чит) лист

━━━━━━━━━━━━━━━━━━━━━━━
🔗 РЕСУРСЫ
━━━━━━━━━━━━━━━━━━━━━━━

• llama.cpp PR #22673 (слияние MTP)
https://github.com/ggml-org/llama.cpp...

• Unsloth Qwen 3.6 27B MTP GGUF
https://huggingface.co/unsloth/Qwen3....

• Unsloth Qwen 3.6 35B-A3B MTP GGUF
https://huggingface.co/unsloth/Qwen3....

• Предыдущее видео: Подробный анализ спекулятивного декодирования DFlash

━━━━━━━━━━━━━━━━━━━━━━━
🟢 DISCORD
━━━━━━━━━━━━━━━━━━━━━━━

Локальный ИИ, llama.cpp, сборки для домашних лабораторий, необычные эксперименты по инференции, конфигурации с низким объемом видеопамяти.

Если вы тоже разрабатываете системы ИИ, ориентированные на владение:
discord.gg/XgBzczAWs

━━━━━━━━━━━━━━━━━━━━━━━

Я читаю черновики запросов на слияние llama.cpp в день их принятия, так что вам не придется этого делать.

Подпишитесь, чтобы получать информацию о:
• Локальном ИИ
• Оптимизации llama.cpp
• Экспериментах по разгрузке MoE
• Выводе данных с низким объемом видеопамяти
• Самостоятельно размещаемых системах ИИ
• Необычных открытиях в бенчмарках

#localai #llamacpp #mtp #qwen #speculativedecoding #ai

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Одно обновление llama.cpp ускорило локальный ИИ на 65%

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]