Одно обновление llama.cpp ускорило локальный ИИ на 65%
Автор: Codacus
Загружено: 2026-05-19
Просмотров: 28231
Описание:
Одно обновление llama.cpp позволило ускорить работу локального ИИ на MacBook Pro на 65% — и на 23% на бюджетной видеокарте с использованием того же самого флага.
Эта функция называется Multi-Token Prediction (MTP) и недавно была добавлена в llama.cpp. И в зависимости от того, зависит ли ваша система от производительности процессора или видеокарты, прирост скорости может быть огромным.
В этом видео:
— Что на самом деле делает MTP / Multi-Token Prediction
— Почему локальный вывод ИИ внезапно стал намного быстрее
— Тесты MacBook Pro (+65%)
— Тесты бюджетных GPU + MoE offload (+23%)
— Почему одно и то же обновление llama.cpp ведет себя по-разному на разном оборудовании
— Тестирование Qwen 3.6 MTP GGUF
— Объяснение спекулятивного декодирования ngram-mod
— Лучшие флаги llama.cpp для скорости локального LLM
Результаты:
• MacBook Pro (Metal, dense 27B): ускорение в 1,65 раза, 92,8% принятия черновиков
• Бюджетный GPU + MoE offload (35B-A3B): ускорение в 1,23 раза, 84,4% принятия черновиков
Одно и то же семейство моделей. Одно и то же обновление llama.cpp. Совершенно другое поведение масштабирования.
Если вы используете локальный ИИ, llama.cpp, Qwen, модели MoE или самостоятельно размещенные LLM-модели, это обновление вам важно.
━━━━━━━━━━━━━━━━━━━━━━
🕒 ГЛАВЫ
━━━━━━━━━━━━━━━━━━━━━━━
0:00 Локальный ИИ стал быстрее
0:44 Что на самом деле делает MTP
1:54 Результат для MacBook Pro — +65%
3:04 Результат для бюджетной видеокарты — +23%
4:46 Почему разница в результатах
6:28 Спекулятивное декодирование ngram-mod
7:29 Лучшие настройки (чит) лист
━━━━━━━━━━━━━━━━━━━━━━━
🔗 РЕСУРСЫ
━━━━━━━━━━━━━━━━━━━━━━━
• llama.cpp PR #22673 (слияние MTP)
https://github.com/ggml-org/llama.cpp...
• Unsloth Qwen 3.6 27B MTP GGUF
https://huggingface.co/unsloth/Qwen3....
• Unsloth Qwen 3.6 35B-A3B MTP GGUF
https://huggingface.co/unsloth/Qwen3....
• Предыдущее видео: Подробный анализ спекулятивного декодирования DFlash
━━━━━━━━━━━━━━━━━━━━━━━
🟢 DISCORD
━━━━━━━━━━━━━━━━━━━━━━━
Локальный ИИ, llama.cpp, сборки для домашних лабораторий, необычные эксперименты по инференции, конфигурации с низким объемом видеопамяти.
Если вы тоже разрабатываете системы ИИ, ориентированные на владение:
discord.gg/XgBzczAWs
━━━━━━━━━━━━━━━━━━━━━━━
Я читаю черновики запросов на слияние llama.cpp в день их принятия, так что вам не придется этого делать.
Подпишитесь, чтобы получать информацию о:
• Локальном ИИ
• Оптимизации llama.cpp
• Экспериментах по разгрузке MoE
• Выводе данных с низким объемом видеопамяти
• Самостоятельно размещаемых системах ИИ
• Необычных открытиях в бенчмарках
#localai #llamacpp #mtp #qwen #speculativedecoding #ai
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: