llama.cpp стал быстрее: Qwen 27B и 35B 3B на 16 ГБ VRAM (тест MTP)
Автор: kintu
Загружено: 2026-05-15
Просмотров: 14252
Описание:
В этом видео я покажу вам новую функцию прогнозирования множественных токенов (MTP) в файле llama.cpp, используя новейшие модели Qwen 3.6 MTP GGUF от Unsloth. Я подробно объясню, что такое MTP, проведу сравнительный анализ моделей с 27 и 35 битами и покажу, как ускорить локальную генерацию токенов до 2 раз. Я также предоставлю подробное пошаговое руководство по настройке параметров командной строки для самостоятельного запуска на потребительском оборудовании.
Свяжитесь со мной 🤝
• LinkedIn: / george-kintu-k
• X: https://x.com/gk_kintu
• IG: / kintugk
Ссылки 🔗 и ресурсы
• llama.cpp (форк am17an MTP): https://github.com/am17an/llama.cpp
• Qwen3.6-27B-MTP-GGUF (Unsloth): https://huggingface.co/unsloth/Qwen3....
• Qwen3.6-35B-A3B-MTP-GGUF (Unsloth): https://huggingface.co/unsloth/Qwen3....
• Упомянутое видео: Paddle OCR : • PaddleOCR-VL-1.5 vs GLM-OCR: Local Test
• Упомянутое видео: Qwen 3.6 27B против 35B-A3B : • Qwen 3.6 27B vs 35B-A3B: 16GB VRAM Local Test
По вопросам сотрудничества:
📧 [email protected]
Характеристики ПК:
Видеокарта: Nvidia RTX 5060 Ti 16 ГБ: https://amzn.to/4rU7xRy
Оперативная память: 64 ГБ 4x16 ГБ Kingston Fury: https://amzn.to/473HoaG
⏱️ Таймкоды
0:00 Вступление: Что такое прогнозирование нескольких токенов (MTP)?
1:39 Тест 1: Полный веб-сайт-портфолио (HTML/CSS/JS)
3:41 Тест 2: 3D-игра про автомобили в браузере (Three.js)
6:44 Тест 3: Поиск информации в документах (PaddleOCR)
8:59 Как MTP работает изнутри
10:06 Учебное пособие по командной строке llama.cpp и объяснение флагов
14:19 Загрузка моделей Unsloth и необходимый форк llama.cpp
15:32 Заключительные мысли и заключение
#LocalLLM #llama_cpp #Qwen3 #MultiTokenPrediction #Unsloth #AIWorkflow #OpenSourceAI #MachineLearning #CodingWithAI
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: