ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

llama.cpp стал быстрее: Qwen 27B и 35B 3B на 16 ГБ VRAM (тест MTP)

Автор: kintu

Загружено: 2026-05-15

Просмотров: 14252

Описание: В этом видео я покажу вам новую функцию прогнозирования множественных токенов (MTP) в файле llama.cpp, используя новейшие модели Qwen 3.6 MTP GGUF от Unsloth. Я подробно объясню, что такое MTP, проведу сравнительный анализ моделей с 27 и 35 битами и покажу, как ускорить локальную генерацию токенов до 2 раз. Я также предоставлю подробное пошаговое руководство по настройке параметров командной строки для самостоятельного запуска на потребительском оборудовании.

Свяжитесь со мной 🤝
• LinkedIn:   / george-kintu-k  
• X: https://x.com/gk_kintu
• IG:   / kintugk  

Ссылки 🔗 и ресурсы
• llama.cpp (форк am17an MTP): https://github.com/am17an/llama.cpp
• Qwen3.6-27B-MTP-GGUF (Unsloth): https://huggingface.co/unsloth/Qwen3....
• Qwen3.6-35B-A3B-MTP-GGUF (Unsloth): https://huggingface.co/unsloth/Qwen3....
• Упомянутое видео: Paddle OCR :    • PaddleOCR-VL-1.5 vs GLM-OCR: Local Test  
• Упомянутое видео: Qwen 3.6 27B против 35B-A3B :    • Qwen 3.6 27B vs 35B-A3B: 16GB VRAM Local Test  

По вопросам сотрудничества:
📧 [email protected]

Характеристики ПК:
Видеокарта: Nvidia RTX 5060 Ti 16 ГБ: https://amzn.to/4rU7xRy
Оперативная память: 64 ГБ 4x16 ГБ Kingston Fury: https://amzn.to/473HoaG

⏱️ Таймкоды
0:00 Вступление: Что такое прогнозирование нескольких токенов (MTP)?

1:39 Тест 1: Полный веб-сайт-портфолио (HTML/CSS/JS)
3:41 Тест 2: 3D-игра про автомобили в браузере (Three.js)
6:44 Тест 3: Поиск информации в документах (PaddleOCR)
8:59 Как MTP работает изнутри
10:06 Учебное пособие по командной строке llama.cpp и объяснение флагов
14:19 Загрузка моделей Unsloth и необходимый форк llama.cpp
15:32 Заключительные мысли и заключение

#LocalLLM #llama_cpp #Qwen3 #MultiTokenPrediction #Unsloth #AIWorkflow #OpenSourceAI #MachineLearning #CodingWithAI

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
llama.cpp стал быстрее: Qwen 27B и 35B 3B на 16 ГБ VRAM (тест MTP)

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]