ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?

localai

codacus

homelab

llama.cpp

rtx 3060

ai

gguf

mixture of experts

moe

budget gpu ai

private ai

self hosted ai

local llm

qwen 3.6

Автор: Codacus

Загружено: 2026-08-23

Просмотров: 19692

Описание: Я создал кэш экспертов для моделей MoE, самые популярные эксперты храню в видеопамяти, а остальные обрабатываю из системной оперативной памяти.
Базовое значение было 42. Вот что потребовалось, чтобы понять, почему, и к чему это привело: 80 токенов в секунду на пике, и всё ещё более 70 с реальным контекстом в окне.
Одна RTX 3060. Модель 35B. Неожиданная часть: сам по себе кэш почти ничего не стоит. Ценность ему придаёт то, как он влияет на спекулятивное декодирование.

⚙️ ДВА ФЛАГА
Всё остальное здесь — это команды, которые вы уже запускали. Эти два — новые:
--moe-cache-profile [path.csv]
--moe-cache-slots [n]

Полные команды, оба шага, в закреплённом комментарии.

⏱️ РАЗДЕЛЫ
0:00 Введение
0:31 Кладбище
2:35 Данные говорят, что не стоит
5:47 Сборка и удар под дых
7:42 Предательство планировщика
10:54 Увеличение производительности
14:08 Почему это работает
17:58 Ваша видеокарта

📊 ЦИФРЫ
базовый уровень, без кэша ............ 42 ток/с
кэш "работает" ............... 6 ток/с ← два дня
кэш фактически работает ........ 44 ток/с
кэш, 124 слота .............. 55 ток/с
спекулятивное декодирование само по себе .... 55 ток/с
оба вместе ................. 70 ток/с ← больше, чем по отдельности
параллельные цепочки GPU/CPU ....... 75 ток/с
пик .......................... 80 ток/с
с реальным контекстом ............. 70+ tok/s

⚠️ ПОМОЖЕТ ЛИ ЭТО ВАМ?
Зависит от того, сколько модулей помещается в модель. На 3060 с 35B помещается примерно половина модулей Expert, и прирост большой. На модели 118B, где помещается только 36 из 256 модулей Expert, прирост падает до 5%. При уровне менее 15–20% фиксированный набор модулей перестает быть оптимальным решением. В главе 7 рассматривается, где проходит граница для вашей карты.

🔧 НАСТРОЙКА
Qwen3.6-35B-A3B UD-Q4_K_M
RTX 3060 12 ГБ · Ryzen 5600X · 30 ГБ ОЗУ · Ubuntu 24.04 llama.cpp с кэшированием MoE Expert
—
Если вы запускаете модели локально и хотите получить больше от уже имеющегося у вас оборудования, то этот канал именно для этого. Подписывайтесь, впереди ещё много интересного.

#localllm #llamacpp #rtx3060 #qwen3 #selfhostedai ​​#localai

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Насколько быстро RTX 3060 на самом деле тянет модель на 35B (улучшение llama.cpp)?

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]