ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

MoE: секрет маршрутизации в основе каждой модели, которую вы используете

mixture of experts

mixture of experts explained

moe llm

moe model

what is mixture of experts

mixture of experts llm

moe architecture

moe vs dense

sparse mixture of experts

how mixture of experts works

expert routing

moe router

active parameters vs total parameters

kimi k3

qwen moe

deepseek moe

gemma 4

local llm

llm vram

run llm locally

llm architecture explained

ai explained

devsplainers

Автор: Devsplainers

Загружено: 2026-08-12

Просмотров: 3383

Описание: В Kimi K3 находится 896 экспертов, и 16 из них срабатывают при каждом написанном слове. Звучит как гигантская модель, которую наконец-то можно запустить дома, но это не так.

Архитектура, основанная на использовании смешанных экспертов, лежит в основе почти каждой модели, которую вы использовали в этом году, и ошибка, которую допускают большинство разработчиков, отражается в вашем счете за оборудование. Модель, которая вычисляет с использованием 2% своих ресурсов, всё равно должна хранить 100% своих ресурсов в памяти. В этом видео показано, что на самом деле происходит, когда ваш запрос попадает на маршрутизатор, почему слово «эксперт» вводит в заблуждение и как читать два числа на карте модели перед покупкой оборудования.

Получайте самые актуальные мнения на свою электронную почту каждый вторник: https://devsplainers.com/takeouts/

Разделы:
00:00 896 экспертов, которых никто не использует
00:40 Что такое «эксперт» на самом деле
01:57 Внутри маршрутизатора: 256 фрагментов, выбрано 8
02:52 Каждое слово, каждый этап
04:18 Никто не назначает специализации
05:09 Что на самом деле дает вам разреженность
05:35 Почему счет за оперативную память взимается за всю модель
06:33 Модели MoE чаще нарушают ваши правила
07:20 Общее и активное значение на карте модели
07:41 Почему модель на 400 байт дешевле модели на 27 байт

Что такое смесь экспертов? Модель смеси экспертов (MoE) разделяет большой блок внутри каждого этапа языковой модели на множество более узких копий, называемых экспертами, и добавляет небольшой маршрутизатор, который выбирает несколько из них для каждого отдельного слова. Маршрутизатор Qwen 35B-A3B поддерживает 256 экспертов на каждом этапе и запускает 8, поэтому 3 миллиарда параметров выполняют работу, эквивалентную 35 миллиардам. Это сокращает вычислительные затраты на токен, поэтому алгоритмы MoE LLM генерируются быстро и стоят дешевле в расчете на токен через API. При этом не расходуется память. Маршрутизатор может отправить следующее слово любому эксперту на любом этапе, поэтому каждый параметр должен оставаться загруженным. Общее количество параметров указывает, какое оборудование следует приобрести. Активные параметры указывают на скорость работы.

В этом видео:
• Как маршрутизатор MoE оценивает и выбирает экспертов по токенам и слоям
• Почему «эксперт» — это не эксперт по Python или французский язык
• Цифра 20,7%, которая сводит на нет наивную предварительную выборку экспертов
• Плотные модели против моделей MoE и откуда на самом деле берется экономия
• Балансировка нагрузки, мертвые эксперты и исправление от DeepSeek
• Почему потоковая передача экспертов с SSD стоит 13 секунд на слово
• Чтение общего и активного количества параметров (35B-A3B) перед расчетом мощности машины
• Почему модели MoE менее надежно следуют правилам использования инструментов, чем плотные модели

Похожие видео Devsplainers:
• Мы только что достигли критической точки локального LLM (Colibri):    • We Just Hit the Local LLM Tipping Point (C...  
• Kimi сейчас не справляется с давлением:    • Kimi Can’t Handle the Pressure Right Now  
• Может ли локальный LLM действительно заменить Claude или Codex? Программирование?    • Can a Local LLM Actually Replace Claude or...  
• Кэш ключ-значение: настоящая причина высоких затрат на ИИ:    • KV Cache: The Real Reason Your AI Bill Is ...  
• Объяснение контекстного окна: почему 1 миллион токенов все еще забывают:    • Context Window Explained: Why 1M Tokens St...  

Источники:
• Moonshot AI, технический блог Kimi K3: https://www.kimi.com/blog/kimi-k3
• Google, документация по модели Gemma: https://ai.google.dev/gemma/docs
• Mixtral of Experts, Mistral AI: https://arxiv.org/abs/2401.04088
• Технический отчет DeepSeek-V3: https://arxiv.org/abs/2412.19437
• Невероятно большие нейронные сети (Shazeer et al., 2017): https://arxiv.org/abs/1701.06538
• Switch Transformer (Fedus et al.): https://arxiv.org/abs/2101.03961
• ST-MoE (Zoph et al.): https://arxiv.org/abs/2202.08906
• OLMoE (Muennighoff et al.): https://arxiv.org/abs/2409.02060
• Модели Qwen, Hugging Face: https://huggingface.co/Qwen
• Измерения сообщества из r/LocalLLaMA: трассировки экспертной маршрутизации, математические расчеты пропускной способности экспертной замены и тест вызова инструментов dense vs MoE

#MixtureOfExperts #MoE #LocalLLM #AI #LLM

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
MoE: секрет маршрутизации в основе каждой модели, которую вы используете

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]