MoE: секрет маршрутизации в основе каждой модели, которую вы используете
Автор: Devsplainers
Загружено: 2026-08-12
Просмотров: 3383
Описание:
В Kimi K3 находится 896 экспертов, и 16 из них срабатывают при каждом написанном слове. Звучит как гигантская модель, которую наконец-то можно запустить дома, но это не так.
Архитектура, основанная на использовании смешанных экспертов, лежит в основе почти каждой модели, которую вы использовали в этом году, и ошибка, которую допускают большинство разработчиков, отражается в вашем счете за оборудование. Модель, которая вычисляет с использованием 2% своих ресурсов, всё равно должна хранить 100% своих ресурсов в памяти. В этом видео показано, что на самом деле происходит, когда ваш запрос попадает на маршрутизатор, почему слово «эксперт» вводит в заблуждение и как читать два числа на карте модели перед покупкой оборудования.
Получайте самые актуальные мнения на свою электронную почту каждый вторник: https://devsplainers.com/takeouts/
Разделы:
00:00 896 экспертов, которых никто не использует
00:40 Что такое «эксперт» на самом деле
01:57 Внутри маршрутизатора: 256 фрагментов, выбрано 8
02:52 Каждое слово, каждый этап
04:18 Никто не назначает специализации
05:09 Что на самом деле дает вам разреженность
05:35 Почему счет за оперативную память взимается за всю модель
06:33 Модели MoE чаще нарушают ваши правила
07:20 Общее и активное значение на карте модели
07:41 Почему модель на 400 байт дешевле модели на 27 байт
Что такое смесь экспертов? Модель смеси экспертов (MoE) разделяет большой блок внутри каждого этапа языковой модели на множество более узких копий, называемых экспертами, и добавляет небольшой маршрутизатор, который выбирает несколько из них для каждого отдельного слова. Маршрутизатор Qwen 35B-A3B поддерживает 256 экспертов на каждом этапе и запускает 8, поэтому 3 миллиарда параметров выполняют работу, эквивалентную 35 миллиардам. Это сокращает вычислительные затраты на токен, поэтому алгоритмы MoE LLM генерируются быстро и стоят дешевле в расчете на токен через API. При этом не расходуется память. Маршрутизатор может отправить следующее слово любому эксперту на любом этапе, поэтому каждый параметр должен оставаться загруженным. Общее количество параметров указывает, какое оборудование следует приобрести. Активные параметры указывают на скорость работы.
В этом видео:
• Как маршрутизатор MoE оценивает и выбирает экспертов по токенам и слоям
• Почему «эксперт» — это не эксперт по Python или французский язык
• Цифра 20,7%, которая сводит на нет наивную предварительную выборку экспертов
• Плотные модели против моделей MoE и откуда на самом деле берется экономия
• Балансировка нагрузки, мертвые эксперты и исправление от DeepSeek
• Почему потоковая передача экспертов с SSD стоит 13 секунд на слово
• Чтение общего и активного количества параметров (35B-A3B) перед расчетом мощности машины
• Почему модели MoE менее надежно следуют правилам использования инструментов, чем плотные модели
Похожие видео Devsplainers:
• Мы только что достигли критической точки локального LLM (Colibri): • We Just Hit the Local LLM Tipping Point (C...
• Kimi сейчас не справляется с давлением: • Kimi Can’t Handle the Pressure Right Now
• Может ли локальный LLM действительно заменить Claude или Codex? Программирование? • Can a Local LLM Actually Replace Claude or...
• Кэш ключ-значение: настоящая причина высоких затрат на ИИ: • KV Cache: The Real Reason Your AI Bill Is ...
• Объяснение контекстного окна: почему 1 миллион токенов все еще забывают: • Context Window Explained: Why 1M Tokens St...
Источники:
• Moonshot AI, технический блог Kimi K3: https://www.kimi.com/blog/kimi-k3
• Google, документация по модели Gemma: https://ai.google.dev/gemma/docs
• Mixtral of Experts, Mistral AI: https://arxiv.org/abs/2401.04088
• Технический отчет DeepSeek-V3: https://arxiv.org/abs/2412.19437
• Невероятно большие нейронные сети (Shazeer et al., 2017): https://arxiv.org/abs/1701.06538
• Switch Transformer (Fedus et al.): https://arxiv.org/abs/2101.03961
• ST-MoE (Zoph et al.): https://arxiv.org/abs/2202.08906
• OLMoE (Muennighoff et al.): https://arxiv.org/abs/2409.02060
• Модели Qwen, Hugging Face: https://huggingface.co/Qwen
• Измерения сообщества из r/LocalLLaMA: трассировки экспертной маршрутизации, математические расчеты пропускной способности экспертной замены и тест вызова инструментов dense vs MoE
#MixtureOfExperts #MoE #LocalLLM #AI #LLM
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: