Почему MoE в Kimi K3 не разрушилась
Автор: Jia-Bin Huang
Загружено: 2026-08-11
Просмотров: 10666
Описание:
Kimi K3 потряс мир технологий: в тестах на программирование, знания и логическое мышление он на равных конкурирует с сильнейшими моделями с закрытым исходным кодом, имея 2,8 триллиона параметров и всего 104 миллиарда активных токенов.
В этом видео объясняется архитектура, лежащая в основе этого разрыва: стабильная латентная модель MoE. Мы строим её на основе фундаментальных принципов: латентная модель MoE, которая делает доступным использование 896 экспертов, и три механизма, обеспечивающие стабильность обучения при разреженности 16 из 896: RMSNorm на маршрутизируемой ветви, SiTU-GLU внутри каждого эксперта и квантильная балансировка на маршрутизаторе.
Разделы:
0:00 Kimi K3: модель с открытыми весами 2.8T
01:10 FFN/MoE: где находится большинство параметров
01:52 Смесь экспертов (MoE)
04:31 Скрытый MoE
06:52 Поддержание стабильности: RMSNorm
07:35 Поддержание ограничений: SiTU-GLU
12:59 Занятость экспертов: квантильная балансировка
20:44 Стабильный скрытый MoE
Ссылки:
Kimi K3: Open Frontier Intelligence (Kimi Team, 2026) https://arxiv.org/abs/2607.24653
LatentMoE (Elango et al., 2026) https://arxiv.org/abs/2601.18089
Балансировка нагрузки без потерь вспомогательных ресурсов (Технический отчет DeepSeek-V3) https://arxiv.org/abs/2412.19437
Связанные видео:
Многоголовочный механизм скрытого внимания (MLA): • How Attention Got So Efficient [GQA/MLA/DSA]
Механизм внимания Кими-дельта (KDA): • A Visual Guide to Linear Attention
Механизм остаточного внимания (AttnRes): • Transformers Attend Over Tokens. Why Not O...
Модель смеси экспертов (MoE): • Mixture of Experts (MoE), Visually Explained
Линейные блоки с вентилями (GLU): • The 60-Year Hunt for AI's Most Important F...
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: