Разбор архитектуры Kimi K3 (даже для тех, кто не в теме)
Автор: Tonbi's AI Garage
Загружено: 2026-07-23
Просмотров: 2280
Описание:
Kimi K3 имеет 2,8 триллиона параметров, но его запуск обходится дешевле, чем у моделей, значительно меньших по размеру — как? Я разбираю его необычную архитектуру, следуя одному вопросу от момента нажатия клавиши Enter до ответа, без необходимости обладать математическим образованием.
🧠 Запускаете агентов? Предоставьте им базу знаний. Agent Wikis предлагает бесплатные, тщательно отобранные вики-страницы для магистров права по множеству тем в области ИИ, а также уровень Pro (9,99$/мес.) для супербольших вики-страниц с гораздо большей глубиной: https://agentwikis.com/
Подпишитесь на мою БЕСПЛАТНУЮ еженедельную рассылку, где я делюсь своими нефильтрованными мыслями о последних новостях в области ИИ, интересных исследованиях и проектах, над которыми я работаю: https://www.onchainaigarage.com/
Используя реальную подсказку для отладки — ошибку выхода из системы, скрытую в двух числах, расположенных на расстоянии 183 000 токенов друг от друга, — я прослеживаю, как Kimi K3 читает, думает и пишет, и какой трюк он использует для снижения затрат на каждом этапе. Проще говоря: кэширование префиксов, механизм внимания Kimi Delta Attention с «белой доской» и скоростью затухания для каждого входа, а также слои MLA с полным текстом в качестве страховки, смесь экспертов из 896 экспертов с квантильной балансировкой, остаточные значения внимания и 4-битные веса MXFP4, обученные с самого начала в упрощенном виде. В конце я честно признаю: большая часть этого — это доработка опубликованных работ, а показатели производительности взяты из Moonshot / более ранних статей, поскольку полный отчет по K3 и веса еще не опубликованы.
Временные метки:
0:00 - Загадка: 2,8 ТБ параметров, но дешево в эксплуатации
1:36 - Четыре места, где модель обходится дорого
2:58 - Пример ошибки: два числа, разделенные 183 тыс. токенов
5:29 - Кэширование префиксов: пропуск уже выполненной работы
6:25 - Чтение подсказки: предварительное заполнение, декодирование и внимание
9:20 - Внимание Kimi Delta: трюк с «доской»
11:58 - Закрытый MLA: система безопасности полной стенограммы
13:53 - Смесь экспертов: 896 специалистов, 16 работают
16:41 - Остаточные значения внимания: слои выбирают, что услышать
18:31 - Быстрое написание: 4-битные веса + обучение стенографии
22:11 - Полная картина + честные оговорки
#KimiK3 #MoonshotAI #LLM #AIArchitecture #MixtureOfExperts #Attention #ОткрытыеВесы #МашинноеОбучение #ОбъяснениеИИ
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: