MoE с триллионом параметров против компактных латентных моделей: разбор Kimi 3, DeepSeek-V4, GRAM...
Автор: Byte Goose AI.
Загружено: 2026-08-01
Просмотров: 340
Описание:
В первой половине сегодняшнего эпизода мы разберем внутреннюю механику новейших гигантов в области обработки данных с триллионом параметров: Kimi 3 и DeepSeek-V4.
Мы рассмотрим:
Как Kimi 3 обрабатывает контексты с миллионами токенов, используя механизм Kimi Delta Attention (KDA) — переходя от стандартного внимания с матричным умножением к динамическим обновлениям дельта-состояния в непрерывном времени — в сочетании с параметризованными остатками внимания.
Как DeepSeek-V4 сокращает количество операций с плавающей запятой (FLOPs) для отдельных токенов благодаря гибридному ядру, состоящему из сжатого разреженного внимания (CSA) и сильно сжатого внимания (HCA), одновременно обеспечивая стабильность сигнала в многопотоковых остатках с помощью гиперсоединений с ограничениями на многообразии (mHC), спроецированных на политоп Биркхофа.
Кроме того, проводится математическое сравнение их стратегий маршрутизации MoE и конвейеров оптимизации, сопоставляя стандартный AdamW с ортогональными обновлениями матрицы знака оптимизатора Muon.
Затем, во второй половине, мы переходим к парадигмальному сдвигу, незаметно меняющему вычисления во время тестирования: малые вероятностные рекурсивные модели.
Вместо того чтобы тратить миллионы долларов на создание пошаговых цепочек рассуждений в огромных моделях с более чем 100 миллиардами параметров, как сети с менее чем 100 миллионами параметров, такие как GRAM, PTRM и LDT, решают сложные, невыпуклые комбинаторные задачи? Мы рассмотрим, как:
GRAM использует стохастические возмущения для ветвления параллельных непрерывных гипотез,
PTRM использует внедрение гауссовского шума в сочетании с внутренними Q-головками-верификаторами для масштабирования вычислений во время тестирования, и
LDT использует нейросимволические проекции решетки для обеспечения точных, проверяемых математических выводов без создания ни одного промежуточного текстового токена.
Если вас интересуют динамические обновления состояния внимания, неевклидовы оптимизаторы и непрерывное перемещение в латентном пространстве, вы попали по адресу. Давайте сразу перейдем к делу.
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: