[Разреженное внимание] Объяснение нативного разреженного внимания (NSA): эффективное моделировани...
Автор: Byte Goose AI.
Загружено: 2026-01-24
Просмотров: 290
Описание:
Наконец-то мы видим трещины в самом большом препятствии эпохи LLM: квадратичной стене.
В течение многих лет механизм «полного внимания» был нашей главной силой и одновременно нашим главным недостатком. Он обеспечивает моделям «память», но также требует экспоненциальных вычислительных затрат по мере увеличения длины контекста. Мы пытались исправить это во время инференса, мы пытались сократить его постфактум — но сегодня мы говорим о сдвиге парадигмы, который закладывает эффективность в саму ДНК модели.
Сегодняшний эпизод посвящен глубокому изучению механизма разреженного внимания (Native Sparse Attention, NSA).
Итак, как же ему удается обрабатывать огромные объемы документов, не перегружая сервер? NSA использует трехчастную иерархическую стратегию, имитирующую то, как человек просматривает учебник:
Скользящее окно: для гиперлокальной точности — фокусировка на словах прямо перед ним.
Сжатие токенов: Для общего семантического обзора — чтобы с первого взгляда понять суть всей главы.
Выборочные блоки: Для более точного поиска — возможность «телепортироваться» к конкретному факту, скрытому на глубине 50 000 токенов.
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: