Почему LLM-ы с длинным контекстом замедляют работу (и как это исправить при использовании метода ...
Автор: Tonbi's AI Garage
Загружено: 2026-04-09
Просмотров: 4230
Описание:
Что если бы вы могли ускорить обработку событий внимания в 2-9 раз на полном прямом проходе модели — и даже обрабатывать контексты такой длины, с которой ваш GPU раньше не справлялся?
📰Подпишитесь на мою БЕСПЛАТНУЮ еженедельную рассылку, где я делюсь своими нефильтрованными мыслями о последних новостях в области ИИ, интересных исследованиях и проектах, над которыми я работаю: https://www.onchainaigarage.com/
🐦 Следите за Tonbi на X, чтобы получать обновления об ИИ и блокчейне в режиме реального времени! https://x.com/tonbistudio
LLM-модели с длинным контекстом замедляются до минимума, потому что механизм внимания масштабируется квадратично — удвоение входных данных приводит к увеличению вычислительных ресурсов в 4 раза. В этом видео подробно объясняется, как работает механизм внимания, рассматриваются механизмы, используемые моделями сегодня (MHA, GQA, Flash Attention, DSA от DeepSeek), а затем исследуется HISA (Hierarchical Indexed Sparse Attention) — новый подход, который заменяет сканирование токенов методом перебора двухэтапным поиском блоков. Я устанавливаю его на стандартные модели Qwen 2.5 3B и Llama 3.2 3B с использованием чистого PyTorch на потребительской RTX 3060 — без переобучения, без пользовательских ядер CUDA — и измеряю скорость и качество. Затем я упаковываю его в плагин с открытым исходным кодом, который вы можете попробовать сами.
✅ Понимание всего спектра механизмов внимания — MHA, GQA, Flash Attention и Dynamic Sparse Attention от DeepSeek — и почему ни один из них не решает квадратичную проблему.
✅ Двухэтапный поиск блоков HISA обеспечивает в 7-14 раз более быстрый выбор токенов, чем DSA при контексте 128K, а полные прямые проходы модели — до 9 раз быстрее.
✅ Качество остается прежним или немного улучшается — разреженное внимание фокусируется на релевантных токенах, уменьшая шум вместо добавления ошибок.
Скампи и Тонби — дуэт человека и ИИ, создающий публичные проекты в блокчейне. Тонби привносит вкус, рассудительность и экспертные знания в своей области. Скампи же привносит неутомимые исследования, программирование и энергию, присущую креветкам. 🦐
🐦 Tonbi: https://x.com/tonbistudio
💻 GitHub Tonbi: https://github.com/tonbistudio
🌐 Портфолио: https://www.tonbistudio.com
Ресурсы:
🔗 Плагин HISA (с открытым исходным кодом): https://github.com/tonbistudio/hisa-p...
🔗 Статья о HISA (Hierarchical Indexed Sparse Attention): https://huggingface.co/papers/2603.28458
🔗 Hugging Face Transformers: https://huggingface.co/docs/transformers
Временные метки:
0:00 - Вступление: Твит о новой статье о механизме внимания
0:25 - Проблема: LLM-ы с длинным контекстом становятся медленнее и хуже
1:14 - Что такое внимание? Интерактивная демонстрация
2:43 - Почему механизм внимания не масштабируется (квадратичная стоимость)
3:32 - Текущие подходы: объяснение MHA и GQA
4:25 - Flash Attention: быстрее, но все еще квадратичная стоимость
4:52 - Динамическое разреженное внимание DeepSeek (DSA)
6:08 - Подвох: DSA все еще сканирует все
6:31 - Представляем HISA: иерархический блочный поиск
7:46 - Что утверждается в статье
8:25 - Мой эксперимент: добавление HISA к стандартной модели
9:30 - Что пошло не так: повторяющийся текст, количество блоков, сбои OOM
10:37 - Результаты скорости: индексатор HISA против DSA при разной длине контекста
11:37 - Тест качества: перплексия на Qwen 2.5 3B
12:52 - Тест в реальном времени: запуск HISA на Llama 3.2 3B Instruct
15:16 - Результаты прямого прохода полной модели: до В 9 раз быстрее
16:10 - Плагин HISA с открытым исходным кодом
17:07 - Результаты скорости от начала до конца при полном проходе модели
18:06 - Что это доказывает и куда двигаться дальше
19:29 - Заключение и призыв к действию
Далее:
Больше экспериментов, расширяющих возможности разреженного внимания — объединенные ядра GPU, вытеснение из кэша ключ-значение, интеграция vLLM и тестирование на более мощных GPU с еще более длинными контекстами! 👀
Что вы думаете о методах разреженного внимания? Вы пробовали запускать модели с длинным контекстом локально? Поделитесь своим опытом в комментариях! Если это было полезно, пожалуйста, поставьте лайк, подпишитесь и нажмите на колокольчик, чтобы получать уведомления о новых экспериментах в области машинного обучения! 🦐✨
#SparseAttention #HISA #DeepSeek #Transformers #AttentionMechanism #LLM #MachineLearning #ClaudeCode #MLEngineering #FlashAttention #AIResearch #LocalLLM
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: