ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Почему LLM-ы с длинным контекстом замедляют работу (и как это исправить при использовании метода ...

ai

attention

llm

context

dsa

hisa

Автор: Tonbi's AI Garage

Загружено: 2026-04-09

Просмотров: 4230

Описание: Что если бы вы могли ускорить обработку событий внимания в 2-9 раз на полном прямом проходе модели — и даже обрабатывать контексты такой длины, с которой ваш GPU раньше не справлялся?

📰Подпишитесь на мою БЕСПЛАТНУЮ еженедельную рассылку, где я делюсь своими нефильтрованными мыслями о последних новостях в области ИИ, интересных исследованиях и проектах, над которыми я работаю: https://www.onchainaigarage.com/

🐦 Следите за Tonbi на X, чтобы получать обновления об ИИ и блокчейне в режиме реального времени! https://x.com/tonbistudio

LLM-модели с длинным контекстом замедляются до минимума, потому что механизм внимания масштабируется квадратично — удвоение входных данных приводит к увеличению вычислительных ресурсов в 4 раза. В этом видео подробно объясняется, как работает механизм внимания, рассматриваются механизмы, используемые моделями сегодня (MHA, GQA, Flash Attention, DSA от DeepSeek), а затем исследуется HISA (Hierarchical Indexed Sparse Attention) — новый подход, который заменяет сканирование токенов методом перебора двухэтапным поиском блоков. Я устанавливаю его на стандартные модели Qwen 2.5 3B и Llama 3.2 3B с использованием чистого PyTorch на потребительской RTX 3060 — без переобучения, без пользовательских ядер CUDA — и измеряю скорость и качество. Затем я упаковываю его в плагин с открытым исходным кодом, который вы можете попробовать сами.

✅ Понимание всего спектра механизмов внимания — MHA, GQA, Flash Attention и Dynamic Sparse Attention от DeepSeek — и почему ни один из них не решает квадратичную проблему.

✅ Двухэтапный поиск блоков HISA обеспечивает в 7-14 раз более быстрый выбор токенов, чем DSA при контексте 128K, а полные прямые проходы модели — до 9 раз быстрее.

✅ Качество остается прежним или немного улучшается — разреженное внимание фокусируется на релевантных токенах, уменьшая шум вместо добавления ошибок.

Скампи и Тонби — дуэт человека и ИИ, создающий публичные проекты в блокчейне. Тонби привносит вкус, рассудительность и экспертные знания в своей области. Скампи же привносит неутомимые исследования, программирование и энергию, присущую креветкам. 🦐

🐦 Tonbi: https://x.com/tonbistudio
💻 GitHub Tonbi: https://github.com/tonbistudio
🌐 Портфолио: https://www.tonbistudio.com

Ресурсы:
🔗 Плагин HISA (с открытым исходным кодом): https://github.com/tonbistudio/hisa-p...
🔗 Статья о HISA (Hierarchical Indexed Sparse Attention): https://huggingface.co/papers/2603.28458
🔗 Hugging Face Transformers: https://huggingface.co/docs/transformers

Временные метки:
0:00 - Вступление: Твит о новой статье о механизме внимания
0:25 - Проблема: LLM-ы с длинным контекстом становятся медленнее и хуже
1:14 - Что такое внимание? Интерактивная демонстрация
2:43 - Почему механизм внимания не масштабируется (квадратичная стоимость)
3:32 - Текущие подходы: объяснение MHA и GQA
4:25 - Flash Attention: быстрее, но все еще квадратичная стоимость
4:52 - Динамическое разреженное внимание DeepSeek (DSA)
6:08 - Подвох: DSA все еще сканирует все
6:31 - Представляем HISA: иерархический блочный поиск
7:46 - Что утверждается в статье
8:25 - Мой эксперимент: добавление HISA к стандартной модели
9:30 - Что пошло не так: повторяющийся текст, количество блоков, сбои OOM
10:37 - Результаты скорости: индексатор HISA против DSA при разной длине контекста
11:37 - Тест качества: перплексия на Qwen 2.5 3B
12:52 - Тест в реальном времени: запуск HISA на Llama 3.2 3B Instruct
15:16 - Результаты прямого прохода полной модели: до В 9 раз быстрее
16:10 - Плагин HISA с открытым исходным кодом
17:07 - Результаты скорости от начала до конца при полном проходе модели
18:06 - Что это доказывает и куда двигаться дальше
19:29 - Заключение и призыв к действию

Далее:
Больше экспериментов, расширяющих возможности разреженного внимания — объединенные ядра GPU, вытеснение из кэша ключ-значение, интеграция vLLM и тестирование на более мощных GPU с еще более длинными контекстами! 👀

Что вы думаете о методах разреженного внимания? Вы пробовали запускать модели с длинным контекстом локально? Поделитесь своим опытом в комментариях! Если это было полезно, пожалуйста, поставьте лайк, подпишитесь и нажмите на колокольчик, чтобы получать уведомления о новых экспериментах в области машинного обучения! 🦐✨

#SparseAttention #HISA #DeepSeek #Transformers #AttentionMechanism #LLM #MachineLearning #ClaudeCode #MLEngineering #FlashAttention #AIResearch #LocalLLM

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Почему LLM-ы с длинным контекстом замедляют работу (и как это исправить при использовании метода ...

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]