Multi-Query (MQA) и Grouped-Query (GQA) Attention: визуальное объяснение
Автор: ExplainingAI
Загружено: 2026-05-12
Просмотров: 897
Описание:
Почему современные модели больших языков, такие как Llama, Qwen, Gemma и Gemini, используют механизм внимания с групповыми запросами (GQA) вместо стандартного механизма внимания с несколькими головками (MHA)?
В этом видео мы подробно разберем механизм внимания с несколькими запросами (MQA) и механизм внимания с групповыми запросами (GQA) — две важные оптимизации внимания в современных моделях больших языков. Мы поймем, как память кэша ключ-значение и пропускная способность памяти становятся основными узкими местами во время авторегрессивного декодирования и вывода в моделях больших языков, и почему архитектуры трансформеров перешли к механизмам внимания MQA и GQA для более быстрого вывода и уменьшения размера кэша ключ-значение.
Мы наглядно объясним механизм внимания с несколькими запросами, механизм внимания с групповыми запросами и разницу между MHA, MQA и GQA, включая принцип работы общих проекций ключа и значения между головками внимания. Мы также сравним производительность MQA и GQA, потребление памяти кэша ключ-значение, задержку декодирования и эффективность вывода.
Вторая половина видео посвящена реализации в PyTorch, где мы начинаем с базовой реализации Multi-Head Attention и шаг за шагом модифицируем её в Multi-Query Attention и Grouped-Query Attention. В конце видео мы рассматриваем методы повышения качества обучения GQA, предложенные для преобразования существующих многоголовочных контрольных точек трансформеров в модели MQA/GQA.
⏱️ Временные метки:
00:00 Введение - Узкое место в виде памяти KV-кэша и пропускной способности
02:46 Объяснение механизма многозапросного внимания (MQA)
03:57 Интуитивное понимание того, чему обучаются головки внимания MQA
06:18 Спектр MHA, MQA и GQA
07:48 Объяснение механизма внимания с групповыми запросами (GQA)
09:54 Сравнение размеров KV-кэша
11:04 Сравнение производительности MQA, GQA и MHA
11:51 Базовая реализация многоголовочного внимания (MHA)
13:40 Реализация MQA в PyTorch
15:51 Реализация GQA в PyTorch
17:54 Повышение уровня обучения моделей MQA/GQA
📖 Ресурсы:
Статья о MQA - https://arxiv.org/pdf/1911.02150
Документ GQA - https://arxiv.org/pdf/2305.13245
🔔 Подписывайтесь:
https://tinyurl.com/exai-channel-link
Электронная почта - объяснение[email protected]
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: