Визуальное объяснение работы KV-кэша в LLM-системах | Как LLM-системы быстрее генерируют токены
Автор: ExplainingAI
Загружено: 2026-04-08
Просмотров: 14181
Описание:
Кэширование ключ-значение (KV-кэш) — одна из ключевых техник, обеспечивающих высокую скорость инференса в современных больших языковых моделях (LLM).
В этом видео мы наглядно и интуитивно разбираем KV-кэш в LLM и показываем, как именно он ускоряет генерацию токенов. Начиная с вычислений механизма внимания, мы сначала понимаем, почему трансформеры пересчитывают представления ключа и значения на каждом шаге, что приводит к квадратичной сложности вычислений во время генерации.
Затем мы представляем оптимизацию инференса LLM с помощью KV-кэша, где ранее вычисленные тензоры ключа и значения повторно используются на разных шагах генерации. Это снижает сложность вычислений с квадратичной до линейной, что значительно ускоряет инференс.
Мы также рассматриваем полную реализацию KV-кэша в модели в стиле GPT (на основе minGPT), а также сравнение производительности и компромиссы в отношении памяти.
Временные метки:
00:00 Введение - Объяснение кэша ключ-значение в LLM
00:36 Вычисления с самовниманием в трансформерах
04:19 Кэшированные вычисления - Зачем нужен кэш ключ-значение
07:28 Обзор реализации GPT (без кэша ключ-значение)
10:48 Реализация кэша ключ-значение в трансформерах (PyTorch)
17:34 Результаты - Ускорение и компромиссы в использовании памяти при использовании кэша ключ-значение
🔔 Подписаться:
https://tinyurl.com/exai-channel-link
📌 Ключевые слова:
#llm
Электронная почта - [email protected]
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: