Спекулятивное декодирование: почему две LLM быстрее, чем одна
Автор: Efficient NLP
Загружено: 2023-10-12
Просмотров: 36994
Описание:
Попробуйте Voice Writer — озвучьте свои мысли, а ИИ позаботится о грамматике: https://voicewriter.io
Спекулятивное декодирование (или спекулятивная выборка) — это новая техника, при которой меньшая модель LLM (черновая модель) генерирует более простые токены, которые затем проверяются большей моделью (целевой моделью). Это ускоряет вычисление генерации без ущерба для точности.
0:00 — Введение
1:00 — Основные идеи
2:27 — Алгоритм
4:48 — Выборка с отклонением
7:52 — Зачем нужна выборка (q(x) - p(x))+
10:55 — Визуализация и результаты
Статья в Deepmind: https://arxiv.org/abs/2302.01318
Статья в Google: https://arxiv.org/abs/2211.17192
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: