vLLM Production Serving: PagedAttention, пакетная обработка и Multi-LoRA
Автор: Rich & Resourceful
Загружено: 2026-05-09
Просмотров: 70
Описание:
Ваша доработанная модель успешно прошла оценку. Теперь ей нужно обрабатывать реальный трафик. Технология PagedAttention от vLLM устраняет фрагментацию KV-кэша, непрерывная пакетная обработка максимально использует ресурсы графического процессора, а возможность горячей замены нескольких LoRA-адаптеров позволяет в одном развертывании размещать десятки адаптеров на одной базовой модели. Мы рассмотрим весь производственный стек: API-сервер, совместимый с OpenAI, конфигурацию параллелизма тензоров и конвейеров, а также схему развертывания «канареечного» развертывания в продакшн. Подробное описание оценочного стека смотрите в следующем видео плейлисте.
▶ Смотрите далее: Объединение LoRA: TIES, DARE и когда не следует объединять
• Merging LoRAs: TIES, DARE, and When Not to...
Главы:
0:00 PagedAttention: KV-кэш как виртуальная память
3:24 Непрерывная пакетная обработка и математика пропускной способности
5:45 API-сервер, совместимый с OpenAI
8:33 Тензорный параллелизм и конвейерный параллелизм
11:10 Горячая замена для нескольких LoRA
13:53 Шаблоны производства: канареечные, ограничения скорости, настройка задержки
16:31 Время викторины
#LLM #LoRA #AI
---
Раскрытие информации
Аватары и голоса в этом видео сгенерированы ИИ. Весь контент — исследования, сценарии, разработка уроков и собственный видеодвижок — создан профессионалом, сертифицированным по стандартам CISSP, CISM и PMP, имеющим степень магистра в области управления проектами, степень бакалавра в области информационных технологий и находящимся в процессе получения докторской степени в области делового администрирования.
Этот канал создан для того, чтобы сделать обучение доступным и понятным.
Этот канал не связан, не поддерживается и не спонсируется компаниями Meta AI, OpenAI, Anthropic, Google DeepMind, Mistral, Alibaba (Qwen), Hugging Face, NVIDIA, AMD, Apple, Unsloth, Axolotl, vLLM, llama.cpp или любыми другими поставщиками инструментов для моделирования или тонкой настройки. Вся информация об архитектуре модели, методе эффективной тонкой настройки параметров (PEFT), гиперпараметрах, курировании наборов данных, оценке и развертывании взята из документации Hugging Face Transformers и PEFT, опубликованных карточек моделей и лицензий для Llama, Qwen, Mistral, Phi, Gemma и других семейств моделей с открытыми весами, оригинальных статей LoRA и QLoRA (Hu et al. 2021, Dettmers et al. 2023) и последующих исследований, отчетов именованных торговых точек и наборов бенчмарков, включая MMLU, HumanEval, GSM8K и MT-Bench, и предоставляется исключительно в образовательных целях. Лицензии на модели с открытыми весами существенно различаются — некоторые ограничивают коммерческое использование, обучение на выходных данных, развертывание в именованных юрисдикциях или использование выше именованных пороговых значений количества ежемесячно активных пользователей. Всегда читайте фактический файл лицензии, поставляемый с любой моделью, прежде чем развертывать ее для любого неличного использования. Наборы данных для тонкой настройки могут содержать защищенный авторским правом, персонально идентифицируемый или вредоносный контент; вы несете ответственность за правовой статус каждого примера, на котором вы обучаете модель. Центр Hugging Face: huggingface.co | Статья LoRA: arxiv.org/abs/2106.09685 | Статья QLoRA: arxiv.org/abs/2305.14314 | Условия лицензии Llama: llama.com/llama-downloads/.
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: