DeepSeek V4 на вашей RTX 5090: стоит ли использовать выгрузку MoE?
Автор: LLM Requirements
Загружено: 2026-08-02
Просмотров: 827
Описание:
Ваша RTX 5090 уже является очень мощной локальной машиной для обработки ИИ. Qwen 3.6 27B может обрабатывать до 175 токенов в секунду, обрабатывать большие контексты и запускать несколько агентов программирования, не покидая графический процессор.
Но DeepSeek V4 Flash меняет ситуацию. Он обеспечивает производительность агентов на уровне передовых технологий, удивительно близкую к таким моделям, как Opus 4.8, GPT-5.6 Luna, Gemini 3.1 Pro, Gemini 3.6 Flash и GLM-5.2. Подвох в том, что это модель с 284 миллиардами параметров MoE, в то время как у вашей 5090 всего 32 ГБ видеопамяти.
Так может ли системная оперативная память и разгрузка ЦП сделать это практичным?
Подробнее на https://llmrequirements.com
В этом видео:
Qwen 3.6 27B со скоростью до 175 ток/с
DeepSeek V4 Flash против современных моделей Frontier
Точные результаты 0731 Q8, достигающие 13,59 ток/с
Оптимистичный предварительный результат 28 ток/с
Почему пропускная способность ОЗУ важнее, чем её объём
Варианты обновления до 128 ГБ, 192 ГБ и 256 ГБ
Два DGX Spark, достигающие примерно 96 ток/с
Экспертная оптимизация REAP и её предполагаемая производительность
Практический рабочий процесс Qwen-worker и DeepSeek-supervisor
Стоит ли обновлять существующую систему 5090
Разделы
00:00 Что уже делает ваша RTX 5090
00:45 Почему 32 ГБ видеопамяти удивительно много
01:45 DeepSeek V4 меняет Сравнение
03:36 Как работает разгрузка MoE
04:31 Точная производительность DeepSeek 0731 Q8
05:29 Оптимистичный результат 28 ток/с
06:23 Объем ОЗУ против пропускной способности памяти
07:25 Сравнение двух DGX Spark
08:21 Экспертная обрезка REAP
09:20 Практический гибридный рабочий процесс
10:23 Что должен сделать владелец 5090?
#RTX5090 #DeepSeek #LocalLLM #LocalAI #MoE
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: