ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

Масштабируемое обучение моделей смешанного экспертного обучения с использованием ядра Megatron (с...

Автор: Xiaol.x

Загружено: 2026-03-12

Просмотров: 93

Описание: Масштабирование обучения с использованием смешанных экспертов (MoE) создает системные проблемы, отсутствующие в плотных моделях. Поскольку каждый токен активирует только подмножество экспертов, эта разреженность позволяет общему количеству параметров расти гораздо быстрее, чем вычислениям для каждого токена, создавая взаимосвязанные ограничения в области памяти, связи и вычислений. Оптимизация одного измерения часто переносит нагрузку на другое, требуя совместного проектирования всего стека системы. Мы решаем эти проблемы для обучения MoE с помощью интегрированных оптимизаций, охватывающих память (мелкозернистые перевычисления, разгрузка и т. д.), связь (оптимизированные диспетчеры, перекрытие и т. д.) и вычисления (группированные GEMM, слияния, графы CUDA и т. д.). Фреймворк также обеспечивает параллельное свертывание для гибкого многомерного параллелизма, поддержку обучения с низкой точностью для FP8 и NVFP4, а также эффективное обучение с длинным контекстом. На NVIDIA GB300 и GB200 достигается производительность 1233/1048 TFLOPS/GPU для DeepSeek-V3-685B и 974/919 TFLOPS/GPU для Qwen3-235B. Будучи высокопроизводительным, масштабируемым и готовым к использованию в производстве решением с открытым исходным кодом, оно применяется в академической среде и промышленности для обучения моделей MoE с миллиардами и триллионами параметров на кластерах, масштабируемых до тысяч графических процессоров. В этом отчете объясняется, как работают эти методы, каковы их компромиссы и взаимодействие на системном уровне, предоставляя практические рекомендации по масштабированию моделей MoE с помощью Megatron Core.

Авторы: Цзыцзе Ян, Хунсяо Бай, Синь Яо, Деннис Лю, Тонг Лю, Хунбинь Лю, Пинтянь Ли, Эван Ву, Шицин Фань, Ли Тао, Робин Чжан, Юйчжун Ван, Шифан Сюй, Джек Чанг, Сювэнь Чен, Куньлунь Ли, Ян Бай, Гао Дэн, Нань Чжэн, Виджай Ананд Кортиканти, Абхинав Хаттар, Итан Он, Сохам Гованде, Сангкуг Лим, Чжунбо Чжу, Ци Чжан, Хаочэнь Юань, Сяовэй Рен, Дэю Фу, Тайлай Ма, Шунканг Чжан, Цзян Шао, Рэй Ван, Васудеван Ренгасами, Рахит Гарг, Сантош Бхавани, Сипэн Ли, Чендлер Чжоу, Дэвид Ву, Инцан Вэй, Ашват Айтал, Майкл Андерш, Мохаммад Шойби, Цзяцзе Яо, Джун Ян

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
Масштабируемое обучение моделей смешанного экспертного обучения с использованием ядра Megatron (с...

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]