ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

#329

llms

large language models

reasoning

reinforcement learning

RLVR

benchmark

pass@k

distillation

math reasoning

coding

visual reasoning

sampling efficiency

deep learning

evaluation

post-training training

Reinforcement Learning with Verifiable Rewards

Автор: Data Science Gems

Загружено: 2026-07-29

Просмотров: 52

Описание: Обучение с подкреплением и проверяемыми вознаграждениями (RLVR) недавно продемонстрировало заметный успех в повышении эффективности рассуждений больших языковых моделей (LLM), особенно в математических и программистских задачах. Широко распространено мнение, что, подобно тому, как традиционное обучение с подкреплением помогает агентам исследовать и изучать новые стратегии, RLVR позволяет LLM постоянно самосовершенствоваться, приобретая тем самым новые способности к рассуждению, превосходящие возможности соответствующих базовых моделей. В этом исследовании авторы критически оценивают текущее состояние RLVR, систематически исследуя границы возможностей рассуждений LLM, обученных с помощью RLVR, в различных семействах моделей, алгоритмах обучения с подкреплением и математических, программистских и визуальных тестах, используя в качестве метрики оценки pass@k при больших значениях k. Хотя RLVR повышает эффективность выборки в сторону правильных путей, авторы неожиданно обнаружили, что текущее обучение редко выявляет принципиально новые модели рассуждений. Они отмечают, что, хотя модели, обученные с помощью RLVR, превосходят свои базовые модели при меньших значениях k (например, k = 1), базовые модели достигают более высоких показателей pass@k при больших значениях k. Более того, они обнаруживают, что граница возможностей рассуждения у моделей с обучением на основе обучения ... Это подчеркивает необходимость усовершенствования парадигм обучения с подкреплением, таких как эффективные механизмы исследования, более целенаправленная и масштабная обработка данных, детальные сигналы процесса и многоходовое взаимодействие агентов, чтобы раскрыть этот потенциал.

В этом видео я рассказываю о следующем: Что такое RLVR? Современные модели RLVR часто демонстрируют более узкое покрытие рассуждений, чем их базовые модели. Пути рассуждений, генерируемые текущей моделью RLVR, уже существуют в ее базовой модели. Современные алгоритмы RLVR работают аналогично и остаются далекими от оптимальных. RLVR и дистилляция принципиально отличаются.

Более подробную информацию можно найти по ссылкам: https://arxiv.org/pdf/2504.13837 и https://limit-of-rlvr.github.io/

Чен, Чжици, Руи Лу, Эндрю Чжао, Чжаокай Ван, Ян Юэ, Шицзи Сун и Гао Хуан. «Действительно ли обучение с подкреплением стимулирует способность к рассуждениям в системах обучения с подкреплением, выходящих за рамки базовой модели?» Достижения в области нейронных информационных систем 38 (2026): 57654-57689.

Спасибо за просмотр!
LinkedIn: http://aka.ms/manishgupta
Главная страница: https://sites.google.com/view/manishg/

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
#329

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]