#329
Автор: Data Science Gems
Загружено: 2026-07-29
Просмотров: 52
Описание:
Обучение с подкреплением и проверяемыми вознаграждениями (RLVR) недавно продемонстрировало заметный успех в повышении эффективности рассуждений больших языковых моделей (LLM), особенно в математических и программистских задачах. Широко распространено мнение, что, подобно тому, как традиционное обучение с подкреплением помогает агентам исследовать и изучать новые стратегии, RLVR позволяет LLM постоянно самосовершенствоваться, приобретая тем самым новые способности к рассуждению, превосходящие возможности соответствующих базовых моделей. В этом исследовании авторы критически оценивают текущее состояние RLVR, систематически исследуя границы возможностей рассуждений LLM, обученных с помощью RLVR, в различных семействах моделей, алгоритмах обучения с подкреплением и математических, программистских и визуальных тестах, используя в качестве метрики оценки pass@k при больших значениях k. Хотя RLVR повышает эффективность выборки в сторону правильных путей, авторы неожиданно обнаружили, что текущее обучение редко выявляет принципиально новые модели рассуждений. Они отмечают, что, хотя модели, обученные с помощью RLVR, превосходят свои базовые модели при меньших значениях k (например, k = 1), базовые модели достигают более высоких показателей pass@k при больших значениях k. Более того, они обнаруживают, что граница возможностей рассуждения у моделей с обучением на основе обучения ... Это подчеркивает необходимость усовершенствования парадигм обучения с подкреплением, таких как эффективные механизмы исследования, более целенаправленная и масштабная обработка данных, детальные сигналы процесса и многоходовое взаимодействие агентов, чтобы раскрыть этот потенциал.
В этом видео я рассказываю о следующем: Что такое RLVR? Современные модели RLVR часто демонстрируют более узкое покрытие рассуждений, чем их базовые модели. Пути рассуждений, генерируемые текущей моделью RLVR, уже существуют в ее базовой модели. Современные алгоритмы RLVR работают аналогично и остаются далекими от оптимальных. RLVR и дистилляция принципиально отличаются.
Более подробную информацию можно найти по ссылкам: https://arxiv.org/pdf/2504.13837 и https://limit-of-rlvr.github.io/
Чен, Чжици, Руи Лу, Эндрю Чжао, Чжаокай Ван, Ян Юэ, Шицзи Сун и Гао Хуан. «Действительно ли обучение с подкреплением стимулирует способность к рассуждениям в системах обучения с подкреплением, выходящих за рамки базовой модели?» Достижения в области нейронных информационных систем 38 (2026): 57654-57689.
Спасибо за просмотр!
LinkedIn: http://aka.ms/manishgupta
Главная страница: https://sites.google.com/view/manishg/
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: