ycliper

Популярное

Музыка Кино и Анимация Автомобили Животные Спорт Путешествия Игры Юмор

Интересные видео

2025 Сериалы Трейлеры Новости Как сделать Видеоуроки Diy своими руками

Топ запросов

смотреть а4 schoolboy runaway турецкий сериал смотреть мультфильмы эдисон
Скачать

От отслеживания действий агентов к моделированию их поведения — Рустем Фейзханов, Snorkel AI

ai

ai engineer

ai engineering

software development

tech

startups

software architecture

machine learning

Автор: AI Engineer

Загружено: 2026-07-24

Просмотров: 3342

Описание: Возьмите реальный производственный трассировочный файл, восстановите состояние базы данных, инструменты и файлы, к которым прикасался агент, и вы получите задачу, которую любая модель может воспроизвести в идентичных условиях. Именно эта реконструкция является центральным моментом этого доклада. Общедоступные бенчмарки, такие как WebArena, предоставляют вам единый показатель успешности для задач других пользователей, но вас на самом деле интересует стоимость решения задачи, задержка и то, следовал ли агент вашим правилам. Поэтому вы создаете частный бенчмарк на основе собственных трассировочных файлов, подключаете те же навыки, инструменты и средства оценки, которые агент видит в производственной среде, и сравниваете модели «яблоко к яблоку» в той среде, которая важна для вас.

Среды многошаговые и имеют длительный горизонт, поэтому верификатор считывает конечное состояние, а судья LLM проверяет, следовал ли агент правилам, и запуск может быть прерван, как только он явно отклонится от курса. Сложности заключаются в крайних случаях: агенты, которые поощряют взлом симуляции, отсутствующие фикстуры, задачи, которые оказываются неразрешимыми. Аргумент Рустема Фейзханова заключается в том, что это должно быть частью конвейера CI для агентов, подобно тому, как тесты определяют код, связывая трассировки мониторинга с экспериментами и бенчмарком, который обновляется по мере изменения агента. В конечном итоге каждой компании потребуется свой собственный конвейер, как часть цикла управления агентами.

Информация о докладчике:
https://x.com/ryfeus
  / ryfeus  
https://ryfeus.io

Слайды:
https://www.dropbox.com/scl/fi/lyp1my...

Временные метки:
0:00 - Введение: почему Snorkel создает тесты производительности агентов
1:17 - Создание тестов производительности и тестирование агентов в производственной среде
3:08 - Ограничения публичных тестов производительности
4:01 - Почему вам нужен частный тест производительности
4:52 - Среды, инструменты и оценщики
6:34 - Анатомия задачи моделирования
7:37 - Форматы задач: файлы инструкций и данные Oracle
9:20 - Многошаговый, долгосрочный горизонт симуляции
10:54 - Верификаторы, LLM в роли судьи и взлом системы вознаграждений
13:02 - Конвейер CI для агентов
15:19 - Соединение трассировок, экспериментов и бенчмарков
16:51 - Вопросы и ответы

Не удается загрузить Youtube-плеер. Проверьте блокировку Youtube в вашей сети.
Повторяем попытку...
От отслеживания действий агентов к моделированию их поведения — Рустем Фейзханов, Snorkel AI

Поделиться в:

Доступные форматы для скачивания:

Скачать видео

  • Информация по загрузке:

Скачать аудио

Похожие видео

© 2025 ycliper. Все права защищены.



  • Контакты
  • О нас
  • Политика конфиденциальности



Контакты для правообладателей: [email protected]