Terminal-Bench: Тестирование производительности агентов на сложных, реалистичных задачах в интерф...
Автор: Vinh Nguyen
Загружено: 2026-01-23
Просмотров: 349
Описание:
Исследователи представили Terminal-Bench, специализированную оценочную платформу, предназначенную для тестирования агентов ИИ на сложных, требующих высокой квалификации технических задачах в интерфейсах командной строки. Этот бенчмарк включает набор данных Terminal-Bench 2.0, состоящий из 89 задач, проверенных вручную, от настройки устаревших систем до научных вычислений и разработки программного обеспечения. Каждая задача выполняется в контейнеризированной среде Docker, что гарантирует автономное решение проблем агентами в долгосрочных сценариях, отражающих ценную профессиональную работу. В исследовании также представлен Terminus 2, нейтральный каркас агента, используемый для сравнения различных больших языковых моделей, показывающий, что выбор модели, как правило, влияет на производительность больше, чем конкретная архитектура агента. Кроме того, платформа включает Harbor для масштабируемого выполнения и содержит адаптеры для интеграции десятков других известных программных и безопасных бенчмарков. С помощью обширного анализа ошибок на уровне траекторий авторы классифицируют распространенные режимы сбоев, чтобы предоставить план будущих улучшений возможностей агентного ИИ.
https://arxiv.org/pdf/2601.11868
#ai #terminal #benchmark #agent #codingagent #eval #sandbox #docker
Отказ от ответственности: это видео создано с помощью Google NotebookLM.
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: