Чем мощнее AI-зрение, тем меньше оно человечно? CVPR 2026 Keynote: глубокие нейросети и человечес...
Автор: GAIR SG
Загружено: 2026-06-10
Просмотров: 157
Описание:
Когда модели искусственного интеллекта превосходят человеческие результаты на ImageNet, можно подумать: «Проблема решена».
Но Томас Серре, профессор когнитивных и психологических наук в Университете Брауна, в своем выступлении на конференции CVPR 2026 представил парадоксальный вывод: чем сильнее модель, тем меньше она соответствует человеческому зрению.
Он систематически оценил 350 распространенных моделей (включая такие фундаментальные модели, как DINOv3, EVA и Gemma) и обнаружил две тревожные тенденции:
Нейронная согласованность: чем точнее классификация модели, тем хуже ее способность интерпретировать электрофизиологические данные из IT-коры головного мозга обезьяны.
Поведенческая согласованность: стратегии классификации, используемые моделями, более размыты и не сфокусированы, чем те, которые используют люди, практически не обращая внимания на именованные части объекта.
Так что же можно сделать? Профессор Серре предложил два пути:
Путь 1: Учиться как младенец. Обучение модели с использованием видеопоследовательностей + самообучение (вместо статической классификации изображений), с введением ограничений на постоянство объекта. Эксперименты показывают, что предсказание цели самообучения в следующем кадре значительно улучшает соответствие поведению человека.
Путь 2: Обратная связь, как в мозге. Зрительная кора человека — это мощный механизм обратной связи, а не чисто прямой канал. Команда разработала горизонтально управляемый рекуррентный блок (hGRU), который в задаче Pathfinder идеально решил проблему отслеживания контуров, требующую 150 слоев ResNet, достигнув в три порядка большей эффективности параметров.
Последний прорыв: модуль спектральной свертки scSSM, основанный на модели пространства состояний (SSM), впервые позволяет проводить крупномасштабное параллельное обучение рекуррентных архитектур обратной связи. Он достигает эффективности параметров, превосходящей одноголовочный ViT в масштабах ImageNet, и демонстрирует потенциал для обработки чрезвычайно длительных временных контекстов в задачах понимания видео.
Это не ностальгическая презентация, а серьезное напоминание: если мы будем оптимизировать только результаты бенчмарков, системы компьютерного зрения будут все дальше и дальше отходить от истинного понимания.
Эта статья включена в раздел [CVPR 2026 In-Depth Zone] на Leifeng.com, который теперь полностью доступен онлайн!
https://cvpr2026.leiphone.com/
Этот раздел не только содержит инженерные интерпретации важных докладов и передовых экспертных презентаций, но и постоянно обновляет новости конференции из первых рук от наших корреспондентов на месте.
Отсканируйте QR-код ниже или посетите раздел CVPR на Leifeng.com, чтобы посмотреть!
#cvpr2026 #cvpr #computervision #artificialintelligence #chatgpt #artificialintelligence #keynotespeaker #ThomasSerre #rl
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: