Новый ИИ от Alibaba притворяется вашим компьютером... и обходит в этом GPT-5.4
Автор: Prompt Engineer
Загружено: 2026-07-11
Просмотров: 1500
Описание:
Получите GPU Runpod: https://get.runpod.io/pe48
Получите Hostinger: https://www.hostg.xyz/SHJiu
Купон "PROPMT" на скидку 10%
Команда Qwen от Alibaba только что опубликовала в открытом доступе модель, вся задача которой — имитировать ваш компьютер. Qwen-AgentWorld — это «модель языкового мира» — вместо того, чтобы играть роль помощника, она играет роль окружающей среды: терминала Linux, веб-браузера, Android, инструментов MCP. Агенты обучаются внутри симуляции, и по результатам собственного теста команды, большая версия превосходит GPT-5.4, Claude Opus 4.8 и Gemini 3.1 Pro в убедительной имитации окружающей среды. Я разбираю статью — и запускаю основную идею вживую на своем ноутбуке с помощью реальной подсказки модели мира из репозитория в Ollama.
📑 Статья: https://arxiv.org/abs/2606.24597
💻 Репозиторий (Apache 2.0): https://github.com/QwenLM/Qwen-AgentW...
🤗 Веса: https://huggingface.co/Qwen/Qwen-Agen...
📊 Бенчмарк: https://huggingface.co/datasets/Qwen/...
⏱ РАЗДЕЛЫ
0:00 Презентация — ИИ, который намеренно лжет
0:19 Что такое модель языкового мира
0:38 Зачем подделывать компьютер?
0:58 Семь доменов, одна модель
1:15 Как она обучается (CPT → SFT → RL)
1:35 Модели (35B открытая, 397B флагманская)
1:48 AgentWorldBench — превосходит GPT-5.4
2:13 Я запустил идею локально (реальная демонстрация Ollama)
2:33 Симуляция → реальность (+7.1 OOD)
2:49 Обучение во сне — вымышленные миры
3:07 Поворот в базовой модели
3:20 Честные минусы
3:52 Кому это должно быть важно
4:10 Заключение
⚠ Примечания к честности: результаты бенчмарков принадлежат авторам (AgentWorldBench, оценка судьи LLM); результаты открытой версии 35B НИЖЕ, чем у моделей-лидеров — только невыпущенная версия 397B превосходит их. В моей локальной демонстрации используется командная строка терминальной системы на qwen3.5:9b (не веса AgentWorld — для них требуется многопроцессорное оборудование); воспроизведение терминала на экране сжато по времени (реальные ходы занимали 72–224 секунды каждый). Ничего не выдумано.
🔗 Свяжитесь со мной:
Ko-fi → https://ko-fi.com/promptengineer
Patreon → / promptengineer975
Записаться на звонок → https://calendly.com/prompt-engineer4...
GitHub → https://github.com/PromptEngineer48
Twitter/X → / prompt48
#qwen #agentworld #worldmodel #aiagents #opensourceai #alibaba
Повторяем попытку...
Доступные форматы для скачивания:
Скачать видео
-
Информация по загрузке: