Qwen-CUA:只靠截图看屏幕的 AI,OSWorld 拿了 86.2 分

Qwen 团队与 XLang Lab 今天联合发布了 Qwen-CUA——一款原生 Computer Use agent。它不读 DOM、不依赖无障碍元数据、不调专用 API,只靠截图看屏幕,用键盘鼠标操作电脑

目前开放的是技术报告和参考 demo(GitHub 仓库 7月31日刚建),模型权重不在仓库里。

核心思路:从像素出发

Qwen-CUA 的思路很纯粹——人怎么用电脑,它就怎么用

人看屏幕,它看截图;人动鼠标键盘,它发原生鼠标键盘事件。浏览器、桌面应用、专业软件,只要是能显示出来的界面,理论上它都能操作。

对比一下主流的三种路线:

路线 代表 依赖
DOM/API 驱动 OpenAI Operator、各种爬虫 需要能读到页面结构,桌面应用没辙
辅助功能元数据 部分开源方案 依赖应用实现 a11y,很多专业软件没有
纯视觉+原生交互 Qwen-CUA 只有截图,什么软件都能试

前两条路线的致命问题:它们的适用范围被"能读到什么"限制了。浏览器里有 DOM 可用,但 Photoshop、Excel、专业设计软件没有。Qwen-CUA 选择了最通用的交互空间——像素和鼠标键盘,等于把适用范围拉满。

成绩单

两个版本,基于混合专家架构:

版本 参数量 OSWorld-Verified
Qwen-CUA 397B-A17B 86.2
Qwen-CUA-Max >1T 87.6

OSWorld 是 XLang Lab 自己做的桌面操作基准(2024年发布,被认为是衡量 Computer Use agent 的硬标准)。86.2 是什么水平?

对比一下:OpenAI 的 CUA(Operator 的底层模型)在 OSWorld 上只有 38%。也就是说,Qwen-CUA 的成绩是 OpenAI 的两倍多。虽然基准版本和评测年份不同不能完全直接对比,但差距是数量级的。

技术亮点:视觉记忆 + 可验证训练

技术报告里有几个值得关注的点:

20 张活动截图。 长任务场景下,上下文会迅速被截图堆满。Qwen-CUA 保持 20 张截图的活动视觉历史,更早的截图按块折叠,稳定复用前缀——既保留了任务状态,又控制住了上下文增长。这是 Computer Use agent 工程上的老大难,他们给出了具体方案。

100k vCPUs 的 rollout 基础设施。 训练 Computer Use agent 的难点是数据——让模型在真实环境里跑任务,验证成功失败,成本极高。Qwen-CUA 从 1k 任务规模扩展到 40k 任务,动用了近 10 万核的 rollout 设施。每一轮训练后,用当前策略找出"解决不了的任务"和"薄弱领域",反过来刷新监督数据混合和 RL 任务分布,再进行下一轮。

每轮 SFT 从同一检查点重启。 不是不断微调上一个 agent 检查点,而是每次都从中期训练检查点重新开始。每个任务跑 8 次 rollout,保留"既不是完全不可达、也没有饱和"的任务。这个细节很工程化——防止数据污染和任务饱和。

参考 demo:本地就能跑

虽然权重没放出来,但 demo 是完整的:

git clone https://github.com/xlang-ai/Qwen-CUA.git
cd Qwen-CUA/demo
cp .env.example .env

连一个 OpenAI 兼容的多模态端点,就能在本地启动一个浏览器优先的参考 agent,跑起来是完整的"看图→规划→行动→恢复→验证"闭环。带操作台(看截图/动作/审批/原始模型响应)、安全闸门(敏感操作暂停、Playwright 浏览器会话隔离)、可回放运行记录(保存事件/截图/下载/验证证据)。

代价清醒

权重没开源。 仓库明确写着"Model weights are not included"。开放的是技术报告和参考实现,模型本身还要等 Qwen 官方渠道。这是技术报告发布会,不是开源发布会。

GitHub 星星还很少。 83 颗星、2 个 fork,今天刚建的仓库。社区验证还需要时间。

安全性是硬伤。 Computer Use agent 会犯错、会遭遇 prompt injection、会触发不可逆的界面操作。官方自己都写了:用隔离的浏览器上下文、别碰需要登录的高风险工作流、敏感操作要人工审批。模型声称成功 ≠ 真的完成了任务——这句话值得每个想用 Computer Use agent 的人记住。

demo 需要 OpenAI 兼容端点。 也就是说,你得有自己的模型接入渠道,demo 本身不带模型。

赛道判断

Computer Use 赛道 2026 年的格局正在快速成型:OpenAI 有 Operator/CUA,Google 有 Project Mariner,Anthropic 有 Claude Computer Use,现在 Qwen 系也下场了。

Qwen-CUA 的差异化在于:**"原生"——不是给模型套一层截图理解的壳,而是从训练开始就走纯视觉+原生交互路线**,并且把"让界面变化的恢复能力"(recover when the interface changes)当成核心设计目标,而不是附加功能。

87.6 分(Max 版)能不能在真实世界里干活,还要看 demo 跑出来的效果。但"从像素出发"这个方向,大概率是 Computer Use agent 的终局——因为真实世界的软件,不会为 AI 提供 DOM。


相关链接:

评论

暂无评论。

登录后可发表评论。