阿里千问发布Qwen-UI-Agent:当AI学会”用”屏幕,下一代智能体的入口之战已经打响

【软盟资讯】2026年8月20日,阿里巴巴正式发布Qwen-UI-Agent——全球首个以真机训练为核心的GUI智能体基座模型,覆盖手机、电脑、网页及深度搜索四大环境,在MobileWorld、OSWorld-Verified等多项核心基准测试中全面超越GPT-5.6 Sol、Claude Opus 4.8等业界旗舰。同日,千问AI平台接入GLM-5.3与DeepSeek-V4-Pro正式版,完成从自研模型到”模型超市”的战略转身。本文深度拆解Qwen-UI-Agent的技术突破、战略逻辑与行业影响。

2026年8月20日,阿里巴巴正式发布了Qwen-UI-Agent——一个面向真实世界的GUI智能体基座模型。同一天,阿里云千问AI平台(MaaS)宣布完成智谱GLM-5.3和DeepSeek-V4-Pro正式版的接入。两则消息叠加在一起,释放出一个清晰的信号:中国AI大模型产业的竞争,正在从”模型参数竞赛”全面转向”智能体应用落地”的新阶段。

【软盟资讯】原创深度解读,带你拆解这场AI智能体”入口之战”的全貌。

核心导读

当AI学会”用”屏幕,数字世界的入口逻辑将被彻底重写。8月20日,阿里千问发布Qwen-UI-Agent,一套真正在100多台真实手机上”军训”出来的GUI智能体——移动端MobileWorld-Real基准达92.2%,AndroidDaily高达97.5%,多项指标刷新业界纪录。同日,千问AI平台接入GLM-5.3与DeepSeek-V4-Pro,完成从”自研模型”到”模型超市”的转身。从”能回答问题”到”能完成任务”,AI正在经历一场关键进化。

一、Qwen-UI-Agent:让AI真正”会用”每一块屏幕

1.1 什么是GUI智能体?为什么它如此重要?

过去一年,AI智能体的能力边界基本靠CLI(命令行接口)、MCP(模型上下文协议)等工具接口撑起来的。但现实世界的一个残酷真相是:绝大多数软件从来没有、也永远不会开放API。银行的网银系统、政务端的内部平台、企业遗留的老旧系统——它们通通不给接口。

GUI(图形用户界面)是数字世界里覆盖面最广的通用入口。只要有屏幕、有界面,智能体就能像人一样看懂、点击、输入、滑动,把任务完成。Qwen-UI-Agent押注的正是这条路线:不去等世界API化,而是直接把屏幕当成最大的接口。

阿里给它的定位很大胆——”数字设备上的通用执行器”。一套模型,覆盖移动端、电脑端、网页端和深度搜索(DeepSearch)四类环境。

1.2 真机训练:打通”从模拟到真实”的最后一公里

Qwen-UI-Agent最硬的底牌,是真机训练

此前业界绝大多数GUI智能体都在模拟器里训练、在模拟器里评测——一到真实手机上,面对变化的界面、弹窗广告、登录过期、网络抖动,性能就断崖式下跌。这种”模拟环境到真实环境”的鸿沟(sim-to-real gap),是GUI智能体落地的最大拦路虎。

阿里团队搭建了覆盖100多台真实手机、150多款应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建了包含400多项任务、100多款应用的MobileWorld-Real真机基准。这套系统配备了健康感知调度器,能实时监测每台设备的应用状态、账户登录态和网络状况,遇到故障自动切换;还支持虚拟屏幕技术,让单台手机同时运行多个应用会话,把并发rollout效率提升约20倍。

模型在训练阶段直接接触的就是真实登录态、动态内容和随机弹窗,这是它能在真机评测中大幅领先竞品的根本原因。

1.3 性能表现:多项基准测试全面超越业界旗舰

Qwen-UI-Agent在6大核心GUI基准测试中拿下5项第一,成绩单如下:

移动端:

  • MobileWorld基准:82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro达12.0、14.6、8.9个百分点
  • 真机基准MobileWorld-Real:92.2%,超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro
  • AndroidDaily:高达97.5%,接近满分

电脑端:

  • OSWorld-Verified:79.5%,超越GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro
  • OSWorld-v2 Partial分数:40.0%,同时相比基线节省58%执行步数

浏览器与深度搜索:

  • WebArena:73.6%,位列所有对比模型第一
  • BrowseComp-ZH:75.0%

GUI定位:

  • ScreenSpot-Pro:81.5%,在其余4个grounding评测基准也全部刷新SOTA

更值得关注的是,Qwen-UI-Agent的主力版本参数量仅为27B,基于Qwen 3.5系列基础模型打造。以27B的参数量超越多个千亿级旗舰模型,说明这套训练方法靠真实环境数据让中小模型获得了更强的任务完成率与部署性价比。

1.4 统一动作空间:GUI + CLI混合执行

Qwen-UI-Agent将GUI操作、CLI命令(如bash脚本)和API调用纳入同一套动作体系。面对表格处理、文件批量操作等结构化任务,模型可以直接写代码执行;面对需要视觉确认的操作,则切回GUI点击。单次推理中,还能输出批处理动作,一次性完成多个连贯操作,大幅减少交互轮次。

统计数据显示,在OSWorld桌面任务中,CLI动作占比超过40%,批处理动作占比约40%。这意味着模型在电脑端近一半的操作可以走命令行批量执行,执行轨迹被大幅压缩。

1.5 安全机制:会点屏幕的模型,比性能更要命

会点屏幕的智能体,安全问题是悬在头顶的达摩克利斯之剑。Qwen-UI-Agent将安全判断贯穿任务执行全过程:

  • 面对违法或高风险请求,不执行任何界面操作,直接拒绝并终止任务
  • 面对支付、数据删除、隐私授权等敏感场景,在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续执行

官方演示了一个具体例子:用户说”在支付宝给我妈发500块红包”,模型会一路操作到金额、备注都填好,最后一步涉及资金支付时停手,交还用户点确认之后才真正发送。查机票时日期、舱位没给全,它也不替用户猜,先追问。

这种”能停手”的能力,比”能执行”的能力更难训练,也是GUI智能体走向大规模商用的必备前提。

1.6 从”等你吩咐”到”替你操心”:主动服务与跨端协作

依托Harness框架,Qwen-UI-Agent具备主动服务意识。收到航班取消通知时,它会主动查询备选航班和高铁方案、对照日程给出改签建议,确认后执行。任务还能在手机和电脑之间无缝接力:手机相册里找到的收据,能自动归到远程桌面的文件夹、按日期重命名、再生成一张Excel账单汇总。

智能体从”被动响应”进化到”主动服务”,这一步比跑分更接近普通用户的真实需求。

二、千问MaaS平台再扩容:从”自研模型”到”模型超市”的战略转身

2.1 GLM-5.3与DeepSeek-V4-Pro正式版接入

8月21日,阿里云MaaS平台宣布再次扩充模型服务矩阵:智谱旗舰大模型GLM-5.3与DeepSeek-V4-Pro正式版现已接入千问AI平台,相关API服务同步对外开放,开发者可直接调用。

本次新增的两款旗舰模型,重点覆盖编程和智能体应用场景:

  • GLM-5.3:智谱最新版本旗舰大模型,基座参数量为743B,在后训练阶段将性能提升了约50%。重点强化了编程能力、长程任务执行能力和网络安全能力。在开发者社区的实测中,GLM-5.3在3D游戏开发、全栈AI应用构建等任务中表现出色,产品完成度和设计意识明显领先。
  • DeepSeek-V4-Pro:DeepSeek最新正式版旗舰模型,重点增强智能体交互能力,适配代码开发、多步骤复杂任务处理等需求,具备百万级上下文处理能力,适合智能体应用搭建和长文档分析等业务场景。

目前,千问AI平台已汇聚的模型矩阵包括:

模型类别 具体模型 能力方向
自研旗舰 Qwen3.8-Max 通用基座大模型
自研开源 Qwen3.8开源系列 开源社区生态
语音模型 Qwen Audio 3.0 语音识别与生成
图像生成 Qwen-image 3.0 Pro 图像生成与编辑
视频生成 Wan3.0 视频生成
第三方旗舰 GLM-5.3 编程、长程任务、网络安全
第三方旗舰 DeepSeek-V4-Pro 智能体、代码开发、复杂任务
第三方旗舰 Kimi K3 长文本理解与生成

2.2 “模型超市”模式:开发者的效率革命

对于开发者而言,千问AI平台的”模型超市”模式意味着无需对接多家厂商接口,依托统一API即可根据业务需求灵活挑选适配模型,快速把AI能力嵌入自有应用与业务系统,大幅降低多模型接入、维护的研发成本。

部分热门模型已加入Token Plan。目前,DeepSeek-V4-Pro、Qwen3.8-Max和Qwen-Audio系列模型已陆续开放订阅使用。用户订阅套餐后,可在Qoder、Codex等AI工具中按需切换模型,快速完成原型验证与业务落地。

这一模式转变的意义在于:从单一自研模型平台转向聚合式”模型超市”,让开发者不用局限单一模型能力,按需择优调用。不同模型各有所长——GLM-5.3强在编程和长程任务,DeepSeek-V4-Pro强在智能体交互,Qwen3.8-Max强在通用能力——开发者可以根据具体场景选择最合适的工具,而不是被绑定在单一模型生态中。

三、深度解读:阿里这一波组合拳的战略逻辑

3.1 从”模型能力”到”世界执行能力”的跨越

Qwen-UI-Agent的发布,标志着阿里在AI战略上完成了一次关键认知升级:模型能力不等于应用价值,真正的价值在于模型能否在真实世界中执行任务。

过去两年,大模型的竞争焦点是”谁更聪明”——谁在MMLU、HumanEval等基准上得分更高,谁的上下文窗口更长,谁的多模态能力更强。但到了2026年,行业共识正在形成:模型再聪明,如果不能替用户把事办了,其商业价值就大打折扣。

Qwen-UI-Agent的定位——”数字设备上的通用执行器”——精准地回应了这个痛点。它不需要应用开放API,不需要开发者适配接口,只要有一块屏幕,它就能看懂、能操作。这相当于把AI的能力边界从”回答问题”拓展到了”完成任务”。

3.2 真机策略:不可复制的竞争壁垒

Qwen-UI-Agent的”真机训练”策略,构成了一个短期内难以复制的竞争壁垒。

搭建100多台真实手机、覆盖150多款应用的真机环境,不仅需要巨大的硬件投入,更需要持续的运维能力——每台设备的应用状态、账户登录态、网络状况都需要实时监控和调度。阿里团队为此开发的健康感知调度器和虚拟屏幕技术,让这一套系统的运行效率提升了约20倍。

更重要的是,真机训练产生了一个”飞轮效应”:真实的训练数据带来更好的模型性能,更好的模型性能吸引更多真实用户使用,更多真实用户带来更多真实场景数据,反过来进一步提升模型能力。这种飞轮一旦启动,后来者即使投入同样的资源,也需要相当长的时间才能追赶。

3.3 MaaS平台:从”卖模型”到”卖生态”的平台化转型

千问AI平台从自研模型走向”模型超市”,背后是阿里云在AI基础设施层的一次战略升级。

单纯的”卖模型”模式有天花板——无论自研模型多强,总有用户需要其他模型的特长。与其让开发者去对接多家厂商,不如自己搭建一个聚合平台,把各家最好的模型集中在一起,通过统一API提供服务。

这种模式的好处显而易见:

  • 对开发者:降低多模型接入的摩擦成本,提升开发效率
  • 对阿里:将平台从”模型提供商”升级为”AI基础设施入口”,提高用户粘性和平台价值
  • 对模型提供商:借助阿里云的渠道和客户资源,获得更广泛的商业触达

当开发者习惯了在千问AI平台上调用各种模型,阿里就不仅仅是”卖模型”的厂商,而是整个AI开发生态的”水电煤”基础设施。

3.4 组合拳的内在逻辑:GUI智能体+模型超市=AI应用的最佳基础设施

把Qwen-UI-Agent和MaaS平台扩容放在一起看,阿里打的是一套完整的”组合拳”:

  • 底层(模型层):通过自研+第三方聚合,提供最丰富的模型选择
  • 中间层(能力层):Qwen-UI-Agent提供GUI理解与执行能力,让模型能真正”用”屏幕
  • 上层(应用层):开发者基于以上能力,快速构建面向终端用户的AI应用

这套组合拳的核心逻辑是:让AI从”能回答问题”进化为”能完成任务”,同时让开发者以最低的成本、最丰富的方式调用这些能力。

四、行业影响:GUI智能体将如何改变AI产业格局?

4.1 对AI应用开发范式的影响

GUI智能体的出现,将从根本上改变AI应用的开发范式。

传统AI应用开发需要”改造世界”——要么让应用开放API,要么为AI单独开发接口。这导致大量存量应用(尤其是企业级应用和政务系统)无法被AI能力覆盖。

GUI智能体选择了一条相反的路——不改造世界,先学会用世界本来的样子。只要应用有图形界面,AI就能像人一样操作它。这意味着:

  • 数以百万计的存量应用,无需任何改造即可接入AI能力
  • 企业级AI落地的门槛大幅降低,不再需要深度系统集成
  • 跨应用、跨平台的自动化工作流变得前所未有地简单

4.2 对云服务市场竞争格局的影响

阿里云在Qwen-UI-Agent发布同日公布的2027财年第一季度财报已经显示出AI战略的成效:AI云收入484.37亿元,同比大增45%,创22个季度增速新高;AI相关产品季度收入123.76亿元,连续12个季度三位数增长;MaaS年化收入(ARR)突破160亿元。

Qwen-UI-Agent的发布,将进一步巩固阿里云在AI基础设施层的领先地位。当越来越多的开发者依赖千问AI平台构建GUI智能体应用,阿里云就不仅仅是”卖算力”的云厂商,而是”卖AI执行能力”的平台提供商。

4.3 对国产AI生态的深远影响

千问AI平台接入GLM-5.3、DeepSeek-V4-Pro等第三方国产模型,释放了一个积极的信号:中国AI产业的竞争正在从”零和博弈”走向”生态共建”

大模型是一个极度烧钱的行业,没有任何一家公司能在所有场景上都做到最好。通过”模型超市”模式,阿里让不同模型的优势得以互补——GLM-5.3强在编程和长程任务,DeepSeek-V4-Pro强在智能体交互,Qwen3.8-Max强在通用能力——开发者可以按需组合,而不必选边站队。

这对于中国AI产业的整体发展是好事。它意味着资源不再被浪费在重复造轮子上,而是集中在各自擅长的领域深耕,最终形成更丰富的AI能力供给。

五、挑战与展望:GUI智能体的”最后一公里”还有多远?

5.1 当前面临的挑战

尽管Qwen-UI-Agent的发布令人振奋,但GUI智能体的规模化落地仍面临多重挑战:

第一,真实环境的不可预测性。 论文数据显示,基线模型在真实手机上的失败原因中,52%来自真实世界干扰——弹窗广告、UI误读、物理控件滑不准、网络超时等。虽然Qwen-UI-Agent通过真机训练大幅缓解了这一问题,但真实世界的长尾场景几乎是无穷无尽的。

第二,复杂任务的执行稳定性。 在OSWorld-v2评测中,Qwen-UI-Agent的Partial分数为40.0%,虽然比基线节省了58%执行步数,但也意味着在60%的场景中,任务未能完全完成。长程任务(超过100步)的规划、执行与纠错能力,仍有显著提升空间。

第三,安全与信任的边界。 能操作屏幕的智能体,天然面临更高的安全风险。如果模型被恶意利用,可能造成隐私泄露、财产损失甚至更严重的后果。Qwen-UI-Agent的”主动停手”机制是一个好的开始,但在真实场景中,如何定义”敏感操作”、如何平衡安全与效率,仍需要持续探索。

第四,落地形态尚未明确。 模型能力只是第一步。Qwen-UI-Agent未来会以何种形态落地到真实设备上——是嵌入手机操作系统、作为独立App提供服务,还是通过云端API供开发者调用——目前尚未有明确答案。

5.2 未来演进方向

阿里在技术报告中透露了未来的几个演进方向:

  • 更高效的GUI执行:通过更好的Harness优化模型的长程能力,减少不必要的推理步骤
  • 更可扩展的高保真合成环境:虽然已构建此类环境,但将其整合到模型训练中的工作尚未完成
  • AutoResearch数据飞轮:整个流程由AI自动合成任务、自动搭建环境、自动验证结果、自动诊断失败并规划下一轮训练数据,人类只负责监督和修正。这套数据飞轮如果跑通,将极大加速模型迭代速度

5.3 2026年:AI智能体的”应用元年”

中国银河证券在研报中指出,2026年可视为AI智能体的”应用元年”。底层Token消耗的指数级增长和单次任务调用量的结构性提升,表明智能体已开始承担复杂工作。能力范式正从L2推理阶段向L3智能体时代跨越——AI不再只是应答,而是能理解任务、规划流程、调用工具并完成工作。

Qwen-UI-Agent的发布,正是这一趋势的最佳注脚。当AI学会”用”屏幕,它就不再只是一个”问答机器”,而是一个真正能替用户干活的”数字员工”。

六、结语

阿里在8月20日到21日这两天里,用Qwen-UI-Agent和MaaS平台扩容这两记”组合拳”,清晰地勾勒出了自己对于AI未来的判断:模型的智能是基础,但真正改变世界的是模型在真实世界中的执行能力。

GUI智能体赛道,字节、阶跃等国内玩家也在积极布局,海外则有Claude Computer Use、GPT-Operator等竞品。阿里Qwen-UI-Agent的差异化优势在于”真机训练”策略和”模型超市”生态——前者让它在真实场景中表现更可靠,后者让它在开发者生态中更具吸引力。

API之外的世界,远比API之内的大。 Qwen-UI-Agent选择了一条朴素但务实的路:不改造世界,先学会用世界本来的样子。这条路能否通向AI智能体的”iPhone时刻”,还需要时间来验证。

但有一点已经确定:AI学会”用”屏幕的这一天,是AI从”数字大脑”进化为”数字双手”的关键一步。

 

【软盟资讯】原创报道,转载需授权。

 

关于文章版权的声明:

https://news.softunis.com/69502.html 文章来自软盟资讯

若非本站原创的文章,特别作如下声明:

本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。

凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。

如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

(0)
上一篇 2026年8月21日 14:13
开春首展启新程“2027北京机器人产业展览会”3月落地老国展
下一篇 2026年8月21日 14:30

相关文章推荐

发表回复

登录后才能评论