真机训练在 GUI 智能体竞争中形成的壁垒,短期内真实存在,但将其直接等同于长期护城河,判断过于简单。Qwen-UI-Agent 在 100 多台真实设备、150 多款应用构成的环境中训练,并在 MobileWorld-Real 上达到 92.2%,AndroidDaily 达到 97.5%,这些成绩说明真机数据显著缩小了从模拟到真实的性能落差。问题在于,这套壁垒的持续性并不由基准分数本身决定,而取决于它能否转化为难以替代的数据资产、信任机制和生态锁定。
真机训练真正的价值,不是设备数量,而是把真实世界的随机干扰纳入训练分布。公开信息提到,基线模型在真实手机上的失败原因中,约 52% 来自弹窗、UI 误读、物理控件滑动不准和网络超时。这类问题无法靠模拟器完整穷举,因此真机环境提供了更高质量的任务轨迹和失败样本。同时,健康感知调度与虚拟屏幕技术把并发效率提升约 20 倍,降低了持续采集数据的运维门槛。短期看,竞争对手要复制同等规模的环境,需要同时承担硬件投入和长期维护,这确实构成工程壁垒。
但长期判断需要更谨慎。真机训练是数据获取方式,不是不可动摇的资产。应用界面会持续改版,账户状态和业务逻辑会变化,旧有真实数据会快速折旧;如果数据飞轮不能自动补充新场景,护城河就会随时间衰减。阿里在技术报告中提到的未来方向,包括可扩展的高保真合成环境和自动合成任务、自动验证、自动诊断的数据飞轮,本身也说明真机环境更可能是一个启动器,而非最终形态。一旦合成环境在真实分布覆盖上逼近真机,早期硬件壁垒的边际优势就会下降。
更长期的护城河,更可能来自两个方向。一是安全信任。GUI 智能体能够操作支付、删除和授权,主动停手与确认机制的可靠性,直接决定企业是否敢把高风险任务交给模型。这种信任需要长时间、跨场景的验证,比单纯跑分更难复制。二是平台生态。模型超市将 GUI 能力、自研模型和第三方模型放在统一接口之下,开发者切换成本被抬高,形成的是分发和调用层面的锁定,而不是某一套训练设备。
因此,真机训练可以视为 GUI 智能体现阶段的阶段性护城河:它解决了真实环境适配问题,并建立了先发数据优势。但它并非永久壁垒。真正决定长期竞争力的,是从真机数据中沉淀出的自动迭代飞轮、可验证的安全边界,以及围绕开发者形成的生态粘性。谁能让“真实执行”变成持续演进且可信赖的基础能力,谁才更可能守住入口。