宇树公布全自主人形机器人格斗进展:世界模型如何连接规划、决策与动作执行

9月7日,宇树科技公布了一段由世界模型实时驱动的全自主人形机器人格斗视频,并宣布基于 UnifoLM-X2-1.0 实现了世界模型实时驱动的全自主人形机器人搏击。与依赖遥控器、预设动作或固定程序完成表演不同,此次发布将重点放在“实时预测、瞬时规划、动态决策和动作执行”的连续链路上。对于人形机器人产业而言,格斗并不是商业应用本身,但它构成了一个能够集中检验机器人感知、判断、控制和身体协调能力的高动态场景。

世界模型驱动人形机器人自主格斗演示

从遥控动作到自主决策

人形机器人能够完成一个动作,并不等于它具备自主能力。通过遥控器或动作采集设备,机器人可以在人的控制下完成行走、挥拳、躲闪等动作;通过固定程序,也可以让机器人在预设环境中按既定顺序执行一组动作。这类系统的关键问题在于,动作本身通常已经由人或工程师提前设计,机器人主要承担的是复现和控制。

全自主格斗面对的情况不同。机器人需要持续接收环境信息,判断对手或外部物体的状态变化,预测接下来可能发生的运动,并在很短时间内决定下一步如何移动、躲避或攻击。此前的动作如果没有产生预期效果,系统还需要根据新的状态及时调整,而不是机械地继续执行原有指令。

宇树科技此次公布的内容,正是试图证明世界模型可以参与这条实时闭环。根据公开资料,UnifoLM-X2-1.0重点突破的是世界—动作大模型在瞬时规划、决策和动态交互执行方面的技术瓶颈,使机器人能够在高动态、强交互场景下对未来状态进行实时预测和规划,并自主执行搏击动作。

这里的“自主”,核心并不只是机器人脱离遥控器,而是控制链路中是否存在连续的环境理解与行动调整。如果机器人面对变化时仍然只能从预设动作库中选择固定片段,那么它的自主程度仍然有限。只有当模型能够把输入的环境状态转化为可执行的动作,并根据动作结果重新修正判断,机器人才能真正进入动态自主控制阶段。

世界模型连接了哪些环节

在传统机器人系统中,感知、规划、控制往往被拆分成不同模块。摄像头或其他传感器负责采集信息,感知系统识别目标和姿态,规划系统生成路径或动作,控制系统再把动作转化为关节层面的执行指令。这种分工有助于工程实现,但在快速变化的环境中,不同模块之间的延迟、误差和信息损失可能不断累积。

世界模型的作用,可以理解为在模型内部建立对环境状态及其变化的预测能力。它不只是识别“眼前有什么”,还需要进一步判断“接下来可能发生什么”。对于人形机器人来说,对手的身体朝向、重心变化、手臂运动趋势以及双方距离变化,都可能影响下一步动作。机器人不能只对当前画面作出静态反应,而需要把当前状态放进连续变化的时间序列中进行判断。

在此次格斗演示所对应的技术描述中,“实时预测和规划”具有较强的指向性。它意味着模型不只是离线生成一段动作,也不只是根据单个指令输出一个固定结果,而是需要在交互过程中持续处理新信息,并不断更新动作选择。规划因此不再是一次性任务,而成为伴随运动同步发生的过程。

这也解释了为什么格斗场景具有技术展示价值。格斗动作往往涉及身体重心变化、快速位移和双方之间的即时交互。一次判断失误可能导致姿态不稳,动作执行也可能改变下一时刻的环境状态。机器人必须把“看见什么”“判断什么”“准备做什么”和“实际做了什么”连接起来,才能保持动作连续性。

不过,从一段演示视频中能够确认的,主要是企业公布的技术路线和演示效果。视频可以说明系统在特定展示条件下完成了相关动作,但不能单独证明机器人已经在广泛未知环境中稳定执行同类任务,更不能直接等同于商业场景中的长期可靠运行。

瞬时规划为何重要

机器人规划的难点,不只是找到一条从起点到终点的路线,而是在动作尚未完全结束时,就要判断下一步应该如何调整。人形机器人保持平衡、移动和出拳之间存在明显耦合关系:身体向前移动会改变重心,出拳会影响上肢和躯干的姿态,躲避动作又可能带来新的脚步调整。如果规划与执行之间存在较大间隔,原本合理的动作在真正执行时可能已经不适用。

“瞬时规划”可以被理解为对决策响应速度和连续更新能力的要求。它关注的不是一次动作是否漂亮,而是机器人能否在环境变化时快速重新计算。对于产业应用来说,这种能力同样适用于搬运、巡检、协作和复杂操作等任务。工厂中的物体位置可能发生变化,人员可能临时进入工作区域,设备状态也可能与预设条件不同。机器人需要根据实际情况调整,而不是一旦偏离原路径就停止。

格斗场景中的动作更容易暴露规划系统的问题。预设动作可以在固定节奏下完成,但面对移动目标时,机器人必须处理时间差和位置差。它需要预测对方动作的可能方向,同时评估自身姿态是否能够支撑下一步运动。即便最终呈现出来的是一个简单的挥拳或闪避动作,背后也可能包含状态判断、动作选择、身体协调和安全控制等多个环节。

因此,世界模型与动作模型之间的连接,是此次进展的一个关键观察点。世界模型负责理解环境变化并形成预测,动作模型负责将预测转化为身体可执行的行为。二者如果衔接不顺畅,就可能出现“模型判断正确,但机器人做不出来”的情况;也可能出现机器人能够完成动作,却无法根据环境变化及时改变策略。

动态交互考验系统闭环

固定环境中的单机运动,与动态交互中的机器人行为,具有不同的技术难度。机器人单独完成一组动作时,动作的时间、方向和目标通常比较明确;在动态交互中,另一方的行为会持续改变系统状态,机器人无法提前知道所有后续情况。

这类场景要求模型具备更强的闭环能力。所谓闭环,不是输出一次动作后就结束,而是机器人执行动作后继续观察结果,再根据结果调整后续行为。例如,机器人规划的移动距离可能因为对方位置变化而需要修正,原本准备执行的动作也可能因为姿态变化而被取消或替换。动作执行本身成为新的输入,系统必须持续更新。

公开资料将此次突破概括为解决动态交互执行方面的瓶颈。对于行业观察者来说,更值得关注的并不是“格斗”这个具有传播力的标签,而是这种实时交互能力是否能够迁移到其他任务中。机器人真正进入产业环境后,面对的通常不是规范化的对打动作,而是人与机器、机器与设备、机器与物料之间的不确定互动。

从这个角度看,格斗演示可以被视为一个压力较高的技术验证场景,但它仍然只是验证路径中的一个环节。后续还需要观察相关能力能否在不同环境、不同任务和更长时间的运行中保持一致性。企业是否公开更多测试条件、任务范围和稳定性信息,也将影响外界对这一成果的判断。

输入输出对齐仍是产业瓶颈

宇树科技创始人、董事长王兴兴在8月20日举行的2026世界机器人大会上表示,机器人目前最大的瓶颈之一是AI模型的输入和输出对齐程度不够。按照公开报道中的说法,机器人每进行一次输入和输出,都可能产生偏差,这会影响模型在真实任务中的成功率。

这一判断触及具身智能的核心问题。语言模型面对的是文字或数字信息,机器人模型面对的则是现实世界中的连续状态。输入端可能包括视觉信息、身体姿态、空间关系和任务指令;输出端则需要转化为移动、抓取、转身、发力等身体动作。输入信息存在噪声,模型理解可能存在误差,动作执行也会受到机械结构、地面条件和身体平衡的影响。任何一个环节出现偏差,都可能在后续步骤中被放大。

输入输出对齐不足,还会造成模型能力与机器人能力之间的不匹配。模型可能在抽象层面判断出“应该躲避”,但机器人需要进一步回答躲向哪一侧、移动多少、如何保持平衡以及下一步如何恢复姿态。反过来,机器人也可能已经完成一个动作,但模型没有准确理解动作结果,仍然按照旧状态继续规划。

世界模型的价值,就在于尝试把环境状态、未来预测与动作执行放在更紧密的统一框架中。它不是简单增加一个更大的模型,而是要减少从感知到动作之间的断裂,让模型的输出更接近机器人实际能够执行的行为。此次全自主格斗演示如果能够稳定复现,至少说明相关技术路线已经在特定动态交互任务中完成了一次集中展示。

但输入输出对齐并非只靠一次模型发布就能彻底解决。模型训练数据、机器人本体结构、控制系统、传感器质量和实际运行环境都会影响最终效果。即使同一套模型在演示场景中表现良好,换到陌生地面、不同光照、不同交互对象或更加复杂的任务中,也可能出现新的偏差。

从演示突破到产业落地还有距离

宇树科技公开表示,此次成果验证了世界模型驱动人形机器人实现大规模落地部署的基础可行性。这个表述的重点是“基础可行性”,而不是已经完成大规模商业化部署。两者之间仍然存在明显差距。

产业落地需要机器人在真实工作环境中持续完成任务,并满足安全、维护、成本、可靠性和管理等要求。格斗视频所展示的是高动态交互中的自主动作能力,而企业生产和公共服务任务还需要机器人完成稳定搬运、精准操作、异常处理和人机协作。不同场景对模型的要求并不相同,能够快速响应并不等于能够长期可靠运行。

对于投资者和产业客户而言,下一步值得观察的指标,不应只停留在动作是否复杂、画面是否具有冲击力,还包括模型能否适配不同任务,机器人在陌生环境下能否保持较高的任务完成能力,系统出现异常时是否能够安全停止,以及模型能力能否通过工程化方式复制到更多设备上。

宇树科技此前被外界认为在机器人运动控制和本体能力方面具有较强积累,而在机器人“大脑”方向持续发布进展。公开报道还提到,公司已将具身大模型等机器人底层技术作为重要研发投入方向。这样的投入说明,行业竞争正在从单纯比较机械结构、运动速度和硬件成本,逐步转向比较感知、规划、控制与本体协同的综合能力。

人形机器人最终能否形成规模市场,取决于“能不能动”之后的“能不能理解任务、能不能稳定完成、能不能承担成本”。世界模型提供了一种连接环境预测与身体动作的路径,但它需要通过更多任务验证和长期运行,才能转化为真正的产业生产力。

【软盟观察】

宇树科技此次公布的全自主格斗视频,意义不在于机器人会不会“打拳”,而在于世界模型是否开始更紧密地连接环境预测、即时决策和身体执行。对于具身智能行业来说,这是一项具有技术展示价值的进展,也回应了输入输出对齐这一长期瓶颈。不过,演示视频与规模化商业落地之间仍有距离,后续还需要更多关于任务泛化、运行稳定性、安全机制和工程成本的信息。产业界可以积极看待模型与本体融合的方向,但不宜仅凭单一场景就推断人形机器人已经具备广泛替代能力。真正决定行业阶段的,仍是机器人能否在陌生环境中持续、稳定、可控地完成实际工作。

关于文章版权的声明:

https://news.softunis.com/73432.html 文章来自软盟资讯

若非本站原创的文章,特别作如下声明:

本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。

凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。

如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

(0)
词元经济受到关注:数据要素价值释放如何影响AI产业的商业逻辑
上一篇 2026年9月8日 18:19
从工厂控制室到智能生产:AI改造制造业首先改变的是人的工作方式
下一篇 2026年9月8日 18:44

相关文章推荐

发表回复

登录后才能评论