具身智能的上下文学习机制,核心是让机器人不再依赖“每个动作都要海量示教数据”的传统训练路径,而是通过观察少量演示——甚至一段视频——就能理解任务目标并完成长程操作。这个概念借用了大语言模型领域“上下文学习”的思路:模型在推理阶段通过输入中给出的少量示例,即时调整自身行为,而不必重新训练权重。放在机器人身上,就是视觉输入、任务描述和动作序列在模型内部形成一种临时的“任务上下文”,机器人据此推断出接下来该做什么、怎么做。
要理解这套机制,关键要区分它与传统模仿学习的差异。传统做法是收集大量特定任务的示教数据,针对该任务专门训练策略网络,换一个场景或物体往往就要重新采集数据。而上下文学习依托的是通用基础模型——这类模型已经在大规模、多模态的数据上预训练过,掌握了物体识别、空间关系、动作顺序等通用知识。当机器人看到一段新任务的视频时,它并不是在“记住”这段视频,而是把视频当作一种条件输入,激活预训练阶段积累的相关知识,在推理时动态组合出适合当前任务的动作策略。这也是为什么 Skild AI 发布的 S1 机器人基础模型宣称“看一段视频学会长程操作,效果相当于 380 次人工示教”——其背后的逻辑就是把通用知识的复用率提到极致,从而把新技能的习得成本压缩到接近零。
不过,这套机制在机器人身上比在语言模型里要复杂得多。语言模型的上下文学习处理的是符号序列,而机器人面对的是连续变化的物理世界:物体的材质、摩擦力、抓取角度、环境光照都在变动。模型从视频里提取的“任务意图”需要被映射到具体的力矩、轨迹和位姿控制信号上,这个映射过程如果缺乏足够的物理约束,很容易在实验室里表现良好、一到真实场景就失灵。更关键的是安全边界问题——语言模型答错一道题最多是输出质量下降,机器人执行错一个动作则可能造成物理损坏或伤人。因此,上下文学习在具身智能中的落地,不能只看“学会一个新动作”的演示效果,还要看它在无限变化的真实环境中能否稳定泛化、能否在异常情况下主动停止或修正。
从产业角度看,这项机制指向的变革方向是明确的:具身智能的训练成本正在从“数据密集型”转向“知识复用型”。过去制约机器人落地的最大瓶颈是专属数据稀缺且采集昂贵,而上下文学习让通用基础模型加少量演示成为可能,这会让机器人技能的获取方式从“为每个任务单独训练”走向“一个模型、按需适配”。当然,从演示视频到稳定量产之间仍有巨大鸿沟,当前该机制的稳定性、泛化性和安全性都还需要更充分的验证。但可以确定的是,谁能把“看视频学技能”从实验室 demo 变成工厂里可靠的生产力,谁就掌握了具身智能下一阶段的核心竞争力。