深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

给机器人一面"未来镜子":HERON 世界模型开始预测多智能体交互

2026-09-08·量子位·模型推理世界模型具身智能多智能体机器人视频预测
▮ SIGNAL SUMMARY · 摘要快读

Scalabot 发布 HERON 世界模型:输入当前画面+动作预测未来状态,首次能预测双人编花绳等多智能体物理交互。

给机器人一面"未来镜子":HERON 世界模型开始预测多智能体交互

综述

Scalabot 发布 HERON 世界模型——宣称首个能预测多智能体交互的世界模型:输入"当前画面 + 下一个动作",直接预测未来的画面状态。在 WorldArena 1.0 Track 1 上综合得分 75.80。

世界模型这个词近年被反复使用,指模型能理解"世界如何随动作变化":给一个网球,预测它抛出后会怎么下落、碰撞、反弹;给一个关着的冰箱,预测"打开冰箱"后内部是什么样。HERON 的差异点在于,它把预测范围从"单个物体/单个机器人"扩展到了"多智能体同时交互"——官方演示包括两人各拉毛巾一端控球、双人编花绳,预测时要同时保持人物动作、物体形变与运动结果的一致性。这正是机器人进家庭/工厂前最需要的"先预演、后执行"能力。

专业分析

从公开信息拆它的设计:

三类数据的"金字塔"结构。 真机数据(单臂/双臂/轮臂/人形多种构型,记录视觉+动作+本体状态+控制命令)作"真实执行锚点";仿真数据补足稀有状态、危险交互与失败轨迹;Ego 第一视角人类视频补工具使用、双手协作与家庭物体操作。三类数据覆盖了"机器人真实经历"+"想象中可能发生的事"+"人类是怎么做的"三个层面。

异构数据的统一是硬工程。 真机、仿真、人类视频的时间频率、坐标系、身体结构各不相同,HERON 先从各类数据中恢复动作信息(真机/仿真直接提取,人类视频需要反推),再转成同一套"语言"参与训练。这一步决定了模型能不能同时"看得懂机器人日志"和"看得懂人类视频"。

MoT + MoE 架构用于提升未来推演。 分项成绩里物理交互 95.60、空间透视 99.20、运动动态 92.61 都不错,唯独轨迹准确性 56.66 明显拖后腿——长程轨迹的精确预测仍是世界模型的老大难。

"补全画面外信息"值得单独拿出来说。 给关着的冰箱+“打开冰箱”能预测内部,意味着模型不只是做像素外推,而是在学"动作导致的状态变化"这种物理-语义规则,而不是单纯的视频延拓。

关联信息与影响

HERON 与几条技术线咬合:其一,具身智能的主流范式正从"真机强化学习试错"转向"世界模型预演 + 真机微调",预测成本远低于试错成本;其二,视频生成模型(Sora 系、可灵系)与世界模型的边界在模糊——都是"预测下一帧",区别在有没有动作条件与物理一致性约束;其三,OpenWAM 这类"世界-行动模型"开源项目与 HERON 方向一致,说明"动作条件的世界模型"正在成为独立研究分支。

要留意的口径:WorldArena 是 Scalabot 自建评测,Track 1 综合分与分项分的关系、评测集规模都值得等第三方复测;多智能体预测的演示与"可泛化的多智能体预测"之间还有距离。

未来展望

世界模型真正落地的前置条件有三个:预测足够准(轨迹准确性这类短板要先补)、推理足够快(做"预演"要赶在真机动作之前)、与真机控制闭环(预演结果要能转成控制策略)。在这三点之前,世界模型更现实的用途是数据引擎——生成合成轨迹喂给策略模型训练,等于把"真机试错"的一部分搬进仿真。HERON 这类"预测多智能体"的能力如果稳定,协作机器人(两个机械臂配合同一个工件)、人机协作(人与机器人接力操作)的安全预演会先受益。

信号强度

信息局限说明:本文依据情报库收录的量子位报道与官方演示整理;WorldArena 为厂商自建评测,架构细节以技术报告为准,文中对数据金字塔与异构统一的分析部分属于基于公开信息的解读。

SIGNAL FILE · 情报档案

Scalabot HERON 世界模型:画面+动作→预测未来,WorldArena 综合 75.80,支持多智能体交互预测

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://mp.weixin.qq.com/s/SRFPA6WbwNgnxboFdA5YVw(量子位)

RELATED SIGNALS · 关联信号