一天四个世界模型:四家公司,四条不同的路,同一个目的地
同一天里四个世界模型先后发布:高德 ABot-Earth 0.7 做 3D 原生城市生成、大晓 HSImul3R 做人-场景物理可仿真重建、LingBot-World 2.0 轻量版做到 1.3B 单卡实时、京东 JoyAI 把算力和具身数据一起端上来。四条路线,指向同一个目的地。

一天里出现了四个"世界"
9 月 9 日到 10 日这 48 小时里,世界模型这条线上出现了四个发布:
- 高德 ABot-Earth 0.7:号称全球首个 3D 原生城市世界模型
- 大晓 HSImul3R:联合南洋理工 S-Lab、上海人工智能实验室,做人-场景交互的物理可仿真重建
- LingBot-World 2.0 轻量版:1.3B 参数,消费级单卡实时跑
- 京东 JoyAI 世界模型:连同 10 万卡国产算力集群、1000 万小时具身数据采集一起端上来
四个都叫"世界模型",但扒开看,它们在造的根本不是同一种"世界"。 而把四条路线并排看,能看出一条正在转向的行业标准。

专业分析
一、四条路线,各自在造什么
高德:造一座你能走进去的城市。
它的技术路径是"3D 原生"——不用卫星影像拼接,而是用时空数据训练模型,端到端直接生成 3DGS(三维高斯泼溅)格式的城市场景。
最硬的数字在这里:输入一张卫星图或一段文字,10 分钟内在消费级 GPU 上生成公里级 3D 城市场景,官方称效率比传统模式提升 1000 倍。它的底气来自高德积累了二十年的时空数据,覆盖 196 个国家和地区。
高德 CEO 郭宁那句话点出了它的野心:「大模型理解语言,高德空间智能理解世界。」——它想做的是"AI 理解真实世界的入口",而不是又一个生成模型。
大晓 HSImul3R:让重建出来的东西"能站住"。
这条路线最技术,也最有意思。它针对的是一个被忽视很久的鸿沟:视觉上成立,不等于物理上成立。
一个在视频里"坐在椅子上"的人,模型重建出来之后放进物理仿真——椅子可能因为结构缺失直接倒下,人体可能和椅面严重穿模。论文把这叫「感知—仿真鸿沟」。
HSImul3R 的做法是把物理仿真器从"最后的检验工具"变成"重建过程中的主动监督者"(物理闭环双向优化),并把重力稳定性、真实接触、交互稳定性纳入核心评价标准。效果:人-场景三维穿模率从 69.51% 降到 22.90%。
它的意义在于为机器人准备训练场——让网上的海量人类视频,真正变成机器人可以学的技能,而不是一堆好看但不可执行的动画。
LingBot-World 2.0:把"世界"做小、做快。
今年 7 月开源的 14B 主模型已经能做到小时级持续生成、720p/60fps。而这次的轻量版只有 1.3B,消费级单卡实时运行。
这是四种路线里唯一明确面向"玩"的:第一人称射击里能看到爆炸、火焰、能量护盾随操作变化;第三人称能在大场景里持续探索、空间关系维持得住。
值得一提的细节:AMD 高级副总裁在 IFA 柏林开幕演讲里点名了三个开源模型——智谱、千问、LingBot-World,还拿它做了现场 Demo。一个中国团队做的世界模型,被芯片厂商拿去当硬件卖点的展示品,这件事本身比跑分有意思。
京东 JoyAI:不谈模型,谈"运营物理世界"。
京东走的是第四条路:它不强调单个模型多强,而是把算力(10 万卡国产集群)、数据(1000 万小时具身数据)、模型(JoyAI-Echo WM)、场景(零售/物流/健康/工业)打包成一个叫"物理世界运营中心"的东西。
京东云总裁曹鹏那句话很能代表它的立场:「京东的 AI 不是在论文里诞生的,是在生产线、仓库、配送站,在供应链全流程中一单一单磨出来的。」
也就是说:别人在造"世界的模型",京东在说"我本来就有那个世界"。
二、一个共同的转向:评价标准从"像不像"变成"站不站得住"
把四条路线叠起来,第一个共同点很清晰——衡量"世界模型"的尺子正在换。
- 过去比的是画面:够不够真实、够不够高清、动态够不够流畅
- 现在开始比:重力对不对、接触稳不稳、交互能不能在物理仿真里跑下去
HSImul3R 那组"穿模率 69.51% → 22.90%"的数字,比任何画质指标都更能说明问题。因为画面的真假,眼睛能判断;物理的真假,得靠仿真器判断。当评价权从眼睛转向仿真器,这条赛道的门槛就换了一种。
三、第二个共同点:门槛在塌
- 生成一座公里级城市:从"需要专业管线"变成10 分钟 + 消费级 GPU
- 跑一个世界模型:从 14B 数据中心级,压到 1.3B 单卡实时
门槛下降的方向,决定了谁能进来。 当"生成一个可探索的世界"的成本低到一定程度,它的第一批大规模用户不会是研究机构,而是做游戏、做仿真、做内容的小团队。

关联信息与影响
第一,四条路线的分野其实是"数据从哪来"。
- 高德:二十年的时空数据(我有城市)
- 京东:供应链全流程的实体场景(我有物理世界的运营流量)
- 大晓 & LingBot:方法本身(我提供重建/生成的能力)
这解释了一个现象:做世界模型的玩家,多半不是纯模型公司。 世界模型吃的是"真实世界的数据",而这东西买不到——只能靠年头攒。
第二,它和具身智能是同一条线的两端。
HSImul3R 想让人类视频变成机器人的技能来源;京东要采集 1000 万小时具身数据;高德的城市场景是机器人在真实世界导航的底图。世界模型的真正买家,是那些要给机器人准备训练环境的团队。
机器人没法像语言模型那样"在互联网上白嫖数据"——它需要一个能反复试错、又不损坏真实世界的地方。世界模型就是那个地方。
第三,需要泼的冷水。
- "世界模型"这个词目前还没有公认定义。 有人用它指可交互的视频生成,有人指物理仿真,有人指 3D 重建。四个发布都挂这个名字,但可比性很低。
- HSImul3R 的"最难的档位"稳定率只有 13.92%。 这已经是显著进步,但离"机器人可大规模训练"还很远——看进步幅度,也要看绝对水位。
- 京东的"10 万卡集群"目前还是规划口径。 规模承诺要看落地时间表。
未来展望
短期,判断世界模型会分成两个阵营:"做场景的"(城市、game、仿真)和"做数据基建的"(为具身智能造训练场)。前者拼生成质量与成本,后者拼物理真实度和规模。
中期,两条线会合流。当生成的世界足够物理可信、成本又足够低,"在虚拟世界里训练、在真实世界里干活"会从概念变成流水线——那时候最值钱的不是模型,而是谁能定义那个虚拟世界的"物理规则"。
长期看,这里可能长出一个新的基础设施层:不是数据库、不是模型 API,而是"可被 AI 反复试错的世界"。谁提供这个,谁就掌握了具身智能的入场券。
信号强度
- 做机器人 / 具身智能的团队:HSImul3R 那条"物理闭环"思路值得直接借用——把仿真器从验收环节提到训练环节,能省掉大量返工。
- 做内容与游戏的人:1.3B 单卡实时这件事,意味着"生成一个可探索世界"第一次进入你的成本区间,值得动手试一次。
- 看行业方向的人:注意这四个发布会里都没怎么提基准分数,提的是成本、数据集规模和场景——这是赛道从"比技术"转向"比落地"的标志。
- 普通用户:你短期用不到"世界模型"这四个字。但你未来用的导航、购物助手、游戏 NPC,会先替你用上它。
聚合看这四条路线会发现两个共同信号:① 评价标准从"看起来真"转向"物理上成立"——HSImul3R 把重力稳定性、真实接触纳入核心指标,把穿模率从 69.51% 压到 22.90%;② 门槛在塌——14B 到 1.3B 单卡实时,公里级城市场景 10 分钟在消费级 GPU 上生成。世界模型正在从论文概念变成场景入口的争夺。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

