深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

一天四个世界模型:四家公司,四条不同的路,同一个目的地

2026-09-11·量子位·模型推理世界模型具身智能3DGS物理仿真高德京东
▮ SIGNAL SUMMARY · 摘要快读

同一天里四个世界模型先后发布:高德 ABot-Earth 0.7 做 3D 原生城市生成、大晓 HSImul3R 做人-场景物理可仿真重建、LingBot-World 2.0 轻量版做到 1.3B 单卡实时、京东 JoyAI 把算力和具身数据一起端上来。四条路线,指向同一个目的地。

一天四个世界模型:四家公司,四条不同的路,同一个目的地

一天里出现了四个"世界"

9 月 9 日到 10 日这 48 小时里,世界模型这条线上出现了四个发布:

四个都叫"世界模型",但扒开看,它们在造的根本不是同一种"世界"。 而把四条路线并排看,能看出一条正在转向的行业标准。

四块形态各异的透明立体结构并排立在深色台面上:一块是城市网格、一块是相互嵌合的人形与椅子、一块是层叠的景观、一块是密集排列的小方块阵列
都叫"世界模型",造的是四种世界。

专业分析

一、四条路线,各自在造什么

高德:造一座你能走进去的城市。

它的技术路径是"3D 原生"——不用卫星影像拼接,而是用时空数据训练模型,端到端直接生成 3DGS(三维高斯泼溅)格式的城市场景

最硬的数字在这里:输入一张卫星图或一段文字,10 分钟内在消费级 GPU 上生成公里级 3D 城市场景,官方称效率比传统模式提升 1000 倍。它的底气来自高德积累了二十年的时空数据,覆盖 196 个国家和地区。

高德 CEO 郭宁那句话点出了它的野心:「大模型理解语言,高德空间智能理解世界。」——它想做的是"AI 理解真实世界的入口",而不是又一个生成模型。

大晓 HSImul3R:让重建出来的东西"能站住"。

这条路线最技术,也最有意思。它针对的是一个被忽视很久的鸿沟:视觉上成立,不等于物理上成立。

一个在视频里"坐在椅子上"的人,模型重建出来之后放进物理仿真——椅子可能因为结构缺失直接倒下,人体可能和椅面严重穿模。论文把这叫「感知—仿真鸿沟」

HSImul3R 的做法是把物理仿真器从"最后的检验工具"变成"重建过程中的主动监督者"(物理闭环双向优化),并把重力稳定性、真实接触、交互稳定性纳入核心评价标准。效果:人-场景三维穿模率从 69.51% 降到 22.90%。

它的意义在于为机器人准备训练场——让网上的海量人类视频,真正变成机器人可以学的技能,而不是一堆好看但不可执行的动画。

LingBot-World 2.0:把"世界"做小、做快。

今年 7 月开源的 14B 主模型已经能做到小时级持续生成、720p/60fps。而这次的轻量版只有 1.3B,消费级单卡实时运行

这是四种路线里唯一明确面向"玩"的:第一人称射击里能看到爆炸、火焰、能量护盾随操作变化;第三人称能在大场景里持续探索、空间关系维持得住。

值得一提的细节:AMD 高级副总裁在 IFA 柏林开幕演讲里点名了三个开源模型——智谱、千问、LingBot-World,还拿它做了现场 Demo。一个中国团队做的世界模型,被芯片厂商拿去当硬件卖点的展示品,这件事本身比跑分有意思。

京东 JoyAI:不谈模型,谈"运营物理世界"。

京东走的是第四条路:它不强调单个模型多强,而是把算力(10 万卡国产集群)、数据(1000 万小时具身数据)、模型(JoyAI-Echo WM)、场景(零售/物流/健康/工业)打包成一个叫"物理世界运营中心"的东西。

京东云总裁曹鹏那句话很能代表它的立场:「京东的 AI 不是在论文里诞生的,是在生产线、仓库、配送站,在供应链全流程中一单一单磨出来的。」

也就是说:别人在造"世界的模型",京东在说"我本来就有那个世界"。

二、一个共同的转向:评价标准从"像不像"变成"站不站得住"

把四条路线叠起来,第一个共同点很清晰——衡量"世界模型"的尺子正在换。

HSImul3R 那组"穿模率 69.51% → 22.90%"的数字,比任何画质指标都更能说明问题。因为画面的真假,眼睛能判断;物理的真假,得靠仿真器判断。当评价权从眼睛转向仿真器,这条赛道的门槛就换了一种。

三、第二个共同点:门槛在塌

门槛下降的方向,决定了谁能进来。 当"生成一个可探索的世界"的成本低到一定程度,它的第一批大规模用户不会是研究机构,而是做游戏、做仿真、做内容的小团队。

一条从巨大笨重设备通向便携小设备的渐变序列,末端是一台可以托在掌心的小型装置,光线从粗到细收束
从数据中心到单卡,门槛塌下来之后,进来的人就换了。

关联信息与影响

第一,四条路线的分野其实是"数据从哪来"。

这解释了一个现象:做世界模型的玩家,多半不是纯模型公司。 世界模型吃的是"真实世界的数据",而这东西买不到——只能靠年头攒。

第二,它和具身智能是同一条线的两端。

HSImul3R 想让人类视频变成机器人的技能来源;京东要采集 1000 万小时具身数据;高德的城市场景是机器人在真实世界导航的底图。世界模型的真正买家,是那些要给机器人准备训练环境的团队。

机器人没法像语言模型那样"在互联网上白嫖数据"——它需要一个能反复试错、又不损坏真实世界的地方。世界模型就是那个地方。

第三,需要泼的冷水。

未来展望

短期,判断世界模型会分成两个阵营:"做场景的"(城市、game、仿真)和"做数据基建的"(为具身智能造训练场)。前者拼生成质量与成本,后者拼物理真实度和规模。

中期,两条线会合流。当生成的世界足够物理可信、成本又足够低,"在虚拟世界里训练、在真实世界里干活"会从概念变成流水线——那时候最值钱的不是模型,而是谁能定义那个虚拟世界的"物理规则"

长期看,这里可能长出一个新的基础设施层:不是数据库、不是模型 API,而是"可被 AI 反复试错的世界"。谁提供这个,谁就掌握了具身智能的入场券。

信号强度

SIGNAL FILE · 情报档案

聚合看这四条路线会发现两个共同信号:① 评价标准从"看起来真"转向"物理上成立"——HSImul3R 把重力稳定性、真实接触纳入核心指标,把穿模率从 69.51% 压到 22.90%;② 门槛在塌——14B 到 1.3B 单卡实时,公里级城市场景 10 分钟在消费级 GPU 上生成。世界模型正在从论文概念变成场景入口的争夺。

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://www.qbitai.com/2026/09/486900.html(量子位)

RELATED SIGNALS · 关联信号