(本文作者为 机器最前线,钛媒体经授权发布)
文 | 机器最前线
2026 年,世界模型逐渐从学术概念走向产业落地。
World Labs 收购了机器人仿真公司 SceniX,英伟达的 Cosmos 绑定算力主攻仿真,谷歌的 Genie 系列持续迭代。国内 Manifold AI 发布自研世界模型 WorldScape 登顶多个榜单,摩尔线程开源全栈仿真平台 MT Lambda 完成 Sim2Real 真机验证。
各大玩家都在加速布局,但路线分歧也越来越明显,这些号称能“ 理解世界” 的模型,到底是在生成好看的画面,还是在搭建可用的空间?
World Labs 在九月发布了全球首个多模态世界模型 Atlas,恰好提供了一个可供剖析的样本。它的设计思路和取舍,或许能帮我们看清这条赛道的真实走向。
几何重建,让训练场从专业级走向消费级
Atlas 发布后,很多人会联想到 Sora。两者都建立在生成式模型架构之上,输出内容也都以视觉画面呈现,从表面看确实有相似之处。但两者除了都涉及“ 生成” 之外,几乎没有共同点。

Sora 做的事情是视频生成。给它一段文字,它生成一段看起来合理的画面。它关心的是像素之间的连贯性、运动的平滑度、视觉上的逼真感。最终交付的产物是一个视频文件。
Atlas 做的事情与它不同。当你给它几张照片,它能直接按照照片画面重建出一个相同的 3D 场景。这些照片被锚定在三维空间的具体坐标上,模型据此还原几何结构。它主要的关心在于空间坐标对不对、几何结构准不准、程序能不能直接读取。
最终交付的也不是画面,而是可供计算机直接解析的几何数据,例如点云、3D 高斯泼溅,也就是一堆带坐标的空间点、一组带形状和颜色的椭圆体,两者都不是给人看的图片,而是机器能直接读取和计算的“0 和 1”,程序可以直接使用、机器人仿真器也可以直接导入运行。
换句话说,Sora 交付的是“ 画面”,Atlas 交付的是“ 世界”,一个机器人可以直接进去“ 干活” 的数字空间。从照片到三维空间,Atlas 靠的不是像素拼接,而是一套对空间关系的重新理解。这个改变,正在重新定义机器人感知世界的底层逻辑。
1.空间上下文重塑视觉输入规则
传统视觉输入处理的是二维像素阵列,一张图就是一张图,没有深度,没有尺度,没有遮挡关系。Atlas 的空间上下文则让每一帧图像都自带三维坐标,输入从“ 拍到了什么” 变成了“ 从哪拍的、和周围什么关系”。
这个变化直接触及世界模型的底层结构。
一个世界模型通常分为三个模块:视觉模块负责把摄像头、麦克风这类原始信号翻译成模型能理解的内部格式;记忆模块负责学习环境的变化规律,根据当前状态推算下一步会怎样;控制模块则基于这些推算来决定具体怎么动。
Atlas 做的事情,就是把视觉模型和记忆模型这两个环节往前推了一大步。
推动这一步的关键机制,是 Atlas 对空间上下文的理解方式。过去大语言模型用文字上下文来预测下一个词,把输入的文字编码成上下文,再基于上下文生成后续内容。Atlas 的思路一脉相承,但是它用的不是文字,而是带着三维坐标的照片。每一张输入 Atlas 的照片都被固定在一个三维空间位置上,模型能够识别这张图是从哪个方向拍的,和其他照片之间是什么关系。

(图源:World Labs)
这个机制的效果,可以用一个简单场景来说明。想象你在一个房间里拍了五张照片,朝东一张、朝北一张、朝西一张。传统模型看到的是五张独立的平面图。但 Atlas 可以分析出这五张图来自同一个房间的不同角度,并把它们拼成了一张完整的三维房间地图。这不是在拼接画面,而是在还原空间。
2.空间重建降低 3D 场景构建门槛
3D 场景构建的核心门槛,在于几何结构的还原精度。而 Atlas 仅需最少 2 张,最多 25 张普通照片,它就能输出一个完整的 3D 场景,这个 3D 场景可被仿真器直接导入,作为视觉环境的基础。
官方做过一个逐步构建的演示:一开始只给一张办公桌的局部特写,Atlas 生成了一张室内全景图,画面中办公桌和电脑是准确的,但旁边的椅子和墙面全是模型“ 脑补” 出来的。再加入第二张房间整体视角的照片,这一次办公桌和椅子都对了,但画面右侧的显示器区域仍然是空的。直到加入第三张侧面双屏工作台的照片,整个办公场景才完整对齐。

(图源:World Labs)
输入越多,需要“ 脑补” 的部分就越少。官方透露 Atlas 通常只需要两到三张图就能实现可用的重建,也能处理超过一百张输入图做精细建模。另一个案例是斯坦福大学主方庭,仅靠几张从地面拍摄的手机照片,Atlas 就生成了从校园高空俯瞰的连续飞行画面。
这意味着,过去想要搭建一个给机器人训练用的 3D 场地,需要扛着专业设备围绕目标转几十圈,拍摄数百张照片,再花几天时间手工建模。现在一部手机,一段视频,几分钟就能完成。这个效率的提升,把 3D 场景生成从专业测绘的范畴,拉近了普通工程师日常工作的范畴。
3.时空模拟打通真实到仿真链路
当有了 3D 世界后,如何灵活地观察它,成为下一个需要解决的问题。
Atlas 的相机可控生成能力允许用户输入 1 到 6 张参考图,再设计一条相机运动轨迹,模型沿着轨迹生成最高 1440p、最长 1 分钟的视频。其本质是让用户不再“ 猜” 下一帧长什么样,而是让用户用坐标告诉模型“ 从哪个角度看”,模型按坐标渲染对应的画面。
为了验证这项能力的实际效果,World Labs 做了第三方盲测。测试中,Atlas 以相机位姿作为原生输入来控制运镜,其他对比模型通过文本提示描述运镜方式。Atlas 对 MiniMax H3 的胜率是 75%,对阿里 HappyHorse 1.1 是 86%,对字节 Seedance 2.5 是 94%。胜率随着运镜复杂度增加而进一步拉大,说明当相机控制精度成为瓶颈时,Atlas 的原生几何理解能力带来了优势。

(图源:World Labs)
从观察世界到让世界动起来,是 Atlas 的另一个延伸能力。这项能力被称为时空模拟。通过三五台普通手机同步录一段视频,Atlas 就能实现时间冻结、多视角回看的效果,即能把时间暂停在某一帧,允许从任意角度回看同一个瞬间。过去这种效果往往需要几十台同步摄像机才能做到,而现在几台手机配合 Atlas 就能完成,大大降低了多视角捕捉的门槛。
不过对整个机器人行业来说,更重要的是 Atlas 时空模拟带来的仿真价值。
World Labs 曾用手机拍摄了两个大型环境,各取 24 帧重建出 3D 场景,然后模拟不同机器人沿不同路径行走,Atlas 能实时生成机器人传感器应该看到的 RGB 画面和深度数据。而且一个真实场景可以生成上千种变体,改变路线、挪动障碍物、调整光照,全都不需要重新搭建场地。

(图源:World Labs)
这意味着,数据采集的主体从真实机器人变成了虚拟机器人。物理世界的行走只需要一次,剩下的都在数字世界里完成。成本从“ 每次都要跑一趟” 变成了“ 跑一趟,用无数次”。
但成本只是其中一面,生成的虚拟数据还需要跟真实世界对齐。
在传统流程里,环境重建和传感器渲染是两套系统,误差在接缝处累积。而 Atlas 把这两步统一在同一个模型里,消除环节之间的误差传递,让机器人能在虚拟环境中获得与真实世界高度一致的感知数据,训练效果更可靠。
整体来看,空间重建解决了“ 世界长什么样”,相机控制解决了“ 从哪个角度看”,时空模拟解决了“ 时间如何流动”。这三项能力都附着同一个链条,先有几何结构,再有视角控制,最后推演时间的演化。
在这个链条里,视觉模型不再是把图像压缩成抽象的潜在向量,而是直接输出 3D 点云;记忆模型不再是在抽象空间里做预测,而是在三维空间里模拟时空变化;建训练场从专业级变成了消费级,镜头控制从文字描述变成了坐标说话;数据采集从物理空间转向了虚拟空间;世界模型架构里的前两个环节,被 Atlas 一次性推到了新的高度。
但这还不是终点。
物理属性,模拟器真正的硬仗
Atlas 目前解决的是几何层面的问题。世界长什么样子、物体在哪儿、空间关系如何,这些它能从照片里推算出来。
可它还不能解决物理层面的问题。这个世界里的东西怎么动、多重、摩擦多大、会不会变形。照片里看不出来,Atlas 还算不出来。
而要理解这个差距有多大,或许可以从 Atlas 在仿真链路中的实际定位入手。
Atlas 在 Real-to-Sim 工作流中,为模拟机器人生成的传感器数据仅包含 RGB 图像和深度图,不输出碰撞检测信息、刚体动力学参数或接触力计算结果。物理演算需要对接外部物理引擎,比如 MuJoCo、PhysX 等,Atlas 自身架构中没有内置刚体动力学方程、接触力求解器,也没有对摩擦系数或材料刚度的参数化表征。
不仅如此,Atlas 的损失函数是基于图像帧的预测误差,优化的也是画面保真度,而非物理演算的准确性。
这意味着 Atlas 在架构层面拥有先天限制。它在仿真链路中的角色始终是“ 视觉渲染器”,只负责把场景“ 画” 出来,而非“ 算” 出物体如何相互作用。
这种限制可以从 Atlas 在稀疏输入场景中的行为逻辑中看出来。它做的是视觉层面的“ 填空”,从已有像素推断未见区域的几何结构,这是在补画面。但物理仿真要求的是“ 填力”,知道这个位置的东西受到推力会怎么动、受到重力会怎么变形。
像素记录的是外观,不记录力,Atlas 能补画面,但补不出力的响应。视觉推断能找到“ 这个位置该有什么”,但找不到“ 这个物体受力后会怎样”。
World Labs 并非没有意识到这个距离,为了补上物理仿真这块短板,2026 年 7 月,他们收购了机器人仿真公司 SceniX。这家公司的技术方向正是用物理信息增强数字资产,让虚拟物体具备接近真实世界的物理属性。
收购完成后,SceniX 的团队和技术并入 World Labs,双方计划结合 World Labs 在空间建模与三维重建方面的积累,以及 SceniX 在机器人学习与物理仿真领域的技术栈,为 Atlas 从几何重建向物理模拟延伸铺路。
同月,双方公布了 Real-to-Sim-to-Real 工作流,展示了一套完整的闭环:先录制一段真实世界的操作视频,将其转化为带物理属性的仿真环境,在这个环境里训练和优化策略,再把策略部署回真实机器人。

演示中,RB-Y1 机械臂成功完成了线缆操作任务,YAM 机械臂完成了可变形物体操控,所有策略都在仿真中训练、零真实数据、直接迁移到多种真实机器人平台,自主运行一小时无人工干预。这套流程证明了物理仿真到真实迁移的可行性,也为 Atlas 下一步的进化指明了方向。
Atlas 做的事情核心是“ 从照片到几何场景”。SceniX 做的是“ 从视频到物理仿真”。两者如果能够融合,即用 Atlas 重建几何结构,用 SceniX 注入物理参数,就有可能打通从真实世界到物理仿真环境的完整管道。
World Labs 在 Atlas 发布的官方博客中也提到了这一点:Atlas 的时空模拟能力“ 为机器人领域开启真实到模拟的工作流程”,不过目前这个工作流还处于早期阶段。
对于具身智能行业来说,Atlas 的方向是清晰的。数据采集的瓶颈正在从“ 采集更多照片” 转向“ 让这些照片承载物理信息”。
不过,几何可以靠算法推算,从照片里反推空间结构。但每一根线缆的阻尼、每一块布料的编织方式、每一个关节的摩擦特性,都只能通过真实的物理交互来标定。
Atlas 迈过了几何这道坎,但物理这道坎还在前面等着。当它真正能把空间结构和物理规则统一起来的时候,它才算走完了从感知到理解的全链路。
那时,或许也是具身智能行业真正迎来转折点的时刻。
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App














