通用世界模型到底长什么样,眼下 AI 圈各说各话。
视频生成公司把它讲成模拟器,机器人公司把它讲成决策大脑,自动驾驶玩家也在往里下注。8 月 19 日,世界机器人大会的一场分论坛上,生数科技创始人兼首席科学家朱军拿出了自己的答案,按他的划分,通用世界模型一共五级,逐级往上,生数科技的研发和落地覆盖到了第三级。


什么是通用世界模型
朱军的定义从第一性原理出发。他打了一个比方,人学骑自行车、学开车,都是从笨拙到熟练。这个过程里,大脑并没有死记硬背动作,而是在与外部世界持续互动的过程中,逐渐建立了一个关于世界如何运转的内部模型。
映射到机器上,通用世界模型需要三项彼此关联的能力:理解世界 (看懂环境、判断状态)、预测未来 (预判接下来会发生什么、不同动作带来什么结果)、采取行动 (影响数字或物理环境,并用真实反馈修正理解与预测)。
“ 通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。” 朱军说。
通用世界模型终究是大模型,算力、算法和数据三件套一样绕不开。
数据层面,他给出了一个多层金字塔,最底下铺海量网络视频,往上是领域视频,再往上是第一视角的人类视频和带动作记录的人类示范,塔尖是真实机器人交互数据,越往上数据越稀缺,成本越高,跟任务动作和物理结果的联系也越直接。
架构上,生数科技的答案是 MoT,Mixture-of-Transformers。不同模态各配专属参数,再用共享注意力打通跨模态交互,环境理解,状态预测,动作生成就都能在同一个模型里跑。世界动作模型 Motubrain 建在这套架构上,把理解和预测跟行动装进一个模型,不再按模块切开各管一段。
五级路线图,走到第三级
模型对世界理解得越深,跟世界的交互越强,自主性越高,层级就越高。生数科技这几年的实践,落在前三层。
- L1 世界生成 (World Generation):让模型学会生成连贯的世界演化过程,视频是最典型的载体,对象,运动,空间关系,时序变化都从这里学起。
- L2 与世界交互 (Interactive World):模型能接住实时输入了,语言,语音或控制信号进来,后续内容跟着变,一次生成变成了持续互动。
- L3 在世界中行动 (Actionable World):模型跨进物理世界,环境理解,未来预测,动作生成要真正统一,直接输出机器人能执行的动作,再拿真实反馈持续修正。
- L4 自主世界智能体 (Autonomous World Agent):围着长期目标主动感知环境,拆解任务,探索没见过的状态,持续规划行动。
- L5 世界组织者 (World Orchestrator):视野放到单个智能体之外,机器人,数字智能体,人,工具都归它调度,做多智能体之间的任务分配与协作。
Motubrain 是生数科技眼下最能打的一张牌,生数科技给出的数据显示,Motubrain 推理速度比 Motus 快了约 10 倍,换一个机器人本体,50 到 100 条人类示范数据就能完成适配,RoboTwin 2.0 基准测试拿下 96.1 分,排在榜首,银河通用,星尘智能,千寻智能等近十种本体上已经跑通了验证。
L1 到 L3 有了相对具体的技术实践,但离高阶世界智能还远,视频模型的生成质量,可控性,时空一致性都有待提高,世界动作模型放进更复杂更开放的真实环境,稳定性,泛化能力,执行效率也需要优化。
再往 L4 和 L5 走,朱军指出了六项关键挑战:建立覆盖理解、预测、行动和迁移能力的联合评测体系;学习接触、摩擦、作用力和干预后果等真实物理规律;形成持久且可修订的记忆;通过真实交互实现在线学习与自我进化;满足现实延迟与资源约束的高效闭环部署;以及安全性与可控性。
“ 当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。” 朱军说。(本文首发于钛媒体 APP,文 | TechPulse,作者 | 张帅,编辑 | 杨林)
更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App














