
8 月 19 日下午,世界机器人大会分论坛「具身智能大模型的进化之路:从技术分级到产业落地」在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。
8 月 19 日下午,世界机器人大会分论坛「具身智能大模型的进化之路:从技术分级到产业落地」在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,发布团队最新研究成果,并系统阐述通用世界模型的五级发展路线。
朱军表示:「从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。」

从第一性原理出发,定义通用世界模型
世界模型已经延伸到视频生成、环境模拟、机器人决策和动作控制等方向,但行业对「什么样的世界模型才称得上通用」仍缺少共识。
人在学习骑自行车或开车时,会从最初的不协调逐渐变得稳定、准确。其重要原因,是大脑在与外部世界持续互动的过程中,形成了一个关于世界如何运行的「内部模型」。
通用世界模型同样需要三项彼此关联的能力:
1. 理解世界:看懂环境,判断当前状态;
2. 预测未来:预测接下来可能发生什么,以及不同动作会带来怎样的结果;
3. 采取行动:影响数字或物理环境,并利用真实反馈修正理解和预测。
「通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统。」朱军强调,行动不仅是模型的输出,还会改变环境、产生新信息,并进入下一轮理解、预测和决策。

数据、架构与算力:构建通用世界模型的三大要素
要想构建通用世界模型,仍然离不开大模型的三个基本要素:数据、架构与算力。
在数据方面,通用世界模型需要一个由观察逐步走向行动的多层数据金字塔:从海量网络视频开始,逐步扩展到特定领域视频、第一视角人类视频、带动作记录的人类示范,以及真实机器人交互数据。
越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据虽然更稀缺、成本更高,却能更直接地建立任务、动作与物理结果之间的联系。合成数据可以贯穿金字塔的每一层。同时,「不完美数据」同样具有重要价值:失败尝试、纠正动作和恢复过程都包含有效的学习信号,能够帮助机器人学习如何从失败中恢复。

在架构层面,通用世界模型需要统一处理图像、视频、语言和机器人动作等不同模态信息。MoT(Mixture-of-Transformers)通过为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能够在同一模型中协同完成。生数科技的世界动作模型 Motubrain 正是基于这一架构,将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,同时提升异构数据的利用效率和跨任务迁移能力。
算力则同时影响大规模预训练和实时部署。离线视频生成可以容忍一定等待时间,但实时交互和机器人控制必须在环境发生变化之前完成预测和决策。因此,训练基础设施、推理加速、模型蒸馏和高效注意力机制,都是通用世界模型走向实际应用的重要支撑。
通用世界模型如何进化?五级路线图明确进阶方向
从通用基座模型的目标出发,通用世界模型可以划分为五个逐级演进的层级。它们并不是彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互不断增强,模型自主性持续提升的过程。过去几年,生数科技的研发与落地实践已经覆盖其中前三个层级。

L1:世界生成(World Generation)
第一步,是让模型学会生成连贯的世界演化过程。视频正是这一阶段最典型的载体,它帮助模型学习对象、运动、空间关系和时序变化,为进一步理解和预测世界奠定基础。
2024 年,生数科技推出视频生成大模型 Vidu,通过持续提升视频质量、时序一致性和世界动态建模能力,完成了 L1 阶段的初步实践。
L2:与世界交互(Interactive World)
在生成能力之上,模型开始接收实时输入,并根据语言、语音或控制信号持续改变后续内容,从「一次生成」走向「持续互动」。
2026 年 7 月发布的 Vidu S1 将这一能力推进到实时交互阶段。用户可以通过语音实时介入生成过程,持续影响接下来发生的内容,让模型能够根据外部输入动态演化世界。
L3:在世界中行动(Actionable World)
再往前一步,模型开始从数字世界进入物理世界。此时,环境理解、未来预测和动作生成需要真正统一起来,让模型不仅能判断世界发生了什么,还能直接生成机器人可执行的动作,并根据真实反馈持续修正。
Motus 和 Motubrain 标志着生数科技从视频生成进一步走向物理行动。Motus 于 2025 年 12 月发布并全面开源;2026 年 4 月发布的 Motubrain,则进一步将环境理解、世界状态预测和动作轨迹生成统一到同一个模型中,推动通用世界模型从「视觉推演」迈向「物理决策」。
相较 Motus,Motubrain 的推理速度提升约 10 倍,适配新的机器人本体时,仅需 50 至 100 条人类示范数据。在 RoboTwin 2.0 基准测试中,其成绩达到 96.1 分,位居榜首。目前,Motubrain 已在包括银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出在长程任务、多任务场景和不同机器人形态之间的泛化能力。
L4:自主世界智能体(Autonomous World Agent)
具备真实行动能力之后,模型还需要进一步走向自主决策,能够围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。
L5:世界组织者(World Orchestrator)
在更高层级上,模型不再只控制单个智能体,而是能够统筹机器人、数字智能体、人类、工具及其他资源,完成更复杂的任务分配与多智能体协作。
从 L1 到 L5,能力层层递进。没有对世界演化规律的学习和预测,就难以形成稳定、连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习、长期规划和复杂协同能力。
面向 L4、L5,还需突破六项关键挑战
目前,L1 至 L3 已经形成较为具体的技术实践,但距离更高阶的世界智能仍有差距。视频模型仍需持续提升生成质量、可控性与时空一致性;世界动作模型则需要在更复杂、更开放的真实环境中,进一步提升稳定性、泛化能力与执行效率。
继续迈向 L4 和 L5,还需要突破六项关键挑战:
• 建立覆盖理解、预测、行动和迁移能力的联合评测体系;
• 学习接触、摩擦、作用力和干预后果等真实物理规律;
• 形成持久且可修订的记忆;
• 通过真实交互实现在线学习和自我进化;
• 完成满足现实延迟与资源约束的高效闭环部署;
• 进一步强化安全性与可控性。
围绕这一方向,生数科技将持续强化世界生成、与世界交互、在世界中行动三个层级,并进一步补齐目标形成、主动探索、持续学习和长期记忆等能力,为更高阶的自主世界智能体奠定基础。更长远的目标,是构建一个能够持续理解世界、预测不同行动的后果、在明确约束下自主行动,并从真实反馈中不断学习和进化的通用基座。
当理解、预测与行动真正形成闭环,世界模型也将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。
来源:互联网



