当 AI 学会「动手」,智象未来原生全模态世界模型打通仿真与真实物理最后一公里

摘要

2026 年被许多人称为世界模型的元年,大语言模型、多模态模型与具身智能,这三条曾各自狂奔的技术路线正以前所未有的速度交汇。然而,一个 IQ 逼近 140 的顶级大模型,依然无法可靠地完成一个简单的家务操作,这背后的落差恰恰是 Physical AI 必须直面的命题,即高智商不等于「全能」,AI 要改变世界,必须先学会与世界交互。

2026 年被许多人称为世界模型的元年,大语言模型、多模态模型与具身智能,这三条曾各自狂奔的技术路线正以前所未有的速度交汇。然而,一个 IQ 逼近 140 的顶级大模型,依然无法可靠地完成一个简单的家务操作,这背后的落差恰恰是 Physical AI 必须直面的命题,即高智商不等于「全能」,AI 要改变世界,必须先学会与世界交互。

在近日举行的世界机器人大会物理 AI 引领者论坛上,智象未来(HiDream.ai)创始人梅涛提出了一条清晰的破局路径——原生全模态世界模型,它不是将文本、图像、视频、操控指令简单拼接,而是从底层架构上统一多种模态,让模型同时具备对世界的完整表达、物理规律的推演能力,以及动态交互的生成能力。这种「统一」,正是从「模拟世界」走向「交互世界」的关键一跃。

原生全模态:统一架构与核心突破

智象未来自研的 UiT(Unified Transformer)架构正是这一理念的技术载体。基于该架构推出的 HiDream-O1-World 模型,首次参评便在权威榜单 WBench 的 Navi 分榜中登顶。该模型支持文本、图像及交互式操控等多模态输入,并凝练出漫游、编辑、交互三项核心能力。无论是高度还原的真实空间,还是二次元卡通、3A 游戏渲染等风格化世界,它都能在长时程交互中保持时空一致性与物理合理性,简单说,它「记住」了探索过的场景结构,也能让后续动作符合直觉上的物理常识。

产业落地:从数字娱乐到具身仿真

这一突破,迅速打开了多个产业场景的想象空间。在 AI 互动影游中,用户不再是被动观看者,而是可以主动影响叙事走向;在具身智能仿真中,模型可搭建高保真虚拟训练底座,让机器人在「元宇宙」里先摔打千百次,再到真实环境里精准执行;在 3D 场景生成中,创作者只需输入少量描述,即可获得结构完整的立体空间,创意到成品的周期大幅缩短。而智象未来的野心不止于此,他们正围绕世界模型的定义,逐步完善覆盖图像、视频、交互式世界模型的完整矩阵,让「统一」成为贯穿所有产品的基因。

认知中枢:数据-模型-智能体-具身闭环

梅涛强调,世界模型不能孤立存在,他将 Physical AI 的能力底座概括为一个闭环飞轮:数据—世界模型—智能体—具身本体—反馈。最底层是三类数据,互联网的先验数据、仿真的物理试错数据、真实交互的闭环数据,三者缺一不可。中间层是世界模型,它作为认知中枢,回答「世界是什么」和「接下来会发生什么」。最上层是智能体与具身系统,基于世界模型的预测做决策,再由物理本体执行动作。真实环境的反馈又回流为新的训练数据,驱动飞轮持续加速。

在这个闭环中,世界模型的角色尤为关键,没有高质量的世界模型,仿真就难以逼近真实物理规律,具身智能的数据飞轮也转不起来。梅涛以智象未来与诺亦腾机器人的合作为例:利用原生全模态模型对真实采集的人体动作数据进行增强,可以生成大量符合物理约束的视频,同一动作在不同背景、肤色、光照下都保持自然一致。这种能力大幅降低了真实数据采集的成本,让机器人先在仿真中「预习」,再到现实中「实战」,训练效率提升显著。

从长远来看,大模型让 AI 理解世界,智能体与具身系统让 AI 行动于世界,而原生全模态世界模型则将认知、行动与反馈融为一体,赋予 AI 在物理世界中持续学习与进化的能力。这不再是静态的「模拟」,而是动态的「交互」,AI 不再只是观察者或生成者,而是参与者。智象未来的实践表明,当统一架构同时拥抱文本、图像、操控指令和物理规律时,世界模型便从「数字玩具」蜕变为「物理基石」。它既服务数字智能,让影游、设计、仿真更生动;也加速具身智能,让机器人在真实环境中的训练与执行更可靠、更经济。

梅涛表示,智象未来将持续深耕原生全模态路线,以技术创新与生态协同双轮驱动,助力 Physical AI 从技术探索迈入规模化、商业化的全新阶段。从模拟到理解,从推演到交互,这条路的终点,或许正是 AI 真正「活」在物理世界的那一天。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。