智象未来 HiDream-O1-Embodied 交出 0.692 分硬核答卷,全模态战略再落关键一子

摘要

近日,智象未来(HiDream.ai)正式推出具身世界模型 HiDream-O1-Embodied,值得关注的是,该模型并非是单纯在既有技术路径上的延伸,而是对原生全模态理念的一次纵深实践,将视觉、语言、动作、3D 等多源信息统一纳入同一表征框架,使机器人不仅能够「看懂」和「听懂」,更能在物理环境中实时预判动态、稳健操作。由此,智象逐步完成了从图像、视频、3D 到动作的全模态覆盖,并贯通了理解、推演到执行的全链路,构建起统一世界模型基座的技术闭环。

近日,智象未来(HiDream.ai)正式推出具身世界模型 HiDream-O1-Embodied,值得关注的是,该模型并非是单纯在既有技术路径上的延伸,而是对原生全模态理念的一次纵深实践,将视觉、语言、动作、3D 等多源信息统一纳入同一表征框架,使机器人不仅能够「看懂」和「听懂」,更能在物理环境中实时预判动态、稳健操作。由此,智象逐步完成了从图像、视频、3D 到动作的全模态覆盖,并贯通了理解、推演到执行的全链路,构建起统一世界模型基座的技术闭环。

RoboColiseum 榜首之争:0.692 分背后的「扰动适应」硬实力

HiDream-O1-Embodied 首次参与具身智能模型评测平台 RoboColiseum,便在最具挑战性的扰动适应(Robustness)子榜单中以平均分 0.692 登顶。该平台基于高保真仿真环境,高度还原真实世界的复杂状况,设置指令跟随、空间理解、扰动适应与通用操作四大能力子榜,共计 78 项评测任务。

其中,扰动适应被公认为难度最高的一环,它通过随机改变背景、光照、材质、机器人初始状态、相机视角与图像质量,并对指令进行多样化改写,考察模型在非理想条件下的稳定性与泛化能力。换句话说,这不再是实验室「温室」中的标准考试,而是让模型直面真实世界中层出不穷的「意外」。HiDream-O1-Embodied 以 0.692 分的成绩拔得头筹,其原生全模态底座为此提供了根本支撑,跨模态的先天优势让模型在感知与理解层面拥有更宽的带宽,而在执行阶段,三项突破性创新则进一步夯实了其稳健性与抗干扰能力。

语言穿透力:超越关键词匹配,直抵用户意图

传统机器人对语言指令的解析往往停留在关键词匹配的浅层,一旦句式或措辞发生变化,响应便可能中断。HiDream-O1-Embodied 构建了覆盖多元动词、句式与表达方式的等价指令空间,使模型摆脱对固定词序的依赖。无论用户说「把杯子拿过来」、「给我拿个杯子」还是「杯子递我一下」,模型都能穿透字面变体,锁定核心意图。这种能力并非简单扩充词汇表,而是在原生全模态框架下将语言与视觉、动作表征对齐,让指令理解真正服务于任务目标,而非机械地响应预设模板。

多视角视觉协同:告别「单点失灵,全局瘫痪」

物理世界中,机器人的视觉通道远非理想状态,相机可能偏移、标定精度随时间漂移、单路画面可能被遮挡或受噪声干扰。HiDream-O1-Embodied 采用多视角信息协同策略,不同视觉通道互为补充,而非依赖某一固定视角。当部分视角出现偏差或暂时不可用时,模型仍能借助其他视角维持场景理解和任务执行能力。这种设计将系统从「一处失灵、全局失效」的脆弱状态,转变为「局部受限、整体仍可运行」的弹性架构,使得视觉感知在真实部署中具备更高的容错空间。

高容错机制:在不完美的数据中练就稳定执行

多数具身模型训练依赖「完美数据」,清晰图像、完整画面、标准视角,但真实世界充斥着光照骤变、画面污损、视野遮挡与信号波动。HiDream-O1-Embodied 在训练阶段主动引入多种非理想条件,迫使模型反复面对不完整、不稳定的信息,并从中学会利用有限线索作出可靠判断。这种训练哲学不仅追求理想条件下的最佳表现,更重视复杂环境中的持续稳定。无论是光照、外观还是场景变化,模型都能灵活调用已有信息,降低环境扰动对任务执行的影响。对 HiDream-O1-Embodied 而言,真正的价值不在于「看得清时做得多好」,而在于「条件不理想时,依然能稳稳完成任务」。

真实基座+生成增强:数据与模型互相驱动的增长飞轮

上述抗扰动能力根植于一个更深层的战略——数据,具身训练中最稀缺、最具决定性的变量正是高质量、多样化的真实数据。智象推出「模型+数据」双驱动策略,让数据生产本身成为模型迭代的有机一环,探索出「真实基座 + 生成增强」的数据生产范式。模型不再被动接收数据,而是主动参与数据创造。

以与诺亦腾的合作为例,高精度真人动作捕捉数据作为真实底座,智象凭借原生全模态能力完成百倍级的数据精细化扩增。基于单段真实动作样本,模型可生成大量变体视频,在严格恪守物理约束的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。这一机制的关键在于,模型同时扮演「考生」与「出题人」:它根据自身能力短板主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。正是这种闭环,让 HiDream-O1-Embodied 在现实世界的强扰动面前展现出超乎寻常的鲁棒性。

全模态世界模型矩阵渐趋完整,从数字世界迈向物理世界

不到一个月前,智象发布了交互式世界模型 HiDream-O1-World,并在交互式视频世界模型评测基准 WBench 的 Navi 分榜中以平均分 80.9 登顶。交互式世界模型侧重理解与推演,赋予 AI 在数字世界中对空间、时间、运动与物体关系的完整认知,而具身世界模型则聚焦操作与执行,让 AI 在物理世界中完成真实任务,两者形成有力互补,共同夯实原生全模态世界模型的底层根基。

正如智象未来创始人兼 CEO 梅涛此前强调,下一代大模型竞争的关键,不在于单一模态能力的线性增长,而在于从单模态走向多模态,并最终走向原生统一的全模态。从 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象正稳步构建覆盖视觉模型、交互式世界模型及具身世界模型的完整矩阵,这不仅体现了原生全模态技术在多元场景中的延展能力,更彰显了其强大的内生进化潜力。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。