具身智能的「数据圈地运动」,上限在哪儿?

摘要

百万小时采集计划成为头部厂商标配,星海图宣布年内完成百万小时,京东计划两年内积累超 1000 万小时。数采硬件密集发布,开源数据集接连涌现。 目标只有一个:谁先圈到更多的数据,谁就能训练出更大的模型。

 2026 年,具身智能行业正陷入一场关于数据的「 圈地运动」。

百万小时采集计划成为头部厂商标配,星海图宣布年内完成百万小时,京东计划两年内积累超 1000 万小时。数采硬件密集发布,开源数据集接连涌现。 目标只有一个:谁先圈到更多的数据,谁就能训练出更大的模型。

今天选择什么样的传感器、采集到什么质量的数据,在很大程度上决定了机器人未来能走多远。

如果说,数据决定机器人的上限,那又是什么在决定数据的上限?

答案必然是「机器人之眼」。

目前,行业真正缺少的不只是更多数据,而是具备真实尺度、稳定时空关系、并能高效进入训练与推理流程的高质量空间数据。

从感知小白到传感器堆叠狂魔

时间倒回到 1960 年,当第一台工业机器人 Unimate 在通用汽车的装配线上举起焊枪,它没有摄像头,不带激光,只有关节编码器在黑暗中默默计数。这台感知「小白」 ,没有眼睛,只有粗壮的「肌肉」 与重达两吨的「 骨骼」 。那是机器人史上的「 蛮荒时代」。准确地说它是一台机器,还不能叫做「人」。

1970 年代,超声波传感器第一次让机器「 听见」 了距离。

1980 年代,激光测距仪登上舞台,SLAM 的种子被埋下。

1990 年代,CCD 相机与激光雷达开始进入移动机器人,这也使得机器第一次走出了固定工位,用于园区巡检、AGV 搬运,它开始「看」 了。

2000 年代,微软 Kinect 把深度相机的价格打到了平民级,双目结构光开始用于近距离识别。机器人第一次试图「理解」 眼前的物体。

2010 年代,多传感器融合 SLAM 成熟,激光雷达从机械式走向固态,深度学习接管了视觉感知。机器人开始做无人配送、人机协作。传感器越堆越多,算法越来越复杂,数据越采越庞大。

2020 年代起,事件相机、神经形态传感器、多模态大模型等新型感知模态如潮水般涌来。机器人开始尝试家庭服务、精密装配、零样本泛化操作。

回看「机器人之眼」六十年来时路,几乎每过十年,机器人就要经历一次感知的代际穿越。

从「看不见」到「 听见」 ,从「 听」到「看」,从「看」到「看」,从「看懂」到「 多传感器堆叠」。每一次穿越,都伴随着一次传感器数量的大跃进,也伴随着一次系统复杂度的指数级膨胀。

宇树 G1 头部 1 颗激光雷达,智元 G2 底盘 2 颗,银河通用 Galbot S1 头部 2 颗底盘 2 颗——4 颗。欧菲光的头部方案更狠:5 颗 RGB 相机加 1 颗 ToF 加 lMU,全塞在一个身体里。

六十年,每一次代际穿越都解决了上一个十年的问题,却又为下一个十年埋下了更复杂的种子。

堆到临界点:融合方案的物理缺陷

「堆传感器」在行业内有个体面的名字——多传感器融合方案。这条赛道上挤满了厂商,所有人都在同一条旧路上加速。但加速的同时,一个尴尬的现实越来越难被忽视:装得越多,割裂越深。机器人身上挂满了传感器,可不同数据之间仍然是割裂,模型需要花大量成本去做对齐、做融合。

有行业资深从业者在公开场合直言:目前主流的 3D 结构光、激光雷达、iToF 及双目立体视觉四条路线并存,没有一家整机厂商只依赖单一技术,这本身就是融合方案「不得已而为之」 的注脚。传感器越多,融合越复杂,边际成本越高。

然而,时间行进到 2026 年,这条「堆传感器」的路,似乎走到了一个微妙的临界点。

激光雷达厂商集体寻找「 图像化」之路,将车载激光雷达感知能力从点云级迈入图像级;头部激光雷达厂商还推出 6D 全彩激光雷达超感光芯片,剑指空间智能与物理 Al。所有人都在找一个答案,但仍然是把融合做得更好,没想过换一条路试试。

目前,主流厂商习惯用「组合拳」 ,远距离,交给激光雷达类传感器。以 dToF 为核心,配合 CMOS 与 IMU,主打长距建图与定位导航,主流产品最远测距 70 米,稳定精度达厘米级,机器人靠它做全局避障。

近距离,交给高精度深度相机。以散斑结构光或 ITOF 与 IMU 一体化集成,专注机械臂末端的高精度操作,在 8 米范围内实现±5mm 的稳定感知,机器人靠它「看」清细节。

两套系统加起来,试图覆盖机器人的「远」和「近」、导航与操作、移动与安全作业。客观地说,这是目前工程上最成熟的方案之一,毕竟能把多传感器硬件同步精度做到了小于 1ms,已经是顶尖水平。

但此种方案,从原理上绕不开的三个问题:

视差。多个传感器物理位置不同,看到的角度不同,后端融合时必然存在对齐误差。

时间同步。不同传感器采样频率不同,数据到达算法的时间不同,拼在一起的世界模型天然存在「时间差」。对于高速运动的物体,这个差就是失控的距离。

材质盲区。高反光金属、透明玻璃、亮晶晶的薄膜,光要么穿透,要么镜面反射,传统算法拿到的点云是残缺的,甚至是完全空白的。

这三个问题,不是算法不够好能解决的。它们是「先成像、后计算」这条技术路线自带的物理缺陷。

当「堆传感器」走到临界点,行业才意识到:第六次代际穿越,不能再是「加一颗传感器」 ,而必须是「换一种看的方式」。

第三条路线:先计算,后成像

2026 年 8 月,杭州。时空张量机器人——这家来自杭州的硬科技公司,将在 2026 世界机器人大会(WRC)上全球首发其核心产品 :7D 空间智能视觉传感器「天眼 ·Tensopt」。

它选择的路线,和主流融合方案完全不在一条赛道上。

时空张量提出了「基于高时间分辨的空间计算智能成像」,核心逻辑四个字:先计算,后成像。

拆解开来,是一套自研的「 一路双光」光路架构——一条物理光路、一枚传感器,既有空间距离感知,同时又有二维语义感知。纳秒级脉冲激光负责测距与三维重建,皮秒级时序同步与单光子级门控成像负责高清可视化感知,照明和成像在同一时刻、同一光路里完成。

这是什么概念?

传统相机的工作方式是:光进来,传感器记录,然后交给芯片去算。时空张量的 7D 空间智能相机把这个过程反过来了,它在光子到达传感器之前就开始计算。

「 一路」是硬件形态,「双光」是功能分工。既能测距又能二维彩色成像。它不依赖多传感器硬件拼接,从物理层面消除了多传感器融合的视差与时间同步问题。

时空张量用了一个词来定义这条路线:「超越融合」。

7D:把全光函数的七个维度,融进一枚传感器

光学领域,一条完整的光线需要 7 个维度,也就是计算机视觉里常说的「全光函数」 。时空张量将这 7 个维度融合进一枚传感器:X / Y / Z 三维坐标 + RGB 语义 + 时间戳,叠加脉冲飞行时间测距。

传统方案需要把摄像头 + 激光雷达 + 毫米波雷达拼在一起使用,而时空张量的空间智能相机仅需要一台相机、一条光路、一个物理信号,即可实现感知统一。

落到机器人场景的具体参数上:

感知量程 0.15m-30m,近距离毫米级精度,中远距离厘米级精度。一个相机,同时覆盖远距导航避障和近场精细操作。换句话说,7D 空间智能相机的感知能力,是前面提到的行业顶尖主流方案中「移动之眼」加「操作之眼」之和。

原生输出超过 3000 万点/秒的超稠密点云。前文提到的主流方案,原生点云密度远低于这一量级。点云越稠密,物理世界的空间几何关系和语义属性还原越不失真。

全分辨率 25Hz 实时空间点云生成。行业顶尖的主流方案, 目前全分辨率空间点云生成速度为 10Hz,用于对运动目标的空间状态进行动态捕获。

内置 Al 算力。时空张量 7D 空间智能相机自己通过计算成像直接输出深度信息和彩色点云,无需借助外部算力资源,而主流方案需要外部算力才能得到成像结果。

时空张量的 7D 空间智能相机每一项与行业主流方案相比都遥遥领先!

真正打动产业的,是高反光和高透明

参数再漂亮,不如一个场景来得有说服力。

家庭服务。机器人进厨房帮人洗碗,玻璃杯、透明保鲜膜、不锈钢锅——全是传统视觉的盲区。光要么穿透要么镜面反射,点云残缺,机器人抓不住杯子,甚至会把碗碰碎。「天眼」凭借「先计算、后成像「 的物理原理,直接对空间光场的占用率进行测量,不依赖表面反射特性,因此能够实现对透明玻璃、高反光金属、纯白墙面、微光暗环境等传统深度相机和激光雷达反复失效的边缘场景进行无空洞完整重建。玻璃、金属、透明膜,在它面前没有盲区。

精密装配。3C 电子产线上,手机主板插件间隙小于 0.1mm,机械臂末端需要微米级定位精度。传统视觉在反光焊点、金属引脚面前频繁失准,良率上不去。 「天眼」 以毫米级空间定位精度、每秒超 3000 万点的真图像级稠密点云,为机器人的「手眼协同」提供了高精度的精密数据底座,让机械臂在毫米级操作空间里稳定作业,时空张量团队将其概括为「最后一毫米」。

物流分拣。电商仓库里包裹形态各异、堆叠无序,透明胶带封 口的纸箱、亮面包装袋、异形软包,传统视觉需要大量样本训练,遇到透明材质直接失效。「天眼」超稠密点云还原出完整的空间几何关系,对于一个巴掌大小、结构复杂的异形工件,「天眼」可以用数百个精确的三维点来刻画其完整轮廓,而传统方案可能只有寥寥几十个采样点。

户外作业。配送机器人在强光、眩光、逆光环境下穿行,传统摄像头过曝、激光雷达信号衰减。「天眼」抗干扰能力达 100KLux,在单一光路内完成照明与成像,不受环境光变化干扰,机器人看到的不是「过曝的白片」,而是清晰的三维世界。

这些场景的共同特点是:它们都是传统多传感器融合方案「看不准」或「看不到」 的,而「天眼」从物理原理层面绕开了这个问题。

这套方案给产业带来的改变是实打实的:帮助客户减少 2-3 个传感器,标定成本降低 60% 以上,SLAM 精度提升 3 倍。

为什么是现在?

机器人视觉的路线之争,为什么在 2025-2026 年这个时间点迎来了实质性分野?

第一 ,VLA 模型的爆发 ,把视觉输入端的瓶颈放大了。 Google 的 RT-2、 Physical Intelligence 的 π0、智元的 Gen e Envisioner,这些端到端模型把视觉、语言、动作焊在了一起。模型越强,对输入端数据质量的要求就越高——稀疏的、有延迟的、有视差误差的点云,会让再强的模型也只能在「失真世界」里做推理。

第二 ,多传感器融合路线在工程上已经逼近极限。主流方案做到小于 1ms 同步精度,已经是物理层面的顶尖水平。要继续提升,靠堆叠更好的传感器、更精细的标定,边际效益急剧递减。

第三,机器人从专用走向通用,对「 眼睛」的要求从「 能用」变成「全场景」。工业分拣、精密装配、物流搬运、家庭服务——每个场景对视觉的要求都不同,但没有一个场景能容忍「盲区」。

这三股力量叠加,让「先计算,后成像」这条原本小众的路线,突然站到了行业舞台中央。

另外,时空张量还构建了全新数据采集方式:非本体、非穿戴,第三人称视角为主、第一人称视角为辅,分布式部署于真实场景为主,数据脱离本体束缚、可跨硬件复用。至此,数据的「质」与「采」形成闭环,「天眼」保证源头高保真,「天录」保证高效可复用,二者共同抬升「数据圈地运动」 的实际上限。

时空张量的商业化路径也印证了这一点。截至目前,已与两家新能源汽车头部主机厂签订协议,车载版空间智能相机进入上车测试阶段。在具身智能赛道,正在嵌入下一代人形机器人的视觉系统。

写在最后:机器人真的需要「像人一样看」吗?

回到这篇文章开头那个问题:具身智能「数据圈地运动」的上限,到底在哪儿?

当机器人的眼睛能够天然输出具备真实尺度、稳定时空关系、并能高效进入训练与推理流程的 7D 空间数据,行业拼命追逐的「 百万小时高质量数据」 ,将不再依赖事后融合与人工清洗,而是在源头就以「物理级正确」的方式被生产出来。「天眼」所感知的数据天然具备连贯、完整、统一的时空属性,无需繁琐的标定、对齐与融合算法,为行业提供了通往物理 AI 世界的基础设施。

「 一路双光」、空间光切片、计算成像,这些技术的本质,是为机器人量身定义一种只有机器才能做到的「看」。同一束光,在同一个光路里,同时完成照明、成像、测距、三维重建。没有视差,没有时差,没有盲区。

数码相机取代胶片的时候,柯达不是输在胶卷质量上。智能手机取代功能机的时候,诺基亚不是输在按键手感上。每一次底层逻辑的切换,赢家都不是「把旧方案做得更好的人」 ,而是「重新定义了问题的人」。

又一个具身智能的十年,未来,可能比我们以为的来得更快。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。