
记住前 30 秒的世界,预见 6 秒未来
小鹏这次的发布会主题叫「TIME 时间」,乍一看有点抽象——直到你意识到,这恰恰是自动驾驶这几年最大的短板。过去的模型能「看」世界,却看不懂世界如何流动。这次第二代 VLA 的升级,本质上是在解决一个更根本的问题:让 AI 从理解空间,走向理解时空。

从 3D 空间到 4D 时空,AI 学会了记忆和预判
过去的智驾模型更像是在看一张张孤立的照片,识别车、识别人、识别红绿灯,但每一帧之间是割裂的。这次升级最核心的变化,是给模型装上了一条时间轴。
新引入的 Infini-VLA 长时序架构,让模型能记住前 30 秒发生的一切,把散落的画面串联成连续的事件线,而不是孤立的瞬间判断。与此同时,Streaming Inference 流式自回归推理取代了过去"看→算→输出→再看"的老模式,转向"边看、边想、边行动"的并行处理,端到端响应速度提升了 300%。更进一步,X-Foresight 预测世界模型让车辆不只是理解当下,还能推演未来 6 秒内周边车辆和行人可能的行为轨迹。
这三者叠加的结果,是模型面对前车急刹、行人折返、旁车加塞这类突发场景时,反应逻辑更接近一个经验丰富的老司机,而不是一套按帧计算的程序。

更大的模型,是为了更强的泛化
一个容易被忽略的细节是,端侧模型参数量扩大了 3.5 倍,达到主流 VLA 模型的 15 倍以上。这不是简单的堆参数,而是为全球化铺路——模型越大,泛化能力越强,才能在不依赖大量本地化数据的情况下,快速适应德国、欧洲等完全不同的路况和交规。
再叠加超长时序记忆、更快的决策响应和提前预判能力,小鹏给出的结论是综合安全能力提升 20 倍。这是一个相当激进的数字,也说明了这次升级不是渐进式优化,而是架构级的重做。
同时引入的 MoT 混合架构,让模型把不同驾驶场景比如城区、园区、泊车交给不同的"专家"模块处理,减少任务之间互相干扰,让切换更稳定。这背后的逻辑,和大语言模型里的专家混合思路一脉相承。
这次升级还有一个容易被智驾话题盖过、但同样重要的变化,就是 Master Agent 的登场。
以前的车机是"你说一句,它执行一句"。Master Agent 想做的,是让车理解你真正想完成的任务,自动拆解成子任务,再调度智驾、底盘、座舱等各个垂直 Agent 协同执行。比如新推出的语音靠边停车功能,你说一句话,车自己找地方、自己完成整个停车动作,不需要你再一步步指挥。
这其实是把 Robotaxi 上验证过的 L4 级体验,下放到了普通量产车上,技术同源,只是应用场景从车队运营扩展到了千家万户。

一套基座模型,同时喂养汽车和机器人
如果只看这次的智驾升级,可能会低估小鹏这盘棋的大小。真正值得关注的,是小鹏反复强调的定位——不是车企,是物理 AI 公司。
这套第二代 VLA 基座模型,不只是服务于汽车。搭载它的 Robotaxi 近日获得广州市智能网联汽车远程测试资质,可在指定道路开展主驾无安全员测试,意味着小鹏开始进入主驾无人的关键道路验证阶段。同一套能力也正在向人形机器人 IRON 落地,这台机器人搭载 3 颗图灵 AI 芯片,有效算力高达 2250 TOPS,已经实现端侧部署,无需远程遥操作即可自主完成复杂工作任务。
就在 8 月 24 日,小鹏机器人业务完成首轮股权融资,融资超 9 亿美元,投后估值超 63 亿美元,刷新了中国具身智能行业单轮私募股权融资纪录,由 IDG 资本领投,腾讯和阿里巴巴两家战略投资者也参与其中。资本市场的这份认可,某种程度上也是对小鹏从汽车向机器人延伸这条技术路线的验证。
值得一提的是,先进能力不会只留在旗舰车型上。通过学习式 Token 压缩与蒸馏训练,小鹏把第二代 VLA 的能力部署到了算力更低的平台,蒸馏后的图灵 VLA 2.0 Lite 预计 9 月开启首批推送,小鹏 G9L Max 版本将首发搭载,让更多老车主也能用上更安全可靠的城区辅助驾驶体验。
真正的护城河,从来不是单次的模型参数
小鹏在发布会上特别强调了一个观点:物理 AI 的竞争,不是看谁的模型参数一次性有多大,而是看谁能持续建设支撑模型进化的基础设施,并把每一次真实世界的反馈转化为下一轮能力提升。
这套 AI Infra 体系背后有一些具体的数字支撑:模型单次训练数据吞吐量已达到 1 亿 clips,是半年前的 10 倍。依托百万级车队和十亿级数据资产,小鹏正在构建一个正向循环——数据越多,问题发现越充分,模型进化越快,又产生更多数据。
这句话说得挺实在,模型会不断迭代,但真正形成壁垒的是持续迭代模型的能力;产品会不断变化,但真正产生长期价值的是支撑产品进化的基础设施。这也是为什么小鹏愿意把 AI Infra 单独拿出来讲——比起一次发布会的参数对比,这才是决定谁能在物理 AI 这条长赛道上走到最后的关键变量。
这次升级的真正意义,不在于某一项具体功能有多炫,而在于小鹏第一次让 AI 具备了记住过去、理解现在、预判未来的完整时间感,而这套能力,正沿着汽车、机器人、更多智能本体的路径,持续向更广阔的物理世界扩散。



