智驾网 | 2026-09-02 11:41 作者:零酱 0

小鹏打通智驾的「昨天今天明天」

L3 VLA 何小鹏 李先明
小鹏物理世界基座模型首次把「时间」纳入模型,AI 理解世界从3D空间跃迁至4D时空,让中国道路环境的「地狱难度」,变成中国智驾模型的「训练红利」。

一切的故事,要从一个赌约开始。


2025年12月,何小鹏曾与小鹏通用智能中心负责人刘先明立下赌约: 


如果第二代VLA在8月30日前在国内达不到特斯拉FSD V14.2在硅谷的整体效果,何先明将在金门大桥裸奔;如果达成目标,何小鹏则将在硅谷研发中心修建一座对标国内总部的中式风味食堂。


就在赌约公开之前,何小鹏刚刚在小鹏科技日上发布了第二代VLA,宣布去掉L「语言转译」环节,实现了从视觉信号到动作指令的端到端直接生成;且这套以第二代VLA为逻辑的物理世界模式可跨域驱动汽车、Robotaxi、机器人和飞行汽车。


彼时赌约中的两个人,何小鹏在机器人IRON被迫「剪腿自证」后哽咽;刘先明则在科技日之前的某次运动中「同样」摔伤了腿,不知道是不是对这个赌约或者机器人的受伤有什么预知能力。


好在,时间是个好东西。


图片


今年的8月27日,刘先明踩在Deadline之前宣布全新XOS 6.3.0大版本即将推送上车,小鹏G9L将首发搭载最新版本;差不多一年多前预告的「蒸馏版本」的图灵VLA 2.0 Lite也预计9月开启首批推送。


其实,何小鹏在发布会之前已经被曝出现在小鹏北美研发中心的新址,在这场分享会结束后,他在社媒发文发文:


「去年,我跟Xianming立下了一个有趣的赌约。今天,我想说一句:恭喜你们,硅谷食堂要来了!」


还是那句话,时间是个好东西,它让一场赌约最终走向双赢,而XOS 6.3.0大版本的最大的变化,就是可以理解「时间」。


问题是,时间到底是什么?


01.

智驾开始理解过去现在和将来


在刘先明的表述中,行业过去普遍停留在对静态3D空间的理解,而真实道路从来不是一张张静止的图片,而是一个连续变化、不断演进的动态过程。


图片


而小鹏此次升级的核心,是让模型第一次建立起对时间维度的完整认知,把过去的3D变成4D,从对空间的认知变成对时空的理解。


图片


这是一个有「时序」的渐进过程:


在「过去」:XOS 6.3.0通过 Infini-VLA 架构记住过去 30 秒的世界状态,让驾驶判断拥有真正的上下文记忆;


在「现在」:XOS 6.3.0通过 Streaming Inference(流式自回归推理)把「看→算→输出→再看」的离散模式,变成「边看、边想、边行动」的并行处理,将系统的响应速度和整体延时提升了300%。


在「将来」:XOS 6.3.0通过 X-Foresight 它能根据目标的位置、速度、运动趋势、道路结构等多维信息,推演未来6秒( 官方实验数据显示,模型最长推演时长为21秒)内周边交通参与者的可能行为,做出最合理、安全的驾驶决策;结合 Flow Matching 对多峰概率分布进行丝滑推演。


简单地说即是XOS 6.3.0正在尝试通过记忆过去、理解现在、预判未来,让 AI司机从「看见」走向「看懂」。


怎么证明AI司机不仅是「看见」而是「看懂」了呢?


刘先明在现场展示了一个能解释上述概念的场景:前车三点掉头,本车通过引入更长的时序理解前车意图。


图片


小鹏的车辆并未在前车挪腾期间盲目插空,而是一直耐心等其完成掉头后再迅速通过。


也就是说,在前车倒车的过程中,系统已准确识别前车意图并做出了等待的判断。


图片


另外,在面对突发障碍物(如几米内突然窜出的两轮车)时,得益于流式推理(Streaming Inference)的加持,系统可以做到毫秒级避让。


所谓「流式推理」通俗理解即是不等全部计算完成,系统一边计算、一边输出结果,它区别于传统的「全部算完再一次性返回完整结果」的批量推理。

这既提各了效率也保证了安全。


而当遇到对向车辆强行借道、占满车道的尴尬对峙时,系统则依靠世界模型的常识推演能力,提前预判对方未来的行驶轨迹,主动避让或寻找绕行空间。

当然,长时序建模、世界模型、端到端、流式推理,这些方向都不是第一次被讨论,难点始终在于,谁能够在有限芯片资源、车规级稳定性和监管要求之下,把这些能力以可规模交付的方式落到量产车上。


这其实也是物理AI相对于数字AI最大的不同:没有无限算力、需要超高时延要求、安全下限极高,有法规限制。


小鹏需要在这个充满约束的真实世界不断逼近物理极限。


02.

扩大泛化能力而非军备竞赛


要让这套时空架构在车载端侧跑起来,行业常见的思路是削减模型能力或者堆芯片,但小鹏在底层做了大量反直觉的选择,其中刘先明首先否认了削减模型能力:


「为什么我们需要一个更大的模型?」


刘表示,更大的参数量才能实现足够强的泛化能力,让快速进入全球市场成为可能。小鹏第二代VLA全新版本端侧模型参数量提升3.5倍,是主流VLA的15倍以上,但同时,不同于单纯加芯片的暴力逻辑,刘先明选择首先尊重物理世界的算力束缚:


「Scaling Law (扩展定律)的目的不是军备竞赛,而是通过更大的参数量实现更强的泛化能力和普世性。」


新版模型引入了MoT混合架构,通过针对不同任务动态分配模型能力,让时序信息在不同任务间复用,减少城区道路、园区、泊车等不同场景之间的任务干扰,把不同的问题交给不同的「专家」,让模型在不同驾驶任务之间更加稳定地切换。从而在模型参数量扩大 3.5 倍、达到主流 VLA 十五倍以上的情况下,不带来线性的算力爆炸。


图片


「所有这些因素加在一起,让我们这个版本的综合安全能力提升了超过20倍。」


借助通过底层架构更新去平衡模型能力和端侧限制,所有的目的就是在量产版上实现其描述的能力。


而为了适配小鹏推出的更多车型,围绕这套新架构,小鹏同时推出了面向单图灵芯片Max版本的蒸馏方案。


图片


小鹏通过学习式Token压缩与蒸馏训练,把第二代VLA基座模型的核心能力迁移到算力更低的平台上,形成VLA 2.0 Lite版本,这一版本计划在9月开启首批推送,并由G9L Max率先搭载。


除了自家芯片版本,刘先明表示,双 Orin版本的后续推送也已排上日程,从一个侧面证实了第二代VLA跨车型、跨算力平台的基座模型能力,当然更好的证明是跨本体。


03.

「用做机器人的思维做智能汽车」


小鹏在去年发布第二代VLA大模型的同时,即提出了「三颗图灵芯片」的硬件部署方案。


彼时何小鹏在财报电话会中和后续官宣中曾明确:从G7、P7开始,Ultra版本将标配三颗自研图灵AI芯片,整车有效算力达到2250TOPS。


这三颗芯片的分工也很明确——两颗驱动智驾VLA大模型,负责感知、决策和驾驶控制;第三颗则用于智能座舱,与高通8295P协同驱动VLM多模态大模型,让车机具备视觉理解和自然语言交互能力。


2026 款P7+、G7以及后续 X9增程版等车型的Ultra版本,都是按照这个「2+1」的三芯架构量产的。


但在此之前,第三颗芯片的能力并未完全释放,直到今天,与其对应的小鹏自研的语言大模型来了。


「点亮的第三颗图灵芯片,就是这颗座舱的图灵芯片。」


图片


小鹏在新版本中引入了Master Agent,打通了VLA与VLM的能力,本质上是把整车架构从传统语音控制逻辑,升级为更接近机器人智能体的体系:


前端由自研OMNI多模态模型负责整合视觉、语音和环境信息;中间由更大的模型完成意图理解与任务推理,后端再通过控制接口调用车端能力执行动作,使车辆从「识别一句指令并回复」,进化为「理解用户意图、结合环境判断并操作整车完成任务」。


这在车端一个直观的应用场景即是通过语音指令靠边停车、语音控制泊车和模糊语义导航。


系统在听懂指令之外,完成环境感知、路径选择、避障与动作执行,可以说这是今年大热的舱驾融合的一个直观进化。


而模糊语义导航则直观地展示了小鹏正在把「命令式交互」逐步推进到「意图式交互」,Master Agent 让整车第一次拥有了统一大脑。


图片


用「做机器人」的思维做智能汽车,正是刘先明所说的「Car as Robot」。


巧合的是,就在XOS 6.3.0发布前三天,小鹏在自家财报公布当日上午官宣其机器人业务获得超9亿美元的融资,刷新了中国具身智能行业单轮私募融资纪录。


据了解,本轮融资资金将用于软硬件研发、物理 AI 模型训练、数据采集、全链条量产基地建设,以及全球商业化拓展。


对于机器人业务,小鹏的目标已经聚焦在「把机器人真正造出来、卖出去」,而不是停留在演示阶段。


小鹏在2026年的秋天打出了一套构建「物理 AI 生态」的叙事组合拳——用资本事件证明机器人业务的独立性,用第二代VLA世界基座模型证明汽车与机器人的底层统一。


04.

物理AI的工业化流水线


「我们是物理AI公司。」


这是小鹏又一次对自身技术身份的重新强调。


图片


一直以来,小鹏管理层从未满足于把自己定义为一家只做智能汽车的汽车公司,小鹏在过去几年一直投入建设的,其实是一套支撑模型持续进化的底层系统,即AI infra。


图片


在小鹏的语境下,「AI infra」可以拆解成一条「物理AI工业化流水线」,包含四个具体环节:


1.数据体系


百万辆小鹏车在路上自动采集真实路况,回传到云端统一存储;工程师发现问题后,能从 1.1 亿个视频片段中快速检索相似场景,精准定位训练数据。


2. 训练集群


支撑这种迭代速度的,是小鹏建立的向量空间数据分析体系「Vector Space」,针对每一个用户反馈的问题,团队能在海量数据仓库中快速检索相似场景,精准定位训练数据,实现『问题发现→数据召回→模型训练→仿真验证』的闭环。大规模计算集群支撑模型快速迭代,让小鹏能在一个月内从 610 版本推进到 620、再到 630。


3. 仿真验证平台


新模型不用先装车,先在虚拟环境里跑几万遍,测试不同车型、天气、路况下的表现。小鹏的仿真日新模型测试量两个月内提升了近三倍,相当于用虚拟测试替代了大部分实车路测。


4. 车端算力


自研图灵芯片解决算力、功耗和延迟问题,让大模型能高效跑在车里,而不是只待在服务器上。


图片


这份物理AI的通用底座,上支撑自动驾驶和机器人两种本体,向下统管数据、算力和验证工具链。


图片


刘先明在分享末尾埋了一个容易被忽略的彩蛋:XLLM 架构让通用大模型能在单颗图灵芯片上高效运行。这意味着图灵芯片的野心不止于车和机器人,它正在具备作为独立边缘算力平台的可能——车、机器人、局部算力扩展,三块拼图合拢,才是小鹏眼中物理 AI 的完整闭环。


「⼀个基础能⼒、泛化能⼒、参数量⾜够⼤的基座模型,是可以扩展和流动的。它可以向上扩展成Robotaxi,也可以向下变成L2,也可以进⾏⼀定的横展。」


「这才是我们的核⼼护城河——不仅可以累积数据,还有统⼀化存储、多模态快速检索能⼒,以及⾮常⾼效的数据挖掘能⼒。」


05.

中国智驾模型的「训练红利」


不过,相比技术愿景的铺陈,其实际表现能达到何小鹏与刘先明赌约所言的能力要求吗——


「小鹏第二代VLA的国内体验=特斯拉FSD V14.2在硅谷」


为验证这一标准,何小鹏透露,他和同事们分别在中国、北美、欧洲和澳洲等地,试驾了小鹏第二代 VLA 以及全球友商的最新版本,得出的结论是:


在大路等常规道路场景下,小鹏第二代 VLA已与全球一流水准并驾齐驱;


而在小路博弈、园区和停车场等复杂场景下,体验甚至更好,支持从导航直接到达停车位,既高效又安全。


图片


今年7月,小鹏在德国仅用一周时间即完成了第二代VLA的本地化验收测试,这意味着一套主要基于中国数据训练出来的模型,在本地训练数据投入极少的情况下,依然能够在欧洲城市道路上保持较高一致性的体验表现。


「我认为这比友商的全球多区域泛化能力要明显领先。」


对一家中国车企来说,这比单次功能演示更有价值,因为它说明模型的泛化能力正在脱离对单一区域规则的高度绑定。中国道路环境的「地狱难度」,正在变成中国智驾模型的「训练红利」。


海外媒体对这一点的关注也很集中。


Autonomous Vehicle International和inElectronics & Design都提到,小鹏计划在2027年启动VLA 2.0全球交付,并将在海外先进行道路验证,再依据各市场监管审批逐步开放能力;其中inElectronics & Design直接把VLA 2.0定义为一次架构级变化,关注点放在端到端Vision-to-Action能力对于复杂路况泛化的支撑作用上。


随着大众被明确为VLA 2.0在中国市场的首个客户和商业合作伙伴,小鹏的角色也开始从新势力车企,延伸到能否向全球主流车企输出核心AI能力的技术公司。


摩根士丹利此前就将VLA 2.0形容为「a bold leap forward」,认为特斯拉将面临越来越多能在全球市场挑战其自动驾驶技术的中国公司。


这也从侧面说明,在全球资本和产业视角里,小鹏如今面对的已不只是国内智驾同行,而是更广义的全球自动驾驶技术竞争。


当然,技术领先不等于通关:明年上半年能否率先拿下欧洲DCAS监管许可,仍是小鹏要面对的硬骨头。


监管壁垒向来比技术壁垒更难啃,但至少这一次,中国公司手里握着的,不再是成本优势,而是模型本身的话语权。


写在最后:


如果把属于小鹏智驾的时序拉长,什么是它的过去、现在和将来?


在刘先明的回忆中,在过去的一年,小鹏团队的执念是「追上特斯拉」。


现在呢,小鹏已经把研发中心和中式食堂一起搬到了特斯拉家门口,但与之同步的是, 在小鹏二季度财报发布后,资本市场的短线反应偏谨慎,市场对短期盈利和后续增长指引仍存疑虑。


第二代VLA和「物理AI」发布会强化了小鹏的技术叙事,但技术叙事要转化为估值修复,仍需财务和交付层面的进一步验证。


那将来呢?


刘先明其实在分享会的一开始就说明了:物理AI最终就是要尝试去理解物理世界,并且去尝试在物理世界中去行动:


「⼀家真正的AI公司,是要解决Unknown Unknown Problems(未知的未知问题)。」

智驾注:本文转载来源为智驾网,由AutoR智驾转载。
收藏 0 分享:
相关文章
关于智驾 关于投稿 商务合作