8月27日,小鹏集团举办了以“TIME 时间”为主题的物理AI分享暨第二代VLA全新版本体验日活动。小鹏第二代VLA大模型迎来了发布以来的首次重大升级,全新XOS6.3.0版本将在小鹏G9L全球首发。此次模型升级的核心,是让AI开始真正理解时间,推动物理AI基座模型实现从静态3D空间理解到动态4D时空理解的底层能力跃迁。
在自动驾驶领域持续验证Scaling Law的小鹏,此次将端侧模型参数量扩大了3.5倍,与业内常见小模型拉开了数量级差距。通过超长时序的上下文记忆能力,AI司机真正做到了“看得准,会思考,反应快”。同时,全新版本引入了整车大脑Master Agent,实现VLA与VLM的驾舱融合,并将部分Robotaxi的L4级体验下放到了量产车型。
物理AI面对的真实世界并不是一张张静止的图片,而是一个连续演进的过程,模型想要像人类一样理解世界,必须首先理解“时间”。传统的模型虽然能识别车辆和行人,但车辆需要知道过去、现在以及未来可能发生什么。为此,第二代VLA全新引入Infini-VLA长时序架构,能够记住前30秒的世界,使驾驶判断拥有更长的上下文,连续发生的道路事件不再被割裂成独立画面。
为了跟上现实中不断变化的道路状况,第二代VLA同步提升了模型推理效率,采用Streaming Inference(流式自回归推理),从离散推理走向连续推理,端到端响应速度提升了300%。模型能够做到“边看、边想、边行动”的并行处理,面对前车突然刹停、行人折返或旁车强行加塞等突发情况时,反应如同老司机般娴熟敏捷。
不仅如此,小鹏X-Foresight预测世界模型首次上车,可预判6秒内发生的事情,推演周边交通参与者未来的可能行为。新版模型还引入了MoT混合架构,通过针对不同任务动态分配模型能力,减少城区、园区、泊车等不同场景之间的任务干扰。凭借更大的参数量、超前轨迹预判、超长有效时序和更快决策响应,多维综合安全能力提升了20倍。
在车机座舱方面,小鹏首次推出Master Agent,用做机器人的方式重构车机大脑,实现VLA与VLM的驾舱融合。它不仅能理解自然语言和模糊语义,还能将用户意图自动拆解为任务,调度智驾、底盘、座舱、车身控制等垂直Agent协同执行。新版本还带来了“语音靠边停车”和“语音控制就近泊入”功能,实现了从“语音指令”到“自主执行”的完整闭环,Robotaxi的L4级同源技术正加速下放至量产车。
小鹏作为一家面向全球的具身智能公司,正致力于通过统一技术底座打通汽车和机器人,推动物理AI进入规模化复用阶段。搭载第二代VLA的Robotaxi近日已获得广州市智能网联汽车远程测试资质,可在相关道路开展主驾无安全员测试。在机器人本体方面,搭载3颗图灵AI芯片的小鹏通用人形机器人IRON算力高达2250TOPS,已实现端侧部署并能自主完成复杂工作任务。小鹏机器人业务近期也完成了超9亿美元的首轮股权融资,投后估值超63亿美元。
为了实现科技普惠,小鹏通过学习式Token压缩与蒸馏训练,将第二代VLA基座模型能力部署到算力更低的平台。蒸馏后的图灵VLA2.0Lite将于9月首发搭载于小鹏G9L Max版本。同时,小鹏正全力推进第二代VLA的全球化部署,近期在德国完成了本地化验收测试,目标于明年上半年率先在欧洲获得监管许可并向海外用户交付。
这一系列进化的背后,依赖的是小鹏长期建设的完整AI Infra体系。依托百万车队和十亿级数据资产,小鹏构建了数据飞轮,单次训练数据吞吐量已达到1亿clips,比半年前增长10倍。通过不断沉淀AI Infra,小鹏正将模型能力的进化从单一汽车产品跨越至机器人等不同本体,持续拓展物理AI与真实世界交互的边界。
