Qzone
微博
微信
盖世汽车讯 据外媒报道,比亚迪人工智能团队于7月29日发表了首篇研究论文《HyWorldVLA》,介绍了一种混合世界模型HyworldVLA。该模型结合了像素级和潜在空间世界建模,并采用视觉-语言-动作(VLA)架构,用于自动驾驶。HyWorldVLA在NAVSIM v1公开基准测试中取得了90.59的PDMS评分,超越了以往所有最先进的结果。该基准测试通过碰撞安全性、行驶区域合规性、安全距离、目标完成度和运动舒适性等指标来衡量实际驾驶质量。
图片来源:arxiv.org
该混合世界模型架构解决了自动驾驶世界模型中的一个根本性权衡问题。像素级模型通过预测未来视频帧来获取环境细节,但计算成本高昂且对视觉噪声敏感。潜在空间模型为了提高效率,在压缩的隐藏表示中运行,但可能会丢失对安全驾驶决策至关重要的真实世界细节。HyWorldVLA兼顾了两者:在训练过程中使用像素级监督作为“看门狗”,强制潜在空间保留足够的帧重建信息;同时在压缩空间中进行推理以提高效率。消融实验证实,移除像素级预测会使PDMS值从90.59降至87.50,而移除潜在空间处理则会降至89.91,这验证了这两个组件都是必要的。
训练流程分为三个阶段。首先,视频变分自编码器(VAE)在文本描述作为语义上下文的引导下,将连续的视频帧压缩成紧凑的潜在特征。其次,将图像、动作、语言和潜在特征转换为统一的离散标记,用于自回归的下一标记预测,同时对像素预测和潜在特征预测进行双重监督。像素标记预测起到质量保证作用,防止潜在特征表示崩溃。第三,动作生成模块将潜在特征与历史信息融合,生成轨迹输出,并通过对候选轨迹进行评分和直接生成连续轨迹来验证其有效性。
潜在特征监督权重至关重要:微调过程中不施加任何约束时得分为90.17,最优权重为0.1时得分为90.59,而过高的权重则降至89.75。这表明适度的约束既能保留预训练的语义信息,又不会限制模型发现与驾驶相关的表征的能力。
【以上内容转自“盖世汽车”,不代表本网站观点。 如需转载请取得盖世汽车网许可,如有侵权请联系删除。】