文章总结: 本文梳理自动驾驶端到端技术脉络,涵盖感知、预测与规划三大模块。重点分析Sparse4D等感知算法的时序融合,以及VADv2、DriveVLM等大模型架构。文章指出数据驱动是核心,融合视觉语言模型的方案正成为新趋势,有助于提升系统逻辑性与泛化能力,为自动驾驶算法研发提供参考。
综合评分: 85
文章分类: AI安全,车联网安全
自动驾驶端到端脉络整理
谈思实验室
2026年1月5日 16:53
上海
点击上方蓝字谈思实验室
获取更多汽车网络安全资讯
01
背景
自动驾驶感知最近似乎进入瓶颈期,接近一年的时间Nuscenes障碍物检测榜单都不再有更新,而大模型如火如荼的发展把数据驱动的AI发展逻辑也代入了自动驾驶领域。这篇博客主要是想把最近关注到的一些自动驾驶端到端的论文整理一下,捋出一些有价值的思路和想法。
参考VAD的论文思路,我会把端到端整体划分为3部分:
- 感知端到端
- 预测端到端
- 规划端到端-端到端整体架构
02
感知端到端
感知端到端这一块主要涉及到多传感器融合和时序融合。我想从障碍物和车道线这2个领域分别调一篇比较有代表性的论文聊一聊。
- 障碍物:Sparse4D v3: Advancing End-to-End 3D Detection and Tracking
nuscensce视觉障碍物检测SOTA方案,整体架构延续DETR一派,新增维护memory队列,其中巧思很多,主要有一下几点:
1、可学习query中新增队列实例做初始化(注意速度,是否拿来做障碍物的位置编码残差项?)
2、按属性拆分的attention
3、在模型中做实例信息整合,而无需显式匹配,在记忆队列里维护实例id
- 车道线:MapTracker: Tracking with Strided Memory Fusion for Consistent Vector HD Mapping
选择这篇主要是思路和效果都不错,放个效果图大家感受一下~
这篇文章比较吸引我的一个点在架构上
这篇文章和上面的Sparse4D一样是维护了2个记忆队列,可以把这些记忆队列理解为车道线的隐藏状态,这个状态在时序迭代中是越来越切合实际的。可以着重关注一下Minit的2个feature,可以看到在推理的初始阶段这2个tensor是不包含什么信息的,随着推理,这2个tensor的信息实际上由t-1时刻的特征替代,整个架构的前一部分是做t-1 – > t时刻的预测,后一个阶段是做t-1和t时刻的特征融合和t时刻的状态估计,整个流程和卡尔曼滤波几乎别无二致,这也算是一种致敬吧。
思考点:这里的所有CA能不能参考LLM换成因果attention?
03
预测端到端
1、FIERY: Future Instance Prediction in Bird’s-Eye View from Surround Monocular Cameras
虽然是21年的文章,但是确实非常经典
文章的预测部分引入一个隐藏的状态,这个状态满足个元素相互独立的多元正态分布,通过网络预测其期望和方差,再通过分布采样一个状态作为当前时刻的隐藏状态,这个隐藏状态又作为输入用来预测下一时刻的环境。
个人觉得这样建模是比较好的体现了未来的不确定性。
- Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction
把障碍物轨迹预测建模为多智能体+多运动模式的组合,核心点在下面这个公式,可以按MapTRV2的思路去理解,即智能体和运动模式看做正交的2个变量,通过2者间的组合可以构建其智能体运动空间
下面是不同运动模式的运动终点的可视化分析,可以看到不同运动模式的偏好
这篇文章的建模稍显复杂,感觉不是很必要,整体思路上参考一下就行了
04
规划端到端-端到端架构
这一部分主要介绍一下最近看的几篇比较流行的端到端架构,总结一下异同。
1、VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
首当其冲的这篇论文架构重点确实清新,指出了端到端的核心点,规划模块。实际上这篇论文很清晰的指出了规划模块的输入输出和约束。
输入包含几块:感知结果,原始图像信息,导航信息和自车运动信息。
输出:规划轨迹的概率分布
监督信号:实际轨迹与预测轨迹的KL散度
约束信息:地图和其他障碍物约束
最后提一句损失函数,有3部分:
-
轨迹的概率分布之间的KL散度
-
碰撞等约束条件的冲突损失
-
感知的监督损失
2. Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
这篇文章与VAD师出同门,一样优秀的可视化功底,几张图基本把训练流程、模型架构和模块间相互支撑的关系讲清楚了
这篇是VLM结合端到端的文章,重点主要在VLM的设计上,以下是VLM关注的几个问题:
-
场景描述
-
交通灯状态
-
VRU信息
-
其他障碍物的运动信息
-
自车的运动规划
-
运动规划的解释
这几个问题解释了规划的逻辑并为端到端提供高级的驾驶意图指导
这个图展示了VLM和E2E的信息交互,2个模块间的相互支撑很明显
2.1 DRIVEVLM: The Convergence of AutonomousDriving and Large Vision-Language Models
DriveVLM的架构跟Senna很像,都是VLm和E2E并行交互,但是某种程度上来说DriveVLM走的更远一些
上面是DriveVLM的架构,VLM的推理部分更加格式化,且推理之间的递进关系可能能帮助其推理逻辑更加缜密
VLM推理的3步:
-
分析理解场景,找出关键障碍物
-
分析关键障碍物,给出其状态和其与自车的交互信息
-
生成驾驶意图,分为3层:
3.1 meta-action:意图动作
3.2 decision:动作规划
3.3 Waypoints:具体的轨迹点
还给出了推理标注流程,数据集构建流程:
-
长尾目标挖掘和挑战的场景挖掘
-
人工过滤
-
关键帧挑选
-
场景标注
-
人工校验
3. EMMA: End-to-End Multimodal Model for Autonomous Driving
这篇文章是纯VLM支撑的端到端自动驾驶,输入图像和文本信息,输出感知和规划路径
基于CoT的规划,推理部分包含4个主题:
-
场景理解
-
关键目标
-
关键物体的行为描述
-
元决策(例如保持低速直行)
方案有些激进,但是一体化的思路值得参考
4. RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based
Reinforcement Learning
提出利用GS多视角图像,支持训练的反馈闭环
3阶段训练:
s1:感知预训练
s2:规划预训练
s3:规划策略网络强化学习
同时使用PPO强化学习和模仿学习
强化学习的4种反馈信息,GS生成能比较好的模拟这些corner case:
-
动态障碍物碰撞
-
静态账务碰撞
-
位置偏移专家轨迹
-
航向角偏移专家轨迹
来源:知乎@wnwn
https://zhuanlan.zhihu.com/p/27983835711
谈思-汽车出海安全合规(欧洲)
交流群
谈思 AutoSec Europe 峰会旨在搭建一个能融汇全球视野与中国实践、连接技术前沿与落地应用的国际性专业平台,以助力中国汽车应对在出海过程中面临的网络与数据安全合规痛点。从前沿技术研讨、合规要点解析到经验交流,都将通过本平台为您提供持续支持。社群已超过200人,需邀请加入,如需入群,欢迎添加社群小助手微信taaslabs01。
谈思-SDV&AIDV技术出海
交流群
诚邀行业同仁加入谈思SDV&AIDV出海技术交流群,聚焦软件定义汽车、AI定义汽车、下一代EEA、智能座舱、智能驾驶、软件架构、域控制器开发、芯片技术、软件工具等核心议题,欢迎大家加群交流探讨~~社群已超过200人,需邀请加入,如需入群,欢迎添加社群小助手微信taaslabs01。
end
谈思汽车媒体门户
精品活动推荐
AutoSec系列沙龙
专业社群
部分入群专家来自:
新势力车企:
特斯拉、合众新能源-哪吒、理想、极氪、小米、宾理汽车、极越、零跑汽车、阿维塔汽车、智己汽车、小鹏、岚图汽车、蔚来汽车、吉祥汽车、赛力斯……
外资传统主流车企代表:
大众中国、大众酷翼、奥迪汽车、宝马、福特、戴姆勒-奔驰、通用、保时捷、沃尔沃、现代汽车、日产汽车、捷豹路虎、斯堪尼亚……
内资传统主流车企:
吉利汽车、上汽乘用车、长城汽车、上汽大众、长安汽车、北京汽车、东风汽车、广汽、比亚迪、一汽集团、一汽解放、东风商用、上汽商用……
全球领先一级供应商:
博世、大陆集团、联合汽车电子、安波福、采埃孚、科世达、舍弗勒、霍尼韦尔、大疆、日立、哈曼、华为、百度、联想、联发科、普瑞均胜、德赛西威、蜂巢转向、均联智行、武汉光庭、星纪魅族、中车集团、赢彻科技、潍柴集团、地平线、紫光同芯、字节跳动、……
二级供应商(500+以上):
Upstream、ETAS、BlackDuck、NXP、TUV、上海软件中心、Deloitte、奇安信、为辰信安、云驰未来、信大捷安、信长城、泽鹿安全、纽创信安、复旦微电子、天融信、奇虎360、中汽中心、中国汽研、上海汽检、加特兰微电子、浙江大学……
人员占比
公司类型占比
文章
不要错过哦,这可能是汽车网络安全产业最大的专属社区!
首发!小米雷军两会上就汽车数据安全问题建言:关于构建完善汽车数据安全管理体系的建议
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:谈思实验室 《自动驾驶端到端脉络整理》