自动驾驶周报|格局大变!百度华科大“统一模型”对决清华“脑认知”,谁能终结自动驾驶“长尾问题”?
自动驾驶系统正从“多模态堆叠”走向“统一架构设计”,从“黑盒决策”走向“透明化推理”。过去一周,全球顶尖研究机构在统一模型构建、传感器融合鲁棒性、长时序数据压缩、人机协同决策、脑认知增强规划与多模态可解释性等领域取得关键进展。
- 华中科技大学与百度等提出的UniLION,以线性群组RNN实现多模态、多任务统一建模,摒弃Transformer二次计算负担;
- 爱尔兰与英国团队系统评估遮挡天气对LiDAR与相机融合性能的影响,揭示激光雷达在三维检测中的关键鲁棒性;
- 罗切斯特理工学院提出DejaView系统,利用长期时空冗余实现点云超高倍压缩,大幅降低自动驾驶存储成本;
- 麻省理工学院发布SAFe-Copilot,在语义层面融合人类意图与AI规划,重新定义人机共驾的协同机制;
- 清华大学通过脑电认知信号增强端到端规划,为自动驾驶注入人类决策机制;
- 首尔国立大学提出LMD方法,实现任意多模态融合模型的逐层贡献分解,打开感知黑盒。
- ……
本文精析6项前沿突破,从统一架构到可解释融合,从脑认知增强到长效数据压缩,一览自动驾驶核心技术演进。
1 — 基于BEVFusion:遮挡场景下LiDAR与相机3D检测性能全面基准
Evaluating the Impact of Weather-Induced Sensor Occlusion on BEVFusion for 3D Object Detection

论文内容:
准确的三维目标检测对于自动驾驶车辆在复杂真实环境中的安全行驶至关重要。鸟瞰图(BEV)表示方法通过将多传感器数据投影为自上而下的空间格式,已成为实现鲁棒感知的一种有力手段。尽管基于BEV的融合架构通过多模态融合已展现出优异性能,但环境因素(如雾、霾或物理遮挡)导致的传感器遮挡对三维检测精度的影响仍缺乏深入研究。本文利用BEVFusion架构,在nuScenes数据集上评估了遮挡对相机和激光雷达(LiDAR)输出的影响。检测性能采用平均精度均值(mAP)和nuScenes检测分数(NDS)进行衡量。结果表明,仅依赖相机进行检测时,中等程度的相机遮挡会导致mAP下降41.3%(从35.6%降至20.9%)。相比之下,激光雷达仅在严重遮挡下性能急剧下降,mAP降低47.3%(从64.7%降至34.1%),并对远距离检测造成严重影响。在融合场景中,影响取决于被遮挡的传感器:遮挡相机仅导致4.1%的小幅下降(从68.5%降至65.7%),而遮挡激光雷达则导致更显著的26.8%下降(降至50.1%),这表明模型在三维目标检测任务中更依赖于激光雷达。本文的研究结果凸显了未来亟需开展面向遮挡的评估方法研究,并开发更先进的传感器融合技术,以在部分传感器失效或因恶劣环境条件导致性能下降时仍能保持检测精度。
论文地址:
https://arxiv.org/html/2511.04347v1
2 — 清华大学:具身认知增强型端到端自动驾驶
Embodied Cognition Augmented End2End Autonomous Driving

论文内容:近年来,基于视觉的端到端自动驾驶已成为一种新的范式。然而,主流的端到端方法通常依赖于在标签监督下训练的视觉特征提取网络,这种有限的监督框架限制了驾驶模型的通用性和适用性。本文提出了一种名为 E 3 A D E^{3}AD E3AD 的新范式,主张通过视觉特征提取网络与通用脑电图(EEG)大模型之间的对比学习,来捕捉潜在的人类驾驶认知,从而提升端到端规划能力。为此,本文构建了一个用于上述对比学习过程的认知数据集。随后,本文在公开可用的自动驾驶数据集上,以主流驾驶模型为基线,研究了利用人类驾驶认知增强端到端规划的方法及其潜在机制。为了全面评估规划性能,本文同时进行了开环和闭环测试。实验结果表明,本文范式显著提升了基线模型的端到端规划性能。消融实验进一步验证了驾驶认知的贡献以及对比学习过程的有效性。这是首次将人类驾驶认知引入以改进端到端自动驾驶规划的研究工作;它也是将具身认知数据融入端到端自动驾驶系统的初步尝试,为未来受脑启发的自动驾驶系统提供了有价值的启示
论文地址:
https://arxiv.org/html/2511.01334v1
3 — 麻省理工提出人机共驾新范式,重新定义共享自治
SAFe-Copilot: Unified Shared Autonomy Framework

论文内容:自动驾驶系统在罕见、模糊或分布范围之外的场景中仍然表现脆弱,而人类驾驶员则能够通过情境推理成功应对这些情况。共享式自主控制作为一种有前景的方法应运而生,它在自动驾驶系统存在不确定性时引入人类输入,以缓解此类失效问题。然而,目前大多数现有方法仅将仲裁机制限制在低层次的轨迹层面,这些轨迹仅代表几何路径,因而无法保留底层的驾驶意图。本文提出了一种统一的共享自主框架,该框架在更高层次的抽象层面上整合人类输入与自主规划器。本文的方法利用视觉语言模型(VLM)从多模态线索(如驾驶员行为和环境上下文)中推断驾驶意图,并生成连贯的策略,以协调人类控制与自动驾驶之间的决策。本文首先在模拟人类环境中对该框架进行研究,结果显示其达到了完美的召回率,同时具备高准确率和高精确度。一项针对人类受试者的调查显示,参与者在92%的情况下认同系统的仲裁结果。最后,在Bench2Drive基准上的评估表明,与纯自主系统相比,该方法显著降低了碰撞率并提升了整体性能。基于语义化、语言表征层面的仲裁由此成为共享自主性的一项设计原则,使系统能够进行常识推理,并持续保持与人类意图的一致性。
论文地址:
https://arxiv.org/html/2511.04664v1
4 — 华科大、香港大学、百度等联合提出 基于线性分组循环神经网络的统一自动驾驶模型
UniLION: Towards Unified Autonomous Driving Model with Linear Group RNNs

论文内容:尽管Transformer在多个领域展现出卓越的性能,但其二次方复杂度的注意力机制在处理长序列数据时带来了显著的计算开销。本文提出了一种统一的自动驾驶模型UniLION,该模型基于线性群组RNN算子(即对分组特征执行线性RNN),能够高效地处理大规模LiDAR点云、高分辨率多视角图像,甚至时间序列数据。值得注意的是,UniLION作为一种单一且通用的架构,无需显式的时间融合或多模态融合模块,即可无缝支持多种专用变体(例如仅LiDAR、含时序的LiDAR、多模态以及多模态时序融合配置)。此外,UniLION在一系列核心任务中始终表现出具有竞争力、甚至达到最先进水平的性能,涵盖3D感知(如3D目标检测、3D目标跟踪、3D占据预测、鸟瞰图地图分割)、预测(如运动预测)以及规划(如端到端规划)等任务。这种统一的范式在保持卓越性能的同时,自然简化了多模态与多任务自动驾驶系统的设计。最终,本文希望UniLION能为自动驾驶领域中3D基础模型的发展提供一种全新的视角。
论文地址:
https://arxiv.org/html/2511.01768v1
5 — 罗切斯特理工学院联合悉尼大学 仅存储变化点云,实现高效3D数据压缩
Been There, Scanned That: Nostalgia-Driven LiDAR Compression for Self-Driving Cars

论文内容:一辆自动驾驶汽车每天可产生数TB的传感器数据,其中很大一部分是由LiDAR等深度传感器生成的三维点云数据。这些数据必须传输到云端存储,用于训练机器学习模型或进行分析(例如事故发生后的事故溯源调查)。为降低网络传输和存储成本,本文提出了DejaView系统。虽然以往的研究利用帧间冗余来压缩数据,但DejaView则在更长的时间尺度(数天乃至数月)上寻找并利用数据冗余,从而实现更高效的压缩。DejaView的设计基于一个关键观察:自动驾驶汽车的运行区域有限,且车辆通常每日行驶相似路线,因此它们每天采集的三维数据很可能与过去采集的数据高度相似。为了捕捉这一特性,DejaView的核心是一种“差分”操作,它将当前点云以与历史三维数据之间的差异形式紧凑表示。通过对两个月的LiDAR数据进行端到端实验,DejaView可在重建误差仅为15厘米的情况下,将点云数据压缩至原来的1/210。
论文主页:
https://arxiv.org/html/2511.00652v1
6 — 首尔国立大学提出LMD 实现任意多模态模型的逐层模态分解
Layer-Wise Modality Decomposition for Interpretable Multimodal Sensor Fusion

论文内容:在自动驾驶中,感知模型决策过程的透明性至关重要,因为即使单次感知错误也可能导致灾难性后果。然而,当使用多传感器输入时,由于传感器信息在融合网络中相互交织,很难确定每种模态对最终预测的具体贡献。为此,本文提出了逐层模态分解(LMD)方法,这是一种即插即用、与模型无关的可解释性技术,能够将预训练融合模型各层中的模态特异性信息分离开来。据本文所知,LMD是首个能够在自动驾驶传感器融合系统中将感知模型的预测结果归因于各个输入模态的方法。本文在自动驾驶场景下的相机-雷达、相机-激光雷达以及相机-雷达-激光雷达三种设置中,对预训练的融合模型进行了LMD评估。通过基于结构化扰动的量化指标以及按模态划分的可视化分解结果,验证了LMD的有效性,证明其具备解释高性能多模态架构的实际应用潜力。
如何高效转型Al大模型领域?
作为一名在一线互联网行业奋斗多年的老兵,我深知持续学习和进步的重要性,尤其是在复杂且深入的Al大模型开发领域。为什么精准学习如此关键?
- 系统的技术路线图:帮助你从入门到精通,明确所需掌握的知识点。
- 高效有序的学习路径:避免无效学习,节省时间,提升效率。
- 完整的知识体系:建立系统的知识框架,为职业发展打下坚实基础。
AI大模型从业者的核心竞争力
- 持续学习能力:Al技术日新月异,保持学习是关键。
- 跨领域思维:Al大模型需要结合业务场景,具备跨领域思考能力的从业者更受欢迎。
- 解决问题的能力:AI大模型的应用需要解决实际问题,你的编程经验将大放异彩。
以前总有人问我说:老师能不能帮我预测预测将来的风口在哪里?
现在没什么可说了,一定是Al;我们国家已经提出来:算力即国力!
未来已来,大模型在未来必然走向人类的生活中,无论你是前端,后端还是数据分析,都可以在这个领域上来,我还是那句话,在大语言AI模型时代,只要你有想法,你就有结果!只要你愿意去学习,你就能卷动的过别人!
现在,你需要的只是一份清晰的转型计划和一群志同道合的伙伴。作为一名热心肠的互联网老兵,我决定把宝贵的AI知识分享给大家。 至于能学习到多少就看你的学习毅力和能力了 。

第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。
如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)