在自动驾驶(Autonomous Driving,简称“智驾”)领域,过去十年(2015–2025)是一场从**“人工定义规则(Rule-based)”“端到端数据驱动(End-to-End Data-driven)”**的范式革命。

智驾的演进不仅仅是避障能力的提升,更是底层架构从“机械逻辑”向“具身智能”的重构。


一、 算法架构:从“代码堆砌”到“神经网络原生”

  • 2015-2019(模块化时代): 智驾系统被拆分为感知、定位、预测、规控四个独立模块。每一层都由工程师编写数万行 if-else 逻辑。

  • 痛点: 无法穷尽现实世界的极端场景(Corner Cases),模块间的“信息损耗”导致系统在复杂路口频频接管。

  • 2020-2022(BEV+Transformer): 特斯拉引入 BEV(鸟瞰图) 架构。通过 Transformer 将多个摄像头的 2D 图像实时融合成统一的 3D 空间。

  • 2023-2025(端到端大模型): 模仿人类直觉的 VLA(视觉-语言-动作) 架构成为主流。传感器数据直接输入一个统一的深度神经网络,输出转向、加减速指令。不再依赖手写规则,而是让 AI 具备了“驾驶常识”。


二、 感知进化:从“依赖地图”到“感知即地图”

  • 强图时代(2015-2021): 早期智驾高度依赖高精地图(HD Map)。车辆像是在预设的“虚拟轨道”上行驶,一旦道路修路或地图未更新,系统就会失效。
  • 无图时代(2022-2025): 随着 Occupancy Network(占用网络) 技术的成熟,车辆具备了实时感知物理空间占用的能力。
  • 现状: 2025 年,主流智驾已实现“无图化”。车辆能像人类一样,在完全陌生的城市路段依靠实时视觉语义理解完成顺畅驾驶,解决了高精地图维护成本高、鲜度差的顽疾。

三、 数据与训练:从“人工采集”到“数据飞轮”

维度2015 (实验/测试阶段)2025 (大规模量产阶段)
数据规模几十台改装车,人工拷贝硬盘数百万台量产车全天候回传高价值数据
标注方式纯人工 2D 框标注4D 空间自动标注 + 生成式 AI 自动打标
训练基石少量 GPU 节点万卡级超算中心 (如 Tesla Dojo, 华为算力云)
仿真能力简单的几何场景模拟World Model:生成符合物理规律的真实视频流

四、 平台底座:从“黑盒工具”到“全栈可观测平台”

为了支撑自动驾驶的安全性,平台层(协议、监控、日志、诊断)经历了重构:

  • 通信协议: 车内通信从低速 CAN 总线转向车载以太网。采用 DDS/Zenoh 协议,确保海量视频数据在各计算单元间以微秒级时延传输。

  • 监控与诊断: 引入 eBPF(内核级观测) 技术。

  • 在不干扰智驾推理的前提下,实时监控 Linux 内核的任务调度。如果神经网络推理出现 10ms 以上的抖动(Jitter),诊断系统能立刻定位是由于系统中断还是资源争抢。

  • 日志闭环: 发生紧急接管(Takeover)时,日志系统会自动截取前后 10 秒的 4D 快照。这些“失败经验”通过云端自动回传,通过“数据飞轮”转化为模型进化的养料。


五、 总结:2025 年的智驾奇点

2025 年,智驾技术正式进入了**“大规模社会化运作”**。

  • 商业落地: 城市全场景 NOA 已成为主流新能源车的标配,Robotaxi(无人驾驶出租车)开始在多个一线城市商业化运行。
  • 本质变化: 智驾已不再是一个独立的行业插件,它是**“物理 AI(具身智能)”**在移动出行领域的首个大规模应用。
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐