论文题目:双目立体视觉研究进展与应用

期刊:激光与光电子学进展

摘要:双目立体视觉模仿人类视觉系统对环境进行三维感知,通过对校正后的左右图像进行立体匹配获取两幅图像的 视差,再根据三角测量原理计算出场景的深度,在近几十年中一直是计算机视觉领域的研究热点,取得了一系列的进展。 传统的立体匹配方法采用手工设计的特征进行立体匹配,研究表明,这类方法对弱纹理或重复纹理区域以及遮挡区域表 现不佳。近年来,基于深度学习的立体匹配方法取得了显著的进展,表现出了强大的应用潜力。本综述对这一不断发展 的领域进行全面的调研,讨论不同方法之间的优点和局限性,介绍市面上的双目产品,并展望该领域的研究与应用前景。

论文概述

这是一篇发表在《激光与光电子学进展》2023年第8期上的综述文章,由奥比中光科技集团和深圳奥芯微视科技有限公司的研究团队撰写。论文系统回顾了双目立体视觉领域的研究进展,特别关注立体匹配算法的发展。


双目立体视觉研究全景扫描——从传统方法到深度学习的演进之路

引言:像人类一样感知三维世界

你是否想过,为什么我们能够准确判断物体的远近?这要归功于我们的双眼视觉系统。双目立体视觉技术正是模仿人类视觉系统,通过两个相机捕获同一场景的不同视角图像,通过立体匹配算法计算视差,进而恢复场景的三维信息。

一、双目立体视觉的核心挑战

1.1 什么是立体匹配?

立体匹配是双目视觉的核心任务。简单来说,就是要在左图中找到一个像素点(x, y),然后在右图中找到它的对应点(x_R, y_R)。视差d = x - x_R,而深度Z与视差的关系为:

Z = BF/d

其中B是两个相机之间的基线距离,F是等效焦距。

1.2 为什么这么难?

论文指出了几个关键难点:

  • 弱纹理或重复纹理区域:想象一面白墙,怎么找对应点?
  • 遮挡问题:左图能看到但右图被遮挡的区域
  • 高反光区域:镜面、玻璃等材质
  • 透明物体:如玻璃杯、塑料瓶

经过40多年的研究,这些问题仍未完全解决,至今仍是研究热点。

二、从传统方法到深度学习的演进

2.1 传统方法时代(2002-2015)

Scharstein等人在2002年提出的经典框架将立体匹配分为四个步骤:

  1. 匹配代价计算:计算两个像素点的相似度
  2. 代价聚合:利用周围信息优化匹配代价
  3. 视差计算:选择最优视差
  4. 视差优化:后处理改善结果
关键传统方法:
  • AD-Census(2011):结合绝对差和Census变换
  • 引导滤波(2011):保持边缘的同时进行代价聚合
  • SGM半全局匹配(2008):平衡精度和效率,被Intel D435等产品采用

传统方法的优点是可解释性强、计算效率高,但在复杂场景下精度有限。

2.2 混合方法过渡期(2015-2016)

2015年是转折点。Zbontar等人的MCCNN首次将卷积神经网络用于图像块匹配:

  • 设计了快速结构MCCNNFast和精确结构MCCNNAcc
  • 只在代价计算阶段使用CNN
  • 代价聚合和后处理仍用传统方法

这类方法被称为混合方法,在当时取得了最好的结果,但速度很慢。

2.3 端到端深度学习时代(2016至今)

第一阶段:DispNet开创先河(2016)

DispNet是首个端到端视差估计网络,结构类似光流估计网络FlowNet:

  • DispNetS:直接将左右图拼接输入
  • DispNetC:引入相关操作构建代价空间

虽然精度有限,但开创了端到端学习的先河。

第二阶段:3D卷积崛起(2017-2019)

这一时期的代表性工作:

GCNet(2017):

  • 使用3D卷积进行代价空间聚合
  • 引入soft argmax实现可微的视差回归
  • 奠定了3D卷积架构的基础

PSMNet(2018):

  • 空间金字塔池化(SPP)获取大感受野
  • 堆叠沙漏(stacked hourglass)结构
  • 发表时KITTI排名第一

GANet(2019):

  • 将SGM思想融入网络
  • 引导聚合机制
  • 显著提升精度
第三阶段:迭代优化革命(2020-2022)

RAFT(2020)获得ECCV最佳论文奖,带来了范式转变:

  • 构建4D全局代价空间
  • 使用GRU多次迭代更新视差
  • 强大的泛化能力

受RAFT启发的工作:

  • RAFT-Stereo(2021):多分辨率更新、慢快GRU策略
  • CREStereo(2022):自适应分组局部相关、递归更新模块,在Middlebury和ETH3D数据集第一名
第四阶段:Transformer的引入(2021至今)

Transformer在NLP和CV领域的成功启发了立体匹配研究:

STTR(2021):

  • 从seq2seq角度看待深度估计
  • 使用自注意力和交叉注意力
  • 验证了Transformer的可行性

GMFlow和FlowFormer:

  • 在光流估计领域超越RAFT
  • 全局匹配+Transformer编码
  • 无需大量迭代即可取得优秀结果

三、如何让网络跑得更快?

高精度网络往往计算量巨大。论文总结了三类加速方法:

3.1 轻量化模型设计

基于2D卷积的轻量网络:

  • StereoNet(2018):Google设计,60fps实时网络
  • MobileStereoNet:使用可分离卷积大幅降低参数量
  • HITNet(2021):不建立完整代价空间,采用层次化迭代

优化3D卷积网络:

  • BGNet(2021):双边网格学习进行代价空间上采样,加速4-29倍
  • AANet(2020):自适应聚合模块替代3D卷积

3.2 模型压缩

(1) 剪枝(Pruning):

  • 层间剪枝、特征图剪枝、卷积核剪枝
  • 关键是判断权重重要性:基于权重大小、BN层尺度、激活输出
  • 剪枝后需要微调恢复精度

(2) 量化(Quantization):

  • 训练后量化:在训练好的模型上量化,易于工程化
  • 训练量化:训练时即考虑量化,精度更高但训练复杂
  • 可降至8bit、4bit甚至1bit(BNN)

3.3 专用NPU加速器

以寒武纪CambriconX为例:

  • 支持稀疏网络加速
  • 相比GPU加速10.6倍
  • 能效提升29.43倍

四、数据集:训练的基石

论文详细对比了14个常用数据集:

4.1 真实数据集

  • KITTI2012/2015:自动驾驶场景,稀疏标签(激光雷达)
  • Middlebury:室内场景,稠密标签(结构光扫描)
  • ETH3D:高精度地面真值
  • DrivingStereo:大规模驾驶数据,182,188对图像

4.2 合成数据集

  • SceneFlow(2016):39,049对,完全稠密标签
  • IRS(2019):室内机器人场景
  • CRE(2022):最新合成数据集

关键问题:合成数据训练的模型存在域适应问题,在真实场景表现下降。

五、商业产品现状

论文对比了市面上的双目深度相机:

5.1 基于ASIC芯片的产品

Intel RealSense D455:

  • 使用SGM算法
  • ASIC深度计算引擎
  • 低成本、低功耗,便于大规模应用

奥比中光Gemini 2:

  • MX6600深度计算芯片
  • 支持深度RGB同步和多机同步
  • 六轴惯性传感数据

5.2 其他平台产品

  • Stereolabs ZED 2i:可能使用深度学习算法
  • OAK-D-Pro:集成VPU芯片
  • Rubedos VIPER:移动端GPU实现

关键优势:带有ASIC芯片的产品无需应用平台算力,直接输出深度图,适合消费级应用。

六、未来在哪里?

论文对未来提出了四个重要方向:

6.1 边缘端大规模应用

随着NPU、移动端GPU的成熟,基于深度学习的方法有望在边缘端实时运行。挑战:

  • 模型轻量化
  • 提升泛化能力(避免过拟合特定数据集)

6.2 复杂环境适应性

需要解决:

  • 恶劣光照(雨、雪、雾)
  • 特殊材质(透明、高反光、低反射率)

可能方案:

  • 硬件层面:改善图像采集质量
  • 算法层面:增强语义理解能力

6.3 高分辨率视差估计

现有方法多局限于<1920×1080分辨率。意义:

  • 感知小物体
  • 远距离目标检测

挑战:在保证效率的同时实现高分辨率。

6.4 稀疏几何表达

核心思想:场景深度可以用更紧凑的方式表达

  • 一面墙只需4个点即可完整表示
  • 用几何基元表示物体

潜在优势:

  • 减少网络参数
  • 提高效率
  • 改善泛化性能

七、我的思考

读完这篇综述,我有几点深刻感受:

7.1 深度学习已成主流

虽然传统方法仍有应用(如D455的SGM),但深度学习在精度上已占据绝对优势。RAFT等迭代优化方法展现出强大的泛化能力和精度。

7.2 工程化仍是瓶颈

学术界的SOTA模型往往难以直接工程化:

  • 计算量大
  • 泛化性差
  • 需要高端硬件

ASIC芯片方案是目前消费级应用的最佳选择。

7.3 Transformer潜力巨大

虽然目前还不成熟,但Transformer在立体匹配中已显示出:

  • 全局建模能力
  • 无需大量迭代即可达到好效果

这可能是未来的重要方向。

7.4 数据集仍需丰富

现有数据集主要集中在:

  • 自动驾驶(KITTI、DrivingStereo)
  • 室内场景(Middlebury、InStereo2K)

缺少:

  • 工业场景数据
  • 医疗场景数据
  • 更多样化的真实场景

结语

双目立体视觉技术从传统方法到深度学习,经历了近20年的发展,取得了显著进步。但正如论文指出的,从实验室到产品,从特定场景到通用应用,还有很长的路要走

未来,随着算法的进步、硬件的成熟和数据的丰富,双目立体视觉将在:

  • 自动驾驶
  • 机器人导航
  • AR/VR
  • 工业检测
  • 医疗辅助

等领域发挥越来越重要的作用,让机器真正像人类一样感知三维世界。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐