(综述)双目立体视觉研究进展与应用
论文题目:双目立体视觉研究进展与应用
期刊:激光与光电子学进展
摘要:双目立体视觉模仿人类视觉系统对环境进行三维感知,通过对校正后的左右图像进行立体匹配获取两幅图像的 视差,再根据三角测量原理计算出场景的深度,在近几十年中一直是计算机视觉领域的研究热点,取得了一系列的进展。 传统的立体匹配方法采用手工设计的特征进行立体匹配,研究表明,这类方法对弱纹理或重复纹理区域以及遮挡区域表 现不佳。近年来,基于深度学习的立体匹配方法取得了显著的进展,表现出了强大的应用潜力。本综述对这一不断发展 的领域进行全面的调研,讨论不同方法之间的优点和局限性,介绍市面上的双目产品,并展望该领域的研究与应用前景。
论文概述
这是一篇发表在《激光与光电子学进展》2023年第8期上的综述文章,由奥比中光科技集团和深圳奥芯微视科技有限公司的研究团队撰写。论文系统回顾了双目立体视觉领域的研究进展,特别关注立体匹配算法的发展。
双目立体视觉研究全景扫描——从传统方法到深度学习的演进之路
引言:像人类一样感知三维世界
你是否想过,为什么我们能够准确判断物体的远近?这要归功于我们的双眼视觉系统。双目立体视觉技术正是模仿人类视觉系统,通过两个相机捕获同一场景的不同视角图像,通过立体匹配算法计算视差,进而恢复场景的三维信息。
一、双目立体视觉的核心挑战
1.1 什么是立体匹配?
立体匹配是双目视觉的核心任务。简单来说,就是要在左图中找到一个像素点(x, y),然后在右图中找到它的对应点(x_R, y_R)。视差d = x - x_R,而深度Z与视差的关系为:
Z = BF/d
其中B是两个相机之间的基线距离,F是等效焦距。
1.2 为什么这么难?
论文指出了几个关键难点:
- 弱纹理或重复纹理区域:想象一面白墙,怎么找对应点?
- 遮挡问题:左图能看到但右图被遮挡的区域
- 高反光区域:镜面、玻璃等材质
- 透明物体:如玻璃杯、塑料瓶
经过40多年的研究,这些问题仍未完全解决,至今仍是研究热点。
二、从传统方法到深度学习的演进
2.1 传统方法时代(2002-2015)
Scharstein等人在2002年提出的经典框架将立体匹配分为四个步骤:
- 匹配代价计算:计算两个像素点的相似度
- 代价聚合:利用周围信息优化匹配代价
- 视差计算:选择最优视差
- 视差优化:后处理改善结果
关键传统方法:
- AD-Census(2011):结合绝对差和Census变换
- 引导滤波(2011):保持边缘的同时进行代价聚合
- SGM半全局匹配(2008):平衡精度和效率,被Intel D435等产品采用
传统方法的优点是可解释性强、计算效率高,但在复杂场景下精度有限。
2.2 混合方法过渡期(2015-2016)
2015年是转折点。Zbontar等人的MCCNN首次将卷积神经网络用于图像块匹配:
- 设计了快速结构MCCNNFast和精确结构MCCNNAcc
- 只在代价计算阶段使用CNN
- 代价聚合和后处理仍用传统方法
这类方法被称为混合方法,在当时取得了最好的结果,但速度很慢。
2.3 端到端深度学习时代(2016至今)
第一阶段:DispNet开创先河(2016)
DispNet是首个端到端视差估计网络,结构类似光流估计网络FlowNet:
- DispNetS:直接将左右图拼接输入
- DispNetC:引入相关操作构建代价空间
虽然精度有限,但开创了端到端学习的先河。
第二阶段:3D卷积崛起(2017-2019)
这一时期的代表性工作:
GCNet(2017):

- 使用3D卷积进行代价空间聚合
- 引入soft argmax实现可微的视差回归
- 奠定了3D卷积架构的基础
PSMNet(2018):
- 空间金字塔池化(SPP)获取大感受野
- 堆叠沙漏(stacked hourglass)结构
- 发表时KITTI排名第一
GANet(2019):
- 将SGM思想融入网络
- 引导聚合机制
- 显著提升精度
第三阶段:迭代优化革命(2020-2022)

RAFT(2020)获得ECCV最佳论文奖,带来了范式转变:
- 构建4D全局代价空间
- 使用GRU多次迭代更新视差
- 强大的泛化能力
受RAFT启发的工作:
- RAFT-Stereo(2021):多分辨率更新、慢快GRU策略
- CREStereo(2022):自适应分组局部相关、递归更新模块,在Middlebury和ETH3D数据集第一名
第四阶段:Transformer的引入(2021至今)
Transformer在NLP和CV领域的成功启发了立体匹配研究:
STTR(2021):
- 从seq2seq角度看待深度估计
- 使用自注意力和交叉注意力
- 验证了Transformer的可行性
GMFlow和FlowFormer:
- 在光流估计领域超越RAFT
- 全局匹配+Transformer编码
- 无需大量迭代即可取得优秀结果
三、如何让网络跑得更快?
高精度网络往往计算量巨大。论文总结了三类加速方法:
3.1 轻量化模型设计
基于2D卷积的轻量网络:
- StereoNet(2018):Google设计,60fps实时网络
- MobileStereoNet:使用可分离卷积大幅降低参数量
- HITNet(2021):不建立完整代价空间,采用层次化迭代
优化3D卷积网络:
- BGNet(2021):双边网格学习进行代价空间上采样,加速4-29倍
- AANet(2020):自适应聚合模块替代3D卷积
3.2 模型压缩
(1) 剪枝(Pruning):
- 层间剪枝、特征图剪枝、卷积核剪枝
- 关键是判断权重重要性:基于权重大小、BN层尺度、激活输出
- 剪枝后需要微调恢复精度
(2) 量化(Quantization):
- 训练后量化:在训练好的模型上量化,易于工程化
- 训练量化:训练时即考虑量化,精度更高但训练复杂
- 可降至8bit、4bit甚至1bit(BNN)
3.3 专用NPU加速器
以寒武纪CambriconX为例:
- 支持稀疏网络加速
- 相比GPU加速10.6倍
- 能效提升29.43倍
四、数据集:训练的基石
论文详细对比了14个常用数据集:

4.1 真实数据集
- KITTI2012/2015:自动驾驶场景,稀疏标签(激光雷达)
- Middlebury:室内场景,稠密标签(结构光扫描)
- ETH3D:高精度地面真值
- DrivingStereo:大规模驾驶数据,182,188对图像
4.2 合成数据集
- SceneFlow(2016):39,049对,完全稠密标签
- IRS(2019):室内机器人场景
- CRE(2022):最新合成数据集
关键问题:合成数据训练的模型存在域适应问题,在真实场景表现下降。
五、商业产品现状

论文对比了市面上的双目深度相机:
5.1 基于ASIC芯片的产品
Intel RealSense D455:
- 使用SGM算法
- ASIC深度计算引擎
- 低成本、低功耗,便于大规模应用
奥比中光Gemini 2:
- MX6600深度计算芯片
- 支持深度RGB同步和多机同步
- 六轴惯性传感数据
5.2 其他平台产品
- Stereolabs ZED 2i:可能使用深度学习算法
- OAK-D-Pro:集成VPU芯片
- Rubedos VIPER:移动端GPU实现
关键优势:带有ASIC芯片的产品无需应用平台算力,直接输出深度图,适合消费级应用。
六、未来在哪里?
论文对未来提出了四个重要方向:
6.1 边缘端大规模应用
随着NPU、移动端GPU的成熟,基于深度学习的方法有望在边缘端实时运行。挑战:
- 模型轻量化
- 提升泛化能力(避免过拟合特定数据集)
6.2 复杂环境适应性
需要解决:
- 恶劣光照(雨、雪、雾)
- 特殊材质(透明、高反光、低反射率)
可能方案:
- 硬件层面:改善图像采集质量
- 算法层面:增强语义理解能力
6.3 高分辨率视差估计
现有方法多局限于<1920×1080分辨率。意义:
- 感知小物体
- 远距离目标检测
挑战:在保证效率的同时实现高分辨率。
6.4 稀疏几何表达
核心思想:场景深度可以用更紧凑的方式表达
- 一面墙只需4个点即可完整表示
- 用几何基元表示物体
潜在优势:
- 减少网络参数
- 提高效率
- 改善泛化性能
七、我的思考
读完这篇综述,我有几点深刻感受:
7.1 深度学习已成主流
虽然传统方法仍有应用(如D455的SGM),但深度学习在精度上已占据绝对优势。RAFT等迭代优化方法展现出强大的泛化能力和精度。
7.2 工程化仍是瓶颈
学术界的SOTA模型往往难以直接工程化:
- 计算量大
- 泛化性差
- 需要高端硬件
ASIC芯片方案是目前消费级应用的最佳选择。
7.3 Transformer潜力巨大
虽然目前还不成熟,但Transformer在立体匹配中已显示出:
- 全局建模能力
- 无需大量迭代即可达到好效果
这可能是未来的重要方向。
7.4 数据集仍需丰富
现有数据集主要集中在:
- 自动驾驶(KITTI、DrivingStereo)
- 室内场景(Middlebury、InStereo2K)
缺少:
- 工业场景数据
- 医疗场景数据
- 更多样化的真实场景
结语
双目立体视觉技术从传统方法到深度学习,经历了近20年的发展,取得了显著进步。但正如论文指出的,从实验室到产品,从特定场景到通用应用,还有很长的路要走。
未来,随着算法的进步、硬件的成熟和数据的丰富,双目立体视觉将在:
- 自动驾驶
- 机器人导航
- AR/VR
- 工业检测
- 医疗辅助
等领域发挥越来越重要的作用,让机器真正像人类一样感知三维世界。
更多推荐
所有评论(0)