AeroScapes:用于语义分割的集成知识迁移
摘要
https://www.cs.cmu.edu/~deva/papers/aeroscapes.pdf
语义分割网络通常以严格监督的方式学习,即它们在相似的数据分布上进行训练和测试。在存在域偏移的情况下,性能会急剧下降。在本文中,我们探索了跨训练和测试分布的学习方法,这些分布在场景结构、视角和对象统计方面存在显著差异。受空中无人机机器人技术蓬勃发展的推动,我们考虑了从空中视角进行语义分割的目标任务。受Cityscapes[11]影响的启发,我们引入了AeroScapes,这是一个新的包含3269张空中场景图像(由一群无人机拍摄)的数据集,这些图像附有密集的语义分割标注。我们的数据集在视角、场景构成和对象尺度方面与现有的分割数据集(侧重于地面视角或室内场景域)不同。我们提出了一种简单但有效的方法,将从这些不同域(其中存在大量带标注的训练数据)中学习的知识迁移到我们的目标任务中。为此,我们通过每个源域逐步微调来训练多个用于空中分割的模型。然后,我们将这些模型集合视为一个可以聚合以显著提高性能的集成。我们与广泛使用的标准基线相比,实现了很大的绝对改进(8.12%8.12\%8.12%)。
1. 引言
自然场景的像素级语义分割是一项基本的视觉识别任务。近期,标准分割基准(如PASCAL VOC和Microsoft COCO[13, 29])上取得了显著进展。这一成功在很大程度上归功于卷积网络[50, 28, 8]。研究界还探索了包含物体(如草地和天空等无定形背景区域)和事物(如汽车和人等对象)类别的分割任务[11, 51]。其他应用领域包括生物医学成像[45, 10, 1]和卫星成像[23, 22, 33]等。特别是,自动驾驶技术取得了显著发展[46, 40, 2],并且可用的基准数量也在不断增加[11, 42, 37]。
分割基准:经典的语义分割基准主要关注一般场景,包括室内和室外设置[13, 29, 51, 36]。随着新型传感器的引入,许多分割基准开始关注特定场景(如城市环境的地面视角(用于自动驾驶车辆)[36, 11, 51]和直接俯瞰视角(用于轨道卫星)[41, 34, 23])的有限视角。然而,空中机器人技术的最新进展使得捕获不同的视角和场景变得更加容易。与之前研究的领域相比,这些领域在统计方面有很大的不同,这也是我们工作的重点。
域偏移:大多数深度分割模型都是经过精心设计和测试的,它们在高度相似的数据域上进行训练和测试以获得高精度。在存在域偏移的情况下,性能通常会急剧下降。事实上,数据集分布之间的域偏移对于学习能够很好地泛化到所有域的良好表示是一个主要挑战。有趣的是,另一种观点是,从这种多样化的源域中多源学习表示实际上可能有助于泛化,因为每个域都为目标任务提供了补充信息。在我们的工作中,我们介绍了一种简单的方法,用于从一组多样化的源域中为目标任务传输适当的信息。
知识迁移:我们转向迁移学习技术,这些技术允许我们将知识从现有域(存在大量带标注的数据)迁移到空中设置(存在有限带标注的数据)。尽管从源任务到目标任务的迁移学习是一个研究得很好的问题[38, 49],但到目前为止,最常见的方法是微调在源任务上预训练的模型[18]。事实上,几乎每个当代视觉识别系统都会将知识从ImageNet[43]迁移到感兴趣的目标任务。我们使用这种方法,通过在一组有限的空中训练图像上进行微调(例如,ImageNet → AeroScapes),生成一个全卷积网络(FCN)作为初始基线。然而,我们希望从多个域迁移知识,包括室内场景和城市环境的地面视角图像(见图1)。这些源域具有丰富标注的数据集,代表了我们想要利用的丰富知识源。但是,迁移这种知识的确切方式可能是独特且微妙的——一些室内物体(如人)可能出现在室外,而一些室外物体在空中视角下可能看起来相似(如自行车和摩托车)。

集成迁移:我们的主要见解是通过学习一个使用逐步微调训练的模型集成(ImageNet → PASCAL → AeroScapes,ImageNet → Cityscapes → AeroScapes等)来结合来自多个源的知识。直观地说,集成中的每个模型都利用不同的源知识,因此可能会犯不同的错误(例如,PASCAL模型可能在人身上更准确,因为它们在PASCAL中经常出现,而Cityscapes模型可能在车辆上更准确)。然后,我们最优地组合这些集成以获得最终预测。我们的集成模型相比强大的基线提高了8.12%8.12\%8.12%。综上所述,本研究的主要贡献如下:
- 我们提出了一种新的与架构无关的方法,用于将从为目标域之外的其他域定制的丰富标注源数据集中编码的多样化数据源中存在的知识迁移。
- 我们发布了AeroScapes空中语义分割数据集,该数据集用于研究从多个分割基准迁移知识的可行性。
- 我们使用全卷积网络对提出的基准进行了实验验证,并与采用广泛接受的最佳实践训练的强大基线相比,报告了显著改进。
2. 相关工作
语义分割:最先进的语义分割方法使用卷积网络来学习从图像空间到语义标签空间的像素到像素的映射[30, 9, 50, 28, 27, 12]。这些深度神经网络的成功可以归因于大量像素级标注的可用性以及深度网络从大数据中以端到端方式学习的能力。其中最成功的深度模型之一是全卷积网络(FCN)[30],它可以直接生成空间标签图作为输出。
多任务学习:多任务学习通过结合在每个域上通过互补任务学习到的特定域信息来提高模型的泛化能力[6]。这些方法通常通过学习跨域表征来学习一种可泛化的表征。受多任务学习范式的启发,我们提出了一个多源学习框架,该框架从多个源表征中学习单一目标域的表征。理论上,在多任务框架下可以从不同域中学习单一表征[25]。然而,在实践中,这需要在不同任务之间适当加权,并且需要大量的内存预算来同时处理多域数据。我们提出的多源学习框架证明能够以简单而有效的方式获得具有竞争力的结果。
知识迁移:对语义类别进行像素级标注是一项耗时的工作。大量文献采用半监督和弱监督学习方法来辅助这种繁琐的标注工作,这可以视为标签空间中的知识迁移。弱监督通常以类级标签[24]、特定点标注[3]、目标定位[48]或显著性机制[21]的形式提供。[39]中的作者为弱监督和半监督设置下的图像分割开发了一个期望最大化框架。最近,Chaudhry等人[7]结合了显著性图和注意力图来获得可靠的线索,以提高分割性能,并有效地从类标签中探索知识。
域适应:域适应方法旨在解决不同数据域之间分布的差异[26]。最近基于深度学习的方法通过最大化混淆[14, 15, 47]或显式最小化其跨域分布之间的距离[31, 32]来对齐域特征。据我们所知,[19]是唯一应用于语义分割的深度域适应方法。它涉及图像域的对抗训练和类分布对齐,这使得学习变得困难。许多域适应方法关注目标域中几乎没有或没有标记数据可用的场景。在我们的情况下,我们已经投入了大量精力来收集和标注AeroScapes数据集,因此使用成熟的微调范式来将知识从多个源域迁移到我们的目标AeroScapes域。
3. AeroScapes语义分割数据集
大多数经典的定位基准都侧重于理解图像中的对象,而忽略了对象出现的场景。背景元素为前景中的对象提供了语义和几何上下文[36, 5]。例如,自动驾驶汽车可能会根据其视线中识别出的道路进行导航,或者路径规划器可能要求汽车永远不要尝试在天空或水上停车。因此,必须教会基于地面或空中的自主代理识别前景和背景元素。
预见未来事件的能力是实时自主系统的关键属性,这些系统依赖于场景理解来进行决策。对于此类系统的适当测试平台必须包含标记的图像序列[42, 11]。依赖视觉场景理解进行决策的代理还必须学会将时间信息融入其表征中。因此,导航系统评估基准必须包含视频数据。
空中机器人使我们能够捕捉到以前未曾探索过的视角和多样化的环境。虽然自动驾驶汽车被限制在地面上行驶,但空中机器人可以在三维空间中自由导航,使我们能够捕捉到比以前基准更丰富、更多样化的视觉尺度和视角。上述限制促使我们收集了AeroScapes数据集{ }^{1},其中包含从在5-50米高度飞行的无人机上捕获的图像。与这些图像相关联的分割图用素材类(植被、道路、天空、建筑)和事物类(人、自行车、汽车、无人机、船、障碍物、动物)进行了标注(图2)。

AeroScapes数据集包含从141个视频序列中获取的3269张图像,并包含几个时间下采样的视频序列。AeroScapes中的类别分布反映了包含素材和事物标注的典型户外图像中观察到的数据不平衡。事物类的累积权重约占数据的1.51%(图3)。

数字只能讲述数据集(关于统计分布)的部分情况。图4显示了来自(a)ILSVRC数据集[43]、(b)ADE20k数据集[51]和(c)AeroScapes数据集的人物类的代表性样本。在ILSVRC(源域)上训练的深度卷积网络可能无法将其学习到的人物类表征与AeroScapes(目标域)中的人物类表征相关联。然而,ADE20k在人物类方面看起来与AeroScapes相似。在第5节中,我们观察到对象类别的视觉外观会影响系统在该特定类别上的性能。

4. 集成知识迁移
我们的主要论点是,分割基准的集合体代表了一种可应用于相关但不同任务的“元”知识源。重要的是,每个源都编码了大量经过整理的人类知识,这些知识通过图像和标签表现出来。我们提出,通过在每个数据源上训练深度网络来提取这些知识,并通过微调将这些知识迁移到目标域。
上述过程产生了一系列模型(每个数据源一个),这些模型可以应用于目标域。可以使用经典集成技术来聚合预测结果,也可以使用压缩技术将集体知识提炼到单个网络中[17, 4]。我们首先讨论促使我们认为这是一条合理的探究路线的直觉,特别是对于AeroScapes语义分割设置而言。
4.1. 动机
自然场景中的对称性和结构往往会产生意想不到的视觉对应关系。我们定性地检查了源域[13,36,51]和目标域(AeroScapes),以了解对象是否在不同的域中看起来视觉上相似。

我们发现了一些可预测的相似性——盆栽植物可能与户外场景中的树相似,交通标志和红绿灯可能与路灯等障碍物相似(图5a)。然而,在没有语义相似性的情况下,也可能出现视觉结构和对称性的相似性——室内场景中的风扇可能与室外的无人机相似,而室内场景中的淋浴器可能与远处的红绿灯相似(图5b)。由于我们仅从这些源域迁移与任务无关的知识,因此这些定性相似性可能会转化为定量性能的提升。
4.2. 数据驱动的知识迁移
知识迁移依赖于在学习一项任务时获得的知识,并将其应用于另一项任务。特定领域的大量像素注释的同时可用性以及深度网络的灾难性遗忘[35]特性,促使我们以数据驱动的方式研究知识迁移,作为解决注释有限任务的一种手段。具体来说,我们提出将从视觉上多样化的领域迁移知识,以学习对有限数据的目标领域进行改进的预测。
在监督学习环境中,我们有一组源域DsD_{s}Ds,∀s∈{1,2,…,S}\forall s \in\{1,2, \ldots, S\}∀s∈{1,2,…,S},其知识在相应的分类器集合CsC_{s}Cs,∀s∈{1,2,…,S}\forall s \in\{1,2, \ldots, S\}∀s∈{1,2,…,S}中紧凑地表示,这些分类器可以适应目标域Dtarget D_{\text {target }}Dtarget 中的任务。设Xtarget X_{\text {target }}Xtarget 是Dtarget D_{\text {target }}Dtarget 中的一张图像,Ytarget Y_{\text {target }}Ytarget 是其相关标签。我们使用分类器CsC_{s}Cs将Xtarget X_{\text {target }}Xtarget 投影到域DsD_{s}Ds中,以获得表示PsP_{s}Ps。这有助于我们整合来自域DsD_{s}Ds的知识:
Cs(Xtarget )⇒PsC_{s}\left(X_{\text {target }}\right) \Rightarrow P_{s}Cs(Xtarget )⇒Ps
每个表示PsP_{s}Ps中编码的互补信息被进一步用来学习一个函数fff,该函数将它们聚合起来以预测目标域标签Ytarget Y_{\text {target }}Ytarget :
f(P1,P2,…,PS)⇒Ytarget ^f\left(P_{1}, P_{2}, \ldots, P_{S}\right) \Rightarrow \hat{Y_{\text {target }}}f(P1,P2,…,PS)⇒Ytarget ^
4.3. 跨域迁移表示
最先进的语义分割方法基于深度神经网络。我们的像素分类器CsC_{s}Cs采用全卷积网络(FCNs)的形式。最近已经提出了许多架构[8, 27, 28]。然而,我们选择使用简单且有效的标准FCN架构进行分析。
由于神经网络包含数百万个参数,并且对训练数据分布非常敏感,因此直接将其作为目标域的特征提取器并不明智。我们通过微调全卷积网络(FCNs)中较高的任务特定层,同时冻结较低层,来使来自源域DsD_{s}Ds的投影PsP_{s}Ps适应目标域。我们相信部分微调网络是正确的策略,原因如下:(1)在网络中微调更少数量的参数可以避免在数据有限的目标域上过拟合。(2)至关重要的是,微调所有层可能会导致丢失存在于不同源域中的互补信息。仅微调任务特定层能够使网络集合利用来自不同源域的知识。
4.4 学习表示集合
我们旨在学习一种最优方法,用于结合分类器(Cs)\left(C_{s}\right)(Cs)产生的表示(Ps)\left(P_{s}\right)(Ps)。形式上,我们寻求学习一个函数f(C1,C2,…,CS;θ)f\left(C_{1}, C_{2}, \ldots, C_{S} ; \theta\right)f(C1,C2,…,CS;θ),该函数预测每个像素位置的分割标签。
受超列公式[16]的启发,我们通过连接每个空间位置的类别概率分布来结合SSS个模型的预测。给定训练图像XiX_{i}Xi及其真实分割图Ytarget iY_{\text {target }}^{i}Ytarget i,我们寻求优化以下目标:
minθ∑i∥f(P1i,P2i,…,PSi);θ)−Ytarget i∥2\min _{\theta} \sum_{i} \| f\left(P_{1}^{i}, P_{2}^{i}, \ldots, P_{S}^{i}\right) ; \theta)-Y_{\text {target }}^{i} \|^{2}minθ∑i∥f(P1i,P2i,…,PSi);θ)−Ytarget i∥2
我们将f(⋅;θ)f(\cdot ; \theta)f(⋅;θ)建模为单层回归网络,以学习每个独立源域对每个类的贡献程度。在第5.2节中,我们将此回归网络与其他用于结合每个源域预测的策略进行了比较。
5. 实验分析
在本节中,我们探索了所提出的集合知识迁移方法,以提高语义分割任务的性能。分析使用了Cityscapes[11]、PASCAL Context[36]和ADE20k[51]场景解析分割基准作为源域,以及AeroScapes数据集(第3节)作为目标域。
我们首先简要描述了我们在独立源域上为AeroScapes数据集学习模型的方法,以及用于结合这些单源模型的集合知识迁移网络设计。这些描述伴随着对这些模型性能的分析。我们以分析结尾,该分析证明了来自不同源域的互补信息提高了多源集合的性能。
实现细节:我们在所有实验中使用全卷积网络[30](FCNs)。我们通过随机梯度下降(minibatch大小为1、固定学习率为1e−101 e-101e−10、动量为0.99、权重衰减为5e−45 e-45e−4)来训练深度网络(第5.1节)。对于每个源域,我们冻结网络的前九个卷积层并微调后续层。AeroScapes数据集被分为80%-20%的训练-测试分割。我们确保视频序列中的图像帧仅包含在训练集或测试集中。在我们的所有实验中,都使用平均交并比(mIOU)指标来报告分割性能。回归网络(第5.2节)以固定的学习率1e−21 e-21e−2、动量0.9和权重衰减5e−45 e-45e−4进行训练。我们使用Caffe工具箱[20]来实现网络。
5.1. 从单一来源学习
最近,在PASCAL VOC数据集上对全卷积网络(FCN)风格的网络进行微调时,采取了先在MS COCO数据集[29]上进行微调的中间步骤。这带来了虽小但非微不足道的性能提升[50]。同样地,我们对几个从公共分割基准数据集中预训练的FCN 8步长网络进行了微调,以预测Aerospace数据集的结果。我们使用的源域是PASCAL Context[36]、ADE20k[51]和Cityscapes[11]。请注意,PASCAL Context和PASCAL VOC[13]数据集包含重叠的图像,但具有不同的分割图。
我们对所提出的框架进行了实证分析。我们首先微调了在Imagenet(ILSVRC)[43]上预训练的VGG-16卷积网络[44],以AeroScapes为基准方法。我们微调了在ILSVRC上预训练的VGG-16网络,以获得8步长的FCN网络。由于AeroScapes包含许多小尺度的对象类别,我们还训练了4步长和2步长的FCN网络。虽然我们发现与8步长的FCN网络相比,训练4步长的FCN网络在性能上有所提升,但2步长的FCN网络与4步长的FCN网络相比并没有显著提升。然后,我们在来自不同领域的预训练模型上重复此过程,包括PASCAL Context、ADE20k和Cityscapes。对于每个源域,我们搜索超参数以找到知识迁移的最佳设置。这产生了三个不同的AeroScape模型,其平均交并比(mean-IoU)分别为52.02%、51.62%和49.55%。每种方法的类别性能如图7所示。
分析 在ILSVRC上训练的更高分辨率的网络(FCN 4步长)的性能优于较粗糙的网络(FCN 8步长),但人和自行车除外。我们认为,在较粗糙的分辨率下操作所带来的某种程度的“模糊”有助于这些类别的知识迁移。这可能会辅助预测,因为这些类别是AeroScapes数据集中一些最易变形的类别——精细的细节可能会损害预测结果。使用其他知识源(PASCAL Context、Cityscapes、ADE20k)初始化的FCN 8步长网络的性能始终优于使用ILSVRC数据初始化和训练的FCN网络。
可以预见的是,在某些领域微调过的AeroScapes模型在特定类别上的表现相对更好或更差。在任何分割基准测试中,人类都是备受关注的。虽然PASCAL中的人类主要是大型前景对象,Cityscapes中的人类是直立的行人或驾驶员,但ADE20k中有一部分人类(如图4所示)在视觉上与AeroScapes中的人类相似。从Cityscapes微调而来的模型在建筑方面的表现更好,但在船只方面的表现更差。Cityscapes包含几个在视觉上与Aeroscapes中的建筑相似的类别,而Cityscapes中没有船只。令人惊讶的是,从Cityscapes派生的模型在Aeroscapes的汽车类别上表现更差。我们认为这是由于Cityscapes中的汽车图像主要由前视图和后视图组成,与AeroScapes中主要为俯视图的汽车图像存在巨大差异。这种类别性能的不均匀性促使我们将从不同源域微调而来的模型的预测结果结合起来。
5.2. 从多个来源学习
由于某些预训练模型在特定类别上表现更好,因此探索一种胜者全取的方法是很自然的:对于每个类别,选择最佳的单源模型。这种策略产生了53.83%的平均交并比(mIOU)(图7中的Ensemble-Winner),比最佳单源模型高出1.8%。虽然这表明结合多个来源是有帮助的,但这并不是一个可实现的模型。
通过将在单一来源上学习的模型所获得的softmax分布相结合(第5.1节),上述策略可能成为一个切实可行的系统。我们首先从一种混合搭配的方法开始,根据类别优胜者融合来自单源模型的softmax分布。该模型产生了55.02%的平均交并比(mIOU)(图7中的EnsembleMixMatch),比胜者全取的方法高出1.2%。
混搭策略相较于胜者全得的方法有所改进。然而,它忽略了除类别胜者之外的所有表示,并丢弃了有用信息。将来自每个单源模型对每个类别的表示进行组合的最简单策略是对softmax预测进行平均。这种平均集成方法产生了56.69%mIOU56.69\% \mathrm{mIOU}56.69%mIOU(图7中的Ensemble-Average),比混搭方法高出1.6%1.6\%1.6%。这种方法假设每个类别的所有softmax分布都同样重要。由于我们在第5.1节中观察到,某些单源模型在特定类别上相对更好或更差,因此我们现在学习权衡和组合来自每个源网络的预测。具体来说,我们训练了一个单层回归网络,该网络学习线性组合来自单源模型的softmax分布。

所提出的框架(图6)是通过对softmax分布进行后期融合得到的网络的加权平均集成,产生了57.08%mIOU57.08\% \mathrm{mIOU}57.08%mIOU(图7中的EnsembleSoftReg),比平均集成方法高出0.4%0.4\%0.4%。回归网络采用分层抽样进行训练,以确保网络不会偏向于事物类别。我们在图8中展示了定性结果。

分析:将微调限制在上层任务特定层有助于多源迁移,因为集成模型具有多样性。Ensemble-MixMatch优于Ensemble-Winner表明,它在处理负样本方面表现更好,而IOU指标对此很敏感。EnsembleAverage优于Ensemble-MixMatch表明,从互补领域学习到的表示对于特定类别很重要。EnsembleAverage的表现出乎意料地好,这表明网络的集成学习到了相当强大的互补表示,并且简单的聚合方法效果相当不错。我们观察到Ensemble-Average和Ensemble-SoftReg之间唯一存在非微小差异的类别是船只类别。这可能是由于Cityscapes单源模型在船只上的表现不佳,从而降低了Ensemble-Average船只分类器的性能。

单源集成:我们还研究了所提出框架中性能提升的来源——多源集成的更高性能是来源于多个源的互补知识,还是仅仅是由于集成导致的容量增加?我们在单一源域上训练了具有等效容量的集成网络。图9显示,单源集成在一定程度上有所帮助。然而,单源集成(53.05%mIOU53.05\% \mathrm{mIOU}53.05%mIOU)的表现不如我们提出的多源方法(57.08%mIOU57.08\% \mathrm{mIOU}57.08%mIOU)。

6. 结论
全卷积网络(FCNs)在现有的语义分割基准测试中建立了最先进的性能。在监督环境中训练的数据驱动方法通常在存在域偏移时性能会下降。在这项研究中,我们探索了跨在场景结构、视角和对象统计方面存在显著差异的数据分布的FCNs语义分割。我们考虑了具有空中视角的图像上的语义分割,并研究了从地面视角分割基准测试中迁移知识的可行性。为此,我们准备并发布了AeroScapes数据集,该数据集包含使用无人机群拍摄的3269张空中图像(及相关语义分割图)。
我们通过从多个源域进行渐进式微调,为空中分割训练了多个模型。要从每个域传递的精确知识是独特且微妙的——室内物体可能出现在室外,而室外物体在空中视角下可能看起来相似。因此,我们将从不同域调整得到的模型视为一个集成,并将它们聚合起来以提高性能。我们通过回归网络成功地从每个源域学习了重要组件,从而实现了8.12%8.12\%8.12%的整体提升。
所提出的框架与底层网络架构无关,并允许我们利用可能包含关键互补信息的小型分割数据集。作为未来的工作,可以协作学习网络微调和预测回归,以利用来自不同数据源的信息。
致谢
如果没有Autel Robotics的帮助,我们不可能完成这项研究,他们帮助我们编译了AeroScapes数据集。本研究部分得到了美国国家科学基金会(NSF)IIS-1618903基金的资助、美国国防部高级研究计划局(DARPA)合同编号HR001117C0051的资助,以及国家情报总监办公室(ODNI)情报高级研究计划活动(IARPA)通过IARPA研发合同编号D17PC00345的资助。此外,本研究还得到了谷歌研究和英特尔视觉云系统科学与技术中心(ISTC-VCS)的支持。本文中的观点和结论属于作者本人,不应解释为必然代表ODNI、IARPA或美国政府的官方政策或认可(无论是明示还是暗示)。美国政府有权为政府目的复制和分发再印本,尽管其上有任何版权注释。
更多推荐
所有评论(0)