【读点论文】A Comprehensive Survey of Few-shot Learning梳理好相关定义和概念,认清方法和目的。从数据层面,迁移特征复用,元学习,原型度量等方向去解决小样本问题
A Comprehensive Survey of Few-shot Learning: Evolution, Applications, Challenges, and Opportunities
Abstract
- 小样本学习(FSL)已成为一种有效的学习方法,并显示出巨大的潜力。尽管最近在处理 FSL 任务方面取得了创造性的成果,但从少量甚至零样本中快速学习有效信息仍然是一个严峻的挑战。在此背景下,我们广泛调查了过去三年发表的 200 多篇关于 FSL 的最新论文,旨在及时、全面地概述 FSL 的最新进展,并公正地比较现有作品的优缺点。为了避免概念上的混淆,我们首先详细阐述并比较了一组相似的概念,包括小样本学习、迁移学习和元学习。此外,我们提出了一种新的分类法,根据 FSL 的挑战,根据知识抽象水平对现有工作进行分类。为了丰富本次调查,我们在每个小节中对这些主题的最新进展进行深入分析和富有洞察力的讨论。此外,以计算机视觉为例,我们重点介绍了FSL的重要应用,涵盖了各个研究热点。最后,我们以对技术演进趋势的独特见解以及未来潜在的研究机会来总结本次调查,希望为后续研究提供指导。
- 该综述(Yisheng Song 等作者)围绕少样本学习(FSL) 展开,系统调研了过去三年 200 + 篇最新论文,首先辨析了 FSL 与传统机器学习(ML)、迁移学习、元学习的易混淆概念,提出基于 “知识抽象程度” 的新分类法(将 FSL 分为单模态学习与多模态学习,单模态含数据增强、迁移学习、元学习),随后深入分析各分支的核心方法、代表模型及挑战,以计算机视觉为案例(覆盖图像分类、目标检测、语义分割、实例分割)展示 FSL 的应用进展,最后指出未来方向(如优化数据分布评估、提升数据 - 标签映射鲁棒性等),为后续研究提供指导。
- FSL 是机器学习的一个分支,核心目标是让模型从极少量标注样本(“少样本”)中快速学习有效信息,提升对未见过任务的性能。其正式定义参考 Wang 等(2020)的表述:“一个计算机程序若能基于少量经验(E),在特定任务类(T)上通过性能指标(P)衡量,实现性能提升,则称其为 FSL”—— 这里的 “经验 E” 即标注样本,且数量极少(通常每类 1-5 个)。
- FSL 的任务场景通常用 “N-way-K-shot” 描述,核心是区分支持集(Support Set) 和查询集(Query Set):支持集:训练阶段的少量标注样本,含 N 个类别,每个类别 K 个样本(即 “N-way-K-shot”);查询集:测试阶段需预测的样本,其类别与支持集完全不重叠(这是 FSL 与传统机器学习的核心差异之一);单样本学习(One-shot Learning, OSL):N-way-1-shot,支持集每类仅 1 个样本;零样本学习(Zero-shot Learning, ZSL):N-way-0-shot,支持集无样本,仅依赖语义特征(如文本描述、属性)实现预测;跨域 FSL(FSCD):融合 “跨域” 与 “FSL” 特点,源域与目标域数据分布差异大(如 “自然图像→医疗图像”),且目标域每类样本极少,是当前 FSL 最具挑战性的方向。
- FSL 的本质是 “用有限样本解决无限任务”,其知识体系围绕 “挑战 - 方法 - 适配场景” 展开:概念层:FSL 的核心是 “支持集与查询集类别无重叠”,需区分 OSL/ZSL/ 跨域 FSL,且与传统 ML、迁移学习、元学习形成 “分支 - 方法 - 目标” 的关系;方法层:单模态方法解决 “局部问题”(数据、特征、任务),多模态方法解决 “全局信息不足”,其中 “预训练 + 微调”(迁移学习)、MAML(元学习)、原型网络(度量学习)是工程落地的主流;应用层:计算机视觉是 FSL 的核心场景,需根据任务(分类 / 检测 / 分割)选择适配方法(如分类用原型网络,检测用 Meta-DETR)。
INTRODUCTION
-
硬件和信息技术的最新进展加速了各种物联网应用领域中数十亿设备的互连。智能和自适应设备越来越多地部署在健康、交通、工业生产、环境检测、家庭自动化以及许多其他证明万物互联 (IoE) 框架合理的关键基础设施中。这些海量的终端设备产生了大量的数据,需要发送回服务器进行集中处理和存储。虽然边缘生成的数据总量非常大,但单个设备或单个场景生成的每个数据集的体量极其有限,样本很少。
-
传统的数据驱动和单域算法在这些设置中表现不佳。为此,人们进行了大量的研究来探索基于少量样本和跨领域场景的有效学习方法。小样本学习(FSL)和元学习不可避免地成为一种有前途的方法。然而,如何有效地从小样本数据集甚至跨域中获取有效信息仍然是当今FSL面临的最大挑战。
-
此外,现实场景中的数据分布通常具有长尾效应,并且很难在不同领域推广相同的模型。以智能制造工业检测为例,泛化性差的问题已成为影响其智能模型性能的关键挑战之一。具体来说,目前的工业质检设备需要一定的特定照明条件,而在一种照明条件下训练的AI模型很难“泛化”到其他照明条件。
-
此外,考虑到工业质检场景的高精度要求,目前的AI模型通常采用监督学习,需要大量缺陷样本进行训练。但实际生产场景中不良品比例较小,很难采集到足够数量的满意样品。而且,也不可能跨域传输。例如,PC外观缺陷检测模型不能直接用于检测手机屏幕、冰箱、洗衣机甚至不同型号PC的缺陷。
-
同样,再比如,在识别元器件、电路板的字符图像时,由于元器件供应商众多,器件种类繁多,字符样式也多种多样,因此不可能为一个供应商收集到足够数量的各类字符图像样本,导致每种类型的样本很少甚至没有。表 1 详细总结了这些挑战。
-

-
表1 当前行业迫切需要解决的挑战
-
Scenes Challenges Key Solutions 质检流水线 受光照影响、样本少、跨域无法迁移 少样本跨域迁移、模型泛化鲁棒性 电子元件识别 颜色 / 尺寸 / 品牌多样、单品牌样本少、存在未见过的新品牌 少样本学习、迁移学习、统一特征表示
-
-
为了更有效地应对这些挑战,FSL在数据、算法和模型上做出了一些创造性的工作。到目前为止,作为最经典的分类学之一,FSL分为元学习和基于度量的学习。在这篇综述中,从挑战的角度,我们将FSL分为数据增强、迁移学习、元学习和多模态学习。
-
数据增强侧重于通过度量或生成方法来模拟不同场景下的数据,以最大化实际数据分布。迁移学习主要与预训练和微调相结合,从大规模辅助数据集中提取先验知识。当领域相关性相对不常见或没有大型辅助数据集时,迁移学习有一定的局限性。
-
元学习是目前解决FSL问题的主流方法。近年来,一些学者质疑“这种元或情景训练范式真的对FSL问题负责并且是最优的吗?”。这引发了关于 FSL 元学习必要性的广泛讨论。多模态学习融合了语言、图像、音频等不同维度的信息。多模态学习有望打破人类真实信息世界中FSL有用信息不足的困境。
-
由于FSL的特殊性,每种FSL方法都不同程度地面临着多方面的挑战。数据增强最直接的挑战之一是数据样本过于有限,模型无法仅依靠少数样本来评估真实的数据分布。因此,在这种设置下训练的模型是有偏差的,很容易陷入过度拟合。在迁移学习中,特征可以有效缓解FSL中数据量较小且无法跨相似域迁移的问题。
-
然而,如何有效地表示特征、如何在不同任务之间重用特征以及如何在数据和标签之间建立有效的映射是迁移学习中存在的巨大挑战。此外,在元学习范式中,当用一组任务训练元学习器时,它不仅对数据空间进行采样,而且对任务空间进行采样。通过不断适应每个具体任务,使得网络具有抽象的学习能力。当训练任务和目标任务明显不同时,元学习的效果最小。此外,在多模态学习领域,人们进行了广泛的研究来探索如何有效地整合多种模态的信息来辅助FSL。
-
现有的几篇调查论文研究了 FSL 的相关工作,例如,有工作将 FSL 方法分为经验学习和概念学习。工作根据概率分布将FSL方法分为生成模型和判别模型。最近,工作提出了一种新的分类法,从数据、模型和算法方面对 FSL 方法进行分类。然而,据我们所知,还没有一篇论文从 FSL 挑战的角度提供了分类。通过总结FSL的挑战,读者可以更好地掌握FSL背后的动机和原理,而不是局限于各种模型。表 2 总结了本文中使用的关键缩略语列表。
-

-
表 2 关键缩略语列表
-
-
FSL 的诞生背景:边缘计算场景下(如 IoT、工业质检),终端设备总数据量大但单设备 / 单场景数据集极小(如工业质检中缺陷样本占比低),传统数据驱动算法性能差,FSL 与元学习成为解决方案。
-
FSL 的定义与关键术语:模型从极少量经验(E)中学习,提升在任务(T)上的性能(P),核心是E 极小。N-way-K-shot:支持集含 N 个类别、每类 K 个样本,查询集类别与支持集无重叠;N-way-1-shot 为单样本学习(OSL),N-way-0-shot 为零样本学习(ZSL)。跨域 FSL:融合跨域(源域→目标域存在域间隙)与 FSL 特点,是当前 FSL 最具挑战性的方向之一。
-
概念 核心区别 传统 ML vs FSL 传统 ML 测试集类别包含于训练集;FSL 支持集与查询集类别完全不重叠,依赖少量样本 + 先验知识 迁移学习 vs FSL 迁移学习侧重源域到相关目标域的知识迁移;FSL 若通过预训练获取先验知识,可属于迁移学习,但更聚焦 “少样本” 场景 元学习 vs FSL 元学习是 “学习如何学习” 的框架(通过任务 / 数据双采样提取元知识),是解决 FSL 的方法之一;FSL 是 “少样本学习” 的目标,并非等同于元学习
Organization of the Survey
-
本次调查的其余部分组织如下。第 2 节概述了 FSL,介绍了 FSL,比较分析了机器学习、元学习和迁移学习,并总结了当前 FSL 的变体和挑战。此外,为了系统地解决这些障碍,在本节中我们演示了一种新的分类法来对现有的 FSL 相关作品进行分类。第三节至第六节从FSL挑战的角度对当前主流研究进行了系统考察,并从各个方面进行了比较分析。通过这种分类法,每个部分的末尾都提供了讨论和总结,使我们能够深入了解各个领域以及一些潜在的研究机会。第7节以计算机视觉为例,按时间顺序盘点了FSL在图像分类、目标检测、语义分割、实例分割等方面的最新进展。第八部分深入探讨FSL当前面临的挑战以及如何在各个分支寻求突破。本文的总体轮廓如图1所示。这项调查的主要贡献可概括如下:
-
我们从边缘计算场景开始,其中出现了小样本学习挑战,解释并澄清了几个容易与 FSL 混淆的类似概念。这将有利于帮助读者建立小样本学习、迁移学习和元学习之间的关系。
-
我们通过知识图和热图从挑战的角度全面调查FSL相关工作。通过这种分类,我们将FSL分为几个不同的级别,其中最高级别是多模态学习,主要使用各种语义知识来辅助判断,第二、第三和第四级别是单模态学习,分别解决数据级别、特征级别和任务级别的挑战。值得注意的是,我们还对FSL跨领域研究进行了富有洞察力的讨论,这是目前FSL领域更具挑战性的方向。
-
我们调查了近三年来足够数量的论文,总结了FSL在计算机视觉领域的主要成就,包括图像分类、目标检测、语义分割和实例分割。
-
带着调查最后提到的这些挑战,结合实际应用,我们深入研究FSL当前面临的挑战,探讨如何在各个分支中找到突破点,共同推动FSL的研究朝着更实用的方向发展。
-
我们对 FSL 的演变提供独特的见解,并确定与每个挑战相关的几个未来方向和潜在研究机会。
-

-
图1. 调查概念图。
-
CONCEPTS AND PRELIMINARIES
- 作为机器学习(ML)的一个分支,FSL 仍然是一个年轻的领域。什么是 FSL?它与机器学习、迁移学习和元学习有何关系?目前存在哪些 FSL 变体?研究论文中经常出现哪些基准数据集?在本节中,我们将通过回答这些问题来为读者解决 FSL 的障碍。
What Is Few-Shot Learning?
-
FSL的概念受到人类强大的推理和分析能力的启发,广泛应用于边缘计算场景。 2020年,Wang等人通过机器学习的经验、任务和表现给出了FSL的详细定义,这是迄今为止最受认可的定义之一:如果计算机程序的性能可以通过 P 测量的 T 上的 E 来提高,则可以说计算机程序可以从某些类别的任务 T 和性能测量 P 的经验 E 中学习。这里值得一提的是,FSL 中的 E 非常小。近年来,相关神经科学证据表明,人类先天能力与各种记忆系统有关,包括参数化慢速学习新皮质系统和非参数化快速海马学习系统,分别对应FSL的基于数据的慢速学习和基于特征的快速学习。
-
为了更好地理解FSL,有必要引入两个概念,一个是N-way-K-shot问题,另一个是跨域FSL。 N-way-K-shot问题经常用来描述FSL遇到的具体问题。在这种情况下,支持集代表训练阶段使用的小数据集,它为测试的第二阶段生成参考信息。查询集是模型实际需要预测的任务。请注意,查询集类永远不会出现在支持集中。经典的N-way-K-shot表示支持集有N个类别,每个类别有K个样本,那么整个任务只有N*K个样本。因此,N-way-1-shot 代表单次学习,N-way-0-shot 代表零次学习。跨领域的概念源于迁移学习,是指将源领域的知识迁移到目标领域。这些域之间通常存在域间隙。跨域FSL融合了跨域和FSL的特点,是最近出现的一个具有挑战性的方向。
-
现阶段,FSL仍然存在很多挑战,这些挑战来自各个方面,包括但不限于数据、模型和算法。在这种背景下,挑战可以根据知识的整合程度概括如下:
-
数据分布评估不准确:由于成本、道德、法律或其他原因,FSL 无法访问大型数据集。因此,依赖少量样本进行学习会在估计实际数据分布时产生偏差,这对于某些任务可能是致命的。为此,利用有限的信息最大限度地探索数据分布成为 FSL 面临的最重大挑战。数据增强是解决FSL估计不准确的直接方法。目前的主要工作集中在探索可迁移的类内或类间特征以及使用生成器定制特定图像。
-
特征重用敏感性:通过对大规模辅助数据集进行采样,不断积累先验知识。迁移学习可以轻松地将其从源域使用到相似的目标域。预训练的目的是通过特征提取器提取高维特征向量,而微调的目标是对预训练的初始参数进行微小的调整。迁移学习关注数据层面,通过将数据映射到标签来获得独立于任务的更有价值的特征。它在优化特定任务方面表现突出,但普遍受限于当前任务的特点,对未来任务的泛化能力较差。特别是当领域发生较大变化时,如果不进行特征过滤和对齐,可能会导致负面的知识迁移。
-
未来任务的通用性:与迁移学习不同,元学习通过对任务和数据进行双重采样来学习快速构建从已知任务到以前未见过的任务中的目标模型的映射。在FSL中,通过探索任务空间,总结不同任务中的元知识可以以较低的成本快速聚合未见过的任务。作为一种通用的学习框架,元学习独立于具体问题,更面向未来的任务,而不是优化当前的任务。然而,元学习只有在测试和训练任务相对相似的情况下才被证明是有效的,并且它高度依赖于网络结构,缺乏灵活性。当同时用一组任务训练元学习器时,甚至很难适应任务的分布,需要重新设计网络结构。
-
单模态信息的缺陷:由于FSL本质上是信息有限的,因此很难有效地学习特征。在从其他方式获取信息的帮助下,这种情况可以得到很大程度的改善。在这方面,语义辅助是一种提供外部先验知识的优秀方法,通过引入或生成语义信息作为弱监督,可以结合原始模型完成自适应分类。
-
What Is Machine Learning And How It Is Different From Few-shot Learning?
-
传统的冯·诺依曼计算机体系结构允许用户以程序的形式逐步执行一系列指令。然而,这种方法在 ML 中不起作用。相反,机器学习使用大规模数据集作为输入。它对新样本的判断是基于历史数据提取的统计结果。现在,5G 的蓬勃发展为数百万终端设备提供了大规模连接,实现了万物互联。终端设备产生的数据总量巨大,但单个数据集的量却极小。因此,传统机器学习的性能很大程度上依赖于大数据集,因此在样本较少的情况下无法表现良好。为此,FSL 出现并提供了一种处理数据稀缺场景的有前景的方法。
-
近十年来,FSL的研究广泛开展,并取得了重大的研究进展。阿里巴巴提出的KGBert首次在FSL领域超越了人类。图2根据Web of Science的统计结果展示了近十年来FSL相关论文发表情况的统计。据透露,由于FSL理论还不完善,2011年至2015年相关论文相对较少。
-

-
图2. 2010年至2021年上半年在知名期刊上发表的FSL相关论文数量(不包括引用)。
-
-
自2015年以来,随着深度学习的兴起,FSL相关研究论文的数量几乎每年都呈线性增长。刚刚过去的2020年,相关论文数量高达239篇,引用次数相应达到2731次。图3提供了一张知识图谱,涵盖了近年来FSL领域的热点研究主题和前沿发展,包括但不限于零样本学习、单样本学习、迁移学习、多任务学习和元学习。
-

-
图3.知识图谱以Few-shot Learning、One-shot Learning和Zero-shot Learning为关键词,关联了近三年Few-shot Learning领域的主要进展和研究方向。
-
-
FSL 相关任务包括特征表示、可视化、机器人和跨域传输。其中,域适应是一种广泛使用的少样本跨域学习方法。以绿色为主的计算机视觉是最活跃的研究领域,包括图像分类、对象检测、语义分割和实例分割。
-
FSL与传统机器学习最显着的区别在于支持集和查询集的类集是不相交的。在机器学习中,测试集的类预先包含在训练集中。 FSL将有限的监督信息与先验知识相结合来训练模型。模型的输入通常以任务的形式给出。通过不断收集任务,模型可以识别数据和任务之间的异同。
-
当模型遇到看不见的任务时,只需几个迭代训练步骤和适当的初始化参数就可以快速完成知识迁移。相比之下,传统的机器学习需要通过模型中大规模数据集生成的损失函数进行优化。综上所述,FSL只是机器学习的一个非常年轻的分支,主要解决机器学习场景中优质数据集获取困难的问题。
What Is Transfer Learning and How It Is Different From Few-shot Learning?
-
传统的迁移学习涉及将源领域中学到的知识应用到不同但相关的目标领域。在FSL中,有限的训练数据、领域变化和任务修改是导致模型无法很好地从源域迁移到目标域的关键因素。例如,与自然图像数据集imagenet相似度较低的医学图像数据集,如果没有相关专业知识的帮助,即使是仅由少量图像引导的人也很难准确识别。当然,当源域和目标域比较相似时,它也是有效的。最后在FSL任务中,如果先验知识是通过预训练从其他任务或领域获得的,那么FSL可以属于迁移学习,主要学习数据到标签的映射。根据迁移学习的分类,FSL 问题有很多变体,包括单次学习(OSL)、零次学习(ZSL)和跨域少次学习。
-
One-shot Learning:OSL对于支持数据集中的每个样本只有一个正确的标签,其目的是在看到的类中找到最相似的类作为匹配。在警察审讯过程中,这两个过程极其相似。目击者只需看一眼嫌疑人,警方给出的照片即可视为查询图像。证人只需对这些照片回答“是”或“否”。同样,一次性学习也不具体对数据进行分类,而是简单地按照相似度函数的顺序进行聚类。根据现有的工作,一次性学习可以分为两种主要方法。一种是使用生成模型来铸造先验知识,其中贝叶斯编程学习是该领域最具代表性的框架。另一种方法是将 OSL 分类任务转换为验证任务。
-
零样本学习:ZSL首先由Lampert等人提出,它考虑了FSL中更极端的情况。在没有任何查询样本的情况下,仅依靠推理机制来识别以前没有见过的样本。 ZSL本质上是通过使用高维语义特征来代替低维原始数据。嵌入表示和自动编码器是构造中间语义空间的最有效方法,其中包含更全面地定义类别的属性。到目前为止,零样本学习是最接近人类智能的方法之一,可以识别以前未观察到的类别。 One-shot Learning和FSL本质上可以被认为是一种特殊的ZSL。
-
跨域少样本学习:在迁移学习中,目标域中的每个类都有足够多的可用样本。当源域和目标域之间发生较大的域转移时,知识转移往往变得非常具有挑战性。跨域小样本学习结合了迁移学习和 FSL 的挑战。在存在域间隙的情况下,源域和目标域中的类的交集为空,并且目标域中每个类的可用样本量非常小。仅通过源域数据来提高模型泛化能力给模型带来的性能非常有限。目前的工作主要集中在特征的移位变换和辅助数据集的构建上。跨领域的少样本学习可以被认为是目前 FSL 领域最具挑战性的设置之一。
What Is Meta-Learning and How It Is Different From Few-shot Learning?
-
元学习是一种通用的学习范式,它以情景训练机制提供任务训练。图 4 说明了元学习 训练涉及的三个步骤。元学习的重点是使用先验知识提高未见过的任务的泛化能力。如果使用先验知识来教导模型如何学习特定任务,则元学习可以被视为 FSL 的变体。需要强调的是,元学习并不等同于FSL。FSL 应该被视为最终目标。它的目标是在不依赖大规模数据集的情况下实现稳健的生成。通过数据和任务空间的双重采样,元学习能够构建大量与未见过的任务相关的辅助任务。即使有些论文不使用元学习,如果可以考虑情景训练机制,也可能会提高模型的性能,例如元强化学习、元视频检测等。
-

-
图4.元学习训练三步方法包括:找到学习算法,使用任务定义损失函数,找到可以最小化损失函数的参数。
-
-
然而,元学习也有其自身的局限性:当训练和测试任务存在明显的领域差距时,元学习很少用于初始化参数权重。很容易导致模型出现负迁移。此外,元学习高度依赖于网络结构,需要针对广泛变化的任务进行重新设计。尽管如此,元学习仍然是解决FSL最有效的方法之一。
Datasets
-
在 FSL 基准数据集可用之前,研究人员经常使用手动构建 Nway-K-shots 等任务来评估模型的性能。然而,这些简单的任务并不能反映现实问题的复杂性。经过10年的演变,FSL基准数据集完成了从单领域、单一数据集到跨领域、多数据集的转变。
-
如图5所示,2017-2021年期间,有898篇论文使用了CUB-200-2011数据集,占统计总数的46.6%; 587篇论文使用MiniImageNet数据集,占30.5%;使用Omniglot数据集的论文有335篇,占17.4%; 44 篇论文使用了 PASCAL-5i 数据集,46 篇论文使用了 Meta-DataSet 。其他特定数据集是 Paris-Lille-3D 、N-Digit MNIST 、SUN397 ,在过去五年中有 15 篇论文使用了这些数据集。从数量上看,CUB-200-2011、Mini-ImageNet、Omniglot基准数据集在FSL领域占据主导地位。表3从不同维度对上述数据集进行了比较。通过文章的发表,提出了一个更客观的基准数据集来评估FSL的跨域能力。 1) CropDiseases ,植物病害数据集,2) EuroSAT ,卫星图像数据集,3) ISIC 医学皮肤图像数据集,4) ChestX ,X 射线胸部图像数据集。这些数据集与 MiniImageNet 的相似度有所下降。
-

-
图5.少样本学习中最常用的8个数据集,包括主流基准数据集上的论文数量(2017-2021)。可能有一篇论文测试了所有主流基准数据集。数据来自“paperswithcode”平台。
-

-
表3 FSL在机器视觉主要任务中的最新表现
-
Taxonomy
-
根据知识的整合程度,FSL大致分为单模态学习和多模态学习。在本次调查中,单模态学习可以进一步分为数据增强、迁移学习和元学习。它主要侧重于将有限的信息抽象或转移为更高层次的特征向量或元知识。多模态学习更加贴近人类智能的真实世界,不再依赖于有限的样本,而是试图寻找其他模态的空间来辅助FSL。通过这种分类法,我们详尽地回顾和讨论了每种方法。图6生动地展示了挑战视角下的FSL分类。
-

-
图 6. 整个分类以金字塔的形式呈现。最底层代表“云-边-端”边缘计算场景,其特点是高流量下的少样本实时计算。基于此,FSL的挑战根据所需知识的整合程度分为四个级别。其中,以数据增强、迁移学习和元学习为代表的挑战是单模态挑战。
-
评估真实的数据分布:FSL的困难关键在于有限的样本无法反映实际的数据分布。机器学习最直观的想法是根据一定的概率模型生成额外的数据或者从扩展数据中利用大量未标记的数据来扩展辅助数据集。现有的工作重点是探索可以在类之间或在语义级别使用外部数据集学习的特征差异。手工规则和自动学习数据处理是现阶段的两种主要方法。
-
构建数据到标签的映射:此外,如果可以重用基准数据集中的大量特征,这将显着减轻模型对数据的压力。预训练和微调通过学习数据到标签的有效表示以及底层语义特征的有效正则化来帮助 FSL。特别是,预训练阶段学习各种不同任务中的最佳初始化参数,微调阶段冻结大部分较低级别的参数,仅重新训练分类层的参数。
-
导出任务到目标模型映射:微调在小样本的基线模型中已经具有良好的性能。然而,在多任务学习中,大量的任务就像一个任务一样被学习,这导致模型的泛化能力很差。相比之下,元学习使用情景训练机制对数据和任务空间进行双采样,发现不同任务之间的潜在关联,从而对整个任务空间进行良好的描述。
-
信息有限的互补学习:多模态学习在深度学习中被提出很长时间了,但近年来才开始与 FSL 集成。多模态维度的信息最接近真实的人类信息世界,在一定程度上弥补了FSL无法对单一模态的数据分布进行准确评估的缺陷。像素、语义和声音可以作为 FSL 任务的监督信号,甚至最近无监督学习已被用于使用对比学习来探索更鲁棒的特征表示
-
DATA AUGMENTATION TO EVALUATE THE TRUE DATA DISTRIBUTION WITH MAXIMUM PROBABILITY
- 在现实世界的 FSL 任务中,由于隐私、收集成本和标签成本,支持集和查询集中的样本数量通常受到限制。为了缓解这个问题,数据增强被认为是增加 FSL 样本丰富度的最直接方法。然而,FSL 数据增强的核心风险是增强的数据集评估真实数据背后的分布的可能性有多大。根据数据增强技术是否可以在其他任务上重用,FSL数据增强分为手工规则和自动学习数据处理。
Hand-Crafted Rules
- 手工制定的规则需要具有专业领域知识的专家的指导。一个代表性的结果是,Bouthillier 等人提出随机丢弃随机矩形区域上的像素,以生成模拟噪声的黑色矩形块。类似的操作还包括FSL中的随机擦除和填充。尽管如此,简单地依赖单样本像素的简单变换并不能防止过拟合的风险。此外,手工制定的规则根据信息的维度包含数据级别和特征级别。表4总结了手工规则制定的数据增强方法。
-

-
表4 FSL在手工制定规则中的最新表现。
-
Data Level
-
数据级别增强主要是对输入数据的转换,旨在通过对数据进行少量修改来扩展现有数据,以实现模型输入的多样性。随机擦除和随机裁剪是经典算法,通过模拟不同程度损坏的图像,从而提高模型的泛化能力。受此启发,李等人放弃了基于图像整体特征提取器的传统方法,而是专注于局部补丁图像。这些方法需要大规模数据集作为支持。在FSL设置中实现这一点并不容易。
-
相反,CSEI 不需要额外的数据集。具体操作是擦除由度量函数导出的支持集中的大部分判别区域,并使用恢复操作将其替换为图像填充。FTT 通过一些瞬态变换属性(例如不同的天气和照明)的线性插值来丰富数据集。 ZChen 等人 受 MIXUP 思想的启发,提出了一种端到端的方法来将图像作为一个整体进行划分,该方法认为图像即使在经历了各种扭曲之后仍然保留了重要的语义信息。图像失真和 GNN 之间最显着的区别是图像失真只是以线性模式将两个图像拼接在一起。该方法能够在不损失分类的情况下实现最大变形。另外,利用现实世界中大量未标记的数据集进行补充,也是数据扩展的一个很好的方向。
-
最后,当源类和目标类都只有有限数量的样本时,AdarGCN的实现从互联网资源中抓取数据,并自动去除不相关的噪声,以实现可控的数据增强。同时,AdarGCN可以自动判断信息在每个图节点中传播了多远。总之,数据级别的数据增强侧重于通过像素变换和像素生成来增加样本数量。图7展示了手工规则下基于数据级别的主要方法。
-

-
图7 基于数据层面的FSL数据增强主要包括互联网数据采集、环境变化、差异传递和随机作物填充。这里以熊猫图片为例来实现上述变体。
-
Feature Level
-
特征级数据增强主要将像素信息映射到高维潜在空间。它比单纯的原始像素携带更多有效信息。 Gau等人首先探索了少样本数据背后的潜在分布,并提出了一种对抗性协方差增强网络来克服FSL的局限性。它的实验表明,仅仅依靠学习整个图像的特征会给结果带来噪音。楚等人尝试计算每个补丁的特征表示,而不是整个图像。每个小patch通过RNN连接,图像的特征进一步融合。这种启发式算法远远优于简单的注意力模型。
-
张等人从另一个角度解释了部分特征学习,提出使用预训练模型将视觉特征分解为三部分,然后选择原始图像、前景图像和背景图像重新拼接成新的视觉特征。类似地,Laso 探索了高维空间中不同数据集之间特征的差异。通过集合的交集和互补来组合不同的标签,使得图像能够同时包含来自特征级别的多个类的关键信息。将这部分图像作为支持集进行训练,可以显着提高小样本的分类性能。 Chen 等人进一步将特征扩展到高维语义空间。在 FSL 中,通过以压缩方式对有效信息进行建模,特征级增强比数据级增强更有效。图8显示了手工规则下基于特征级别的主要方法。
-

-
图8 基于特征级别的数据增强主要分为全局特征和局部特征。全局特征关注整个图像,包括前景和背景。另一方面,局部特征选择性地关注前景中的主体部分。
-
Learning Data Processing
-
2018年,随着元学习的成熟,数据增强进入了自动增强领域。通过元学习与其他数据增强方法的结合,这一时期涌现了大量优秀的工作。 Hu等人受到DARTS算法的启发,将数据增强抽象为多个子策略,每个子策略根据不同的few-shot任务有一定的被选择的概率。除了基于概率的方法之外,另一种方法是基于生成的方法。 Li等人提出了对抗性特征模型网络-AFHN。模型多样性和判别性特征以少量标记样本为条件。 Chen 等人尝试训练元学习器并生成一个网络,通过融合图像对来端到端地学习图像之间的相似性和差异。 MetaGAN ,在此基础上引入了以任务为条件的对抗性生成器,这有助于 FSL 任务在不同类之间形成可概括的决策边界。
-
另一方面,Zhang等人进一步证明了幻影数据生成对于FSL的有用性,并提出了一种低成本的自动化数据生成方法,该方法使用直接的前景-背景组合来生成用于训练的特征空间级数据。此外,探索支持数据集中类之间和类内的可迁移差异也是有效的。 Deltaencoder使用自动编码器来学习同一类中的差异进行迁移学习,这与基于度量的视觉相似度计算不同。表5总结了用于学习数据处理的数据增强方法。图9显示了FSL下自动学习数据处理涉及的主要方法。
-

-
图 9. 学习数据处理旨在学习多个任务空间中的策略生成器,以便自动匹配不同的任务。与手工制作的尺子相比,它最大的好处是可以重复使用。
-
Discussion and Summary
- 为了最大限度地评估 FSL 设置中真实数据的分布,数据增强已经从手工制定的规则发展到自动学习的数据处理阶段。分水岭是2018年元学习的成熟。本节全面研究数据增强领域新兴的代表性技术,并回顾小样本数据增强的演变。表5清楚地总结了不同维度的模型。
-

-
表5 FSL在学习数据处理领域的最新表现。
-
TRANSFER LEARNING BUILDS DATA-TO-LABEL MAPPINGS FOR SPECIFIC PROBLEMS
- 迁移学习是一种经典的学习范式,旨在解决FSL中只有很少甚至没有标记样本的挑战性问题。特征重用是迁移学习解决FSL缺乏数据设置的核心思想。基本操作是在广泛的数据集上预训练模型,然后在有限的支持集上进行微调。当源领域和目标领域存在很大差距时,知识转移的效率总是低得多。这种跨域的设置给FSL带来了新的挑战。在FSL中,迁移学习大致可以分为预训练和微调阶段,也可以称为基线。图10说明了一般过程。
-

-
图 10. 迁移学习可以分为预训练和微调阶段,其中基线模型可以与其他技术相结合以提高模型性能。
-
Pre-training and Fine-Tuning
-
2012年至2018年,计算机视觉和自然语言处理领域涌现出一大批优秀作品,如MobileNet、ResNet、ELMO、GPT、BERT等。特别是,在预训练模型出现之前,自然语言处理领域进展缓慢。随着计算能力的提高和优秀的预训练模型的提出,它在 BERT 的领导下得到了长足的发展。
-
作为下游任务,如何利用这些优秀的模型来获取特征将很大程度上缓解FSL的数据压力。特别是对于少样本图像分类,作为预训练模型,需要使用外部大规模标签数据集从相似任务中提取先验知识。最常见的做法是设计一个没有分类器层的骨干模型,其中包括卷积神经网络或自动编码器。模型的输入是图像数组,输出是嵌入高维空间的特征向量。高维特征向量获得了目标图像足够的有效语义信息。提出预训练后,研究人员提出了后期微调。预训练中大部分参数被冻结,测试阶段仅更新分类层参数。最近的许多工作已经证明,与基线模型相比,微调可以将5-way-1-shot任务的准确率提高2%-7%。尽管支持集和查询集中的样本数量较少,但预训练和微调对于提高FSL的准确性仍然很有帮助。结论在自然语言处理中也类似。微调可以嵌入到最先进的元学习或半监督学习框架中,以优化模型参数。
-
Dhillon 等人用余弦相似度代替了标准激活函数,Nakamura 等人用自适应梯度优化器代替了传统的梯度下降,这都提高了模型准确性的微调过程。目前,微调通常与元学习相结合。 Cai等人尝试将它们整合起来训练具有特定层的网络。
-
然而,实验结果表明,由于 FSL 设置中支持集和查询集不重叠,因此从源数据集中迁移整个知识并不是 FSL 的最佳解决方案。 Shen等人建议知识应该专门针对零样本进行转移。可转移程度需要通过冻结或微调主干模型中的特定层来控制。同样,微调也可以用于防止新类别的网络污染基本类别的特征空间。到目前为止,FSL和微调已广泛应用于病虫害识别、道路检测和自动问答等任务。
Cross-Domain Few-shot Learning
-
FSL的最新进展很大程度上取决于训练阶段的标记数据。然而,在许多实际应用中为特定任务收集各种形式的数据集是不现实的,这导致了截然不同的领域之间的 FSL 挑战。跨域少样本学习融合了FSL和域自适应问题,是一个相对全面且具有挑战性的设置。长期以来,FSL常用的基准数据集受到标准化数据集结构和自然场景高度相似性的困扰,这导致模型在标准数据集上表现良好,但在现实世界任务中却得到了不可接受的结果。
-
Google 于 2020 年首次发布了名为 Meta-Dataset 的 FSL 跨域数据集,其中包括 ImageNet、CUB-200-2011 等共 10 个公共图像数据集。但这些数据集仍然专注于自然场景,不能被广泛视为跨域的少样本基准数据集。直到 BSCD-FSL 数据集可用。根据与ImageNet的相似程度,分为CropDiseases、EuroSAT、ISIC、ChestX。作者广泛评估了当前 FSL 方法的性能,实验表明所有方法的准确性与所提出的自然图像数据相似性度量相关。如今,跨域 FSL 专注于区分与域无关的特征以及通过迁移学习进行域自适应技术。
-
域适应的目标是将知识从源域转移到目标域,目标域具有与源域相同的类集,但数据分布不同。最近,许多工作都使用自适应网络将其特征与新领域相匹配,或从多个骨干模型中选择与领域无关的特征。 Dvornik 等人通过训练一组不同域的特征提取器分别获得了多个域表示。在训练期间将模型设置为具有多个域的数据集允许在测试阶段尝试迁移到其他域。
-
然而,当域正交时,这种方法在元训练和元测试阶段可能无效。基于此,FRN探索了少样本图像分类的潜在空间,使用岭回归来重建和归一化特征图,而无需添加新的学习参数。 FWT 仅利用源数据进行特征的仿射变换,LRP-GNN 和 SBMTL 也是如此。 FD-MIXUP 通过混合构建辅助数据集,并使用编码器学习与领域无关的特征,以指导网络泛化到其他任务。 STARTUP 不仅利用源数据,还假设模型在训练期间可以访问大量未标记的目标数据。
-
使用大量未标记数据来增强模型对其他领域的通用性。基于度量的方法经常用于半监督和无监督的跨域 FSL。 Lu 等人最近的一篇论文 使用注意力作为度量策略来重新加权和组合特定领域的表示。 Chen等人基于元基线,通过在所有基类上预训练分类器,并基于元学习的最近质心算法对少量样本进行分类,这大大超越了最新的最先进的方法。Li等人受到的启发,提出将领域特定特征映射到相同的共享空间,从而实现与领域无关的通用表示。
Discussion and Summary
- 虽然元学习方法在标准 FSL 设置中比迁移学习具有更高的性能,但在跨域 FSL 设置中情况却相反。最近发表的一篇论文指出,当域出现正交时,微调和预训练的改进同样非常有限。在预训练的特征空间中,基类形成紧凑的簇,而新类分布在大差异组中。目前,经过训练的模型实际部署到生产环境中通常无法适应快速变化的环境。预训练可以看作是一个有很多学习类的任务,但它只是一个单一的学习任务。
META-LEARNING DERIVE TASK-TO-TARGET MODEL MAPPINGS INDEPENDENT OF SPECIFIC PROBLEMS
- 元学习从数据和任务的双重采样中学习历史先验知识,然后提取元知识以应用于未来的任务。元学习独立于具体问题,在任务空间中探索一个最优的初始化参数,抛弃了传统监督学习下与任务无关的特征表示。到目前为止,大多数元学习模型都是使用传统的梯度下降来更新参数。当然,还有基于强化学习和度量方法的非梯度下降方法。在FSL中,元学习可用于自动学习模型参数、度量函数和信息传递
Learning Model Parameters
-
大多数深度学习框架使用不同的参数初始化方法,例如均匀分布、正态分布等。这种随机初始化的最大问题是很容易陷入局部最优位置。元学习的目标是训练超参数生成器,经典方法是 MAML 、Repital 甚至它们的派生变体。 MAML通过计算每个任务的优化方向来识别全局优化方向。与 MAML 相比,Reptile 可以一次更新更少的参数。
-
元学习和多任务学习最大的区别在于,多任务学习只关注当前任务的表现。使用标准 FSL 基准数据集证明元学习比迁移学习表现更好。然而,元学习对网络结构更加敏感,需要对超参数进行微调。之后,更多版本不断发展以分别解决这些问题。如MAML++、一阶MAML(FOMAML)、Meta-SGD、TAML、iMAML、iTMAML。其中Meta-SGD除了MAML之外,除了学习初始化参数之外,还同时找到最优学习率并更新参数的方向。
-
TAML是一种与任务无关的方法,克服了MAML只能使用外部模型的问题。随后,IMAML提出了一种新的损失函数和相应的计算梯度的方法,使得只需要计算损失函数的解就可以获得参数的梯度,而无需关心其具体的优化方法。 iTMAML基于TAML,实现自动任务识别。当数据处于连续状态时,通过更新可以快速适应新任务。目前,MAML已广泛应用于各种任务,产生不同的变体。表6从不同角度区分了MAML、Reptile及其变体。
-

-
表 6 MAML、Reptile 及其变体总结
-
-
学习优化器是学习模型参数的另一个重要方向。 LSTM作为基础优化器,它接受时间t的差异和元网络在时间t-1的隐藏状态。原始网络的输出是模型权重和偏差的更新。 2016年,Xu等人提出BPTT来监督LSTM训练。值得注意的是,这是在监督学习的背景下执行的。如果是在无监督和主动学习的情况下,优化需要进行哪些更新?受此启发,人们进行了很长一段时间的工作专注于强化学习、贝叶斯推理和进化算法,试图通过启发式算法自动找到优化策略。
-
最后,传统的神经架构搜索(NAS)也融入了元学习的思想,并在 FSL 下进行了相应的调整。据我们所知,共享和随机选择的超网权重是 FSL 的早期解决方案。最近,大量工作表明一次性NAS和传统NAS之间仍然存在性能差异。One-shot NAS采用权重共享网络,只需训练一次超级网络,然后进行一轮推理即可得到准确的预测,大大减少了实验所需的计算量。
-
随后,Zhao等人在one-shot NAS的基础上提出了few-shot NAS。其核心思想是将超网划分为多个子超网来搜索搜索空间的不同区域。随着超网数量的略微增加,few-shot NAS 的准确性大大提高。 MetaNAS是第一个将元学习与传统NAS完全结合的方法。MetaNAS 能够借助元学习思想更好地初始化参数。它完全取代了DARTS算法中的加权求和来减少不同的操作,实验结果也表明它更能适应更多下游的学习任务。
Learning Metric Algorithm
-
度量学习与经典元学习不同,度量学习不再将模型分为训练和测试阶段。在之前的许多论文中,度量学习总是单独介绍。在我们的上下文中,度量学习将在元学习的框架下进行解释。图11展示了一种最具代表性的学习方法,该方法基于原型网络,该网络经过改进,在分类任务的基准数据集上获得了实质性改进。
-

-
图11.框架联合执行嵌入模型的端到端学习和原型学习,学习到的嵌入特征用于计算查询图像和原型之间的距离,使不同类之间的距离更远,并使相同类之间的距离更近。
-
-
暹罗神经网络是度量学习中相对较早的模型。可以简单的看成是一个二元分类问题。模型的输入由一组正样本对或负样本对组成,模型需要在推理阶段评估图像的相似度。 Triple loss 是在 FSL 度量学习中处理多对输入的另一种方法。与 Siamese 神经网络相反,三重损失需要正样本、负样本和锚样本同时可用。如果训练样本很容易相互区分,这不利于模型更好地学习判别性特征。硬样本选择技术除了考虑正样本和负样本之间的相对距离之外,还结合了正样本对之间的绝对距离。除此之外,Li等人重新审视了经典的三元组网络,并将其扩展为FSL的K元组网络。
-
与Siamese神经网络相比,原型网络实现了分类的真正意义。最显着的区别是该模型允许更多数据作为输入。通过特征平均,可以找到最具代表性的样本作为原型。然而,简单的特征平均很容易受到噪声的干扰。在此基础上,许多工作探索了如何使原型之间的距离越来越大。最具代表性的工作之一是正负边距的提出,它在最大化模型判别能力的基础上进一步减少过拟合并增强泛化能力。
-
匹配网络是一个更通用的网络框架,它将小样本数据集和未标记数据映射到嵌入空间中的向量。匹配网络结合了最近邻算法的参数和非参数模型的最佳特征,通过学习嵌入表示来对样本距离分布进行建模。实验证明嵌入传播产生更平滑的嵌入流形。如何在有限的时间内学习高质量的嵌入表示对于提高模型的准确性具有重要意义。 GVSE 融合了视觉嵌入、语义嵌入和门控指标,通过模型自动平衡每个指标维度的相对重要性。随后,Arvind Srinivasan等人提出了一种新的架构来改进Inception-Net、U-Net、Attention UNet和Squeeze-Net,该架构以生成嵌入质量的时间作为成本。基于嵌入表示的处理在 FSL 中起着至关重要的作用。
-
关系网络与上述三种模型的不同之处在于它的相似度是使用神经网络计算的。与暹罗神经网络和原型网络相比,关系网络可以被视为提供可学习的非线性分类器来确定关系。分类器可以是预训练神经网络的特征提取器或多嵌入式模块。关系网络最重要的贡献是它摆脱了单一的线性度量函数,并探索使用替代模型来生成相似性。表 7 对每种代表性度量学习算法进行了分类,比较了它们对原始方法的创新。
-

-
表 7 通过基本方法进行度量学习的总结。
-
Learning To Transmit Information
-
事实证明,图神经网络(GNN)近年来在基于关系的任务上表现良好。研究人员发现,其基于类别的信息传输可以很好地帮助 FSL 学习识别新类别,同时避免这些类别受到专有功能的支配。主要是,早期的图神经网络通过在支持集和查询集之间创建完整连接来模拟不同节点之间权重的传播。节点可以用 onehot 编码或嵌入向量表示,节点之间的连接可以通过边传递。考虑到图神经网络算法的复杂性,目前大多数图神经网络的层数都很浅。为了更好地适应 FSL,图神经网络在最近的发展中采用了独特的节点和边设计。图12从探索小样本分布的角度展示了图神经网络FSL的最新代表性算法。
-

-
图12. DPGN 除了关注样本分布之间的关系外,还关注GNN中样本之间的关系。其中点图用于描述样本,分布图用于描述分布。两个 GNN 通过传递信息融合实例级和分布级关系。
-
-
EGNN 使用顶点集、边集和任务集来对节点的标签进行编码。当节点之间发生更新时,同时考虑相似性和差异性,这大大提高了图神经网络对FSL的泛化性能。 Meta-GCN进一步融入了元学习的思想,使得FSL下图的权重更新也可以根据梯度下降步骤进行优化,整个过程只需要很少的梯度步骤,并且可以快速接收新数据。
-
随后,几种基于图结构本身改进的模型出现了。原型网络由 GFL 网络改进,该网络专注于学习具有图结构的小样本数据。 DPGN 使用双图神经网络来描述样本,同时对其分布进行建模。此外,GERN 使用图神经网络连接的嵌入来实现更鲁棒的类内权重转移。然而,这些方法都没有解决图神经网络的浅层问题,直到 2021 年,HGNN 设计了三段自下而上的跳跃连接,以消除普通 GNN 失去节点之间层次关联的陷阱。基于此,Frog-GNN利用多维信息综合节点之间的邻接信息,形成类内相似性和类间相异性的成对关系特征。目前,图神经网络广泛用于少样本图像分类、语义分割和实例分割任务等任务。
Discussion and Summary
- 在FSL中,元学习主要探索从任务到目标模型的映射。它训练一个超级调节设备,该设备根据不同的任务收敛时提供一组良好的超参数。与多任务学习相反,多任务学习只关注单个任务。然而,元学习并不适用于所有情况。目前元学习的思路是有足够的历史任务。如果针对某些问题没有足够的任务,那么元学习可能无法解决这些问题。同样,如果源和目标之间的域差距太大,结果也会变得很糟糕。
MULTIMODAL COMPLEMENTARY LEARNING OF SMALL SAMPLES WITH LIMITED INFORMATION
- 到目前为止,FSL 在单峰领域取得了重大进展。在单模态学习中,模型主要负责将信息表示为特征向量,这些特征向量可以由计算机处理或进一步抽象为更高级别的语义向量。特别是,FSL 中的多模态学习是指通过利用多种模态之间的互补性并消除模态之间的冗余来学习更好的特征表示。在现实生活中,当父母教孩子一些事情时,他们总是包含一般信息和语义描述。这对于 FSL 来说至关重要,因为 FSL 本身就没有多少有效信息来对数据或特征分布进行良好的评估。受此启发,许多研究工作考虑在求解FSL时引入其他模态信息。通过融合多模态信息,可以提高模型感知小样本数据的能力。图13展示了多模态下FSL的主要路径,
-

-
图13.多模态FSL场景,如何在特征表示的情况下通过融合、对齐和辅助对其他模态信息进行有效建模,以弥补本身有效信息的缺乏。
-
Multimodal embedding
- 最近的工作证明了视觉特征对于某些任务的FSL的局限性。语义空间作为辅助信息可以为视觉特征提供有效的上下文并帮助FSL。实验表明两种或多种模态的自适应组合比单模态FSL要好得多。
- 王等通过整合多个视觉特征为每个类别构建弱语义监督。舍恩菲尔德等人改为使用变分自动编码器(VAE)来基于潜在视觉特征对语义特征进行建模。随后,Schwartz等人和Peng等人通过添加类标签、属性和自然语言描述以及知识推理进一步扩展了语义信息。通过嵌入损失函数将额外的语义信息与视觉特征对齐,以大大降低知识转移的成本。基于此,Karpathy等人使用多模态对齐来寻找训练集图像中的图像块与其描述性话语之间存在的潜在对应关系。 Aoxue 等人进一步使用语义信息将类建模为层次结构。
Generate semantic information from images
-
除此之外,使用多模态 FSL 的另一个相关领域是文本到图像的生成。在少样本视觉分类任务中,基于视觉和语义的方法尝试使用文本描述来生成额外的训练图像,具有相当大的优势。Pade等人使用生成对抗网络作为数据生成器来训练模型,可以根据语义信息有目的地生成相应的视觉特征,并可以通过组合原始视觉特征来获得增强的视觉特征。 Zhu等人和Xian等人分别探索了生成图像和特征向量,在ZSL领域取得了可喜的进展。
-
最终,该模型将使用更多细节来生成图像。然而,有时文本描述包含多个目标,并且单个文本描述无法捕获图像中的所有细节。Sharma 等人提供了一个对话界面,该界面使用对话中的文本信息来获取有关图像的更详细信息。
-
另一组文本到图像算法基于具有嵌入的变体自动编码器。与生成方法不同,编码器的输入是属性向量。 Akata 等人探索了来自不同来源的语义特征,例如 WordNet 和词嵌入。然而,这些方法无法在没有部分术语注释的情况下识别图像的部分。埃尔霍赛尼等人使用视觉分类器仅使用文本术语和没有部分注释的测试来检测鸟类图像数据集中的补丁。结果表明,视觉文本信息和鸟类部位可以用零样本联系起来。
Discussion and Summary
- 多模态 FSL 仍处于发展阶段,目前存在几个挑战:如何组合来自异构域的数据,如何处理不同模态组合过程中出现的不同级别的噪声,以及如何共同学习。表 8 将多模态中的 FSL 任务分类为表示、对齐、融合、共同学习和翻译。在多模态 FSL 中,良好的特征表示应该能够根据观察到的模态信息填充缺失的模态。未来将会出现更多的方法,远远超出模态嵌入和从图像生成语义信息的范围。
-

-
表 8 在多模态中从小样本中学习的挑战。
-
FSL APPLICATIONS IN COMPUTER VISION
- 在过去的五年里,我们系统地梳理和总结了计算机视觉领域的FSL,并将任务分为图像分类、目标检测、语义分割和实例分割。下面按照时间维度,以图表的形式进行详细总结。通过阅读本节,读者将能够全面掌握计算机视觉领域的FSL。
-

-
表9 FSL在计算机视觉图像分类任务中的最新表现
-
Few-shot Image Classification
- 在FSL计算机视觉分类任务中,每个任务可能只包含一个或几个样本。解决少样本图像分类任务主要通过数据增强、迁移学习、元学习和多模态融合学习来解决。目前准确率排名前三位的方法都是基于主干模型的特征增强和特征变换。在本节中,我们研究了 2016 年至今的所有小样本图像分类模型,并统计了所有模型在 mini-ImageNet 基准数据集上的最佳性能。这里我们使用 5-way-1-shot 和 5-way-5-shot 作为基线任务。表 9和图14说明了我们的调查结果。
Few-shot Object Detection
- 少样本物体检测(FSOD)是从多个样本中检测稀有物体的任务。 FSL 在图像分类方面取得了很大进展,但在目标检测方面却很少。目前少样本目标检测的发展可分为三个主要阵营:数据增强、迁移学习和元学习。其中,注意力机制在小样本目标检测中发挥着举足轻重的作用。同样,为满足实时要求而进行的几次目标检测的推理速度慢的问题仍然很严重。表10和图14用于显示FSL中物体检测的最新进展。
-

-
表10 2019-2021年FSL在少样本目标检测任务中的最新性能
-
Few-shot Semantic Segmentation
- Few-shot语义分割最早在中提出,直到2017年。它已广泛应用于医学图像和无人驾驶汽车等场景。与传统的语义分割不同,few-shot语义分割在支持数据集中的像素注释信息较少。据我们所知,少样本语义分割可以大致分为有监督语义分割、无监督语义分割和视频语义分割。在机器学习阶段,比较经典的做法是利用概率映射作为先验知识进行推导。在深度学习阶段,出现了大量高效的分割工具算法,但这些模型往往需要大量的手动样本标注。最近,通过提出一种更简洁的范例,对少样本语义分割做出了重大改进,其中仅对分类器进行元学习,而特征编码解码器仍然使用传统的分割模型进行训练。提供表11和图14显示了少样本语义分割。
-

-
表 11 2019-2021年FSL在few-shot语义分割任务中的最新表现
-
Few-Shot Instance Segmentation
- 与语义分割相反,实例分割涉及识别图像中的每个像素并单独对其进行标记。最近,很少有研究处理分割少数实例样本的问题。目前的工作仍然集中在如何使用一些有效的工具来改进 R-CNN。最近的工作提出了一种增量少样本实例分割算法,极大地提高了基准数据集的性能。在本节中,我们调查了近三年有关少镜头实例分割的论文。表 12和图14显示了few-shot实例分割的研究进展。
-

-
表 12 2018-2021 年 FSL 在少样本实例分割任务中的最新性能。
-
FUTURE DIRECTION AND OPPORTUNITIES OF FSL
- 最近的大量工作在 FSL 的各种任务设置方面取得了可喜的进展。尽管如此,对于更具挑战性的场景,训练和验证数据集都很小,其他数据的分布既不能帮助评估真实样本,也没有用于迁移学习的大量训练数据或验证数据集。而且,元学习也没有足够的任务来初始化参数。根据本次调查中提出的分类法,在本节中我们提出了 FSL 未来几个可能的研究方向。此外,通过对 FSL 的全面调查还介绍了应用程序和算法的最新进展。
Better evaluation of data distribution
- FSL的本质是支持数据集太小而无法评估真实的数据分布。那么到底怎样才能利用有限数量的样本来最大化评估真实数据分布呢?最新的工作正在这个方向上做出了有益的尝试,提出了分布校正的思想,通过计算校正基类的均值和协方差,然后可以直接使用线性分类器来获得良好的结果。事实上,当少数样本足够准确地估计真实数据分布时,FSL 和传统深度学习之间的差异并不够大。这是一个令人兴奋的探索方向。同样,在计算机视觉领域,FSL也没有基于真实应用场景的任务设置或数据集。
- 大部分工作仍然集中在利用和挖掘图像数据中的信息。目前主流的基准数据集都或多或少存在着各种问题:mini-Imagenet数据集存在一些不合适的样本或太难的样本,例如实体遮挡、同一图像中的多个对象等。Omniglot数据集距离实际应用还很远,在现实应用中不容易受到启发。 BSCD-FSL提供了更暴力的跨域FSL基准数据集,涉及卫星图像、医学图像。到目前为止,还没有基准数据集可以在细粒度细节上评估模型的泛化能力。开发和完成 FSL 领域的基准数据集将为 FSL 当前的最新技术提供更现实的评估。
Improving the robustness of data-to-label mapping
- BSCDFSL 的出现给 FSL 带来了新的挑战。它的出现探索并揭示了当前FSL跨领域学习解决方案的局限性。最近的研究在该领域取得了一些出色的成果,例如巧妙设计的任务调优、更复杂的超参数调优、辅助数据集的形成以及领域无关特征的提取。目前,微调在迁移学习和元学习的交叉点上已经表现得非常强劲。尽管如此,这两种技术仍然非常不同。预训练可以看作是学习多类任务,但它是单任务学习。另一方面,元学习是一种多任务学习方法。是否有更好的模型能够将元学习和微调结合起来,最大限度地提高模型的性能,同时降低元学习的计算复杂度,是目前值得研究者们进行更深入讨论和交流的方向。
Learn meta-knowledge more effectively from historical tasks
- 元学习仍然仅限于在定义的网络结构下特定任务空间的表现。对于分类任务,目前只能考虑分类任务之间的关联。是否有可能有一个框架可以同时兼顾分类、检测、预测、生成等任务?这将使元学习在某种程度上与任务的概念分离。最近的一些工作试图将每个小批量作为一个整体进行优化。在这种情况下,如何优化内循环将是高效应用优化的一个重要方向。未来,预训练和微调将成为FSL的主流算法。目前,元学习仍在探索任务之间的相关性,尚未出现相关理论来解释元学习背后的因果关系。随着因果论框架的发展,元学习可能会成为一个更通用的框架。
Full convergence of multimodal information
- 多模态学习是目前解决FSL问题的新兴方法,它通过在没有监督信息的情况下自动学习边缘场景中的小样本任务并快速迁移到来自不同领域的数据。它被广泛认为是从有限领域的弱人工智能向通用人工智能的路径探索。在多模态学习场景中实施预训练和微调可以在很大程度上实现跨不同任务使用统一的特征表示。例如,跨模态理解和跨模态生成。多模态预训练模型的出现可以支持多种任务、跨多种场景泛化,并具有强大的大规模泛化和复制能力。在融合两种或多种类型的信息(包括语义信息)方面已经进行了大量的工作。尽管如此,主要工作仍然集中在像素和语义信息上,功能相对单一。为了有效解决多模态下的特征重用并降低数据标注成本,业界迫切需要实现一种强大的涉及三种及更多模态融合的预训练模型。
CONCLUSION
-
作为深度学习的一个重要分支,few-shot Learning不需要大量的数据,而是选择更软的方法来解决问题,可以与迁移学习、元学习和数据增强等技术完美结合。在本文中,我们以问答的形式对 FSL 进行了全面的调查,可以轻松区分容易混淆的概念,并总结了 FSL 下丰富的基线数据集。此外,我们还针对新分类法下 FSL 的发展挑战提供了独特的见解。根据各阶段知识的融合程度,深入分析相关研究方法的演变。此外,为了阐述的完整性,我们还比较和分析了FSL在计算机视觉领域的最新进展。最后,我们根据大量的最新文献提出了未来可能的研究方向和机会的列表。总体而言,本文对近三年来FSL的前沿进展进行了全面、全面的总结,有望为FSL及其相关领域的协同发展做出贡献。
-
数据增强:最大化评估真实数据分布,通过生成 / 扩展样本,缓解 “少量样本无法反映真实数据分布” 的问题,分为两类:手工规则(依赖领域专家知识);自动学习数据处理(结合元学习)。
-
类型 核心方法 代表模型 数据级 随机擦除、裁剪、图像变形、互联网数据爬取 FTT(线性插值瞬态属性)、CSEI(擦除修复)、AdarGCN(网页数据去噪) 特征级 高维特征映射、协方差保持、局部 patch 特征融合 Covariance-Preserving Adversarial Network、Spot and Learn(强化学习选 patch) -
自动学习数据处理(结合元学习):DADA(自动生成增强策略)、AFHN(对抗特征幻象网络)、MetaGAN(任务条件对抗生成),可跨任务复用,无需人工设计规则
-
-
迁移学习:构建数据 - 标签映射,通过预训练从大规模辅助数据提取先验知识,再微调适配少样本任务,分为两类:
- 预训练 + 微调:预训练(用 ImageNet 等大数据集训练特征提取器,输出高维特征)→ 微调(冻结底层参数,仅更新分类层),5-way-1-shot 任务精度比基线高 2%-7%(如 BERT 在 NLP、ResNet 在 CV 领域)
- 跨域 FSL(解决域间隙问题):源域与目标域分布差异大时,知识迁移效果差;解决方案:特征对齐(FRN 用岭回归重构特征)、域无关特征提取(FD-MIXUP 用 mixup 构建辅助数据)、半监督跨域(STARTUP 利用未标记目标数据)
-
元学习:学习任务到目标模型的映射,通过任务 / 数据双采样,让模型 “学习如何学习”,适配未见过的少样本任务,分为三类:
-
学习模型参数:代表模型:MAML(寻找全局最优初始化参数)、Reptile(降低计算复杂度)、Meta-SGD(同时学习学习率),任务差异大时效果差,依赖网络结构
-
模型类型 核心逻辑 代表模型 孪生网络 输入样本对,判断相似度(二分类) Siamese Neural Network 原型网络 计算类别原型(特征平均),最小化类内距离 Prototypical Network(引入正负边际损失提升泛化) 关系网络 用神经网络计算非线性相似度 Relational Network -
学习信息传递(基于图神经网络 GNN):代表模型:EGNN(考虑节点相似度与差异)、DPGN(双图融合实例 / 分布级关系)、HGNN(解决 GNN 层浅问题),运用在少样本图像分类、语义分割。
-
-
核心创新点:传统分类法(如分为元学习、度量学习)仅从 “方法类型” 划分,而文档的新分类法基于 “知识抽象程度”,并紧扣 FSL 的核心挑战(数据分布评估不准、特征复用敏感、任务通用性差、单模态信息缺陷),理解方法背后的动机,而非仅局限于模型本身。
-
单模态学习:解决单模态下的局部挑战,细分为三类:数据增强:解决 “少量样本无法评估真实数据分布” 的挑战,通过扩展样本最大化分布覆盖;迁移学习:解决 “特征复用敏感” 的挑战,通过预训练 + 微调提取先验知识,构建数据 - 标签映射;元学习解决 “未来任务通用性” 的挑战,通过任务 / 数据双采样,学习任务到目标模型的映射。多模态学习解决 “单模态信息缺陷” 的挑战,融合文本、图像等多模态信息,补充少样本任务的有效信息。
-
元学习作为解决 FSL 的主流方法,其在 FSL 中的核心优势是任务空间抽象能力:通过双采样数据和任务空间,模型能总结不同任务的元知识,快速适配未见过的少样本任务(如 MAML 通过多任务优化找到全局最优初始化参数,仅需少量迭代即可适配新任务);独立性:元学习不依赖特定问题,更面向未来任务而非仅优化当前任务,比迁移学习在标准 FSL 场景(任务相似性高)性能更优。关键局限在于任务依赖性强:当训练任务与目标任务存在显著域间隙时,元学习效果极小;网络结构依赖:需为差异大的任务重新设计网络结构,灵活性差;计算复杂度高:如 MAML 的二阶梯度计算成本高。
-
FSL 常与传统机器学习(ML)、迁移学习(Transfer Learning)、元学习(Meta-Learning)混淆,下表从 “核心目标”“数据需求”“任务关系” 三个维度辨析:
-
概念 核心目标 数据需求 任务关系(训练 vs 测试) 与 FSL 的联系 / 区别 传统 ML 从大规模标注数据中学习,优化当前任务性能 需大量标注数据(每类数百至数万样本) 测试集类别包含于训练集 区别:FSL 支持集与查询集类别无重叠;联系:FSL 是 ML 的分支,解决 ML “数据饥渴” 问题 迁移学习 将源域(大数据)知识迁移到目标域(相关任务) 源域需大规模数据,目标域数据可多可少 源域与目标域任务相关(如 “图像分类→缺陷检测”) 联系:FSL 可视为迁移学习的特殊场景(目标域为少样本);区别:迁移学习侧重 “域迁移”,FSL 侧重 “样本量少” 元学习 “学习如何学习”:从多任务中提取元知识,适配新任务 需大量 “任务”(每个任务含少量样本) 训练任务与测试任务同分布(如均为图像分类) 联系:元学习是解决 FSL 的主流方法;区别:元学习是 “方法框架”,FSL 是 “目标”(元学习可用于非 FSL 场景,FSL 也可通过迁移学习实现)
-
-
单模态学习是当前 FSL 的主流方向,针对 “数据、特征、任务” 三个层级的挑战,分为三类方法:
-
方法类型 解决的挑战 解决角度 作用效果 核心意义 数据增强 数据分布评估不准 从 “数据量” 入手:通过生成 / 扩展样本,最大化覆盖真实数据分布 缓解模型过拟合,提升数据分布估计准确性 最直接的 “少样本补充” 手段,无需依赖外部知识 迁移学习 特征复用敏感 从 “知识复用” 入手:预训练提取通用特征,微调适配少样本任务 提升少样本任务精度(如 5-way-1-shot 任务高 2%-7%) 连接 “大规模数据” 与 “少样本任务” 的桥梁 元学习 任务通用性差 从 “任务抽象” 入手:双采样数据 / 任务空间,提取元知识 快速适配未见过任务(仅需少量迭代) 实现 FSL “举一反三” 的核心框架
-
-
手工规则(Hand-Crafted Rules):依赖领域专家知识,对样本进行 “像素级” 或 “特征级” 改造:数据级:随机擦除(Random Erase)、裁剪(CutMix)、图像变形(如模拟不同光照),代表模型如 FTT(线性插值瞬态属性)、CSEI(擦除修复少样本特征);特征级:将像素映射到高维特征空间,如 Covariance-Preserving 网络(保持特征协方差,减少噪声)、Spot and Learn(用强化学习选择局部 patch 特征)。自动学习数据处理(Learned Data Processing):结合元学习,自动生成适配任务的增强策略,可跨任务复用。
-
元学习的本质是 “学习任务到目标模型的映射”,分为三类实现路径:
- 学习模型参数:寻找 “通用初始化参数”,让模型仅需少量迭代即可适配新任务,代表模型如 MAML(模型无关元学习,通过内外循环优化全局参数)、Reptile(简化 MAML 计算,降低复杂度);
- 学习度量算法:定义 “样本相似度度量规则”,直接判断查询集与支持集的关联,代表模型如孪生网络(Siamese Network,判断样本对相似度)、原型网络(Prototypical Network,计算类别原型并最小化类内距离);
- 学习信息传递:用图神经网络(GNN)传递样本 / 任务间的关联信息,代表模型如 DPGN(双图融合实例级与分布级关系)、HGNN(解决 GNN 层浅问题,保留节点层级关联)。
-
多模态学习通过融合 “图像、文本、音频” 等多维度信息,解决 FSL “单模态信息缺陷” 的挑战,核心是 “信息互补与冗余去除”:
- 多模态嵌入:将不同模态特征对齐到同一空间,如 GVSE(融合视觉、语义、门控度量,自动平衡各模态权重)、Schonfeld 等(用变分自编码器 VAE 建模语义特征,与视觉特征对齐);
- 语义生成:从文本生成图像辅助 FSL,如 Chatpainter(通过对话获取文本细节,生成更精准图像)、Akata 等(用 WordNet 语义特征生成图像部件,实现零样本识别)。
FSL 主流方法解析
-
元学习:MAML 及其变体(任务通用性的核心),比如MAML(Model-Agnostic Meta-Learning),核心逻辑:通过 “内外循环” 优化 “通用初始化参数”,内循环(任务级优化):对每个训练任务,用支持集更新参数,计算查询集损失;外循环(元级优化):基于所有任务的损失,更新初始化参数,确保参数对 “未见过任务” 的适配性。局限:二阶梯度计算复杂,训练成本高。
-
度量学习:原型网络(少样本分类的标杆),对支持集中的每个类别,计算所有样本的 “特征平均”,得到该类别的 “原型(Prototype)”;计算查询集样本与各原型的距离(如欧氏距离),将查询集归为 “距离最近的原型类别”;引入 “正负边际损失”:最大化类间距离、最小化类内距离,提升泛化能力。无需复杂参数更新,推理速度快,适合实时场景(如工业质检)。
-
迁移学习:预训练 + 微调(工程落地首选),无需重新设计模型,直接复用成熟的预训练模型(如 ResNet-50、BERT);微调成本低,仅需少量支持集样本即可提升性能。分层微调:冻结底层(如 ResNet 的前 10 层)、微调中层,平衡 “通用特征” 与 “任务适配”;余弦相似度替换激活函数:如 Dhillon 等用余弦相似度替代 ReLU,提升少样本分类准确率 2%-3%。
-
多模态学习:GVSE(跨模态少样本的代表),融合 “视觉特征”“语义特征”“门控度量” 三个模块:视觉特征:从图像中提取 CNN 特征;视觉特征:从图像中提取 CNN 特征;门控度量:自动学习各模态的权重,平衡视觉与语义的贡献。为 “无标注少样本场景” 提供解决方案(如仅用文本描述即可识别未见过的图像类别)。
更多推荐

所有评论(0)