【知识总结系列】- 预训练模型系列算法整理总结

作为新手想要如何学习大模型,从那个大模型开,如何选择。本文就从三维视觉领域的角度对一些相关的视觉大模型进行介绍,如何选择和学习大模型。应用到三维视觉领域的肯定是图像多模态的大模型。


持续更新中~


BLIP和CLIP区别

BLIP (Bootstrapped Language-Image Pretraining) 和 CLIP (Contrastive Language-Image Pretraining) 都是多模态学习领域的关键模型,二者均致力于实现图像与文本的对齐,然而在方法、设计等诸多方面存在明显差异。接下来将详细剖析它们的不同之处:


(一)模型目标

  1. BLIP
  • 核心任务:着重于强化图像 - 文本配对的能力,与此同时能够生成高品质的文本描述,典型应用如生成图像标题。
  • 设计目标:聚焦于生成与理解,非常契合像图像描述生成以及多模态推理这类需要深度语义挖掘的任务。
  1. CLIP
  • 核心任务:专注于优化图像和文本的对比学习,以此达成高效的跨模态检索,像图文检索、文本到图像匹配等任务都能出色完成。
  • 设计目标:将重点置于对比表示学习,致力于训练图像和文本的语义向量空间精准对齐,为检索及表示学习任务量身打造。

(二)方法论

  1. BLIP
  • 预训练方法:创新性地融合生成式(captioning)与对比式(contrastive learning)的多任务预训练策略。
  • 模型结构:采用 Encoder - Decoder 架构(基于 Transformer),巧妙结合文本生成任务与对比学习,让模型兼具多种能力。
  • 训练数据:依托对比学习以及自监督式语言生成任务,所采用的数据集中蕴含高质量的图像 - 文本配对信息。
  1. CLIP
  • 预训练方法:凭借对比学习在海量规模的数据集上展开训练,全力最大化正样本的对齐得分,以提升模型性能。
  • 模型结构:运用双塔结构(Two - Tower Architecture),图像编码器与文本编码器相互独立,各自生成对应的向量表示。
  • 训练数据:充分利用大规模互联网数据,尽管图像和文本的配对关系存在较多噪声,但凭借庞大的数量(如 4 亿对)优势,依然能够训练出强大的模型。

(三)应用场景

  1. 图文检索
  • BLIP:能够为图文检索任务提供支持,特别是在需要深度理解图像深层语义时,展现出卓越的性能表现。
  • CLIP:堪称图文检索的强项领域,凭借快速高效的图文对齐能力,尤其在规模化的检索任务中表现突出。
  1. 图像描述
  • BLIP:更善于生成高质量的图像描述,例如自动生成图像标题、围绕图像创作故事等任务都能轻松应对。
  • CLIP:并不擅长图像描述这类生成任务,其优势主要集中在图像和文本的对齐以及特征表示方面。
  1. 多模态推理
  • BLIP:十分适配复杂的多模态推理任务,比如 VQA(视觉问答)和 NLVR(自然语言视觉推理),能够深入挖掘多模态信息背后的逻辑关系。
  • CLIP:更倾向于浅层语义匹配,对于复杂推理场景的应对能力相对薄弱。

(四)模型架构对比

  1. BLIP架构
  • 输入:同时接收图像和文本作为输入源。
  • 模型结构
    • 图像部分借助视觉编码器(如 Vision Transformer)提取关键特征。
    • 文本方面则通过语言编码器(如 BERT)生成相应的表示。
    • 利用生成式解码器进行描述生成,并且在表示层巧妙融入对比学习,实现多种功能的有机结合。
  • 多任务设计
    • 图像描述生成(captioning),满足生成高质量文本描述的需求。
    • 图像 - 文本对比学习(contrastive learning),强化图像与文本的关联匹配。
  1. CLIP架构
  • 输入:同样以图像和文本作为输入素材。
  • 模型结构
    • 图像通过独立的视觉编码器(如 ResNet 或 Vision Transformer)进行特征提取。
    • 文本借助单独的语言编码器(如 Transformer)生成向量表示。
    • 两个编码器的输出在共享的特征空间中进行对齐,通过对比损失持续优化,确保图像与文本的语义对齐。
  • 单任务设计:专注于对比学习这一单任务,将其做到极致,以实现高效的跨模态检索。

(五)优缺点总结

  1. BLIP
  • 优点:对生成任务提供了强有力的支持,能够胜任更深层次的语义理解与推理任务,挖掘多模态信息的潜在价值。
  • 缺点:对训练数据的质量有着较高的要求,并且生成任务往往需要较为复杂的后处理流程来优化结果。
  1. CLIP
  • 优点:得益于大规模的训练数据,模型的跨模态对齐性能极为优异,在检索类任务上表现卓越,能够快速准确地匹配图文信息。
  • 缺点:对于复杂的推理和生成任务,CLIP 的应对能力略显不足,主要精力集中在语义对齐层面,缺乏深度推理和生成能力。

(六)如何选择?

  1. 检索任务(如图文匹配、文本到图像检索)
  • 强烈推荐使用 CLIP,其卓越的对比学习机制在检索任务中能够发挥出最大优势,快速准确地找到匹配的图文信息。
  1. 生成任务(如图像描述生成、视觉问答)
  • 优先考虑使用 BLIP,它独特的生成式设计使其在这类场景下能够生成高质量的文本内容,满足实际需求。
  1. 综合任务(如多模态推理、跨模态表示学习)
  • BLIP 在综合任务上展现出更强的能力,能够应对复杂的多模态信息处理,但与此同时,模型的复杂度也相对较高,需要投入更多的计算资源和时间进行训练与优化。

倘若你刚刚踏入多模态学习的领域,可以先从 CLIP 着手,熟悉图文对齐的基础知识,待有一定基础后,再逐步深入探究 BLIP 的生成能力以及多任务设计,循序渐进地掌握多模态学习的精髓。


DINO和DINOv2模型的区别和介绍


(一)DINO和DINOv2模型介绍

DINODistillation with No Labels)和DINOv2是Meta AI提出的用于自监督学习的视觉模型,二者在视觉任务(如分类、分割和目标检测)中取得了显著性能。以下详细介绍它们的背景、结构、特点和区别。


(二)DINO模型

  1. 背景
    DINO是一种无监督的视觉学习方法,旨在通过对比学习和自监督的方法训练视觉Transformer模型(ViT),无需人工标注。DINO的核心思想是利用教师 - 学生蒸馏框架,逐步引导模型学习数据中的语义信息。

  2. 核心架构
    DINO的训练框架由两个主要部分组成:

  • 教师模型
    • 由冻结的ViT模型构成,提供目标特征表示。
  • 学生模型
    • 一个可训练的ViT模型,学习对齐教师模型的特征输出。

教师模型的特征输出被用于监督学生模型的训练,而这两者通过不同的数据增强实现特征的一致性。

  1. 训练流程
  • 数据增强:对同一图像进行多种数据增强(如裁剪、翻转)。
  • 特征对齐:通过教师模型和学生模型提取特征,比较它们的特征表示。
  • 蒸馏损失:学生模型通过优化目标对齐教师模型的0输出。
  1. 特点
  • 不需要标签:利用自监督学习,仅依赖未标注数据。
  • 基于对比学习:通过不同增强方式实现特征对齐。
  • 语义表示:生成强大的全局和局部特征,适合下游任务(如图像分类和分割)。
  1. 应用
  • 图像分类
  • 对象分割
  • 聚类分析

(三)DINOv2模型

  1. 背景
    DINOv2是DINO的改进版本,进一步优化了训练框架和特征学习能力,成为一种更通用的视觉特征生成器。DINOv2专注于可转移性和通用性,使得训练后的的特征可以直接用于下游任务,而无需微调。

  2. 核心改进

  • 数据增强改进:采用更强大的数据增强策略,生成更加丰富的输入特征。
  • 模型架构优化:使用改进的ViT架构(如多头注意力机制的优化)。
  • 大规模数据集训练:通过高质量的大规模无标注数据进行训练。
  • ,高效训练框架:使用分布式训练和优化的蒸馏策略。
  1. 训练流程
  • 与DINO相似,DINOv2也采用教师 - 学生架构。
  • 教师模型通过冻结参数提供稳定的语义表示。
  • 学生模型通过对比损失优化特征对齐。
  1. 特点
  • 高可转移性:生成的特征在多个任务中表现出色,无需微调。
  • 语义一致性:特征表示在全局和局部范围内保持一致。
  • 通用性:适用于分类、检测、分割、聚类等多种任务。
  1. 应用
  • 图像分类:直接使用提取的特征完成分类任务。
  • 目标检测:在COCO数据集上表现出优异的分割性能。
  • 图像检索:在无监督场景中实现高精度的相似图像检索。

(四)DINO与DINOv2的对比

特性DINODINOv2
监督方式无监督学习(自监督)无监督学习(自监督)
模型架构Vision Transformer (ViT)改进的Vision Transformer (ViT)
目标生成语义特征表示高质量的通用特征提取器
数据增强标准增强策略更复杂的增强策略
适用场景图像分类、分割多任务,包括检测和分割
训练规模中等规模大规模数据集
特性可转移性中等水平强大
语义表达能力更强

(五)技术细节

  1. 蒸馏与对比损失
  • 蒸馏损失:
    学生模型通过最小化KL散度来对齐教师模型的输出。
  • 对比学习:
    利用增强后的不同视图,计算它们之间的余弦相似度,鼓励语义一致。
  1. 视觉Transformer (ViT)
  • 自注意力机制:学习图像中不同部分的关系,生成全局特征表示。
  • 多头机制:为每个头分配特定的特征学习目标。
  1. 大规模数据集
  • DINO和DINOv2依赖高质量、无标注的大规模数据集进行训练,覆盖多种场景和类别。

(六)DINO/DINOv2与其他模型的对比

模型特点应用场景
DINO自监督学习,生成语义表示分类、分割、聚类
DINOv2通用特征提取,高可转移性多任务(分类、检测、分割)
CLIP图文对齐,支持多模态任务图像 文本检索
SimCLR对比学习,需较大的批次图像分类
MAE自监督掩码预测特征预训练

(七)总结

  • DINODINOv2是自监督学习领域的突破性模型,旨在通过无标注的学习框架提取高质量特征。
  • DINOv2在通用性和特性可转移性上进一步优化,适用于更广泛的任务。
  • 未来发展可能会结合多模态学习(如结合CLIP)和更高效的训练策略,推动自监督学习技术进一步。

ViT/ DINOv2 模型的特点和区别

Vision Transformer (ViT)DINOv2 都是计算机视觉领域的重要视觉模型,二者在目标、设计思路以及具体特性上存在差异。接下来将对它们展开详细介绍与对比:


(一)Vision Transformer (ViT)

  1. Transformer 架构引入计算机视觉
    • ViT 开创性地将 Transformer 架构应用于计算机视觉任务,是该领域的一大突破。
    • 借鉴自然语言处理(NLP)的类似架构,把图像当作序列来处理。
  2. 图像处理方式
    • 首先将输入图像划分成固定尺寸的图像块(patches),例如常见的 16×16 像素大小。
    • 把每个图像块展平为一维向量,类比 NLP 中的“单词”。
    • 运用线性变换对这些图像块进行嵌入(embedding)操作,从而构建起图像块序列。
  3. 自注意力机制
    • 借助多头自注意力机制,ViT 能够捕捉图像块之间的全局关联,突破了传统卷积神经网络局部感受野的限制。
    • 由于不依赖卷积操作,ViT 在模型架构上更加灵活通用。
  4. 性能和规模
    • 在大规模数据集(如 ImageNet)上经过充分训练后,ViT 展现出卓越的性能表现。
    • 不过,ViT 对训练数据的规模以及预训练环节有着较高的依赖度,在小数据集场景下,其效果可能逊色于传统的卷积神经网络(CNN)。
  5. 优点
    • 全局感受野优势:通过自注意力机制,ViT 可以直接对远距离的图像块关系进行建模,使得模型能够感知到图像的全局信息。
    • 出色的可扩展性:随着模型参数数量的增多以及训练数据量的扩大,ViT 的性能能够得到显著提升。
  6. 缺点
    • 对小规模数据集的适应能力较差,泛化性能不佳。
    • 由于模型复杂度较高,对计算资源的需求颇为可观。

(二)DINOv2

  1. 自监督学习
    • DINOv2 作为一种先进的自监督学习方法,最大的亮点在于无需人工标注数据即可进行训练。
    • 其核心目标是构建强大且通用的视觉表征,能够无缝适配多种下游任务。
  2. 基于 Transformer 的模型架构
    • 以 ViT 或与之类似的 Transformer 架构为基石,充分发挥 Transformer 在处理序列数据方面的优势。
    • 作为 DINO 方法的进阶版本,DINOv2 融入了更为强大的表征学习技术,进一步提升模型性能。
  3. 目标函数和机制
    • 采用**知识蒸馏(knowledge distillation)**策略开展自监督训练。
    • 具体而言,通过并行训练一个教师网络和一个学生网络,让学生网络学习教师网络的输出,以此增强特征表征能力。
  4. 多任务适配性
    • DINOv2 所提取的特征能够直接应用于多种下游任务,涵盖分类、目标检测、语义分割等诸多领域。
    • 在无监督场景或者标签稀缺的实际应用环境中,DINOv2 展现出独特的优势。
  5. 改进点
    • 引入增强的正则化技术,使得模型训练过程更加稳定可靠,减少过拟合风险。
    • 当拓展到更大规模的数据集时,DINOv2 的模型性能能够获得更为显著的提升。
  6. 优点
    • 无监督学习优势:极大地减少了对标注数据的依赖,降低了数据标注成本。
    • 强大的泛化能力:生成的特征具备良好的迁徒性,能够轻松应用于不同类型的任务。
    • 相对轻量化:相较于一些需要大量标注数据的监督模型,DINOv2 在标注需求上更为简约,同时对计算资源的要求也较为适度。
  7. 缺点
    • 与完全基于监督学习的方法相比,在某些特定任务上,DINOv2 的性能可能会存在一定差距。
    • 尽管无需标注数据,但自监督训练过程仍然需要海量的无标注数据集作为支撑。

(三)ViT 和 DINOv2 的区别

对比点ViTDINOv2
模型类型基于 Transformer 的视觉模型基于自监督学习的视觉模型
主要任务监督学习,常用于图像分类等任务自监督学习,专注于生成通用特征表征
训练方式依赖标注数据进行监督训练通过自监督方式训练,无需标签
输入处理将图像分割为固定块后直接馈入 Transformer类似 ViT 分割图像为块作为输入基础,优化特征学习
应用场景图像分类、目标检测、语义分割等涵盖更广泛的下游任务,如分类、检索、分割和检测等
数据需求对标注数据需求量大对无标注数据需求量大
泛化能力高度依赖标注数据,泛化能力受预训练数据制约特征表征通用性强,便于多任务迁移
优缺点优点:监督学习下性能优异,扩展性佳优点:无监督学习,特征通用性强
缺点:对标注数据和,计算资源依赖严重缺点:无监督训练耗时,性能略逊于监督模型

(四)如何选择学习和使用?

任务导向:
- 当手头任务聚焦于图像分类,或者需要高度优化的监督学习模型来实现精准预测时,ViT 是更为合适的选择。
(此处有错误,应为:
- 当手头任务聚焦于图像分类,或者需要高度优化的监督学习模型来实现精准预测时,ViT 是更为合适的选择。
- 倘若任务侧重于获取通用视觉表征,以适配多样化的下游任务,又或者拥有大量无标签数据可供利用,那么DINOv2 无疑是首选。)

数据情况:
- 若手头掌握有大量标注数据,这些数据能够为模型训练提供充足的监督信息,此时建议优先选用ViT
- 反之,若面临数据稀缺甚至无标注数据的困境,DINOv2 的自监督学习特性使其能够在这种条件下依然发挥出色,应作为优先考虑对象。

计算资源:
- 由于ViT 的模型复杂度以及对大规模训练数据的要求,其训练过程对计算资源的需求极为苛刻,需要配备强大的硬件设施来支撑。
- 相比之下,DINOv2 虽然也需要大数据集,但在计算资源要求上相对适中,更适配中等规模的计算资源环境。


总结

  • ViT 作为视觉领域的开创性模型,成功将 Transformer 架构引入图像处理流程,但其性能高度依赖标注数据。
  • DINOv2 则凭借强大的自监督学习能力,在无监督表征学习领域表现卓越,尤其适合多任务应用场景。

Stable Diffusion 模型介绍

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐