日攻一卒 ---- SimCLR -自监督学习方法
·
知识扩充:
自监督学习(Self - Supervised Learning): 在没有标注标签的情况下,通过利用数据的自身特点进行学习的一种机器学习方法。
数据增强(Data Augmentation): 在保持样本标签不变的前提下,对原始数据进行一系列变化,如旋转、缩放、裁剪、翻转、色彩变化等,从而增加样本的多样性和数量。 是一种常见的数据预处理方法, 可以提高模型的泛化能力,降低过拟合风险,提高模型在不同环境下的鲁棒性。
对比学习(Contrastive Leaning): 学习如何将不同的样本区分开, 即学习将不同的样本映射到不同的空间位置上。 通常通过比较两个样本的相似性来学习,将相似的样本映射到相近的空间位置上, 将不想死的样本映射到远离的空间位置上。 对比学习通常用于自监督学习和无监督学习, 可以学习到具有高鲁棒性的特征表示。
是什么?
是一种用于自监督学习的方法,全称是 “Simple framework for Contrastive(对比的) Learning of Visual Representations(表现)”。
通过对图像进行数据增强和对比学习来学习到有用的特征表示,从而在没有标签的情况下实现了有监督学习的效果。
为什么被引入?
他的提出主要是为了解决在没有标注数据的情况下,如何训练出具有高泛化性能的图像特征表示
怎么使用?
核心思想: 使用同一张图片的不同变化来生成 “相似" 的图像对, 然后通过对这些正样本进行 对比学习 来学习到图像特征。
具体来说,SimCLR 首先对每个样本应用不同的数据增强方法(如随机裁剪、旋转、颜色抖动等),来生成不同版本的同一张图片。然后将这些变化后的图片对 作为正样本 输入到模型中。
在对比学习阶段, 模型将正样本对比较, 并将他们 映射到相似的 嵌入空间中。
同时, 模型还将每个正样本与其他负样本对比较,并将他们映射到不同的嵌入空间中。
通过最小化正样本之间的差异,并最大化正样本与负样本之间的差异, SimCLR 可以学习到对图像数据的更好的表示。
使用SimCLR方法步骤:
1、 准备数据集: 从原始数据中生成多个变换后的图像对
2、 构建模型: 构建一个卷积神经网络, 用于从图像中学习特征表示
3、 训练模型: 使用对比损失函数训练模型。 对比损失函数的目标是将相似的图像嵌入到相邻的空间中, 将不相似的图像嵌入到远离的空间中。
4、 在目标任务上微调: 将预训练模型的权重初始化到目标任务的模型中, 并使用标注数据微调模型,以获得更好的性能。
更多推荐
所有评论(0)