• 论文链接:

    https://arxiv.org/pdf/2404.18947

简介

多模态融合侧重于整合多种模态的信息,以实现更准确的预测,在自动驾驶、医疗诊断等多种场景中取得了显著的进展。然而,多模态融合的可靠性在很大程度上仍未得到探索,特别是在低质量数据设置下。本文调查了多模态融合的常见挑战和最新进展,并以数据为中心的角度,确定了低质量数据的多模态融合面临的四个主要挑战,即 (1)被异质噪声污染的噪声多模态数据,(2)缺少某些模态的不完整多模态数据, (3)不平衡多模态数据,不同模态的质量或属性显著不同;(4)质量变化多模态数据,每种模态的质量相对于不同样本动态变化。这种新的分类法将使研究人员能够了解该领域的现状并确定几个潜在的方向。本文还对该领域的开放问题以及有趣的未来研究方向进行讨论。

四个核心技术挑战

图 1:低质量多模态数据机器学习挑战的图示。蓝色和金色代表不同的形态。颜色越深表示质量越高。

当前的多模态融合在低质量数据场景下表现不佳,如在存在噪声、不完整或模态不平衡的数据下。由于现实中的多模态数据质量常常不一致,传统的方法可能会失败。本文确定并探索了围绕低质量多模态数据的多模态融合的四个核心技术挑战(如图1所示):

  • 嘈杂的多模态数据。 第一个基本挑战是学习如何减轻多模态数据中任意噪声的潜在影响。高维多模态数据往往包含复杂的噪声。多模态数据的异质性使其具有挑战性,同时也提供了通过探索不同模态之间的相关性来识别和减少潜在噪声的机会。

  • 多模态数据不完整。 第二个基本挑战是使用不完整的多模态数据进行学习。例如,在医疗领域,即使患有相同的疾病,患者也可能选择不同的医疗检查,从而产生不完整的多模态数据。开发灵活可靠的多模态学习方法来处理不完整的多模态数据是一个具有挑战性但有前途的研究方向。

  • 多模态数据不平衡。第三个基本挑战是如何减轻模态之间的偏见和差异的影响。例如,视觉模态总体上比音频模态更有效,导致模型走捷径,缺乏对音频的探索。尽管现有的融合方法表现出有希望的性能,但在某些模态首选应用的推理方面,它们可能无法比单模态主导模型表现得更好。

  • 质量动态变化的多模态数据。第四个基本挑战是如何适应多模态数据质量动态变化的性质。在实践中,由于不可预见的环境因素或传感器问题,不同样品的一种模态的质量通常会有所不同。例如,在低光或背光条件下,RGB 图像的信息量低于热模态图像。因此,在实际应用中,通过了解不同的质量来动态集成多模态数据是必要的。

噪声多模态数据学习

主要思路: 采用多模态间的相关性来识别并减少噪声的影响,例如通过平均融合或加权融合的方法。

多模态噪声根据其来源大致可分为两类:1) 由传感器误差、环境因素或每种模态单独传输产生的特定模态噪声,2) 由弱对齐或未对齐多模态产生的跨模态噪声可以被视为语义级噪声。

模态特定的降噪

模态特定的降噪方法很大程度上取决于输入模态和手头的任务。大多数特定于模态的降噪方法侧重于从多模态数据中聚合有用信息并减轻多模态融合中噪声的影响。一种简单的多模态降噪方法是对多模态数据进行平均融合。由于噪声的随机性,平均运算有效降低了融合图像中噪声的比例。[19]开发了一种智能多模态融合算法。该方法将输入图像分解为高频和低频分量,并提出低频分量的平均融合规则,同时对高频分量利用引导滤波。

跨模态降噪

文中将将弱对齐或未对齐的多模态样本视为跨模态噪声。与特定于模态的噪声相比,跨模态噪声位于更高级别的语义空间。目前的跨模态降噪方法大致可分为基于规则的滤波、基于模型的校正和噪声鲁棒性正则化。

总而言之,从嘈杂的多模态数据中学习是一个常见但具有挑战性的问题。当前的方法从两个角度解决这个问题:模态特定降噪(针对特征噪声)和跨模态降噪(针对语义噪声)。然而,这些方法通常专注于特定场景,例如多模态图像融合或自动驾驶,而对一般噪声模式和学习范式的探索相对较少。文中已经确定了该领域的几个潜在研究课题。首先,利用不同模式的噪声之间的相关性非常重要。例如,高光谱图像中具有相似波长的图像通常表现出相似的噪声模式。其次,利用噪声和清洁模态之间的互补性来降低噪声将是有效的。第三,解决高级语义噪声提出了一个有趣的方向,而且更具挑战性。

缺失模态插补

主要思路: 通过内核或图的填充,以及GAN等生成模型来补全缺失的数据。

图 2:基于插补的不完全多模态学习。

实际应用中,由于设备损坏、数据传输和存储丢失等意外因素,采集的多模态数据往往不完整,部分样本存在部分模态缺失。举一个具体的例子,在面向用户的推荐系统中,浏览行为历史和信用评分信息可能并不总是对某些用户可用。通常,传统的多模态学习模型假设多模态数据的完整性,因此不能直接应用于部分缺失的模态。本文主要关注不完全多模态学习的研究进展。从是否对缺失数据进行插补的角度来看,将现有方法分为两类,包括基于插补的不完全多模态学习无插补的不完全多模态学习,其中基于插补的方法进一步分为两组,如图2所示,包括实例和模态级别插补。

专注于输入不完整模态的方法可以分为两类:一类通过图或核补全间接恢复缺失的模态,另一类直接填充原始数据。对于无插补的不完整多模态学习方法,其设计理念更侧重于利用可用的模态来探索信息和理解多模态数据。然而,这两种处理不完整多模态数据的方法都面临着更深层次的挑战。例如,对缺失模式的估算实例的质量评估通常被忽视。此外,利用先验缺失信息来掩盖未知模态本身就很难弥合模态缺失引起的信息鸿沟和信息不平衡问题

表 3:一些代表性的不完整多模态学习方法总结。

平衡多模态融合

主要思路: 通过优化学习目标或架构设计来平衡不同模态的数据质量。

平衡多模态学习方法关注的是不同模态之间学习属性或数据质量的差异,这是由多模态数据的异质性引起的。这些方法从不同的角度提出解决方案,包括学习目标、优化、架构和数据增强。平衡的多模态学习仍然是一个朝阳领域,还有很多尚未探索的方向。例如,在理论指导下探索模式之间的合作是有希望的。此外,目前的方法主要局限于典型的多模态任务,大部分是判别任务和少量生成任务。事实上,除此之外,还需要联合集成不同模态的多模态大语言模型也可能会遇到这种不平衡问题。预计将扩展当前的研究或在多模态大语言模型设置中设计新的解决方案。

表 4:代表性平衡多模态学习方法总结。

动态多模态融合

主要思路: 引入注意力机制和不确定性感知机制,使融合过程能够根据不同模态的动态变化进行调整。

图 5:动态融合的图示。

当前的多模态融合方法通常依赖于多模态数据具有静态质量的假设,这在现实场景中并不总是成立。处理质量动态变化的多模态数据是多模态智能系统不可避免的问题。由于意外的环境因素和传感器问题,某些模式可能会出现可靠性差和缺乏特定任务信息的问题。此外,如图5所示,不同模态的质量随着场景的不同而动态变化。这种现象催生了一种新的多模态学习范式,即动态多模态融合,旨在适应多模态数据的动态变化质量并选择性地集成任务- 具体信息。本文重点关注动态多模态融合的挑战,并将该文献中的当前进展分为三个主线,包括启发式、基于注意力和不确定性感知的动态融合

启发式动态融合

为了实现鲁棒的多模态融合,以前的工作启发式地设计了动态融合策略。这些动态融合方法源自人类关于当前任务和应用场景的经验和知识(例如,在夜间,热模态比 RGB 更可靠)。作为一个具体的例子,照明条件可以作为引入动态融合的标准。在全天候应用中,之前的工作表明,在多光谱行人检测任务中,RGB 和热模态的质量会随时间变化。虽然在正常照明条件下,与热模态相比,RGB 模态往往包含更多有用的信息,但在弱光或夜间条件下,这种关系可能会逆转,在这些条件下,热模态变得比 RGB 更可靠。基于这一观察,作者提出利用照明感知融合模块来自适应地融合两种模式的特征。

基于注意力的动态融合

动态融合的关键挑战是设计动态机制来学习合理的融合标准。为了实现这一点,另一类方法通常引入注意机制来动态融合多模态信息。文中根据所涉及的注意力机制的不同类型组织了各种动态融合方法,包括自注意力、通道注意力、空间注意力和transformer。自注意力通过允许每个元素与其他元素交互来模拟输入序列中的依赖关系。在多模态情感识别(涉及文本和音频模态)中,音频模态往往比文本传达更多特定于任务的信息,例如语调。然而,由于背景噪声的潜在影响,这两种模式的质量可能因不同样本而存在显着差异。孙等人提出了一种新的多模态交叉和自注意力网络(MCSAN),以动态强调语音情感识别中语言内容和声学信息的信息。

不确定性感知动态融合

与基于直观假设的启发式动态多模态学习方法(在实践中可能并不总是成立)相比,基于不确定性的多模态融合最近成为实现可靠融合的更通用和原则性的方法,通常建立在坚实的基础,例如概率分布或信息论。

动态多模态学习方法关注模态质量随样本、时间或空间的变化,这种变化广泛存在但往往被忽视。 动态融合方法包括启发式(主要为特定应用而设计)、基于注意力(通常用于表示融合)和不确定性感知(对融合的模态和样本水平不确定性进行建模)策略。动态多模态学习具有巨大的潜力。首先,可以在 SOTA 多模态模型(例如 CLIP)中考虑动态原理。其次,实际应用中存在大量动态场景(例如自动驾驶、医学图像融合),因此设计特定于应用的动态融合策略很有趣。例如,在多模态医学图像中,可以在路径级别动态融合它们,这可以提供更好的灵活性和可解释性。

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐