Synergizing Foundation Models and Federated Learning: A Survey

Abstract

  • Foundation Models的发展对很多行业已经产生了很多影响,Foundation Models包括
    • 大语言模型 Large Language Model
    • Vision Transformers
    • 多通道模型Multimodal models
  • 在预训练阶段,Foundation Models对于大容量数据的需求是很大的
  • 相比一般的Foundation Models,特定领域的Foundation Models需要专有的数据,但是由于隐私问题,在可用数据量问题方面提出了实际挑战

1. Introduction

1.1 大模型遇到的窘境

  • 通用的基础模型可以在互联网上开放地利用数据来进行训练,但是特定领域的FM需要专有数据
  • 在法律、医疗保健和金融范围内的数据隐私是尤其敏感的
  • 并且数据通常构成了企业的关键资产,所以数据并不能广泛传播
  • 因此,在尊重数据隐私和解锁特定领域的大模型的潜力的前提下,迫切需要新的策略来处理数据的可用性并促进模型训练

1.2 解决目前窘境的方法——联邦学习

  • 联邦学习在跨分散客户端的协作模型训练中,不需要共享原始数据
  • 联邦学习在服务器和分散的客户端之间进行周期性交互,交换可训练的模型参数,不需要私有客户端数据
  • 通过以上两种手段,联邦学习可以有效的进行隐私保护

1.3 文献的目的

  • 现阶段中,对于基础模型和联邦学习之间协同作用只处于认识阶段,对于这种作用的挑战,方法和方向还缺乏全面理解
  • 这篇文献的目标是弥补对于这份作用的全面理解的空缺,推进隐私感知和特定领域基础模型的发展

1.4 文献主要内容

  1. 第一节 引言
  2. 第二节FM和FL的背景
  3. 第三节 FM&FL的动机和挑战
  4. 第四节 代表性技术
  5. 第五节 跨领域的应用
  6. 第六节 未来方向

2. Background

2.1 Foundation Models

2.1.1 基础模型概念
  • 一个基础模型在经过预训练阶段之后,通过微调之后可以适用于官方你的任务
  • 基础模型在人工智能的各个领域中引发了重大的转变,例如
    • 自然语言处理
      • 大型语言某模型
    • 计算机视觉
    • 语言和声学
2.1.2 基础模型的

2.2 Federated Learning

2.2.1 联邦学习概念
  • 联邦学习是一种学习范式,这种学习范式是一组客户端利用其私有的数据集,在中央服务器的协调下协同学习共享的全局模型
  • 联邦学习的一般目标是找到使以下分布式优化目标最小化的参数集 m i n θ F ( θ ) : = 1 K ∑ k ∈ [ K ] F k ( θ ) min_{\theta}F(\theta):=\frac{1}{K}\sum_{k\in [K]}F_{k}(\theta) minθF(θ):=K1k[K]Fk(θ)其中 K K K表示客户端总数, F ( k ) = E z   D k [ l ( θ ; z ) ] F(k)=\mathbb{E}_{z~D_k}[l(\theta;z)] F(k)=Ez Dk[l(θ;z)]表示第k个客户端的预期风险, D k D_k Dk表示第k个客户端的数据分布, D k ( . . . ; . . . ) D_k(...;...) Dk(...;...)表示用户指定的损失函数
2.2.2 联邦学习经典算法
  • 最具代表性的算法FedAvg系列算法
    • 包括服务器和分散客户端之间的周期性交互,来交换可训练的马总参数
    • 在上面的这个过程中,每个客户端独立地在其本地数据上训练模型,并将模型更新发送到中央服务器中
    • 中央服务器通过计算这些更新的平均值来聚集这些更新并更新全局模型
    • 更新后的模型随后被重新分发给客户端以用于进一步的迭代
  • 还有一些变体
    • FedProx
    • FedDyn
    • FedOpt
  • 联邦学习提供了一种有效的隐私保护方式来训练建立在大规模和多样性数据上的模型,并引发了其在各个领域的应用

3. 基础模型和联邦学习:动机和挑战

3.1 动机

  • 具有互补性
3.1.1 联邦学习扩展了机器学习的数据可用性
  • 通过保护隐私的方式来利用来源广泛的数据,联邦学习可以实现使用敏感的数据在特定领域,如卫生保健和金融,构建模型
  • 联邦学习还可以将个人数据和特定任务数据进行集成,允许为个人应用定制基础模型
3.1.2 基础模型通过特征表示和少量学习能力提升联邦学习
  • 基础模型能够提供先进的特征表示和学习能力
  • 利用基础模型的预先学习的知识可以加速联邦学习过程
  • 基础模型的强大的生成能力可以通过合成额外的数据来帮助联邦学习克服数据异构性挑战,加速联邦学习模型的收敛

3.2 核心挑战

3.2.1 效率挑战
  • 通信带宽,计算能力和存储器
  • 联邦学习的通信瓶颈是由于服务器和客户端在有限带宽信道上频繁的交换训练信息而引起的
3.2.2 适应性挑战
  • 通过联邦学习对基础模型进行学习和微调时,可能会面临性能下降的问题
  • 数据异质性(Data Heterogeneity):客户端之间的数据分布不同,导致FL的性能下降,这在微调基础模型时尤为明显。例如,在自然语言处理(NLP)任务中,不同客户端的数据集在语言、风格、主题或情感上可能存在差异;在多模态场景中,不同类型的数据(如文本、图像和音频)的多样性使这一挑战更加突出。
  • 资源异质性(Resource Heterogeneity):不同参与者设备的内存和计算资源可能不同,这会导致模型同步的延迟和某些参与者的失活(即“stragglers”问题),从而难以充分利用基础模型在FL环境中的潜力
3.2.3 可信度挑战
  • 知识产权
  • 隐私泄露
  • 中毒攻击

4. Techniques

在这里插入图片描述

4.2 Adaptability

4.2.1 Client-Centric Adaptation以客户为中心的适应
  • 利用联邦学习分布式和隐私保护特性的同时,调整基础模型满足个人客户的特定需求或者偏好
  • 下面是两种流行的方法
  1. 个性化(Personalization)——本次任务:基于适配器的方法在冻结的预训练基础模型中引入小型的、可训练的适配器,从而允许针对客户特定的模型适应,而不改变原有的联邦学习。FedDAT(Chen等,2024)利用双适配器结构,个性化适配器侧重于客户特定知识,而全局适配器维护与客户无关的知识。FedDAT在个性化适配器和全局适配器之间执行双向知识蒸馏,以规范客户的更新并防止过拟合。基于提示的方法使用客户特定的软提示来指导模型的响应。pFedPG(Yang等,2023a)训练一个提示生成器,以利用潜在的客户特定特征,并为每个客户生成个性化提示,从而实现高效且个性化的适应。
  2. 客户聚类(Client Clustering):这部分研究旨在根据潜在的关系对客户进行聚类,并为具有相似数据分布的客户组量身定制基础模型,从而减少数据异质性的负面影响并提高准确性。Guo等(2024b)提出了一个基于FedPEFT的多语言建模框架,采用语言家族聚类来缓解LoRA微调的参数冲突。
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐