论文题目:Calibrated Multi-Preference Optimization for Aligning Diffusion Models(对准扩散模型的校准多偏好优化)

会议:CVPR2025

摘要:将文本到图像(T2I)扩散模型与偏好优化对齐对于人工注释的数据集是有价值的,但手动数据收集的沉重成本限制了可扩展性。使用奖励模型提供了一种选择,然而,目前的偏好优化方法在利用丰富的信息方面存在不足,因为它们只考虑成对的偏好分布。此外,他们缺乏对多偏好场景的概括,难以处理奖励之间的不一致性。为了解决这个问题,我们提出了校准偏好优化(CaPO),这是一种新的方法,通过合并来自多个奖励模型的一般偏好来对齐T2I扩散模型,而无需人工注释数据。我们的核心方法包括一种奖励校准方法,通过计算预训练模型生成的样本的预期胜率来近似一般偏好。此外,我们提出了一种基于边界的配对选择方法,通过从Pareto边界中选择配对,有效地管理多偏好分布。最后,我们使用回归损失对扩散模型进行微调,以匹配选定对的校准奖励之间的差异。实验结果表明,在单奖励和多奖励设置下,CaPO始终优于直接偏好优化(DPO)等先前的方法,这些方法通过对T2I基准(包括GenEval和tbi - compbench)的评估得到验证。


深入解析CVPR 2025论文《Calibrated Multi-Preference Optimization for Aligning Diffusion Models》

引言:从人工标注到自动对齐

想象一下,你正在训练一个AI艺术家,希望它能画出既美观又符合描述的图片。传统方法需要大量人工标注"这张图比那张好",成本高昂且难以扩展。那么,能否让AI自己学会什么是"好图"呢?

来自Google DeepMind、KAIST等机构的研究团队在CVPR 2025上提出了Calibrated Preference Optimization (CaPO),一种无需人工标注数据就能对齐文本到图像扩散模型的新方法。更令人兴奋的是,它不仅能同时优化多个目标(如美观度、文本对齐度等),性能还超越了使用人工数据的方法!

Fig.1:校准偏好优化(CaPO)通过对具有不同奖励信号的扩散模型进行优化,提高了扩散模型的性能。顶部和底部组分别使用SDXL和SD3-medium。对于每个组,第一行来自基本模型,第二行是将CaPO应用于基本模型。CaPO倾向于生成更高质量的图像(例如,图像唯美性,文本渲染)和更好的提示对齐(例如,合成生成),而不使用任何人类偏好数据集。

一、现有方法的困境

1.1 人工标注的瓶颈

当前最先进的方法如Diffusion-DPO依赖于人工标注的偏好数据集(如Pick-a-pic)。虽然效果不错,但面临几个关键问题:

  • 数据收集成本高:每个样本对都需要人工比较
  • 可扩展性差:难以覆盖所有场景和风格
  • 更新困难:随着模型和偏好演变,数据需要持续更新

1.2 多目标优化的挑战

实际应用中,我们往往需要同时优化多个目标:

  • 美学质量(图像是否赏心悦目)
  • 文本对齐度(图像是否匹配描述)
  • 构图能力(多对象关系是否正确)

传统方法通常采用简单的加权求和,但这存在明显缺陷:

总分数 = 0.33×美学分 + 0.33×对齐分 + 0.33×构图分

问题在于:

  1. 权重难以确定:最优权重因场景而异
  2. 目标冲突:优化美学可能损害文本对齐
  3. 奖励hack:模型可能过度拟合某个奖励,产生不自然的结果

Table.1:单一奖励结果。通过对每个奖励模型使用自动评估来报告胜率(%)。作者使用Parti提示[69]和DPG-bench提示[20]分别为每个SDXL和SD3-M模型生成图像。我们突出显示了用于微调的奖励

二、CaPO的核心创新

2.1 创新一:奖励校准——从绝对分数到相对胜率

CaPO的第一个关键创新是不直接使用奖励模型的原始分数,而是转换为"期望胜率"

为什么需要校准?

考虑两个奖励模型:

  • 模型A给分范围:0-100
  • 模型B给分范围:0-10

如果直接相加,模型A的影响会远大于模型B。更重要的是,原始分数并不能准确反映样本的"好坏",只能反映相对排序。

校准的具体做法

对于生成的N张图像,CaPO计算每张图相对于其他图的胜率:

这个公式的含义是:计算图像i在成对比较中的平均胜率

例子:假设生成了4张图(A、B、C、D),奖励分数为[8, 5, 3, 6]

  • 图A的校准奖励 = (A>B的概率 + A>C的概率 + A>D的概率) / 3
  • 结果是0到1之间的归一化值

优势

  1. 🎯 范围统一:所有奖励都映射到[0,1]区间
  2. 💪 更鲁棒:关注相对优劣而非绝对数值
  3. 🔒 防止hack:难以通过exploit某个奖励的特定范围来作弊

2.2 创新二:动态目标的偏好优化

传统DPO方法本质上在说:"正样本应该比负样本好1分"(在log空间)。

CaPO则说:"正样本应该比负样本好$\Delta R_{ca}$分"——这个差值由实际的校准奖励差异决定

损失函数设计为:

直观理解

  • 如果两张图差异很大,模型应该明确区分
  • 如果差异很小,模型只需略微偏好
  • 这种自适应的目标比固定目标更合理

2.3 创新三:前沿拒绝采样(FRS)

这是解决多目标优化的关键!

传统方法的问题

假设我们有三个奖励维度(美学、对齐、构图),传统方法会:

  1. 计算加权和:总分 = w1×美学 + w2×对齐 + w3×构图
  2. 选择总分最高/最低的作为正/负样本

问题:可能选出美学很好但文本对齐很差的图作为正样本!

CaPO的解决方案:Pareto最优

CaPO使用非支配排序找到Pareto前沿:

  1. 上层前沿(Upper Pareto Frontier):在至少一个维度更优且没有被任何样本完全支配的样本集
  2. 下层前沿(Lower Pareto Frontier):被其他样本支配的样本集

选择策略

  • ✅ 从上层前沿随机选择正样本
  • ❌ 从下层前沿随机选择负样本

例子

  • 5张图的奖励向量:

    • 图1: [高美学, 低对齐]
    • 图2: [中美学, 中对齐] ← 上层前沿
    • 图3: [中美学, 高对齐] ← 上层前沿
    • 图4: [低美学, 低对齐] ← 下层前沿
    • 图5: [低美学, 中对齐] ← 下层前沿
  • 接受的配对:(2,4), (2,5), (3,4), (3,5)

  • 拒绝的配对:(1,4), (1,5) —— 因为图1虽然美学高,但对齐度太低

优势

  • 🎯 实现真正的多目标优化
  • ⚖️ 自动平衡不同维度
  • 🚀 避免偏向单一目标

2.4 创新四:智能损失加权

CaPO引入了基于噪声水平的损失加权:

其中是log信噪比(SNR),b是偏置参数。

原理

  • 当噪声少(大)时,去噪任务容易,权重应该低
  • 当噪声多(小)时,去噪任务困难,权重应该高

从Table 5可以看出,使用sigmoid加权(b=1.5)相比常数加权:

  • MPS: 56.5% → 61.2% (+8.3%)
  • VQA: 51.8% → 54.6% (+5.4%)
  • VILA: 70.8% → 79.2% (+11.9%)

三、实验验证:全方位领先

3.1 单奖励优化:超越DPO和IPO

在单个奖励模型的优化中,CaPO已经展现出优势。

SDXL基础模型(Table 1a):

  • 使用MPS训练时,CaPO胜率达61.1%,而DPO仅58.5%
  • 使用VILA训练时,CaPO的VQAscore保持49.7%,DPO则下降到49.3%

关键发现:CaPO在优化目标奖励的同时,对其他奖励的负面影响更小,表现出更好的泛化能力。

3.2 多奖励优化:显著优势

这是CaPO真正展现实力的场景!

SDXL多奖励结果(Table 2a):

方法策略MPS胜率VQA胜率VILA胜率
DPOSUM57.2%52.1%71.9%
DPOSOUP56.5%52.2%74.3%
DPOFRS58.1%52.9%78.6%
CaPOFRS61.2%54.6%79.2%

SD3-M多奖励结果(Table 2b):

  • CaPO+FRS在所有三个维度都取得最高分
  • MPS分数:13.58(基线13.39)
  • VQAscore:0.914(基线0.908)
  • VILA:5.943(基线5.793)

关键洞察

  1. 前沿拒绝采样(FRS)优于简单求和(SUM)和模型融合(SOUP)
  2. CaPO+FRS的组合在所有配置中表现最佳
  3. 多目标优化不是零和游戏——CaPO实现了各维度的协同提升

3.3 基准测试:全面提升

在标准化的T2I基准上,CaPO展现出实质性改进。

GenEval(测试对象生成能力):

SDXL → CaPO+SDXL:
- Overall: 0.55 → 0.59 (+7.3%)
- Two Objects: 0.74 → 0.79 (+6.8%)
- Counting: 0.39 → 0.48 (+23.1%)
- Position: 0.15 → 0.15 (持平)

T2I-Compbench(测试组合生成能力):

SD3-M → CaPO+SD3-M:
- Color Attribution: 0.546 → 0.572 (+4.8%)
- Shape: 0.712 → 0.731 (+2.7%)
- Complex: 0.221 → 0.230 (+4.1%)

与SOTA模型对比(Table 3): 虽然FLUX-dev和SD3.5-L是更大的模型(3倍参数量),但CaPO优化后的SDXL和SD3-M在多个指标上接近甚至超越它们!

3.4 挑战Diffusion-DPO:无需人工数据的胜利

最令人印象深刻的结果来自与Diffusion-DPO的直接对比(Table 4)。

实验设置

  • 使用相同的58K提示(来自Pick-a-pic数据集)
  • Diffusion-DPO:使用人工标注的偏好对
  • CaPO:自动生成数据,无需人工标注

结果

模型PickscoreMPSVQAscoreVILA
Diffusion-DPO22.7111.590.8346.049
DPO-Syn22.7411.590.8256.074
CaPO22.8311.710.8386.141

关键结论

  • 📊 全面超越:CaPO在所有4个指标上都优于Diffusion-DPO
  • 💰 成本优势:完全无需人工标注,节省大量成本
  • 🔬 数据质量:合成数据+好的方法 > 人工数据+普通方法

四、技术深度解析

4.1 为什么回归损失优于分类损失?

DPO使用交叉熵损失(本质是分类问题)。

CaPO使用均方误差(回归问题)。

回归的优势

  1. 梯度更稳定:避免sigmoid饱和区的梯度消失
  2. 信息更丰富:利用奖励差异的具体数值,而非仅仅"哪个更好"
  3. 收敛更快:直接拟合目标值而非概率

4.2 计算效率分析

数据生成阶段

  • 每个提示生成16张图像
  • 使用100K提示 → 总共1.6M图像
  • 可并行化,一次性生成

训练阶段

  • 与DPO相同的计算复杂度
  • 无需在线采样(offline方法)
  • 支持大规模模型(SDXL、SD3-M)

4.3 方法的局限性

论文坦诚讨论了几个局限:

  1. 基础模型能力上限

    • SDXL的文本渲染能力有限,CaPO难以突破
    • 但在SD3(更强的基础模型)上,文本渲染有明显改善
  2. 离线学习的收敛速度

    • 相比在线RL,收敛可能较慢
    • 未来方向:扩展到在线学习
  3. 奖励模型依赖

    • 性能受限于奖励模型的质量
    • 需要多样化的奖励模型覆盖不同方面

总结

Calibrated Preference Optimization (CaPO)通过四个关键创新——奖励校准、动态目标优化、前沿拒绝采样和智能损失加权——成功解决了扩散模型偏好对齐的多个关键挑战:

无需人工标注:完全使用合成数据,成本大幅降低
多目标优化:有效平衡冲突的奖励信号
性能卓越:在所有实验中超越现有方法,包括使用人工数据的Diffusion-DPO
理论扎实:基于期望胜率的校准方法有坚实的数学基础
实用性强:可应用于大规模扩散模型(SDXL、SD3-M)

该工作不仅推进了文本到图像生成的技术前沿,更重要的是展示了一种新的范式:通过更好的优化方法,合成数据可以与甚至超越人工标注数据。这为未来的AI对齐研究提供了重要启示。

希望这篇博客能帮助你深入理解CaPO这一创新方法!如果你对特定技术细节感兴趣,欢迎查阅论文原文和补充材料。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐