(论文速读)CaPO:对准扩散模型的校准多偏好优化
论文题目:Calibrated Multi-Preference Optimization for Aligning Diffusion Models(对准扩散模型的校准多偏好优化)
会议:CVPR2025
摘要:将文本到图像(T2I)扩散模型与偏好优化对齐对于人工注释的数据集是有价值的,但手动数据收集的沉重成本限制了可扩展性。使用奖励模型提供了一种选择,然而,目前的偏好优化方法在利用丰富的信息方面存在不足,因为它们只考虑成对的偏好分布。此外,他们缺乏对多偏好场景的概括,难以处理奖励之间的不一致性。为了解决这个问题,我们提出了校准偏好优化(CaPO),这是一种新的方法,通过合并来自多个奖励模型的一般偏好来对齐T2I扩散模型,而无需人工注释数据。我们的核心方法包括一种奖励校准方法,通过计算预训练模型生成的样本的预期胜率来近似一般偏好。此外,我们提出了一种基于边界的配对选择方法,通过从Pareto边界中选择配对,有效地管理多偏好分布。最后,我们使用回归损失对扩散模型进行微调,以匹配选定对的校准奖励之间的差异。实验结果表明,在单奖励和多奖励设置下,CaPO始终优于直接偏好优化(DPO)等先前的方法,这些方法通过对T2I基准(包括GenEval和tbi - compbench)的评估得到验证。
深入解析CVPR 2025论文《Calibrated Multi-Preference Optimization for Aligning Diffusion Models》
引言:从人工标注到自动对齐
想象一下,你正在训练一个AI艺术家,希望它能画出既美观又符合描述的图片。传统方法需要大量人工标注"这张图比那张好",成本高昂且难以扩展。那么,能否让AI自己学会什么是"好图"呢?
来自Google DeepMind、KAIST等机构的研究团队在CVPR 2025上提出了Calibrated Preference Optimization (CaPO),一种无需人工标注数据就能对齐文本到图像扩散模型的新方法。更令人兴奋的是,它不仅能同时优化多个目标(如美观度、文本对齐度等),性能还超越了使用人工数据的方法!

Fig.1:校准偏好优化(CaPO)通过对具有不同奖励信号的扩散模型进行优化,提高了扩散模型的性能。顶部和底部组分别使用SDXL和SD3-medium。对于每个组,第一行来自基本模型,第二行是将CaPO应用于基本模型。CaPO倾向于生成更高质量的图像(例如,图像唯美性,文本渲染)和更好的提示对齐(例如,合成生成),而不使用任何人类偏好数据集。
一、现有方法的困境
1.1 人工标注的瓶颈
当前最先进的方法如Diffusion-DPO依赖于人工标注的偏好数据集(如Pick-a-pic)。虽然效果不错,但面临几个关键问题:
- 数据收集成本高:每个样本对都需要人工比较
- 可扩展性差:难以覆盖所有场景和风格
- 更新困难:随着模型和偏好演变,数据需要持续更新
1.2 多目标优化的挑战
实际应用中,我们往往需要同时优化多个目标:
- 美学质量(图像是否赏心悦目)
- 文本对齐度(图像是否匹配描述)
- 构图能力(多对象关系是否正确)
传统方法通常采用简单的加权求和,但这存在明显缺陷:
总分数 = 0.33×美学分 + 0.33×对齐分 + 0.33×构图分
问题在于:
- 权重难以确定:最优权重因场景而异
- 目标冲突:优化美学可能损害文本对齐
- 奖励hack:模型可能过度拟合某个奖励,产生不自然的结果

Table.1:单一奖励结果。通过对每个奖励模型使用自动评估来报告胜率(%)。作者使用Parti提示[69]和DPG-bench提示[20]分别为每个SDXL和SD3-M模型生成图像。我们突出显示了用于微调的奖励
二、CaPO的核心创新
2.1 创新一:奖励校准——从绝对分数到相对胜率
CaPO的第一个关键创新是不直接使用奖励模型的原始分数,而是转换为"期望胜率"。
为什么需要校准?
考虑两个奖励模型:
- 模型A给分范围:0-100
- 模型B给分范围:0-10
如果直接相加,模型A的影响会远大于模型B。更重要的是,原始分数并不能准确反映样本的"好坏",只能反映相对排序。
校准的具体做法
对于生成的N张图像,CaPO计算每张图相对于其他图的胜率:
![]()
这个公式的含义是:计算图像i在成对比较中的平均胜率。
例子:假设生成了4张图(A、B、C、D),奖励分数为[8, 5, 3, 6]
- 图A的校准奖励 = (A>B的概率 + A>C的概率 + A>D的概率) / 3
- 结果是0到1之间的归一化值
优势:
- 🎯 范围统一:所有奖励都映射到[0,1]区间
- 💪 更鲁棒:关注相对优劣而非绝对数值
- 🔒 防止hack:难以通过exploit某个奖励的特定范围来作弊

2.2 创新二:动态目标的偏好优化
传统DPO方法本质上在说:"正样本应该比负样本好1分"(在log空间)。
CaPO则说:"正样本应该比负样本好$\Delta R_{ca}$分"——这个差值由实际的校准奖励差异决定。
损失函数设计为:

直观理解:
- 如果两张图差异很大,模型应该明确区分
- 如果差异很小,模型只需略微偏好
- 这种自适应的目标比固定目标更合理

2.3 创新三:前沿拒绝采样(FRS)
这是解决多目标优化的关键!
传统方法的问题
假设我们有三个奖励维度(美学、对齐、构图),传统方法会:
- 计算加权和:
总分 = w1×美学 + w2×对齐 + w3×构图 - 选择总分最高/最低的作为正/负样本
问题:可能选出美学很好但文本对齐很差的图作为正样本!
CaPO的解决方案:Pareto最优
CaPO使用非支配排序找到Pareto前沿:
- 上层前沿(Upper Pareto Frontier):在至少一个维度更优且没有被任何样本完全支配的样本集
- 下层前沿(Lower Pareto Frontier):被其他样本支配的样本集
选择策略:
- ✅ 从上层前沿随机选择正样本
- ❌ 从下层前沿随机选择负样本
例子:

-
5张图的奖励向量:
- 图1: [高美学, 低对齐]
- 图2: [中美学, 中对齐] ← 上层前沿
- 图3: [中美学, 高对齐] ← 上层前沿
- 图4: [低美学, 低对齐] ← 下层前沿
- 图5: [低美学, 中对齐] ← 下层前沿
-
接受的配对:(2,4), (2,5), (3,4), (3,5)
-
拒绝的配对:(1,4), (1,5) —— 因为图1虽然美学高,但对齐度太低
优势:
- 🎯 实现真正的多目标优化
- ⚖️ 自动平衡不同维度
- 🚀 避免偏向单一目标
2.4 创新四:智能损失加权
CaPO引入了基于噪声水平的损失加权:
![]()
其中
是log信噪比(SNR),b是偏置参数。
原理:
- 当噪声少(
大)时,去噪任务容易,权重应该低 - 当噪声多(
小)时,去噪任务困难,权重应该高
从Table 5可以看出,使用sigmoid加权(b=1.5)相比常数加权:
- MPS: 56.5% → 61.2% (+8.3%)
- VQA: 51.8% → 54.6% (+5.4%)
- VILA: 70.8% → 79.2% (+11.9%)

三、实验验证:全方位领先
3.1 单奖励优化:超越DPO和IPO
在单个奖励模型的优化中,CaPO已经展现出优势。
SDXL基础模型(Table 1a):
- 使用MPS训练时,CaPO胜率达61.1%,而DPO仅58.5%
- 使用VILA训练时,CaPO的VQAscore保持49.7%,DPO则下降到49.3%
关键发现:CaPO在优化目标奖励的同时,对其他奖励的负面影响更小,表现出更好的泛化能力。

3.2 多奖励优化:显著优势
这是CaPO真正展现实力的场景!
SDXL多奖励结果(Table 2a):
| 方法 | 策略 | MPS胜率 | VQA胜率 | VILA胜率 |
|---|---|---|---|---|
| DPO | SUM | 57.2% | 52.1% | 71.9% |
| DPO | SOUP | 56.5% | 52.2% | 74.3% |
| DPO | FRS | 58.1% | 52.9% | 78.6% |
| CaPO | FRS | 61.2% | 54.6% | 79.2% |
SD3-M多奖励结果(Table 2b):
- CaPO+FRS在所有三个维度都取得最高分
- MPS分数:13.58(基线13.39)
- VQAscore:0.914(基线0.908)
- VILA:5.943(基线5.793)
关键洞察:
- 前沿拒绝采样(FRS)优于简单求和(SUM)和模型融合(SOUP)
- CaPO+FRS的组合在所有配置中表现最佳
- 多目标优化不是零和游戏——CaPO实现了各维度的协同提升


3.3 基准测试:全面提升
在标准化的T2I基准上,CaPO展现出实质性改进。
GenEval(测试对象生成能力):
SDXL → CaPO+SDXL:
- Overall: 0.55 → 0.59 (+7.3%)
- Two Objects: 0.74 → 0.79 (+6.8%)
- Counting: 0.39 → 0.48 (+23.1%)
- Position: 0.15 → 0.15 (持平)
T2I-Compbench(测试组合生成能力):
SD3-M → CaPO+SD3-M:
- Color Attribution: 0.546 → 0.572 (+4.8%)
- Shape: 0.712 → 0.731 (+2.7%)
- Complex: 0.221 → 0.230 (+4.1%)
与SOTA模型对比(Table 3): 虽然FLUX-dev和SD3.5-L是更大的模型(3倍参数量),但CaPO优化后的SDXL和SD3-M在多个指标上接近甚至超越它们!

3.4 挑战Diffusion-DPO:无需人工数据的胜利
最令人印象深刻的结果来自与Diffusion-DPO的直接对比(Table 4)。
实验设置:
- 使用相同的58K提示(来自Pick-a-pic数据集)
- Diffusion-DPO:使用人工标注的偏好对
- CaPO:自动生成数据,无需人工标注
结果:
| 模型 | Pickscore | MPS | VQAscore | VILA |
|---|---|---|---|---|
| Diffusion-DPO | 22.71 | 11.59 | 0.834 | 6.049 |
| DPO-Syn | 22.74 | 11.59 | 0.825 | 6.074 |
| CaPO | 22.83 | 11.71 | 0.838 | 6.141 |
关键结论:
- 📊 全面超越:CaPO在所有4个指标上都优于Diffusion-DPO
- 💰 成本优势:完全无需人工标注,节省大量成本
- 🔬 数据质量:合成数据+好的方法 > 人工数据+普通方法


四、技术深度解析
4.1 为什么回归损失优于分类损失?
DPO使用交叉熵损失(本质是分类问题)。
CaPO使用均方误差(回归问题)。
回归的优势:
- 梯度更稳定:避免sigmoid饱和区的梯度消失
- 信息更丰富:利用奖励差异的具体数值,而非仅仅"哪个更好"
- 收敛更快:直接拟合目标值而非概率
4.2 计算效率分析
数据生成阶段:
- 每个提示生成16张图像
- 使用100K提示 → 总共1.6M图像
- 可并行化,一次性生成
训练阶段:
- 与DPO相同的计算复杂度
- 无需在线采样(offline方法)
- 支持大规模模型(SDXL、SD3-M)
4.3 方法的局限性
论文坦诚讨论了几个局限:
-
基础模型能力上限:
- SDXL的文本渲染能力有限,CaPO难以突破
- 但在SD3(更强的基础模型)上,文本渲染有明显改善
-
离线学习的收敛速度:
- 相比在线RL,收敛可能较慢
- 未来方向:扩展到在线学习
-
奖励模型依赖:
- 性能受限于奖励模型的质量
- 需要多样化的奖励模型覆盖不同方面
总结
Calibrated Preference Optimization (CaPO)通过四个关键创新——奖励校准、动态目标优化、前沿拒绝采样和智能损失加权——成功解决了扩散模型偏好对齐的多个关键挑战:
✅ 无需人工标注:完全使用合成数据,成本大幅降低
✅ 多目标优化:有效平衡冲突的奖励信号
✅ 性能卓越:在所有实验中超越现有方法,包括使用人工数据的Diffusion-DPO
✅ 理论扎实:基于期望胜率的校准方法有坚实的数学基础
✅ 实用性强:可应用于大规模扩散模型(SDXL、SD3-M)
该工作不仅推进了文本到图像生成的技术前沿,更重要的是展示了一种新的范式:通过更好的优化方法,合成数据可以与甚至超越人工标注数据。这为未来的AI对齐研究提供了重要启示。
希望这篇博客能帮助你深入理解CaPO这一创新方法!如果你对特定技术细节感兴趣,欢迎查阅论文原文和补充材料。
更多推荐

所有评论(0)