本文提出了一种名为​​直接偏好优化(DPO)​​ 的新方法,用于训练大型语言模型(LMs)以更好地对齐人类偏好。传统方法如基于人类反馈的强化学习(RLHF)涉及两个复杂步骤:先拟合奖励模型,再通过强化学习(如PPO算法)优化策略。但RLHF过程不稳定、计算成本高,且需要大量调参。DPO则颠覆了这一流程:它通过数学映射将奖励模型参数化,使最优策略能以​​闭式解​​直接提取,仅用简单的二元交叉熵损失函数优化策略。这消除了对显式奖励建模和强化学习的依赖,同时在情感控制、摘要生成和对话任务中实现与或优于RLHF的性能。论文通过理论分析和实验验证(模型规模达60亿参数)证明了DPO的有效性。

文章链接:

2305.18290https://arxiv.org/pdf/2305.18290

Abstract​(摘要)​

虽然大规模无监督语言模型(LMs)学习了广泛的世界知识和一定的推理能力,但由于其完全无监督的训练性质,精确控制其行为十分困难。现有方法通过收集模型生成结果的相对质量的人类标注,并基于这些偏好对无监督语言模型进行微调以实现对齐,通常采用​​人类反馈强化学习(RLHF)​​。然而,RLHF是一个复杂且不稳定的流程:首先需拟合一个反映人类偏好的奖励模型,然后通过强化学习微调大规模无监督语言模型以最大化估计奖励,同时避免过度偏离原始模型。本文提出RLHF中奖励模型的新​​参数化表示​​,使得能够以闭式解提取对应最优策略,从而仅用简单的分类损失即可解决标准RLHF问题。由此产生的算法称为​​直接偏好优化(DPO)​​,其稳定性强、性能优异且计算轻量,无需在微调期间从语言模型采样或进行大量超参数调优。实验表明,DPO在微调语言模型对齐人类偏好方面优于或等同于现有方法。值得注意的是,DPO在控制生成内容情感的任务中超越了基于PPO的RLHF,在摘要和单轮对话任务中匹配或提升了响应质量,同时实现和训练过程显著简化。

1  Introduction​(介绍)​

大规模无监督语言模型(LMs)在超大数据集上的训练获得了惊人能力[11, 7, 42, 8]。然而,这些模型训练数据来源于人类,其目标、优先级和技能差异巨大。其中部分目标或技能可能并非理想模仿对象:例如,我们希望AI编程助手能理解常见编程错误以修正它们,但在生成代码时,我们更希望模型偏向训练数据中(可能罕见的)高质量编程能力。类似地,我们希望语言模型知晓50%人群持有的常见误解,但绝不希望模型在50%的相关查询中声称该误解为真!换言之,从语言模型广泛的知识与能力中选择期望的响应和行为,对构建安全、高性能且可控的AI系统至关重要[28]。

现有方法通常通过强化学习(RL)引导语言模型匹配人类偏好,但本文将证明基于RL的目标可通过简单的二元交叉熵损失精确优化,极大简化偏好学习流程。
现有方法通过筛选代表人类认为安全且有益行为类型的偏好集,将期望行为注入语言模型。这一偏好学习阶段发生在基于大型文本数据集的大规模无监督预训练初始阶段之后。虽然最直接的方法是​​监督微调人类高质量响应示例​​,但最成功的方法类别是​​人类(或AI)反馈的强化学习(RLHF/RLAIF)​​[12, 2]。RLHF方法首先拟合偏好数据集的奖励模型,然后使用RL优化语言模型策略以生成高奖励响应,同时避免过度偏离原始模型。尽管RLHF产生了具备出色对话和编码能力的模型,但其流程远比监督学习复杂:涉及训练多个语言模型并在训练循环中对LM策略采样,计算成本高昂。

本文提出一种无需显式奖励建模或强化学习、直接优化语言模型以符合人类偏好的方法。我们提出​​直接偏好优化(DPO)​​算法:该算法隐式优化与现有RLHF算法相同的目标(带KL散度约束的奖励最大化),但实现简单且训练直接。直观上,DPO更新​​增加偏好响应相对于非偏好响应的对数概率比​​,并通过动态的逐样本重要性权重避免模型退化(朴素概率比目标会出现此问题)。与现有算法类似,DPO依赖理论偏好模型(如Bradley-Terry模型[5])衡量奖励函数与经验偏好数据的对齐程度。然而,现有方法用偏好模型定义训练奖励模型的偏好损失,再训练优化学习奖励模型的策略;而DPO通过变量替换,直接将偏好损失定义为策略的函数。给定人类对模型响应的偏好数据集,DPO可​​用简单的二元交叉熵目标优化策略​​,生成拟合偏好数据的隐式奖励函数的最优策略。

我们的核心贡献是​​直接偏好优化(DPO)​​——一种无需RL、从偏好训练语言模型的简单算法。实验表明,在情感调控、摘要和对话等任务中,DPO至少与现有方法(包括基于PPO的RLHF)同等有效,模型规模达60亿参数。

图1:DPO 优化人类偏好且避免强化学习​​
现有基于人类反馈的微调方法首先将奖励模型拟合至提示词及人类对响应对的偏好数据集,随后通过强化学习(RL)寻找最大化学习奖励的策略;​​相反,DPO 直接通过简单分类目标优化最满足偏好的策略​​,其拟合的隐式奖励模型可通过闭式解提取对应最优策略。

2  Related Work(相关工作)​​

自监督语言模型规模的扩大使其能够通过零样本[33]或少样本提示[6,27,11]完成部分任务。然而,通过在指令和人工撰写补全的数据集上进行微调,可显著提升其在下游任务的表现及与用户意图的对齐[25,38,13,41]。这种"指令微调"过程使LLM能泛化至指令微调集外的指令,并普遍提升可用性[13]。尽管指令微调取得成功,但人类对响应质量的相对判断通常比专家演示更易收集,因此后续工作开始用人类偏好数据集微调LLM,从而提升翻译[20]、摘要[40,51]、故事生成[51]和指令遵循[28,34]的能力。这些方法首先在Bradley-Terry模型[5]等偏好模型下,优化神经网络奖励函数以兼容偏好数据集,然后使用强化学习算法(通常是REINFORCE[47]、近端策略优化(PPO;[39])或其变体[34])微调语言模型以最大化给定奖励。

密切相关的研究方向利用经人类反馈微调的LLM生成额外合成偏好数据,用于针对性属性(如安全性或无害性)[2],仅需人类以文本准则形式提供弱监督作为LLM的标注。这些方法融合了两类研究:一类是用强化学习训练语言模型以实现多样化目标[35,29,48],另一类是基于人类偏好的通用学习方法[12,21]。尽管使用人类相对偏好具有吸引力,但用强化学习微调大型语言模型仍是主要实践挑战;本工作提供了无需RL优化相对偏好的理论依据方法。

在语言之外的情境中,从偏好中学习策略已在赌博机和强化学习环境中得到研究。使用偏好或行动排序(而非奖励)的情境赌博机学习被称为情境对决赌博机(CDB;[50,14])。在缺乏绝对奖励的情况下,CDB的理论分析用冯·诺依曼赢家(von Neumann winner)概念替代最优策略——该策略对任意其他策略的预期胜率至少为50%[14]。然而在CDB设置中偏好标签是在线给出的,而在人类偏好学习中,我们通常从固定批量的离线偏好标注行动对中学习[49]。类似地,基于偏好的强化学习(PbRL)从未知"评分"函数生成的二元偏好中学习[9,37]。PbRL存在多种算法,包括可重用离策略偏好数据的方法,但通常需先显式估计潜在评分函数(即奖励模型),再优化该函数[16,9,12,36,21]。我们则提出单阶段策略学习方法,直接优化策略以满足偏好。

3  Preliminaries(预备知识)

我们回顾Ziegler等人(及后续研究[40, 1, 28])的RLHF流程,通常包含三个阶段:

  1. 监督微调(SFT);
  2. 偏好采样与奖励学习;
  3. RL优化。

​​SFT阶段​​:RLHF通常从监督学习开始,针对下游任务(对话、摘要等)的高质量数据微调预训练语言模型,获得模型\pi ^{SFT}。

奖励建模阶段​​:在第二阶段,SFT模型通过提示x生成响应对 \left ( y_1,y_2 \right )\sim \pi ^{SFT}\left ( y,x \right )。这些响应对被呈现给人类标注者,其偏好表示为 y_w\succ y_l|x,其中 y_w​ 和 y_l 分别为 \left ( y_1,y_2 \right ) 中的偏好与非偏好补全结果。偏好被认为由潜在奖励模型 r^*\left ( y,x \right ) 生成,但我们无法直接访问该模型。建模偏好的常用方法是Bradley-Terry(BT)模型[5](若可获得多个排序响应,更通用的Plackett-Luce排序模型[32,23]也适用)。BT模型规定人类偏好分布 p^* 可表示为:

假设可访问从 p^* 采样的静态比较数据集 \mathcal{D}=\left \{ x^{(i)},y_{w}^{(i)},y_{l}^{(i)} \right \}_{i=1}^{N}​,我们可参数化奖励模型 r_\phi \left ( x,y \right ) 并通过最大似然估计参数。将该问题视为二元分类,负对数似然损失为:

其中 \sigma 为logistic函数。在语言模型背景下,网络 r_\phi \left ( x,y \right ) 通常从SFT模型 \pi ^{SFT}\left ( y|x \right ) 初始化,并在最终transformer层顶部添加线性层以预测标量奖励值[51]。为确保奖励函数方差更低,先前工作对奖励归一化,使得所有x满足 E_{x,y\sim \mathcal{D}}\left [ r_\phi \left ( x,y \right )\right ]=0。

RL微调阶段​​:在RL阶段,学习到的奖励函数为语言模型提供反馈。遵循先前工作[17,18],优化目标公式化为:

其中 β 控制与基础参考策略 \pi _{ref}(即初始SFT模型 \pi ^{SFT})的偏离程度。实践中,语言模型策略 \pi _\theta 也初始化为 \pi ^{SFT}。此约束至关重要:既防止模型过度偏离奖励模型准确的分布,又保持生成多样性并避免坍缩到单一高奖励答案。由于语言生成的离散特性,该目标不可微,通常通过强化学习优化。标准方法[51,40,1,28]是构建奖励函数:

r\left ( x,y \right )=r_\phi \left ( x,y \right )-\beta \left ( \text{log}\pi _\theta\left ( y|x \right ) - \text{log}\pi _{ref}\left ( y|x \right )\right )

并使用PPO[39]最大化。

4  Direct Preference Optimization(直接偏好优化)

受限于在大规模问题(如微调语言模型)中应用强化学习算法的挑战,我们的目标是​​直接从偏好中推导策略优化方法​​。与现有RLHF方法不同(其先学习奖励函数再通过RL优化),我们提出一种奖励模型参数化的特殊选择,使得无需RL训练循环即可闭式提取其最优策略。如下文详述,我们的核心洞见是:利用从奖励函数到最优策略的解析映射,将奖励函数上的损失函数转化为策略上的损失函数。这种变量替换方法避免拟合显式独立的奖励模型,同时仍在人类偏好模型(如Bradley-Terry模型)下优化。本质上,策略网络同时表示语言模型和(隐式的)奖励函数。

​​推导DPO目标​​:我们从与先前工作相同的RL目标(公式3)出发,考虑一般奖励函数r。依据先前工作[31,30,19,15],可证明KL约束奖励最大化目标(公式3)的最优解形式为:

其中 Z\left ( x \right )=\sum_{y}\pi _{ref}\left ( y|x \right )exp\left ( \frac{1}{\beta }r\left ( x,y \right ) \right ) 是配分函数(完整推导见附录A.1)。即使使用真实奖励函数 r^* 的MLE估计 r_\phi ,估计配分函数 Z(x) 仍然昂贵[19,15],使得该表示在实践中难以应用。然而,我们可重新排列公式4,用其对应的最优策略 \pi _r 、参考策略 \pi _{ref} 和未知配分函数 Z(⋅) 表达奖励函数。具体地,首先对公式4两边取对数,经代数运算得:

我们可将此重参数化应用于真实奖励 r^* 及其对应最优模型 \pi ^* 。幸运的是,Bradley-Terry模型仅依赖于两个补全的奖励差异,即 p^*\left ( y_1\succ y_2|x \right )=\sigma \left ( r^*\left ( x,y_1 \right )-r^*\left ( x,y_2 \right ) \right ) 。将公式5中的重参数化代入偏好模型公式1,配分函数相消,我们可仅用最优策略 \pi ^* 和参考策略 \pi _{ref} 表达人类偏好概率。因此,Bradley-Terry模型下RLHF的最优策略 \pi ^* 满足偏好模型:

(推导见附录A.2)。虽然公式6使用Bradley-Terry模型,但我们可类似推导更通用的Plackett-Luce模型[32,23]的表达式(见附录A.3)。

现在,我们获得用最优策略而非奖励模型表示的人类偏好数据概率,可为参数化策略 \pi _\theta​ 制定最大似然目标。类比奖励建模方法(即公式2),我们的策略目标变为:

此方式下,我们使用替代参数化拟合隐式奖励,其最优策略即为 \pi _\theta 。此外,由于我们的过程等价于拟合重参数化的Bradley-Terry模型,其具有特定理论性质(如偏好数据分布满足适当假设时的[4]一致性)。第5节将进一步讨论DPO与其他工作相关的理论性质。

​​DPO更新机制​​?为理解DPO的机制,分析损失函数 \mathcal{L}_{DPO}​ 的梯度具有意义。关于参数 θ 的梯度可写为:

其中 \hat{r_\theta }\left ( x,y \right )=\beta \text{log}\frac{\pi _\theta \left ( y|x \right )}{\pi_{ref} \left ( y|x \right )} 是由语言模型 \pi _\theta​ 和参考模型 \pi _{ref} 隐式定义的奖励函数(更多讨论见第5节)。直观上,损失函数 \mathcal{L}_{DPO} 的梯度增加偏好补全 y_w​ 的似然,降低非偏好补全 y_l 的似然。​​关键在于​​:样本权重由隐式奖励模型 \hat{r_\theta }​ 对非偏好补全的高估程度加权(以 β 缩放),即隐式奖励模型错误排序补全的程度(考虑KL约束强度)。实验表明此加权至关重要——无此加权的朴素方法会导致语言模型退化(附录表3)。

DPO流程概述​​:通用DPO流程如下:

  1. 对每个提示x采样补全 y_1,y_2\sim \pi _{ref}\left ( \cdot |x \right ) ,通过人工偏好标注构建离线偏好数据集 \mathcal{D}=\left \{ x^{(i)},y_{w}^{(i)},y_{l}^{(i)} \right \}_{i=1}^{N}​;
  2. 优化语言模型 \pi _\theta 以最小化给定 \pi _{ref} 和 \mathcal{D} 下的 \mathcal{L}_{DPO}​ ,并设定期望的 β。

实践中,人们倾向于复用公开的偏好数据集,而非生成样本并收集人工偏好。由于偏好数据集使用 \pi ^{SFT} 采样,当 \pi ^{SFT} 可用时我们初始化 \pi _{ref}=\pi ^{SFT} 。但当 \pi ^{SFT} 不可用时,我们通过最大化偏好补全 \left ( x,y_w \right ) 的似然初始化 ​\pi _{ref} ,即 \pi _{ref}=\text{arg max}_\pi E_{x,y_w\sim \mathcal{D}}\left [ log\pi \left ( y_w|x \right ) \right ] 。此过程有助于缓解真实参考分布(不可用)与DPO所用 \pi _{ref} 间的分布偏移。更多实现细节和超参数见附录B。

​​5  Theoretical Analysis of DPO(DPO的理论分析​)

本节将深入解读DPO方法,提供理论支撑,并将DPO优势与用于RLHF的参与者-评判者算法(如PPO[39])的问题相关联。

​​5.1 Your Language Model Is Secretly a Reward Model(语言模型的隐式奖励属性)​​

DPO能够通过单一最大似然目标绕过显式奖励拟合和强化学习来学习策略。注意优化目标公式5等价于使用奖励参数化 r^* \left ( x,y \right )=\beta \text{log}\frac{\pi _\theta^* \left ( y|x \right )}{\pi_{ref} \left ( y|x \right )}​ 的Bradley-Terry模型,且在变量替换下,我们优化参数化模型 \pi _\theta 等价于公式2中的奖励模型优化。本节将构建此重参数化背后的理论,证明其不约束学习奖励模型的类别,并允许精确恢复最优策略。我们首先定义奖励函数间的等价关系:

定义 1​​
称两个奖励函数 r(x,y) 和 r{}'(x,y) 等价,当且仅当r\left ( x,y \right )-r{}'\left ( x,y \right )=f\left ( x \right )对某函数 f成立

易见此为等价关系,其将奖励函数划分为不同类别。我们可陈述以下引理:

​​引理 1​​
在Plackett-Luce(特别是Bradley-Terry)偏好框架下,同一等价类的两个奖励函数导出相同的偏好分布。

​​引理 2​​
同一等价类的两个奖励函数在约束RL问题下导出相同的最优策略。

证明较直接,详见附录A.5。第一引理是Plackett-Luce模型族的欠指定问题[32]。由于此欠指定性,通常需施加额外可识别性约束以保证公式2中MLE估计的保证[4]。第二引理指出同一类的所有奖励函数产生相同最优策略,因此我们的最终目标仅需恢复最优类中的任意奖励函数。我们在附录A.6证明以下定理:

定理 1​​
在温和假设下,所有与Plackett-Luce(特别是Bradley-Terry)模型一致的奖励类均可表示为 r \left ( x,y \right )=\beta \text{log}\frac{\pi \left ( y|x \right )}{\pi_{ref} \left ( y|x \right )},其中 \pi \left ( y|x \right )为某模型,\pi_{ref} \left ( y|x \right ) 为给定参考模型。

证明概要​​
考虑任意奖励函数 r(x,y),其通过公式4导出对应最优模型 \pi _r\left ( y|x \right )。我们将证明该等价类中的奖励函数可使用上述重参数化表示。定义投影算子 f 为:

此算子仅用 \pi _r​ 的配分函数对数归一化奖励函数。因添加的归一化项仅是前缀 x 的函数,故 f\left ( r;\pi _{ref}, \beta \right )(x,y) 是 r(x,y) 等价类中的奖励函数。最后将 r 替换为公式5的右侧(对任意奖励函数成立),有f\left ( r;\pi _{ref}, \beta \right )(x,y)=\beta \text{log}\frac{\pi _r \left ( y|x \right )}{\pi_{ref} \left ( y|x \right )}。投影 f 生成具有期望形式的 r 等价类成员,故在提出的重参数化中不损失奖励模型的普适性。

我们可将定理1视作规定每个等价类中DPO重参数化选择的奖励函数,即满足下式的奖励函数:

即 \pi \left ( y|x \right ) 是有效概率分布(概率为正且和为1)。但依据公式4,可知公式9是由奖励函数 r(x,y) 导出的最优策略的配分函数。​​DPO算法的核心洞见​​是:对欠约束的Plackett-Luce(特别是Bradley-Terry)模型族施加特定约束,在保持可表示奖励模型类别的同时,使公式4中的最优策略对所有提示 x 均可解析求解。

5.2 Instability of Actor-Critic Algorithms(参与者-评判者算法的不稳定性​)​

我们也可用本框架诊断标准参与者-评判者算法(如PPO)在RLHF中的不稳定性。遵循第3节概述的RLHF流程,聚焦RL微调步骤。我们可关联至约束RL问题的​​推断即控制框架​​[22]。假设参数化模型 \pi_\theta \left ( y|x \right ) 并最小化 D_{\mathrm{KL}}\left[ \pi_\theta (y \mid x) \parallel \pi^* (y \mid x) \right],其中 \pi ^* 是由奖励函数 r_\phi \left ( y,x \right ) 通过公式7导出的最优策略。经代数推导得到优化目标:

此为先前工作[51,40,1,28]优化的相同目标,使用与 r_\phi 奖励类等价的DPO奖励。此设置中,我们可将 f\left ( r_\phi ,\pi _{ref}, \beta \right ) 中的归一化项解释为参考策略 \pi_{ref} 的​​软值函数​​。尽管此项不影响最优解,但若缺失,目标的策略梯度可能具有高方差,导致学习不稳定。我们可通过学习值函数容纳归一化项,但这同样难以优化。先前工作使用人类补全基线(本质上是归一化项的单样本蒙特卡洛估计)。​​相反,DPO重参数化产生的奖励函数无需任何基线​​。

图2:​​
​​左图:期望奖励 vs 参考策略KL散度的前沿曲线​​,DPO在所有KL值下提供最高期望奖励,证明其优化质量;
​​右图:TL;DR摘要任务中GPT-4评估的胜率(对比人类撰写摘要)​​,DPO在摘要任务中超越PPO最佳表现,且对采样温度变化更具鲁棒性。

6  Experiments(实验)​​

本节通过实验评估DPO从偏好直接训练策略的能力。首先,在受控文本生成环境中研究:​​DPO如何高效权衡最大化奖励与最小化参考策略KL散度​​,对比PPO等常见偏好学习算法?其次,评估DPO在更大模型和更难RLHF任务(摘要和对话)的性能。我们发现,​​几乎无需超参数调优,DPO即达到或超越强基线水平​​(如基于PPO的RLHF)。以下描述实验设置,更多细节见附录C。

​​任务​

实验探索三种开放域文本生成任务:

​​受控情感生成​​:提示x为IMDb数据集电影评论前缀,策略需生成正向情感文本y。为受控评估,使用预训练情感分类器生成偏好对(满足 p\left[\text{positive} \mid x, y_w\right] > p\left[\text{positive} \mid x, y_l\right])。监督微调(SFT)阶段在IMDb训练集评论上微调GPT-2-large至收敛(细节见附录C.1)。

​​摘要任务​​:x为Reddit论坛帖子,策略需生成帖子要点摘要y。遵循先前工作,使用Reddit TL;DR摘要数据集及Stiennon等人收集的人类偏好。SFT模型基于人类撰写的论坛帖子摘要微调,RLHF使用TRLX框架[44]。人类偏好数据集来自另一相似SFT模型的样本。

​​单轮对话​​:x为人类查询(从天体物理问题到关系建议),策略需生成吸引人且有用的响应y;使用Anthropic Helpful and Harmless对话数据集(含17万人类与自动助手对话)。每条记录以大型语言模型生成的响应对及标注偏好结尾。此任务无预训练SFT模型,故在偏好补全上微调通用语言模型作为SFT模型。

评估方法​​

采用两种评估方式:

​​受控情感生成​​:因可访问真实奖励函数(情感分类器),通过​​奖励-KL前沿曲线​​(图2左)分析算法优化约束奖励目标(公式3)的效能;

​​摘要与对话​​:因真实奖励函数未知,使用​​GPT-4胜率​​评估(代理人类评估摘要质量/响应帮助性)。摘要任务以测试集参考摘要为基线,对话任务以测试集偏好响应为基线。现有研究表明LM自动评估优于传统指标[10],第6.4节的人类研究验证了GPT-4评估的可靠性。

对比方法​​

除DPO外,评估多种现有训练语言模型匹配人类偏好的方法:

  • ​​Zero-shot提示​​:摘要任务用GPT-J[45],对话任务用Pythia-2.8B[3](2样本提示);

  • ​​监督微调​​:SFT模型及Preferred-FT(仅在偏好补全 y_w​上监督微调);

  • ​​Unlikelihood​​[46]:最大化 logP\left ( y_w|x \right )同时最小化 logP\left ( y_l|x \right )(含权重系数 α∈[0,1]);

  • ​​PPO​​[39]:基于偏好数据学习奖励函数;

  • ​​PPO-GT​​:受控情感任务中访问真实奖励的Oracle方法;

  • ​​Best of N​​:从SFT模型采样N个响应,返回学习奖励函数最高分响应(计算代价高但性能强)。

6.1  DPO优化RLHF目标的能力?​​

约束RL目标(公式3)通过KL散度平衡​​奖励最大化​​与​​避免偏离参考策略​​。因此对比算法时需兼顾奖励收益与KL差异——稍高奖励但KL大幅增加并不可取。图2左展示情感任务中各算法的奖励-KL前沿曲线(执行22次训练:PPO目标KL∈{3,6,9,12},DPO β∈{0.05,0.1,1,5},Unlikelihood α∈{0.05,0.1,0.5,1},Preferred-FT使用随机种子)。每100训练步评估测试提示集,计算真实奖励函数下的平均奖励和序列级KL散度 D_{KL}\left ( \pi ||\pi _{ref} \right )。我们发现,​​DPO迄今产生最高效的前沿曲线​​——在保持低KL散度的同时实现最高奖励。这一结果尤为显著,原因有很多。首先,​​目标一致性下的效率优势​​:DPO与PPO优化同一目标,但DPO效率显著更高;其奖励-KL权衡曲线​​严格支配​​PPO;其次,​​真实奖励访问下的性能突破​​:即便PPO可访问真实奖励(PPO-GT),DPO仍实现更优前沿。

6.2  DPO能否扩展到真实偏好数据集?

在摘要任务中,自动评估指标(如ROUGE)与人类偏好相关性较低[40],先前研究发现基于人类偏好使用PPO微调语言模型能生成更有效的摘要。我们在TL;DR摘要数据集的测试集上采样生成结果,通过计算相对于测试集参考补全的平均胜率来评估不同方法。所有方法在0.0至1.0的温度范围内采样生成补全,胜率如图2(右)所示:DPO、PPO和Preferred-FT均基于相同的GPT-J SFT模型微调。我们发现DPO在温度0.0时胜率约为61%,超过PPO在其最佳采样温度0.0时的57%表现;DPO的最高胜率也优于Best of N基线。需说明由于未系统调优DPO的β超参数,这些结果可能低估DPO的潜力。此外,DPO对采样温度的鲁棒性显著优于PPO——后者在高温下性能会退化至基础GPT-J模型水平,而Preferred-FT相对SFT模型未显著提升。(第6.4节人类评估显示:DPO温度0.25样本以58%胜率优于PPO温度0样本)

在单轮对话任务中,我们在Anthropic HH数据集测试集的单步人机交互子集评估不同方法。GPT-4评估以测试集偏好补全为参考计算胜率。由于该任务无标准SFT模型,我们使用预训练的Pythia-2.8B初始化,通过Preferred-FT在选定补全上训练参考模型(确保补全符合模型分布),继而用DPO训练。同时对比了Best of 128 Preferred-FT补全(此任务Best of N基线在128个补全时达到平台期,见附录图4)和Pythia-2.8B基础模型的2样本提示版本,发现DPO在各方法最佳温度下表现相当或更优。尽管评估了知名来源的PPO训练RLHF模型,但未找到使其优于基础Pythia-2.8B模型的提示或采样温度。基于TL;DR实验结果及两种方法优化相同奖励函数的事实,我们将Best of 128视为PPO级性能的粗略代理。总体而言,DPO是唯一在Anthropic HH数据集上超越偏好补全的计算高效方法,其性能与计算密集的Best of 128基线相当或更优;最终如图3所示,DPO能快速收敛至最佳性能。

图3:​​

​​左图:Anthropic-HH单轮对话任务的GPT-4胜率​​,DPO是唯一超越测试集人工选定摘要的方法;

​​右图:不同采样温度下训练过程的胜率变化​​,DPO相对数据集标注的改进在不同采样温度下均保持稳定。

6.3  对新输入分布的泛化能力​​

为对比PPO与DPO在分布偏移下的性能,将Reddit TL;DR训练的PPO与DPO策略在CNN/DailyMail新闻摘要测试集评估(使用TL;DR最优温度:0和0.25)。结果见表1:

算法

温度0胜率 vs. 真实摘要

温度0.25胜率 vs. 真实摘要

DPO

0.36

0.31

PPO

0.26

0.23

​​结论​​:DPO在新分布下显著优于PPO(胜率高38%~46%)。

​​6.4  通过人类判断验证GPT-4评估​​

在TL;DR摘要任务进行人类研究验证GPT-4可靠性,使用两种提示:

  • ​​GPT-4(S)​​:简单询问"哪种摘要更好概括要点?"

  • ​​GPT-4(C)​​:额外要求"摘要需精确简洁"

    结果见表2:

    指标

    DPO vs. PPO (n=272)

    SFT vs. PPO (n=122)

    PPO-1 vs. PPO (n=199)

    GPT-4(S)胜率

    47%

    27%

    13%

    GPT-4(C)胜率

    54%

    32%

    12%

    人类胜率

    58%

    43%

    17%

    GPT-4(S)-人类一致率

    70%

    77%

    86%

    GPT-4(C)-人类一致率

    67%

    79%

    85%

    人类间一致率

    65%

    -

    87%

    ​​结论​​:

    • GPT-4(C)评估与人类相关性更高(平均一致率77% vs. 人类间一致率76%);

    • GPT-4判断与人类偏好显著相关(Kendall τ=0.71, p<0.001)。

7  Discussion(讨论)

从偏好中学习是一种强大且可扩展的框架,用于训练能力强、对齐性高的语言模型。我们提出的​​直接偏好优化(DPO)​​,为无需强化学习即可从偏好训练语言模型提供了简洁的训练范式。与将偏好学习问题强行嵌入标准强化学习框架(以使用现成强化学习算法)不同,DPO建立了语言模型策略与奖励函数间的映射机制,使语言模型能够通过简单交叉熵损失直接满足人类偏好,无需强化学习且不损失普适性。在几乎无需超参数调优的情况下,DPO性能媲美或超越现有RLHF算法(包括基于PPO的方法),这显著降低了基于人类偏好训练更多语言模型的门槛。

​​局限性与未来工作​​

我们的研究引出了若干重要问题:

  1. ​​泛化能力验证​​:DPO策略相比显式奖励函数学习在分布外场景的泛化机制需深入探究。初步结果表明DPO策略与PPO模型泛化能力相似,但需更全面研究——例如,基于DPO策略的自标注训练能否同等高效利用未标注提示?

  2. ​​奖励过优化现象​​:需探究奖励过优化在直接偏好优化中的表现形式:图3右所示性能轻微下降是否为其典型案例?

  3. ​​规模化拓展​​:当前模型验证规模为60亿参数,向百亿级前沿模型扩展是未来重要方向。

  4. ​​评估体系优化​​:GPT-4计算的胜率受提示形式影响显著(第6.4节证实),未来需研究自动化系统高质量评判的最佳方法。

  5. ​​跨模态应用​​:DPO在语言模型偏好训练外存在广阔应用场景,包括图像、音频等多模态生成模型训练。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐