TTRL:无需标注数据,基于强化学习模型进行自我学习,左脚踩右脚提升
摘要:本文研究了在没有明确标签的数据上,针对大型语言模型(LLMs)推理任务的强化学习(RL)。该问题的核心挑战是在推理过程中进行奖励估计,同时无法获取到真实标签信息。尽管这种设置看似难以捉摸,但我们发现测试时扩展(Test-Time Scaling,TTS)中的一些常见实践,例如多数投票法,能够产生出人意料的有效奖励,适合用于驱动强化学习训练。在本工作中,我们引入了一种名为测试时强化学习(Test-Time Reinforcement Learning,TTRL)的新方法,用于在无标签数据上使用强化学习训练大型语言模型。TTRL通过利用预训练模型中的先验知识,实现了大型语言模型的自我进化。我们的实验表明,TTRL在各种任务和模型中都能持续提升性能。值得注意的是,TTRL仅使用无标签测试数据,就将Qwen-2.5-Math-7B在2024年AIME上的pass@1性能提升了约159%。此外,尽管TTRL仅受到Maj@N指标的监督,但它已展现出能够持续超越初始模型上限,并接近直接在带有真实标签的测试数据上训练的模型性能的潜力。我们的实验结果验证了TTRL在各种任务中的普遍有效性,并突显了TTRL在更广泛任务和领域中的潜力。
本文目录
一、背景动机
论文题目:TTRL: Test-Time Reinforcement Learning
论文地址:https://arxiv.org/pdf/2504.16084
当前测试时扩展(Test-Time Scaling, TTS)通常用来去增强大型语言模型(LLMs)的推理能力。研究表明,与预训练时扩展相比,TTS在计算效率上更具优势,能够在相同的计算投入下获得更好的性能。然而,现有的测试拓展方法主要集中在测试时推理(TTI),如通过多数投票(majority voting)或蒙特卡洛树搜索(Monte Carlo tree search)等策略来提升模型性能,而测试时训练(TTT)的研究相对较少。
强化学习在提升LLMs的推理能力方面发挥着重要作用,尤其是在长链推理(long chain-of-thought)方面。然而,现有的基于RL的方法主要依赖于大规模训练数据,并且在处理新出现的复杂输入时存在局限性。此外,随着任务复杂度的增加,为RL获取大规模标注数据变得越来越不切实际,这阻碍了模型的持续学习能力。
在本篇文章中,引入了一种名为测试时强化学习(Test-Time Reinforcement Learning,TTRL)的新方法,用于在无标签数据上使用强化学习训练大型语言模型。

二、核心贡献
1、提出了TTRL框架,其能够在没有显式监督的情况下,通过测试时的强化学习训练LLMs,利用预训练模型中的先验知识,实现模型的自我进化。
2、证明了TTRL在多种任务和模型上的一致有效性,特别是在数学推理基准测试中,TTRL在仅使用未标注的测试数据下,在AIME 2024上性能有明显提升。
三、实现方法
3.1 实现方法论
TTRL的核心思想是在测试时,通过重复采样策略在rollout阶段准确估计标签,并计算基于规则的奖励,从而在没有真实标签的情况下进行强化学习。
具体来说,给定一个由提示x表示的状态,模型通过策略πθ(y|x)生成输出y。为了构建奖励信号,模型生成多个候选输出{y1, y2, ..., yN},并通过多数投票或其他聚合方法得到共识输出y*,作为最优动作的代理。
环境根据样本动作y与共识动作y之间的一致性提供奖励r(y, y)。强化学习的目标是最大化期望奖励,并通过梯度上升更新参数。

3.2 多数投票奖励函数
TTRL使用多数投票来估计标签,并基于此计算规则奖励。对于一个问题x,模型生成一组输出,然后通过答案提取器提取预测答案P={ŷi}N_i=1。通过多数投票得到最常见的预测作为估计标签y,然后使用y计算规则奖励。奖励函数定义为:如果预测答案与估计标签匹配,则奖励为1,否则为0。
3.3 具体步骤
1、重复采样策略:在rollout阶段,模型通过重复采样生成多个候选输出{y1, y2, ..., yN}。这些候选输出用于估计标签和计算奖励。
2、多数投票:从候选输出中通过多数投票得到最常见的预测作为估计标签y。这种方法在没有真实标签的情况下提供了一个有效的标签估计。
3、奖励计算:基于估计标签y,计算每个候选输出的奖励。如果候选输出与估计标签匹配,则奖励为1,否则为0。这种基于规则的奖励函数简单且有效。
4、强化学习更新:使用估计的奖励信号,通过强化学习更新模型参数。具体来说,通过最大化期望奖励来更新模型参数,使用梯度上升方法进行优化。
四、实验结果
4.1 实验设置
1、模型选择:实验使用了Qwen2.5-Math-1.5B和Qwen2.5-Math-7B作为基础模型,以及LLaMA-3.1-8B-Instruct作为指令模型。
2、评测基准:评估了TTRL在三个数学推理基准测试(AIME 2024、AMC和MATH-500)上的性能。
4.2 主要结果
1、TTRL在多个任务和模型上都表现出色。例如,在AIME 2024上,TTRL将Qwen2.5-Math-7B的pass@1性能提升了159.3%,在AMC上提升了74.9%,在MATH-500上提升了66.4%。这些提升是在没有使用任何标注训练数据的情况下实现的,仅依赖于未标注的测试数据。

2、TTRL不仅在目标任务上表现出色,还能够泛化到其他任务。例如,在AIME 2024上训练的TTRL模型在AMC和MATH-500上也取得了显著的性能提升,表明TTRL的自我进化能力具有良好的泛化性。

3、尽管TTRL的训练设置与现有模型不同,但其性能在某些情况下已经接近或超过了现有模型。例如,在MATH-500上,TTRL的性能接近于直接在测试数据上进行RL训练的模型,这表明TTRL在无监督学习中的有效性。

五、局限性
1、TTRL的成功在很大程度上依赖于模型对目标任务的先验知识。如果模型的先验知识不足以处理数据的复杂性,TTRL可能无法取得预期的性能提升。
3、TTRL对超参数的设置非常敏感,尤其是在奖励估计存在噪声和测试数据的特性下。例如,温度参数和训练批次大小对训练的稳定性和成功性有显著影响。
更多推荐
所有评论(0)