摘 要

        结合预先训练的大型语言模型的思维链提示在复杂的推理任务中取得了令人鼓舞的结果。本文提出了一种新的解码策略——自一致性,以取代思维链提示中使用的幼稚贪婪解码。它首先对不同的推理路径进行抽样,而不是只取贪婪的推理路径,然后通过将抽样的推理路径边缘化来选择最一致的答案。自洽利用了一种直觉,即一个复杂的推理问题通常允许多种不同的思维方式导致其唯一的正确答案。我们广泛的实证评估表明,自一致性在一系列流行的算术和常识性推理基准上提高了思维链提示的性能,包括GSM8K(+17.9%)、SVAMP(+11.0%)、AQuA(+12.2%)、StrategyQA(+6.4%)和ARC-challenge(+3.9%)。

1 引言

        尽管语言模型在一系列NLP任务中取得了显著的成功,但它们展示推理的能力通常被视为一种限制,不能仅仅通过增加模型规模来克服(Rae等人,2021;BIG-bench协作,2021年,除其他外)。为了解决这一缺点,Wei等人(2022)提出了思维链提示,其中提示语言模型生成一系列模仿人在解决任务时可能使用的推理过程的短句。例如,给定问题“如果停车场里有3辆车,还有2辆车到达,停车场里有多少辆车?”,而不是直接回答“5”,一个语言模型会被提示用整个思维链来回答:“停车场已经有3辆车了。”又来了两个。现在有3 + 2 = 5辆车。答案是5。”已经观察到,思维链提示显著提高了模型在各种多步骤推理任务中的性能(Wei et al, 2022)。
        在本文中,我们引入了一种称为自一致性的新型解码策略来取代思维链提示中使用的贪婪解码策略(Wei et al ., 2022),从而进一步显著提高了语言模型的推理性能。自洽利用了直觉,即复杂的推理任务通常允许多种推理路径达到正确答案(Stanovich & West, 2000)。一个问题越需要深思熟虑的思考和分析(Evans, 2010),可以恢复答案的推理路径的多样性就越大。
        图1用一个示例说明了自一致性方法。我们首先用思维链提示来提示语言模型,然后我们提出了一个“抽样和边缘化”的解码过程,而不是贪婪地解码最优推理路径:我们首先从语言模型的解码器中采样,生成一组不同的推理路径;每个推理路径可能导致不同的最终答案,因此我们通过边缘化抽样推理路径来确定最优答案,以在最终答案集中找到最一致的答案。这种方法类似于人类的经验,如果多种不同的思维方式导致相同的答案,一个人更有信心最终的答案是正确的。与其他解码方法相比,自一致性避免了贪婪解码的重复性和局部最优性,同时减轻了单采样生成的随机性。

图1:自一致性方法包含三个步骤:(1)使用思维链(CoT)提示提示语言模型;(2)通过对语言模型的解码器进行采样,替换CoT提示中的“贪婪解码”,生成多样化的推理路径集;(3)剔除推理路径,在最终答案集中选择最一致的答案进行聚合。

        自一致性比之前的方法简单得多,之前的方法要么训练一个额外的验证器(Cobbe等人,2021),要么训练一个重新排序器,给出额外的人工注释,以提高生成质量(Thoppilan等人,2022)。相反,自一致性是完全不受监督的,可以与预先训练好的语言模型一起使用,不需要额外的人工注释,并且避免了任何额外的训练、辅助模型或微调。自一致性也不同于典型的集成方法,其中训练多个模型并汇总每个模型的输出,它更像是在单个语言模型之上工作的“自集成”。
        我们在四种不同尺度的语言模型上评估了广泛的算术和常识性推理任务的自一致性:公共UL2-20B (Tay等人,2022)和GPT-3-175B (Brown等人,2020),以及两个密集激活的解码语言模型:LaMDA-137B (Thoppilan等人,2022)和PaLM-540B (Chowdhery等人,2022)。在所有四种语言模型中,自一致性在所有任务中都比思维链提示得到了显著的提高。特别是,当与PaLM-540B或GPT-3一起使用时,自一致性在算术推理任务中实现了新的最先进的性能水平,包括GSM8K (Cobbe等人,2021)(+17.9%的绝对精度增益),SVAMP (Patel等人,2021)(+11.0%),AQuA (Ling等人,2017)(+12.2%),以及常识推理任务,如StrategyQA (Geva等人,2021)(+6.4%)和ARCchallenge (Clark等人,2018)(+3.9%)。在其他实验中,我们发现自一致性可以显著提高NLP任务的性能,在这些任务中,与标准提示相比,添加思维链可能会损害性能(Ye & Durrett, 2022)。我们还表明,自一致性显著优于样本和秩、波束搜索、基于集成的方法,并且对采样策略和不完美提示具有鲁棒性。

 2 不同推理路径的自洽性

        人性的一个突出方面是人们的思维方式不同。人们很自然地认为,在需要深思熟虑的任务中,可能有几种方法来解决问题。我们建议通过从语言模型的解码器中采样,在语言模型中模拟这样的过程。
        例如,如图1所示,一个模型可以对一个数学问题生成几个貌似合理的回答,这些回答都得到了相同的正确答案(输出1和3)。由于语言模型不是完美的推理器,模型也可能产生不正确的推理路径或在推理步骤之一中犯错误(例如,在输出2中),但这样的解决方案不太可能得到相同的答案。也就是说,我们假设正确的推理过程,即使它们是不同的,在最终的答案中往往比不正确的过程有更大的一致性。

        我们通过提出以下自洽方法来利用这种直觉。首先,向语言模型提示一组手工编写的思维链示例(Wei等人,2022年)。接下来,我们从语言模型的解码器中抽取一组候选输出,生成多样化的候选推理路径。自洽性与大多数现有的采样算法兼容,包括温度采样(Ackley等人,1985年;Ficler & Goldberg,2017年)、top-k采样(Fan等人,2018年;Holtzman等人,2018年;Radford等人,2019年)和核采样(Holtzman等人,2020年)。最后,我们通过边际化抽样推理路径并选择生成的答案中最一致的答案来汇总答案。
        更详细地说,假设生成的答案ai来自一个固定的答案集,a_{i} \epsilon A,其中i = 1, ... , m索引从解码器中抽取的m个候选输出。给定一个提示和一个问题,自洽性引入了一个额外的潜在变量ri,这是一个代表第i个输出中推理路径的令牌序列,然后将(r_{i}; a_{i})的生成耦合起来,其中r_{i}a_{i},即生成一个推理路径r_{i}是可选的,仅用于达到最终答案a_{i}。例如,考虑图1中的输出3:前几句话“She eats 3 for breakfast ... So she has 9 eggs * $2 = $18.”构成了ri,而最后一句“The answer is $18”中的答案18被解析为a_{i}
        在从模型的解码器中抽样多个(r_{i}; a_{i})之后,自洽性通过对a_{i}进行多数表决来对ri进行边际化处理,即argmax_{a}\Sigma _{i=1}^{m}1(a_{i} = a),或者我们定义为最终答案集中最“一致”的答案。

        在表1中,我们通过使用不同的答案聚合策略展示了一组推理任务的测试准确性。除了多数投票之外,还可以对每个(r_{i}; a_{i})乘以P(r_{i};prompt;question)在汇总答案时。注意计算P(r_{i};prompt;question),我们可以取模型生成(r_{i}; a_{i});给予(prompt;question),或者我们可以通过输出长度将条件概率归一化(Brown et al, 2020),即

        其中logP(t_{k}\mid prompt,question,t_{1},...,t_{k-1})为生成(r_{i}; a_{i})以之前的令牌为条件,K是(r_{i}; a_{i})。在表1中,我们展示了采用“未加权和”,即直接对a_{i}进行多数投票,与使用“规范化加权和”进行聚合产生非常相似的准确性。我们仔细研究了模型的输出概率,发现这是因为对于每个(r_{i}; a_{i}),归一化条件概率P(r_{i};prompt;question)彼此非常接近,也就是说,语言模型将这些代视为“相似的可能性”此外,在汇总答案时,表1中的结果表明,“规范化”加权和(即公式1)比其未规范化的对应项产生更高的准确性。为了完整性,在表1中,我们还通过采取“加权平均”来报告结果,即,每个a获得其加权和除以\Sigma _{i=1}^{m}1(a_{i}=a)的分数,这导致更差的性能。

 

表1:不同答案聚合策略在PaLM-540B上的准确率比较。

        自洽性探索了一个有趣的空间,介于开放式文本生成和具有固定答案的最优文本生成之间。推理任务通常有固定的答案,这也是研究人员通常考虑贪婪解码方法的原因(Radford等人,2019年;Wei等人,2022年;Chowdhery等人,2022年)。然而,我们发现即使所需的答案是固定的,引入推理过程中的多样性也可以非常有益;因此,我们利用采样,这是开放式文本生成中常用的方法(Radford等人,2019年;Brown等人,2020年;Thoppilan等人,2022年),来实现这一目标。需要注意的是,自洽性只能应用于最终答案来自固定答案集的问题,但原则上,如果可以在多次生成之间定义一个好的一致性度量,例如两个答案是否一致或相互矛盾,这种方法可以扩展到开放式文本生成问题。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐