Discovering state-of-the-art reinforcement   learning algorithms

Junhyuk Oh*, Iurii Kemaev*†, Greg Farquhar*, Dan A. Calian*, Matteo Hessel,
Luisa Zintgraf, Satinder Singh, Hado van Hasselt, David Silver

Google DeepMind
*同等贡献。†工程负责人。

发表于 Nature (2025)

论文 代码 引用

研究背景

人工智能(AI)领域正在经历一场革命:用从数据和经验中学习的组件取代人工设计的组件。自然而然的下一步是让学习算法本身也能够从经验中被学习。

许多最成功的 AI 智能体都基于强化学习(RL),智能体通过与环境交互来学习,在包括围棋、国际象棋和《星际争霸》等复杂竞技游戏的掌握方面取得了众多里程碑式的成就。

传统的 RL 算法可以用数学公式写下并用代码实现。它们由人类专家通过艰苦的试错过程设计,受实验、理论和人类直觉的指导。

另一方面,我们发现的规则——称为 DiscoRL——由一个神经网络表示,它比简单的数学公式灵活得多。它不是人工设计的,而是通过一个自动化过程学习的,利用许多智能体与多样化和复杂环境交互的经验。

DiscoRL 在各种基准测试中优于许多现有 RL 算法,并且随着用于发现的环境增多而变得更强。

方法

RL 智能体通常会做出对学习有用的预测。它们的语义由更新规则决定,例如某个动作的价值。在我们的框架中,智能体做出没有预定义语义的额外预测,以开放发现全新预测语义的可能性。

RL 智能体使用损失函数来优化它们的策略和预测。这个函数依赖于智能体自身的预测,以及它在与环境交互时收到的奖励。

我们使用一个称为"元网络"的神经网络来定义预测和策略的损失函数,而不是用公式手动定义损失函数。元网络是随机初始化的,因此最初充当一个随机更新规则。我们让元学习过程优化元网络,逐步发现更高效的更新规则。

为了从经验中发现一个强大的更新规则,我们创建了大量智能体群体,每个智能体与自己环境交互。每个智能体使用共享的元网络来更新它们的预测和策略。然后我们估计它们的性能来计算元梯度,这告诉如何调整元网络以获得更好的性能。随着时间的推移,发现的规则成为更强更快的 RL 算法。发现过程完成后,发现的规则可用于在未见过的环境中训练新的智能体。

为了扩大发现过程,我们开发了一个可以处理数百个并行智能体的元学习框架。为了提高容错性并促进我们的研究,我们确保智能体、环境和元学习的各个方面都是确定性的和可检查点的,从而提供完全的可复现性。我们还实现了一些优化来处理计算密集型的元梯度,包括混合模式微分、递归梯度检查点、混合精度训练和抢先参数卸载(+)

(+) Kemaev, I., Calian, D. A., Zintgraf, L. M., Farquhar, G. & van Hasselt, H. 通过混合模式微分实现可扩展元学习。 国际机器学习会议 (2025)

实验结果

经过大规模元学习后,我们发现 DiscoRL 在许多具有挑战性的基准测试中优于或与最新技术相当。

1. 在 Atari57 上元学习 Disco57

我们在多样化的标准 Atari57 环境集上训练 Disco57 更新规则。

2. 评估 Disco57

Disco57 在未见过的 ProcGen 和 DMLab-30 领域上接受零样本评估,以衡量泛化能力。

3. 扩展训练集:元学习 Disco103

我们用更具挑战性的 ProcGen 和 DMLab-30 扩展训练领域,以元学习 Disco103。

4. 在未见领域上评估

我们在未见过的领域上评估 Disco57 和 Disco103:Crafter、NetHack、Sokoban。

DiscoRL 具有泛化能力,在未用于发现的环境中表现良好,并且这些环境具有完全不同的观察和动作空间。DiscoRL 还可以泛化,当用于训练比用于发现的智能体具有更多参数和数据的智能体时。

发现过程可扩展,随着训练环境数量、多样性和复杂性的增加,以及消耗的经验总量的增加,性能也在提高。

我们发现发现的预测捕捉了新的语义,识别了中等时间尺度上即将发生事件的重要特征,例如未来策略熵和大奖励事件。更多详情请参阅论文

总体而言,研究结果表明,RL 算法的设计未来可能由能够随数据和计算有效扩展的自动化方法引领。

引用


@Article{DiscoRL2025,
  author  = {Oh, Junhyuk and Farquhar, Greg and Kemaev, Iurii and Calian, Dan A. and Hessel, Matteo and Zintgraf, Luisa and Singh, Satinder and van Hasselt, Hado and Silver, David},
  journal = {Nature},
  title   = {Discovering State-of-the-art Reinforcement Learning Algorithms},
  year    = {2025},
  doi     = {10.1038/s41586-025-09761-x}
}

代码可用性

我们在开源 Apache 2.0 许可证下提供元训练和评估代码,以及 Disco103 的元参数,在 GitHub 上提供。

致谢

感谢 Sebastian Flennerhag、Zita Marinho、Angelos Filos、Surya Bhupatiraju、Andras György 和 Andrei A. Rusu 对相关想法的反馈和讨论。还要感谢 Blanca Huergo Muñoz、Manuel Kroiss 和 Dan Horgan 对工程基础设施的帮助。最后,感谢 Raia Hadsell、Koray Kavukcuoglu、Nando de Freitas 和 Oriol Vinyals 对项目的高层反馈,以及 Simon Osindero 和 Doina Precup 对早期版本工作的反馈。

许可和免责声明

版权所有 2025 Google LLC

所有软件均根据 Apache 许可证版本 2.0(Apache 2.0)获得许可;除非符合 Apache 2.0 许可证,否则您不得使用此文件。您可以在以下网址获取 Apache 2.0 许可证的副本: https://www.apache.org/licenses/LICENSE-2.0

所有其他材料均根据知识共享署名 4.0 国际许可证(CC-BY)获得许可。您可以在以下网址获取 CC-BY 许可证的副本: https://creativecommons.org/licenses/by/4.0/legalcode

除非适用法律要求或书面同意同意,否则根据 Apache 2.0 或 CC-BY 许可证分发的所有软件和材料均按"原样"分发,不附带任何明示或暗示的保证或条件。有关特定语言管理权限和限制的详细信息,请参阅许可证。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐