简介

AReaL​ 是一个开源的全异步强化学习(RL)训练系统,专门为大型推理模型和智能体模型设计。该项目由清华大学交叉信息研究院(IIIS)和蚂蚁集团AReaL团队的成员联合开发,基于开源项目ReaLHF构建,并完全致力于开源原则——不仅提供训练好的模型,还公开了完整的训练细节、数据和所需的基础设施,确保研究结果的可复现性。AReaL的命名灵感来源于“真实的珍珠奶茶”,团队以此寓意项目的可口、可定制和亲民特性,希望用户能像享受珍珠奶茶一样享受使用AReaL的过程。

技术定位:在大语言模型和智能体快速发展的时代,高效的强化学习训练系统成为推动技术进步的关键。传统同步RL训练系统存在效率瓶颈,特别是在处理多轮交互、复杂推理任务时。AReaL通过创新的全异步架构,解决了这些挑战,实现了行业领先的训练速度,同时保持了训练稳定性。该系统特别针对大规模推理模型和智能体模型的训练需求进行了优化,支持从数亿到数千亿参数模型的训练。

核心价值:AReaL的核心价值在于其全异步训练架构完整的开源生态。与传统的同步训练相比,AReaL的异步设计允许不同组件(如环境模拟、模型推理、梯度更新)并行执行,显著提高了硬件利用率,实现了高达2.77倍的训练加速。同时,项目提供了从算法实现、数据处理到集群部署的完整工具链,降低了研究人员和开发者构建自定义AI智能体的门槛和成本。

主要功能

1. 全异步强化学习训练架构

AReaL最突出的特点是其全异步RL训练能力,通过创新的“boba²”(双珍珠)架构,实现了环境模拟、模型推理和参数更新的完全解耦和并行执行。这种设计消除了传统同步训练中的等待时间,使系统能够持续保持高吞吐量。异步训练特别适合多轮智能体RL场景,因为它自然支持不同轮次间的并行执行,大幅简化了训练流程的复杂性。

2. 多算法支持与灵活配置

系统内置了丰富的强化学习算法,包括GRPO(Group Relative Policy Optimization)、GSPO、PPO(Proximal Policy Optimization)、DAPO(Decoupled Advantage Policy Optimization)、LitePPO、Dr.GRPO、REINFORCE++、RLOO(Reward Learning with Offline Optimization)、SAPO和M2PO等。所有算法都同时支持异步和同步版本,用户只需通过简单的配置切换(如设置max_head_offpolicyness=0)即可在两种模式间转换,满足不同研究需求。

3. 广泛的模型与后端兼容性

AReaL支持多种主流模型架构,包括Qwen2/3系列、Qwen3-MoE混合专家模型、Qwen2.5-VL和Qwen3-VL视觉语言模型、Gemma 3等,同时也兼容其他Hugging Face LLM。在训练后端方面,系统支持Megatron-LM、PyTorch FSDP和PyTorch Archon,分别针对不同规模的训练需求优化。推理后端则支持vLLM和SGLang,提供高效的序列处理能力。

4. 参数高效训练与扩展技术

项目集成了多种参数高效训练技术,特别是LoRA(Low-Rank Adaptation)支持,允许用户在保持预训练权重不变的情况下,通过训练少量附加参数来适应新任务。结合SGLang和vLLM后端,LoRA训练实现了高性能的参数高效微调。系统还支持张量并行、序列并行、上下文并行、流水线并行和专家并行等多种并行策略,满足千亿级参数模型的训练需求。

5. 异构硬件支持与云原生部署

AReaL不仅支持传统的NVIDIA GPU,还通过社区贡献实现了对华为昇腾(Ascend)NPU设备的稳定支持。系统提供与SkyPilot的集成,支持在GCP、AWS和Kubernetes等云平台上的一键部署,简化了大规模集群的运维管理。容器化部署通过Docker支持,确保环境的一致性和可复现性。

6. 智能体训练与多轮交互支持

专门针对AI智能体训练优化,AReaL原生支持多轮交互场景,包括奖励折扣跨轮次计算、状态维护和长期规划。系统集成了多种智能体框架,如OpenAI Agents SDK和CAMEL-AI,支持工具调用、搜索集成、视觉推理等复杂智能体能力。预置的示例涵盖了客服智能体、搜索智能体、多轮数学推理智能体等实际应用场景。

7. 数据合成与自进化引擎

项目引入了EigenData——一个自进化数据合成引擎,能够自动生成高质量的训练数据。结合AReaL的RL训练,使用EigenData生成的235B MoE模型在τ²基准测试中超越了Gemini 3.0 Pro和GPT 5.2的表现。这种数据引擎与训练系统的紧密集成,为持续模型改进提供了强大的数据基础。

8. 轻量级版本与快速原型支持

针对研究者和快速原型开发需求,AReaL提供了轻量级版本AReaL-lite。该版本采用算法优先的API设计,代码量减少80%的同时保持了90%的核心功能和性能。AReaL-lite特别适合算法研究、教学和小规模实验,降低了入门门槛,同时仍支持全异步智能体RL训练。

安装与配置

基础环境准备

AReaL支持Linux环境,推荐使用Python 3.9或更高版本。系统需要CUDA环境(用于GPU训练)或昇腾CANN环境(用于NPU训练)。对于大规模集群部署,建议配置共享存储(如NFS或云存储)以便多节点间数据同步。基础依赖管理通过uv工具进行,这是现代Python的快速包管理器和解析器。

标准安装流程

最直接的安装方式是通过Git克隆仓库并使用uv同步依赖。首先克隆仓库:git clone https://github.com/inclusionAI/AReaL,然后进入项目目录:cd AReaL。安装uv工具(如果尚未安装):pip install uv。最后同步依赖,对于CUDA环境使用:uv sync --extra cuda,对于纯CPU环境可省略--extra cuda参数。这个过程会自动下载所有必要的Python包和系统依赖。

开发环境配置

对于计划贡献代码或进行开发的用户,需要安装开发依赖组。在基础安装完成后,运行:uv sync --extra cuda --group dev(CUDA环境)或uv sync --group dev(非CUDA环境)。然后设置预提交钩子以确保代码质量:pre-commit install。开发环境配置还包括测试框架、代码格式化工具和文档生成工具。

昇腾NPU环境配置

对于使用华为昇腾硬件的用户,需要切换到专门的分支:git checkout ascend。然后按照昇腾文档配置CANN工具包和驱动程序。依赖安装命令调整为:uv sync --extra ascend。昇腾分支提供了完整的NPU支持,包括自定义算子和优化后的训练流程,性能与GPU版本相当。

集群部署配置

多节点训练需要配置Ray集群。首先在所有节点上安装相同版本的AReaL和依赖。然后配置共享存储,确保所有节点能访问相同的模型检查点和数据集。修改YAML配置文件中的路径指向共享存储位置。启动Head节点:ray start --head --port=6379,在工作节点上:ray start --address='head-node-ip:6379'。最后通过AReaL的Ray调度器启动训练任务。

Docker容器化部署

对于需要环境隔离或快速部署的场景,AReaL提供了Docker支持。构建镜像:docker build -t areal:latest .。运行容器:docker run --gpus all -it areal:latest。Docker配置包含了所有必要的依赖,确保训练环境的一致性。用户还可以基于提供的Dockerfile定制自己的镜像,添加特定模型或数据集。

云平台集成配置

通过SkyPilot集成,AReaL可以轻松部署到主流云平台。首先安装SkyPilot:pip install skypilot。然后准备云凭证(如AWS的IAM密钥或GCP的服务账户密钥)。修改AReaL的SkyPilot配置文件,指定实例类型、区域和存储配置。最后使用sky launch命令启动集群,AReaL会自动处理节点配置和软件安装。

如何使用

单节点训练入门

最简单的使用场景是在单台服务器上运行训练。AReaL提供了丰富的示例脚本,用户可以从数学推理任务开始体验。系统会自动下载所需的数据集(如openai/gsm8k)和基础模型(如Qwen/Qwen2-1.5B-Instruct)。运行命令:python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local。这个命令会启动一个本地训练任务,使用GRPO算法在GSM8K数学推理数据集上训练模型。

多节点分布式训练

对于大规模训练,需要配置多节点集群。首先确保所有节点网络互通且能访问共享存储。然后准备Ray集群,在YAML配置文件中指定节点数量和GPU配置。启动命令示例:python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml cluster.n_nodes=2 cluster.n_gpus_per_node=8 scheduler.type=ray。这个配置会在2个节点、每个节点8个GPU的集群上启动训练,AReaL会自动处理节点间的通信和数据同步。

算法选择与配置调优

AReaL支持多种RL算法,用户可以通过简单的配置切换算法。每个算法都有对应的YAML配置文件,包含了超参数、模型架构、训练策略等设置。用户可以根据任务特性选择合适的算法:对于稳定性要求高的场景选择PPO,对于样本效率要求高的选择GRPO,对于离线数据利用选择DAPO。系统还支持算法组合和自定义算法实现,通过继承基础算法类并实现关键方法即可集成新算法。

模型定制与架构修改

用户可以使用预训练模型或自定义模型架构。对于Hugging Face格式的模型,只需在配置中指定模型名称或路径。对于自定义架构,需要实现对应的模型类并注册到模型工厂中。AReaL支持混合专家模型、视觉语言模型等复杂架构,配置相应并行策略即可。模型保存和加载支持检查点恢复、部分加载等高级功能,便于长时间训练和实验管理。

训练监控与可视化

训练过程中,AReaL会输出详细的日志信息,包括损失值、奖励曲线、样本效率等关键指标。系统集成了TensorBoard支持,用户可以通过Web界面实时监控训练进度。此外,AReaL还提供了自定义监控钩子,允许用户添加特定指标的跟踪和可视化。对于生产环境,可以配置Prometheus监控和警报,确保训练任务稳定运行。

推理服务部署

训练完成后,用户可以将模型导出为标准格式并部署为推理服务。AReaL支持与vLLM和SGLang推理引擎集成,提供高吞吐量、低延迟的推理能力。部署配置包括批量大小优化、动态批处理、持续批处理等高级特性。对于多模型服务场景,可以配置模型路由和负载均衡,实现高效的资源利用。

实验管理与复现

AReaL强调实验的可复现性。每次训练都会自动生成完整的配置快照和随机种子记录,确保实验可以精确复现。系统还提供了实验对比工具,可以并行运行多个配置并比较结果。对于长期研究项目,建议使用实验管理平台(如Weights & Biases或MLflow)与AReaL集成,实现实验跟踪、版本控制和协作分析。

应用场景实例

实例1:大规模数学推理模型训练

场景描述:一家AI研究机构需要训练一个专门解决复杂数学问题的语言模型,目标是在GSM8K、MATH等基准测试上达到领先水平。传统训练方法面临样本效率低、训练不稳定、计算成本高等挑战。机构需要一个能够高效利用计算资源、支持多种强化学习算法、且能处理多步推理的训练系统。

解决方案:研究团队采用AReaL系统进行数学推理模型的训练。他们使用GSM8K数据集作为训练基础,配置GRPO算法进行强化学习微调。利用AReaL的全异步架构,环境模拟(问题生成)、模型推理(答案生成)和参数更新可以并行执行,硬件利用率达到85%以上,相比同步训练获得2.5倍加速。团队还利用AReaL的多算法支持,并行实验了PPO、DAPO等不同算法,最终选择GRPO作为主要算法因其在数学推理任务上的样本效率优势。训练过程中,他们使用AReaL的监控工具跟踪奖励曲线和准确率提升,及时调整超参数。

实施效果:训练时间从预计的3周缩短到10天,计算成本降低60%。最终模型在GSM8K测试集上达到92.5%的准确率,超越了同等规模的基线模型。研究团队将训练细节和模型检查点开源,其他研究者可以完全复现他们的结果。基于这个成功经验,团队扩展了训练规模,使用AReaL的混合并行策略训练了320亿参数的模型,在更复杂的数学竞赛问题上取得了突破性进展。

实例2:多轮对话客服智能体开发

场景描述:一家电商平台需要开发智能客服系统,能够处理复杂的多轮客户咨询,包括订单查询、退货处理、产品推荐等场景。传统基于规则的客服系统灵活性不足,而端到端的训练又面临奖励稀疏、长期规划困难等挑战。平台需要一个能够训练多轮交互智能体、支持复杂奖励设计、且能处理真实对话数据的系统。

解决方案:平台使用AReaL训练多轮对话客服智能体。他们收集了历史客服对话数据,构建了包含τ²基准测试中零售、航空、电信等多个领域的训练环境。利用AReaL对多轮交互的原生支持,他们设计了跨轮次的奖励折扣机制,使智能体能够考虑长期对话效果而非单轮回复质量。训练采用异步架构,多个对话环境并行运行,显著提高了数据收集效率。团队还集成了外部知识库和工具调用能力,使智能体能够查询订单系统、计算退货金额等。

实施效果:客服智能体在内部测试中达到了人类客服85%的解决率,同时处理速度提高了3倍。多轮对话的成功率从传统系统的40%提升到72%,客户满意度调查显示智能体服务的评分接近人类客服水平。系统上线后,人工客服工作量减少了30%,他们可以专注于更复杂的咨询场景。平台还将训练框架抽象为通用对话智能体模板,快速适配到新的业务领域。

实例3:端到端搜索智能体构建

场景描述:一个研究团队希望构建能够自主进行网络搜索、信息整合和报告生成的智能体,用于学术研究和商业分析。传统方法需要分别训练搜索查询生成、结果筛选、信息提取和报告撰写等模块,集成复杂且误差累积。团队需要一个端到端的训练框架,能够优化整个搜索工作流,而不仅仅是单个组件。

解决方案:团队基于AReaL开发了ASearcher——端到端的搜索智能体。他们使用Tongyi-DeepResearch工作流作为基础环境,智能体需要根据用户问题制定搜索策略、执行搜索、评估结果相关性、提取关键信息并生成结构化报告。AReaL的全异步训练特别适合这个场景,因为搜索环境(模拟或真实API)通常有较高延迟,异步架构允许模型训练不因环境响应而阻塞。团队设计了多目标奖励函数,平衡结果相关性、信息完整性和报告质量。

实施效果:训练完成的ASearcher智能体在学术文献搜索任务中,相比传统检索系统,相关文献发现率提高了45%,报告质量评分提高了38%。智能体能够自主探索相关但非直接的关键词,发现人类研究者可能忽略的关联研究。研究团队开源了智能体和训练代码,成为信息检索领域的重要基准。商业公司基于这个框架开发了竞争情报分析系统,自动化了80%的市场调研工作。

实例4:视觉语言模型强化学习对齐

场景描述:一家自动驾驶公司需要训练视觉语言模型来理解复杂交通场景并做出安全决策。预训练的VLM在描述图像方面表现良好,但在具体决策任务上需要进一步对齐。公司需要一个能够处理多模态输入、支持复杂奖励信号、且能高效利用昂贵仿真环境的训练系统。

解决方案:公司使用AReaL训练视觉语言模型进行强化学习对齐。他们构建了包含Geometry3K和CLEVR Count等数据集的视觉推理环境,模型需要根据图像内容回答几何问题或计数问题。利用AReaL对视觉语言模型的支持,他们使用Qwen2.5-VL作为基础模型,添加决策头进行训练。异步架构允许同时运行多个仿真环境,每个环境渲染不同的交通场景,最大化GPU利用率。团队还设计了安全奖励函数,惩罚危险决策,鼓励防御性驾驶行为。

实施效果:经过RL对齐的VLM在视觉推理任务上的准确率比纯监督微调提高了25%,在安全关键决策上的保守性提高了40%。模型能够更好地理解场景中的风险因素,如恶劣天气、行人突然出现等。训练效率方面,异步设计使仿真环境利用率从30%提高到75%,同样的硬件资源可以运行更多样的场景。公司将该技术扩展到其他视觉决策任务,如工业质检和医疗影像分析。

实例5:轻量级研究原型快速迭代

场景描述:一个大学实验室进行强化学习算法研究,需要快速原型实现和实验验证。传统大规模训练系统配置复杂、启动缓慢,不适合小规模实验和算法探索。研究人员需要一个轻量级但功能完整的系统,能够快速实现新算法、运行小规模实验、并与现有算法公平比较。

解决方案:实验室采用AReaL-lite进行算法研究。这个轻量级版本保持了AReaL的核心功能,但代码量减少80%,API设计更加简洁。研究人员可以在几分钟内启动一个新算法的实验,而不需要处理分布式训练的复杂性。AReaL-lite支持全异步训练,即使在小规模设置下也能体现算法在异步环境下的特性。团队使用该系统开发了新的离线强化学习算法,并在多个基准任务上验证了其有效性。

实施效果:算法开发周期从平均2个月缩短到2周,研究人员可以更快地验证想法和发表成果。AReaL-lite的简洁设计降低了研究生和新成员的学习门槛,实验室的研究产出增加了60%。开发的算法通过AReaL-lite验证后,可以无缝迁移到完整的AReaL系统进行大规模训练,形成了从研究到应用的完整 pipeline。实验室基于这个工作流程,在顶级会议上发表了多篇强化学习算法论文。

GitHub地址

官方仓库地址https://github.com/inclusionAI/AReaL

项目关键信息

  • 项目名称:AReaL - Asynchronous Reinforcement Learning for Large Reasoning and Agentic Models

  • 核心定位:开源全异步强化学习训练系统,专注于大型推理模型和智能体模型

  • 最新版本:持续活跃开发,定期发布更新(最新重要版本v0.3 "boba²")

  • 技术基础:基于ReaLHF项目,扩展了全异步训练架构

  • 开源协议:项目遵循开源原则,提供完整的训练细节、数据和基础设施

  • 主要贡献者:清华大学交叉信息研究院和蚂蚁集团AReaL团队

项目结构

  • areal/​ - 核心源代码目录

  • examples/​ - 丰富的示例脚本,涵盖数学推理、多轮对话、视觉语言等场景

  • docs/​ - 完整文档,包括算法指南、API参考和最佳实践

  • benchmark/​ - 基准测试和性能评估工具

  • notebook/​ - Jupyter Notebook教程和演示

  • tests/​ - 单元测试和集成测试

  • blog/​ - 技术博客和发布说明

快速开始

  1. 环境准备:确保Python 3.9+和CUDA环境

  2. 克隆仓库git clone https://github.com/inclusionAI/AReaL

  3. 安装依赖cd AReaL && pip install uv && uv sync --extra cuda

  4. 运行示例python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local

  5. 探索更多:查看examples目录下的其他示例,如多轮数学、客服智能体、搜索智能体等

社区资源

  • 问题反馈:通过GitHub Issues报告问题或提出功能建议

  • 贡献指南:CONTRIBUTING.md提供详细的贡献流程和代码规范

  • 讨论论坛:GitHub Discussions进行技术交流和问题讨论

  • 学术论文:项目相关研究论文在arXiv发布,提供理论背景

  • 演示视频:官方YouTube频道提供教程和演示

发展愿景:AReaL项目代表了强化学习训练系统的发展方向——从同步到异步,从单任务到多智能体,从纯文本到多模态。团队致力于将AReaL打造为AI智能体训练的基础设施,降低强化学习应用的门槛,加速AI智能体的发展和部署。通过持续的开源贡献和社区建设,AReaL不仅是一个工具,更是一个推动AI民主化的平台,让每个研究者和开发者都能构建自己的智能体,共同探索人工智能的未来边界。项目路线图包括更高效的异步算法、更广泛的多模态支持、更简化的部署流程,以及与企业级需求的深度集成。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐