Open-AgentRL

面向推理、工具调用与交互环境的强化学习训练框架。

Star 数
★ 641
最近更新
3 个月前
License
Apache-2.0
主语言
Python

30 秒速览

可在哪里用
兼容但需适配
开始前需要
CondaPython 3.10 or 3.11vLLMSGLangMegatron CoreSandboxFusion for code executionAlfWorld for text-game trainingVolcengine Cloud VMs for the documented OSWorld setupShell / 命令行网络访问本地文件系统
典型场景
研究人员想以 3K SFT 数据和 30K RL 数据复现实验性智能体推理训练,并在 AIME、GPQA-Diamond 或 LiveCodeBench-v6 上评测时。
主要局限
这不是即装即用的推理产品;用户必须准备模型、.parquet 数据、绝对路径和场景配置。

这个 Agent 能做什么,适合哪些场景?

Open-AgentRL 汇集了 DemyAgent、RLAnything 和 AutoTool 三条面向 Agentic RL 的研究实现。DemyAgent 提供冷启动 SFT 与基于 GRPO-TCR 的智能体强化学习流程,并覆盖数学、科学和代码推理评测。RLAnything 训练策略、奖励模型与环境的闭环优化,支持 OSWorld 计算机控制、AlfWorld 文本游戏和代码任务。AutoTool 提供动态工具选择的双阶段训练代码:先稳定工具整合轨迹,再以 KL 正则化的 Plackett–Luce 排序目标优化多步选择。它是需要自行准备模型、数据、配置及部分外部执行环境的研究训练仓库,而不是可直接部署的聊天机器人或统一推理服务。

DemyAgent 流程读取 .parquet 格式的 SFT、RL 和评测数据,使用 recipe/demystify/qwen3_4b_sft.shqwen2_7b_sft.sh 微调 Qwen 模型,再用 grpo_tcr_qwen2_7b.shgrpo_tcr_qwen3_4b.sh 进行 GRPO-TCR 训练。代码执行任务通过 SandboxFusion 的 /run_code 端点完成,并需要在 sandbox_fusion_tool_config.yamlverl/utils/reward_score/livecodebench/code_math.py 中配置该端点。RLAnything 分别以 osworld_rl.pyalfworld_rl.pycoding_rl.py 读取对应 YAML 配置开展训练,并以相应的 *_eval.py 脚本输出评测结果。AutoTool 的训练框架覆盖 Phase I 的 SFT 加 RL 轨迹稳定和 Phase II 的工具选择排序优化;仓库说明其完整训练数据和工具集仍将发布。

  1. 研究人员想以 3K SFT 数据和 30K RL 数据复现实验性智能体推理训练,并在 AIME、GPQA-Diamond 或 LiveCodeBench-v6 上评测时。
  2. 拥有 SandboxFusion 本地部署或云端代码沙箱端点的团队,想训练会在推理过程中执行代码的 Qwen 系列模型时。
  3. 已配置 Volcengine 云端虚拟机、安全组和 OSWorld 镜像的团队,想对 GUI 计算机控制策略进行强化学习或评测时。
  4. 需要下载 AlfWorld 环境数据,并在文本交互游戏中训练或评测强化学习策略的研究者。
  5. 希望研究大规模、持续变化工具库上的动态工具选择,并接受 AutoTool 完整数据和工具集尚未公开的团队。

如何安装或部署这个 Agent?

DemyAgent:

git clone https://github.com/Gen-Verse/Open-AgentRL.git
conda create -n OpenAgentRL python=3.11
conda activate OpenAgentRL
cd Open-AgentRL
bash scripts/install_vllm_sglang_mcore.sh
pip install -e .[vllm]

RLAnything:

conda create --name rlanything python=3.10
source activate rlanything
pip install -r requirements_rlanything.txt

仓库未说明 API 密钥要求。代码执行 RL 需额外部署 SandboxFusion 或取得 Volcano Engine Cloud FaaS 的 /run_code 端点;OSWorld 的文档化配置使用 Volcengine 云端虚拟机。

如何使用这个 Agent?

DemyAgent 冷启动 SFT 前,在 recipe/demystify/qwen3_4b_sft.shqwen2_7b_sft.sh 中设置 TRAIN_DATAEVAL_DATAMODEL_PATHSAVE_PATH 的绝对路径,然后运行:

bash recipe/demystify/qwen3_4b_sft.sh

配置 SandboxFusion 端点、RL 数据路径、模型路径、评测集路径和 default_local_dir 后,可运行:

bash recipe/demystify/grpo_tcr_qwen3_4b.sh

RLAnything 的首次训练调用取决于场景,例如:

python osworld_rl.py config=configs/osworld_rl.yaml

单节点运行时需在对应 YAML 中将 num_node 设为 1

这个 Agent 有哪些优点和局限?

优点
  • 同一仓库覆盖智能体推理、GUI 计算机控制、文本游戏、代码任务和动态工具选择,而非只提供单一基准配方。
  • DemyAgent 给出了从冷启动 SFT 到 GRPO-TCR 的完整训练与评测路径,并明确列出数据、模型、检查点和脚本配置项。
  • RLAnything 将策略、奖励模型和环境适应纳入闭环优化,并提供 OSWorld、AlfWorld 与代码场景的独立训练和评测入口。
  • AutoTool 的双阶段方法明确包含 KL 正则化 Plackett–Luce 排序,用于多步动态工具选择。
局限
  • 这不是即装即用的推理产品;用户必须准备模型、.parquet 数据、绝对路径和场景配置。
  • 代码执行训练依赖 SandboxFusion 或 Volcano Engine Cloud FaaS 端点,并要求修改工具配置和奖励评分代码中的端点设置。
  • 文档中的 OSWorld 实验依赖 Volcengine 的安全组、虚拟机镜像和并行云端虚拟机池,基础设施成本未给出。
  • AutoTool 仅提供 200K 工具调用数据的示例格式;完整训练数据和工具集标注为即将发布。

这个 Agent 与同类方案有什么区别?

仓库说明其实现建立在 VeRL 与 ReTool 的代码基础上;所给材料未提供与二者的逐项功能对比。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
Open-AgentRL 当前 28 · 缺口较多 ★ 641 3 个月前 Python
Relax 全模态强化学习引擎 64 · 存在缺口 ★ 621 6 天前 Python
ART 智能体强化训练器 34 · 缺口较多 ★ 11k 今天 Python
veRL Agent RL 训练框架 32 · 缺口较多 ★ 2.3k 3 个月前 Python

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
28/ 100 五分制 1.4 / 5
信任安全 0/29
可靠稳定 3/14
适用触发 8/18
规范维护 8/18
有效结果 6/13
证据核验 3/8
查看各维度的扣分理由
信任安全0 / 29 · 0.0/5

证据显示仓库未提供任何权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的机制。README 中提及的 SandboxFusion 和云服务可能涉及外部执行,但未说明权限控制或用户确认。因此所有信任标准均得 0 分。

可靠稳定3 / 14 · 1.1/5

自一致性:README 中多个部分(如 DemyAgent、RLAnything、AutoTool)描述一致,但存在一些不一致,如 RLAnything 的论文编号 2602.02488 看起来像未来日期,且 ICML 2026 的接受声明无法验证。依赖可用性:requirements.txt 列出了依赖,但未固定版本,且未提供锁定文件,因此依赖可用性仅得 1 分。失败消息:未提供任何错误处理或失败消息的文档,得 0 分。

适用触发8 / 18 · 2.2/5

受众与场景:README 明确面向研究人员,提供了多种训练和评估场景(如 OSWorld、AlfWorld、编码),得 2 分。能力边界:未明确说明框架的局限性或适用边界,得 1 分。触发精度:提供了具体的命令和配置,但未说明触发条件或前置条件,得 1 分。环境适配:提供了安装说明,但未说明对特定硬件或云环境的依赖,得 1 分。

规范维护8 / 18 · 2.2/5

信息架构:README 结构清晰,有导航和分节,得 2 分。安装说明:提供了安装命令,但未提供详细的依赖安装步骤,得 2 分。命名稳定性:项目名称和模块名称在文档中一致,但未提供命名规范,得 1 分。示例与 FAQ:提供了训练和评估示例,但无 FAQ,得 2 分。已知限制:未提及任何已知限制,得 0 分。许可证:提供了 Apache-2.0 许可证,得 2 分。版本与变更日志:有更新日志,但未提供版本号或变更日志文件,得 1 分。维护责任:未明确维护者或贡献指南,得 1 分。

有效结果6 / 13 · 2.3/5

输出可用性:提供了模型和数据集,但未提供输出格式或使用示例,得 1 分。边际价值:提供了多个创新方法(如 RLAnything、AutoTool),但未与现有方法进行详细对比,得 2 分。成本效益:未提供训练成本或资源需求,得 1 分。

证据核验3 / 8 · 1.9/5

声明可追溯性:提供了论文链接和模型链接,但未提供实验复现的详细步骤,得 1 分。跨来源佐证:提供了多个外部链接(如 arXiv、Hugging Face),但未提供独立验证,得 1 分。事实与推断分离:README 中混合了事实和推断,未明确区分,得 1 分。

风险与缓解建议
  • 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
  • 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
  • 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
  • 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
  • 仓库未提供任何安全机制,如权限控制、用户确认或数据流透明,使用前需自行评估风险。
  • 依赖未固定版本,且未提供锁定文件,可能导致环境不一致或安全漏洞。
  • README 中声称的 ICML 2026 接受和论文编号可能无法验证,需谨慎对待。
  • 未提及已知限制,可能隐藏潜在问题。
证据充分度: 评估于 2026年8月9日 审查版本 506ec70ffb47
查看完整评分方法 →

常见问题

是否可以直接把它作为在线智能体服务部署?
所给材料描述的是训练和评测仓库,未提供在线服务、统一 API 或聊天产品的部署说明。
训练代码任务需要什么外部权限或服务?
需要 SandboxFusion 本地部署,或 Volcano Engine Cloud FaaS 提供的 /run_code API 端点;该端点要写入指定配置和奖励评分逻辑。
OSWorld 可以在单机运行吗?
可以,文档要求在 configs/osworld_rl.yaml 中将 num_node 设为 1;其报告的实验则使用云端并行虚拟机。
完整 AutoTool 数据集现在可用吗?
仓库提供 200K 轨迹数据的示例格式,但说明完整训练数据和工具集仍将发布。
在 GitHub 查看 ↗ 安装 ↓

相关 Agents