Open-AgentRL
面向推理、工具调用与交互环境的强化学习训练框架。
- Star 数
- ★ 641
- 最近更新
- 3 个月前
- License
- Apache-2.0
- 主语言
- Python
- FA 评分
- 28/100 · 缺口较多
30 秒速览
- 可在哪里用
- 兼容但需适配
- 开始前需要
- 典型场景
- 研究人员想以 3K SFT 数据和 30K RL 数据复现实验性智能体推理训练,并在 AIME、GPQA-Diamond 或 LiveCodeBench-v6 上评测时。
- 主要局限
- 这不是即装即用的推理产品;用户必须准备模型、
.parquet数据、绝对路径和场景配置。
这个 Agent 能做什么,适合哪些场景?
Open-AgentRL 汇集了 DemyAgent、RLAnything 和 AutoTool 三条面向 Agentic RL 的研究实现。DemyAgent 提供冷启动 SFT 与基于 GRPO-TCR 的智能体强化学习流程,并覆盖数学、科学和代码推理评测。RLAnything 训练策略、奖励模型与环境的闭环优化,支持 OSWorld 计算机控制、AlfWorld 文本游戏和代码任务。AutoTool 提供动态工具选择的双阶段训练代码:先稳定工具整合轨迹,再以 KL 正则化的 Plackett–Luce 排序目标优化多步选择。它是需要自行准备模型、数据、配置及部分外部执行环境的研究训练仓库,而不是可直接部署的聊天机器人或统一推理服务。
DemyAgent 流程读取 .parquet 格式的 SFT、RL 和评测数据,使用 recipe/demystify/qwen3_4b_sft.sh 或 qwen2_7b_sft.sh 微调 Qwen 模型,再用 grpo_tcr_qwen2_7b.sh 或 grpo_tcr_qwen3_4b.sh 进行 GRPO-TCR 训练。代码执行任务通过 SandboxFusion 的 /run_code 端点完成,并需要在 sandbox_fusion_tool_config.yaml 与 verl/utils/reward_score/livecodebench/code_math.py 中配置该端点。RLAnything 分别以 osworld_rl.py、alfworld_rl.py 和 coding_rl.py 读取对应 YAML 配置开展训练,并以相应的 *_eval.py 脚本输出评测结果。AutoTool 的训练框架覆盖 Phase I 的 SFT 加 RL 轨迹稳定和 Phase II 的工具选择排序优化;仓库说明其完整训练数据和工具集仍将发布。
- 研究人员想以 3K SFT 数据和 30K RL 数据复现实验性智能体推理训练,并在 AIME、GPQA-Diamond 或 LiveCodeBench-v6 上评测时。
- 拥有 SandboxFusion 本地部署或云端代码沙箱端点的团队,想训练会在推理过程中执行代码的 Qwen 系列模型时。
- 已配置 Volcengine 云端虚拟机、安全组和 OSWorld 镜像的团队,想对 GUI 计算机控制策略进行强化学习或评测时。
- 需要下载 AlfWorld 环境数据,并在文本交互游戏中训练或评测强化学习策略的研究者。
- 希望研究大规模、持续变化工具库上的动态工具选择,并接受 AutoTool 完整数据和工具集尚未公开的团队。
如何安装或部署这个 Agent?
DemyAgent:
git clone https://github.com/Gen-Verse/Open-AgentRL.git
conda create -n OpenAgentRL python=3.11
conda activate OpenAgentRL
cd Open-AgentRL
bash scripts/install_vllm_sglang_mcore.sh
pip install -e .[vllm]RLAnything:
conda create --name rlanything python=3.10
source activate rlanything
pip install -r requirements_rlanything.txt仓库未说明 API 密钥要求。代码执行 RL 需额外部署 SandboxFusion 或取得 Volcano Engine Cloud FaaS 的 /run_code 端点;OSWorld 的文档化配置使用 Volcengine 云端虚拟机。
如何使用这个 Agent?
DemyAgent 冷启动 SFT 前,在 recipe/demystify/qwen3_4b_sft.sh 或 qwen2_7b_sft.sh 中设置 TRAIN_DATA、EVAL_DATA、MODEL_PATH 和 SAVE_PATH 的绝对路径,然后运行:
bash recipe/demystify/qwen3_4b_sft.sh配置 SandboxFusion 端点、RL 数据路径、模型路径、评测集路径和 default_local_dir 后,可运行:
bash recipe/demystify/grpo_tcr_qwen3_4b.shRLAnything 的首次训练调用取决于场景,例如:
python osworld_rl.py config=configs/osworld_rl.yaml单节点运行时需在对应 YAML 中将 num_node 设为 1。
这个 Agent 有哪些优点和局限?
- 同一仓库覆盖智能体推理、GUI 计算机控制、文本游戏、代码任务和动态工具选择,而非只提供单一基准配方。
- DemyAgent 给出了从冷启动 SFT 到 GRPO-TCR 的完整训练与评测路径,并明确列出数据、模型、检查点和脚本配置项。
- RLAnything 将策略、奖励模型和环境适应纳入闭环优化,并提供 OSWorld、AlfWorld 与代码场景的独立训练和评测入口。
- AutoTool 的双阶段方法明确包含 KL 正则化 Plackett–Luce 排序,用于多步动态工具选择。
- 这不是即装即用的推理产品;用户必须准备模型、
.parquet数据、绝对路径和场景配置。 - 代码执行训练依赖 SandboxFusion 或 Volcano Engine Cloud FaaS 端点,并要求修改工具配置和奖励评分代码中的端点设置。
- 文档中的 OSWorld 实验依赖 Volcengine 的安全组、虚拟机镜像和并行云端虚拟机池,基础设施成本未给出。
- AutoTool 仅提供 200K 工具调用数据的示例格式;完整训练数据和工具集标注为即将发布。
这个 Agent 与同类方案有什么区别?
仓库说明其实现建立在 VeRL 与 ReTool 的代码基础上;所给材料未提供与二者的逐项功能对比。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| Open-AgentRL 当前 | 28 · 缺口较多 | ★ 641 | 3 个月前 | Python | — |
| Relax 全模态强化学习引擎 | 64 · 存在缺口 | ★ 621 | 6 天前 | Python | — |
| ART 智能体强化训练器 | 34 · 缺口较多 | ★ 11k | 今天 | Python | — |
| veRL Agent RL 训练框架 | 32 · 缺口较多 | ★ 2.3k | 3 个月前 | Python | — |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
证据显示仓库未提供任何权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的机制。README 中提及的 SandboxFusion 和云服务可能涉及外部执行,但未说明权限控制或用户确认。因此所有信任标准均得 0 分。
自一致性:README 中多个部分(如 DemyAgent、RLAnything、AutoTool)描述一致,但存在一些不一致,如 RLAnything 的论文编号 2602.02488 看起来像未来日期,且 ICML 2026 的接受声明无法验证。依赖可用性:requirements.txt 列出了依赖,但未固定版本,且未提供锁定文件,因此依赖可用性仅得 1 分。失败消息:未提供任何错误处理或失败消息的文档,得 0 分。
受众与场景:README 明确面向研究人员,提供了多种训练和评估场景(如 OSWorld、AlfWorld、编码),得 2 分。能力边界:未明确说明框架的局限性或适用边界,得 1 分。触发精度:提供了具体的命令和配置,但未说明触发条件或前置条件,得 1 分。环境适配:提供了安装说明,但未说明对特定硬件或云环境的依赖,得 1 分。
信息架构:README 结构清晰,有导航和分节,得 2 分。安装说明:提供了安装命令,但未提供详细的依赖安装步骤,得 2 分。命名稳定性:项目名称和模块名称在文档中一致,但未提供命名规范,得 1 分。示例与 FAQ:提供了训练和评估示例,但无 FAQ,得 2 分。已知限制:未提及任何已知限制,得 0 分。许可证:提供了 Apache-2.0 许可证,得 2 分。版本与变更日志:有更新日志,但未提供版本号或变更日志文件,得 1 分。维护责任:未明确维护者或贡献指南,得 1 分。
输出可用性:提供了模型和数据集,但未提供输出格式或使用示例,得 1 分。边际价值:提供了多个创新方法(如 RLAnything、AutoTool),但未与现有方法进行详细对比,得 2 分。成本效益:未提供训练成本或资源需求,得 1 分。
声明可追溯性:提供了论文链接和模型链接,但未提供实验复现的详细步骤,得 1 分。跨来源佐证:提供了多个外部链接(如 arXiv、Hugging Face),但未提供独立验证,得 1 分。事实与推断分离:README 中混合了事实和推断,未明确区分,得 1 分。
- 源码中未见:最小权限约束只授予完成任务所需的权限:用专用账号或只读令牌,并限定可访问的目录和仓库。
- 源码中未见:执行前用户确认开启或自行加上执行前确认;先在沙箱或测试环境跑通,确认行为后再接入真实数据。
- 源码中未见:数据流向说明运行时观察它连接了哪些外部服务(代理或防火墙日志);弄清数据去向之前不要输入敏感数据。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:依赖安全审查安装前固定版本并做一次依赖扫描(如 npm audit、pip-audit);优先放在容器里运行。
- 源码中未见:外部影响披露先弄清它会写入、发送或修改哪些外部系统,用测试账号或测试仓库验证后再接入正式环境。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 源码中未见:来源归属可核验从官方仓库或包源安装,核对发布者和仓库地址,避免同名仿冒包。
- 仓库未提供任何安全机制,如权限控制、用户确认或数据流透明,使用前需自行评估风险。
- 依赖未固定版本,且未提供锁定文件,可能导致环境不一致或安全漏洞。
- README 中声称的 ICML 2026 接受和论文编号可能无法验证,需谨慎对待。
- 未提及已知限制,可能隐藏潜在问题。
常见问题
是否可以直接把它作为在线智能体服务部署?
训练代码任务需要什么外部权限或服务?
/run_code API 端点;该端点要写入指定配置和奖励评分逻辑。OSWorld 可以在单机运行吗?
configs/osworld_rl.yaml 中将 num_node 设为 1;其报告的实验则使用云端并行虚拟机。