数据与分析 reinforcement-learninggrporeward-modelingosworldalfworldlivecodebenchdynamic-tool-selection

Open-AgentRL

面向推理、工具调用与交互环境的强化学习训练框架。

FollowAgents 评估 · FARS-2.0
待评估
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

Open-AgentRL 汇集了 DemyAgent、RLAnything 和 AutoTool 三条面向 Agentic RL 的研究实现。DemyAgent 提供冷启动 SFT 与基于 GRPO-TCR 的智能体强化学习流程,并覆盖数学、科学和代码推理评测。RLAnything 训练策略、奖励模型与环境的闭环优化,支持 OSWorld 计算机控制、AlfWorld 文本游戏和代码任务。AutoTool 提供动态工具选择的双阶段训练代码:先稳定工具整合轨迹,再以 KL 正则化的 Plackett–Luce 排序目标优化多步选择。它是需要自行准备模型、数据、配置及部分外部执行环境的研究训练仓库,而不是可直接部署的聊天机器人或统一推理服务。

DemyAgent 流程读取 .parquet 格式的 SFT、RL 和评测数据,使用 recipe/demystify/qwen3_4b_sft.shqwen2_7b_sft.sh 微调 Qwen 模型,再用 grpo_tcr_qwen2_7b.shgrpo_tcr_qwen3_4b.sh 进行 GRPO-TCR 训练。代码执行任务通过 SandboxFusion 的 /run_code 端点完成,并需要在 sandbox_fusion_tool_config.yamlverl/utils/reward_score/livecodebench/code_math.py 中配置该端点。RLAnything 分别以 osworld_rl.pyalfworld_rl.pycoding_rl.py 读取对应 YAML 配置开展训练,并以相应的 *_eval.py 脚本输出评测结果。AutoTool 的训练框架覆盖 Phase I 的 SFT 加 RL 轨迹稳定和 Phase II 的工具选择排序优化;仓库说明其完整训练数据和工具集仍将发布。

  1. 研究人员想以 3K SFT 数据和 30K RL 数据复现实验性智能体推理训练,并在 AIME、GPQA-Diamond 或 LiveCodeBench-v6 上评测时。
  2. 拥有 SandboxFusion 本地部署或云端代码沙箱端点的团队,想训练会在推理过程中执行代码的 Qwen 系列模型时。
  3. 已配置 Volcengine 云端虚拟机、安全组和 OSWorld 镜像的团队,想对 GUI 计算机控制策略进行强化学习或评测时。
  4. 需要下载 AlfWorld 环境数据,并在文本交互游戏中训练或评测强化学习策略的研究者。
  5. 希望研究大规模、持续变化工具库上的动态工具选择,并接受 AutoTool 完整数据和工具集尚未公开的团队。

这个 Agent 有哪些优点和局限?

优点
  • 同一仓库覆盖智能体推理、GUI 计算机控制、文本游戏、代码任务和动态工具选择,而非只提供单一基准配方。
  • DemyAgent 给出了从冷启动 SFT 到 GRPO-TCR 的完整训练与评测路径,并明确列出数据、模型、检查点和脚本配置项。
  • RLAnything 将策略、奖励模型和环境适应纳入闭环优化,并提供 OSWorld、AlfWorld 与代码场景的独立训练和评测入口。
  • AutoTool 的双阶段方法明确包含 KL 正则化 Plackett–Luce 排序,用于多步动态工具选择。
局限
  • 这不是即装即用的推理产品;用户必须准备模型、`.parquet` 数据、绝对路径和场景配置。
  • 代码执行训练依赖 SandboxFusion 或 Volcano Engine Cloud FaaS 端点,并要求修改工具配置和奖励评分代码中的端点设置。
  • 文档中的 OSWorld 实验依赖 Volcengine 的安全组、虚拟机镜像和并行云端虚拟机池,基础设施成本未给出。
  • AutoTool 仅提供 200K 工具调用数据的示例格式;完整训练数据和工具集标注为即将发布。

如何安装或部署这个 Agent?

DemyAgent:

git clone https://github.com/Gen-Verse/Open-AgentRL.git
conda create -n OpenAgentRL python=3.11
conda activate OpenAgentRL
cd Open-AgentRL
bash scripts/install_vllm_sglang_mcore.sh
pip install -e .[vllm]

RLAnything:

conda create --name rlanything python=3.10
source activate rlanything
pip install -r requirements_rlanything.txt

仓库未说明 API 密钥要求。代码执行 RL 需额外部署 SandboxFusion 或取得 Volcano Engine Cloud FaaS 的 /run_code 端点;OSWorld 的文档化配置使用 Volcengine 云端虚拟机。

如何使用这个 Agent?

DemyAgent 冷启动 SFT 前,在 recipe/demystify/qwen3_4b_sft.shqwen2_7b_sft.sh 中设置 TRAIN_DATAEVAL_DATAMODEL_PATHSAVE_PATH 的绝对路径,然后运行:

bash recipe/demystify/qwen3_4b_sft.sh

配置 SandboxFusion 端点、RL 数据路径、模型路径、评测集路径和 default_local_dir 后,可运行:

bash recipe/demystify/grpo_tcr_qwen3_4b.sh

RLAnything 的首次训练调用取决于场景,例如:

python osworld_rl.py config=configs/osworld_rl.yaml

单节点运行时需在对应 YAML 中将 num_node 设为 1

这个 Agent 与同类方案有什么区别?

仓库说明其实现建立在 VeRL 与 ReTool 的代码基础上;所给材料未提供与二者的逐项功能对比。

常见问题

是否可以直接把它作为在线智能体服务部署?
所给材料描述的是训练和评测仓库,未提供在线服务、统一 API 或聊天产品的部署说明。
训练代码任务需要什么外部权限或服务?
需要 SandboxFusion 本地部署,或 Volcano Engine Cloud FaaS 提供的 `/run_code` API 端点;该端点要写入指定配置和奖励评分逻辑。
OSWorld 可以在单机运行吗?
可以,文档要求在 `configs/osworld_rl.yaml` 中将 `num_node` 设为 `1`;其报告的实验则使用云端并行虚拟机。
完整 AutoTool 数据集现在可用吗?
仓库提供 200K 轨迹数据的示例格式,但说明完整训练数据和工具集仍将发布。

相关 Agents