开发与工程 reinforcement-learningagent-trainingmulti-gpubenchmark-evaluationmodel-gatewaygrposandbox-integration

rLLM:大语言模型智能体强化学习框架

统一的智能体强化学习框架,支持任意 harness、任意沙箱,一键切换训练后端。

FollowAgents 评估 · FARS-2.1
不推荐
0/ 100 五分制 0.0 / 5
1 2 3 4 5 6
1信任安全0 / 29 · 0.0/5

证据不足:仓库未提供权限管理、用户确认、数据流透明、敏感数据处理、依赖安全、外部影响、回滚或来源归属的明确信息。所有标准均未得到支持,因此评分为0。

2可靠稳定0 / 14 · 0.0/5

证据不足:未提供自洽性、依赖可用性或失败消息的明确证据。所有标准均未得到支持,因此评分为0。

3适用触发0 / 18 · 0.0/5

证据不足:未提供受众与场景、能力边界、触发精度或环境适配的明确证据。所有标准均未得到支持,因此评分为0。

4规范维护0 / 18 · 0.0/5

证据不足:未提供信息架构、安装说明、命名稳定性、示例与FAQ、已知限制、许可证、版本变更日志或维护责任的明确证据。所有标准均未得到支持,因此评分为0。

5有效结果0 / 13 · 0.0/5

证据不足:未提供输出可用性、边际价值或成本效益的明确证据。所有标准均未得到支持,因此评分为0。

6证据核验0 / 8 · 0.0/5

证据不足:未提供声明可追溯性、跨来源佐证或事实与推断分离的明确证据。所有标准均未得到支持,因此评分为0。

证据充分度: 评估于 2026年8月9日 审查版本 1d1109a655e2
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
源码中未见的安全控制:最小权限约束、执行前用户确认、数据流向说明、敏感信息处理、依赖安全审查、外部影响披露、回滚或恢复路径、来源归属可核验
使用前请注意
  • 静态审查仅基于提供的文件,未执行任何运行或独立验证。
  • 仓库未提供AGENTS.md清单,且发布者身份未经验证,应视为未知。
  • 所有标准均因证据不足而评分为0,不代表存在缺陷,而是缺乏可评估的证据。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

rLLM 是一个开源框架,用于训练语言智能体(Agent)的强化学习。它提供统一的 API,让你可以在任意 harness(如 Claude Code、Codex 等)上运行,在 Docker、Daytona、Modal 等沙箱中执行,并支持 verl、tinker、fireworks 等多种训练后端,只需一个标志即可切换。框架内置了 60 多个基准测试(如 Terminal-Bench 2.0、SWE-bench、AIME 等),支持 GRPO、REINFORCE、RLOO 等多种训练方法,并通过模型网关捕获 token ID 和 logprobs,实现评估和训练使用同一份智能体代码。rLLM 已用于训练 DeepScaleR-1.5B、DeepCoder-14B 等开源模型,并被多个学术和工业团队采用。

rLLM 的运行流程是:运行你的智能体 → 收集轨迹(traces)→ 计算奖励 → 更新模型。它通过 @rllm.rollout 装饰器接入你的智能体代码(可以是 OpenAI API、LangGraph 等),通过 @rllm.evaluator 定义奖励函数。在训练时,模型网关(Model Gateway)会透明地捕获 LLM 调用的 token ID 和 logprobs,将数据组织成 Episode(一个任务)、Trajectory(一次智能体运行)和 Step(一次 LLM 调用)。训练后端可以是 verl(分布式多 GPU)、tinker(单机)或 fireworks(Fireworks 平台)。CLI 提供了 rllm eval <benchmark>rllm train <benchmark> 命令,支持快速评估和训练。

  1. 研究者希望在大规模 GPU 集群上训练自己的大语言模型,使用 GRPO 等方法进行强化学习。
  2. 团队想要在多个基准测试(如 SWE-bench、MATH-500)上评估智能体,而无需为每个基准编写单独的代码。
  3. 开发者有自己的智能体程序(如基于 OpenAI API 或 LangGraph),想快速接入强化学习训练而无需修改代码。
  4. 需要灵活切换训练后端(如从单机 tinker 到分布式 verl)以适应不同资源条件的团队。
  5. 希望在隔离的沙箱环境(如 Docker、Modal)中运行智能体,以保证安全性和可重复性。

这个 Agent 有哪些优点和局限?

优点
  • 支持 10+ 种 CLI harness 和 Harbor 兼容任务目录,也允许自定义智能体(LangGraph、OpenAI Agents SDK 等)
  • 兼容多种沙箱(Docker、Daytona、Modal),并提供快照和热池加速,降低训练成本
  • 训练后端可切换(verl、tinker、fireworks),且评估和训练用同一份智能体代码
  • 内置 60+ 基准测试,包含数学、代码、问答、搜索、VLM 等,便于全面评估
  • 提供多种 RL 算法(GRPO、REINFORCE、RLOO、SFT、on-policy distillation)
  • 有成功先例,如 DeepScaleR、DeepCoder、DeepSWE 等模型
局限
  • 需要 Python 3.11 或更高版本,可能限制了旧环境的使用
  • 分布式训练依赖 verl 和 vLLM/SGLang,可能需要额外的 GPU 资源和配置
  • CLI 的基准测试可能需要自动拉取数据集,依赖网络连接
  • 对于非标准智能体程序,需要学习 @rllm.rollout@rllm.evaluator 的接口设计
  • Fireworks 后端是特定平台,可能引入供应商锁定

如何安装或部署这个 Agent?

安装 rLLM 需要 Python >= 3.11。推荐使用 uv 包管理器:

# 安装核心 CLI(tinker 后端)
uv pip install "rllm @ git+https://github.com/rllm-org/rllm.git"

# 如需分布式多 GPU 训练(verl + vLLM/SGLang)
uv pip install "rllm[verl] @ git+https://github.com/rllm-org/rllm.git"

# 如需 Fireworks 训练平台
uv pip install "rllm[fireworks] @ git+https://github.com/rllm-org/rllm.git"

也可以从源码构建或使用 Docker,详见官方文档:https://docs.rllm-project.com/installation

如何使用这个 Agent?

安装完成后,可以通过 CLI 或 Python API 使用。

CLI 快速上手:

# 配置模型提供商
rllm model setup

# 在基准上评估(例如 gsm8k)
rllm eval gsm8k

# 在基准上训练
rllm train gsm8k

Python API 示例:

  1. 定义 rollout(智能体)和 evaluator(奖励函数)
  2. 创建 AgentTrainer 并调用 train 方法

更多示例见 cookbooks 目录。

这个 Agent 与同类方案有什么区别?

rLLM 作为一个通用框架,与特定 harness(如 Claude Code)或训练库(如 verl)对比,它提供了统一的抽象层,允许用户在不同的 harness 和后端之间切换。但 README 未提及具体的替代产品。

常见问题

rLLM 是否支持我现有的基于 OpenAI API 的智能体?
是的,你可以用 @rllm.rollout 装饰器包装任何智能体代码,只要它调用 LLM API。在训练时,rLLM 的模型网关会拦截请求并捕获 token ID 和 logprobs。
训练需要什么硬件资源?
取决于后端。tinker 后端适合单机,verl 后端需要多 GPU 集群,且依赖 vLLM/SGLang。具体配置请参考文档。
如何添加自定义基准测试?
目前只提到内置 60+ 基准测试,但你可以通过 rllm eval 运行,或参考 Harbor 兼容任务目录来添加自定义任务。
支持哪些 RL 算法?
支持 GRPO、REINFORCE、RLOO、SFT、on-policy distillation 等。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents