ART 智能体强化训练器
用 GRPO 为多步骤智能体进行在岗强化训练。
按维度查看评分与理由
证据显示:仓库未提供权限模型、用户确认机制、数据流透明性、敏感数据处理、依赖安全审计、外部影响控制、回滚机制或来源归属的说明。所有信任相关标准均未得到满足,因此得分为0。
证据显示:README和测试文件在描述训练循环和步骤跳过行为时保持一致,但未提供失败消息或错误处理的详细说明。依赖项在pyproject.toml中列出,但未提供可用性保证。因此,自我一致性得2分,依赖可用性和失败消息各得1分。
证据显示:README描述了多种使用场景(如2048、邮件代理、MCP),但未明确说明能力边界或触发条件。环境适配方面,提供了安装说明和依赖项,但未详细说明不同环境的配置。因此,受众和场景得2分,能力边界和触发精度各得1分,环境适配得2分。
证据显示:README提供了安装说明、示例和许可证信息,但未提供变更日志或版本历史。命名稳定性未明确说明。已知限制部分提及了Gemma 3不支持,但未全面列出。因此,信息架构、安装说明、示例和许可证各得2分,命名稳定性、已知限制、版本控制和维护责任各得1分。
证据显示:README展示了多个示例和基准测试,表明输出可用性较高。边际价值方面,提供了与现有框架的集成和性能提升的声明,但未提供成本效益分析。因此,输出可用性和边际价值各得2分,成本效益得1分。
证据显示:README中的性能声明(如40%成本降低、28%训练加速)未提供具体数据或引用来源。基准测试图表存在,但未提供原始数据或复现方法。因此,声明可追溯性、跨来源验证和事实推断分离各得1分。
- 性能声明(如40%成本降低、28%训练加速)缺乏具体数据或引用,需谨慎对待。
- 未提供权限模型或用户确认机制,使用时应自行评估安全风险。
- 依赖项版本固定较严格,可能影响环境兼容性。
这个 Agent 能做什么,适合哪些场景?
ART 是一个开源强化学习框架,用于让基于 LLM 的多步骤智能体从任务执行结果中学习。它由 OpenAI 兼容客户端和独立运行的服务器组成:客户端嵌入现有 Python 应用,服务器在具备 GPU 的机器上执行推理与训练。应用在 rollout 中调用模型、记录 system、user 和 assistant 消息,并对每条 Trajectory 赋予 reward;服务器随后用 GRPO 更新 LoRA 检查点并加载到 vLLM。它既可让客户端在笔记本电脑上连接远程训练服务器,也可使用 W&B Training 的 ServerlessBackend 托管训练与推理基础设施。仓库提供 2048、邮件检索、LangGraph、MCP、Temporal Clue、井字棋、Codenames 及 SFT/RL 训练示例。
你的 Python 代码通过 ART 的 OpenAI 兼容客户端执行智能体工作流,并可并行运行多个 rollout。补全请求被路由到 ART 服务器,服务器用 vLLM 运行当前最新的模型 LoRA;执行期间,system、user、assistant 消息会写入 Trajectory。rollout 完成后,应用为 Trajectory 分配 reward,将分组后的 Trajectories 发送到服务器。训练期间推理会被阻塞,服务器以最新 checkpoint(首次则为空 LoRA)执行 GRPO,保存新 LoRA 到本地目录、重新载入 vLLM,然后恢复推理。使用托管路径时,可创建 art.TrainableModel,并以 art.serverless.backend.ServerlessBackend 注册模型。
- 已有 Python 智能体应用的团队,希望依据任务奖励而非标注数据迭代多步骤行为。
- 构建邮件研究或检索智能体的开发者,希望参考 ART•E 与 RULER 相关示例训练 Qwen 模型。
- 使用 LangGraph 编排工作流的团队,希望为现有 LangGraph 智能体加入强化学习训练。
- 需要让模型学习调用 MCP 服务工具的开发者,例如参考 NWS MCP server 的 MCP•RL 示例。
- 希望训练游戏策略模型的研究者,可从 2048、井字棋或 Codenames 示例开始。
- 需要先进行 SFT 再进行 RL 的团队,例如文档摘要器或 text-to-SQL 蒸馏场景。
这个 Agent 有哪些优点和局限?
- 把多轮消息、任务 reward、GRPO 训练和 LoRA 更新串成一个明确的强化学习循环。
- 客户端与服务器分离;客户端可在笔记本电脑运行,而 GPU 训练服务器可独立部署。
- 训练后的最新 LoRA 会保存并重新加载到 vLLM,使后续 rollout 使用更新后的模型。
- 提供 W&B Training 的 ServerlessBackend,并说明检查点可通过 W&B Inference 立即使用。
- 示例覆盖 LangGraph、MCP 工具使用、游戏任务,以及 SFT 与 RL 组合训练。
- 每轮训练执行时推理会被阻塞,在线服务场景需评估这一训练窗口。
- 本地模式需要可用 GPU 服务器;README 未提供其完整启动和环境配置步骤。
- ServerlessBackend 依赖 W&B API key,采用该路径会引入 W&B 服务依赖。
- 模型兼容性以 vLLM、HuggingFace Transformers 和 Unsloth 支持情况为边界;README 特别指出 Gemma 3 暂不支持。
- 应用需要自行定义 rollout 的任务逻辑和 reward,仓库未提供通用业务奖励函数。
如何安装或部署这个 Agent?
在可运行 Python 的客户端机器上执行:
pip install openpipe-artREADME 未提供本地 ART 服务器的启动命令、Python 版本、GPU 型号或 vLLM 安装步骤。若使用文档中的托管 ServerlessBackend,还需 W&B API key;本地部署则需要一台可运行 ART 服务器的 GPU 机器。
如何使用这个 Agent?
最小托管配置示例:
from art.serverless.backend import ServerlessBackendmodel = art.TrainableModel(project="voice-agent",
name="agent-001",
run_name="agent-001",
base_model="Qwen/Qwen3.6-27B")
backend = ServerlessBackend(api_key="your_wandb_api_key")
model.register(backend)之后在应用中通过 ART 客户端执行 rollout,并在完成时为每条 Trajectory 分配 reward。ART 会将分组 Trajectories 交给服务器训练并更新 LoRA。README 未给出创建 Trajectory、发送训练批次或启动本地服务器的完整可复制 API。