MARTI:多智能体强化学习训练与推理框架

让 LLM 多智能体系统通过强化学习进行可扩展训练与树搜索增强推理,覆盖辩论、智能体链、混合智能体等工作流。

Star 数
★ 560
最近更新
1 个月前
License
MIT
主语言
Python

30 秒速览

可在哪里用
通用 · 跨平台
开始前需要
OpenRLHFRayvLLMPython (pip)8×80G GPUs per agentNVIDIA H200/A80-class GPU nodes for published experimentsShell / 命令行网络访问本地文件系统
典型场景
研究人员想在多智能体辩论或混合智能体设置下,用 GRPO/PPO 对 LLM 做可复现的强化学习训练实验
主要局限
硬件门槛高:单智能体约需 8×80G GPU,多智能体每个智能体再需 8×80G,论文实验使用 3 节点各 8×H200,个人或小团队难以复现

这个 Agent 能做什么,适合哪些场景?

MARTI 是清华大学与上海人工智能实验室开源的 LLM 多智能体强化学习(MARL)训练与推理框架,已被 ICLR 2026 接收。框架遵循“集中式多智能体交互 + 分布式策略训练”原则,包含多智能体世界(Multi-Agent World)、集中式奖励(Centralized Rewarding)和单智能体训练器(Single Agent Trainer)三大模块,底层基于 OpenRLHF,并支持 vLLM v1 引擎与 Hybrid Engine。最新版本 MARTI-v2 引入树搜索增强强化学习(MARS²),面向代码生成等复杂推理任务,提供异步多智能体 MCTS 训练,并集成 GSPO 损失、TIS 修正、动态数据过滤和超长序列缓冲等训练技术,支持最高 32K token 序列与异构多智能体(如 Qwen3-8B + AreaL-boba-2-8B)联合训练。框架内置辩论、智能体链、混合智能体等图式工作流,实验性支持 AutoGen 与 CAMEL 第三方框架。在 LCB 代码生成基准上,多智能体 MCTS 使 Qwen3-8B 相对基础模型提升 8.0%、相对 Vanilla GRPO 提升 4.4%。注意这是一套研究性训练框架,而非开箱即用的推理服务。

MARTI 读取配置与训练脚本(examples/ 目录下的 bash 脚本),通过 OpenRLHF 基础设施与 vLLM 引擎执行多智能体强化学习训练。集中式的 Multi-Agent World 模块负责智能体间交互与奖励分配,Centralized Rewarding 模块实现信用分配与奖励塑形,Single Agent Trainer 对每个智能体的策略进行分布式训练。支持 PPO、GRPO、REINFORCE++、TTRL 等 RL 算法,以及辩论、Chain-of-Agents、Mixture-of-Agents、Review-RL 等工作流。MARTI-v2 的 MARS² 模块执行异步多智能体 MCTS 树搜索,通过自适应节点扩展与精炼探索解空间,产出高质量推理轨迹用于策略更新,支持 GSPO 序列级优化、TIS 采样修正、按智能体的动态样本过滤和超长 token 惩罚缓冲。训练产物是经过多智能体 RL 优化的模型权重(如 Qwen3-8B/14B、DeepCoder-14B 等)。

  1. 研究人员想在多智能体辩论或混合智能体设置下,用 GRPO/PPO 对 LLM 做可复现的强化学习训练实验
  2. 算法工程师需要训练代码生成模型,希望用 MCTS 树搜索代替朴素 rollout 来提升 LCB 类基准的 Pass@1
  3. 团队要联合训练多个异构模型(如 Qwen3-8B + AreaL-boba-2-8B),各智能体拥有独立角色、训练策略和样本过滤
  4. 已有 AutoGen 或 CAMEL 工作流的用户,想把现有编排接入 RL 训练管线(实验性支持)
  5. 需要异步工具调用(Async Tool Use)和多轮智能体 RL(如代码/数学多轮 RL)的研究场景

如何安装或部署这个 Agent?

安装步骤(来自仓库):

  1. 克隆仓库并安装依赖:
git clone https://github.com/TsinghuaC3I/MARTI.git
cd MARTI
pip install -r requirements.txt
  1. 按仓库说明配置依赖,包括 OpenRLHF、Ray 和 vLLM。

硬件门槛:单智能体训练约需 8×80G GPU;多智能体训练每个智能体约需 8×80G GPU。仓库未提供 Docker 镜像或托管服务,需自行准备 GPU 集群环境。

如何使用这个 Agent?

在脚本中设置路径后运行对应示例脚本:

ROOT_DIR="/path/to/MARTI"
MODEL_DIR="/path/to/models"

# 单智能体 MCTS 训练(MARS²)

bash examples/mars2/run_train_single_mcts.sh

# 多智能体 MCTS 训练

bash examples/mars2/run_train_multi_mcts.sh

# 异步多轮代码 RL(单智能体)

bash examples/single-agent/run_train_code_async.sh

# 多智能体辩论

bash examples/multi-agent/run_train_mad.sh
# Chain-of-Agents (MathChat)
bash examples/multi-agent/run_train_mathchat.sh
# Review-RL
bash examples/reviewrl/run_train_reviewrl_async.sh

文档位于 docs/ 目录(Overview、Workflows Integration、Reward and Training、Experiments)。

这个 Agent 有哪些优点和局限?

优点
  • ICLR 2026 论文支撑,并提供 arXiv 技术报告(2602.07848),方法有同行评审背书
  • 多智能体训练与单智能体 RL 在同一框架内统一,内置信用分配与奖励塑形,省去自行拼装管线
  • MARS² 提供异步多智能体 MCTS 训练,LCB 基准上多智能体相对 Vanilla GRPO 提升最高 4.4%,且支持 32K 超长序列与异构智能体训练
  • 支持 PPO、GRPO、REINFORCE++、TTRL 多种 RL 算法,并实验性兼容 AutoGen/CAMEL 现有编排
局限
  • 硬件门槛高:单智能体约需 8×80G GPU,多智能体每个智能体再需 8×80G,论文实验使用 3 节点各 8×H200,个人或小团队难以复现
  • 研究性框架,AutoGen/CAMEL 集成为实验性,生产化程度未知
  • 无托管服务或 Docker 部署方案,需要自行维护 OpenRLHF/Ray/vLLM 依赖栈
  • 对模型家族有具体实验证据(Qwen3、AreaL-boba、DeepCoder、DeepSeek-R1、Gemma、Llama 出现在主题标签中),其他模型的实际效果缺乏公开验证

这个 Agent 与同类方案有什么区别?

MARTI 明确构建于单智能体 RL 框架 OpenRLHF 与 verl 之上,与它们的关系是扩展而非替代:OpenRLHF/verl 面向单智能体策略训练,MARTI 在此之上增加集中式多智能体交互、奖励分配与多智能体树搜索(MARS²)。README 未提及其他具名多智能体 RL 竞品。

与相关度最高的同类 agent 并排比较关键指标。

Agent 源码审查 Star 最近更新 主语言 完整支持的平台
MARTI:多智能体强化学习训练与推理框架 当前 36 · 缺口较多 ★ 560 1 个月前 Python
AgentsMeetRL——智能体强化学习资源大全 29 · 缺口较多 ★ 1.8k 8 天前 HTML
Hands-On Modern RL 实战教程 30 · 缺口较多 ★ 4.4k 20 天前 Python
rLLM:大语言模型智能体强化学习框架 0 · 缺口较多 ★ 5.8k 11 天前 Python OpenAI API

FollowAgents 如何评估这个 Agent?

FollowAgents 源码审查 · FARS-2.1
缺口较多
36/ 100 五分制 1.8 / 5
信任安全 10/29
可靠稳定 3/14
适用触发 6/18
规范维护 8/18
有效结果 6/13
证据核验 3/8
查看各维度的扣分理由
信任安全10 / 29 · 1.7/5

该仓库是面向研究者的多智能体强化学习训练框架,而非部署型Agent。来源归属方面证据充分:致谢、OpenRLHF/vLLM/Ray等上游依赖、贡献者名单与联系方式齐全,得3分。权限方面仅见到requirements.txt与训练脚本,未见明显的最小权限设计或说明;未发现凭据窃取或隐蔽外传代码,wandb为常见实验遥测但未说明其数据上报内容,扣分点在于数据流向未文档化。敏感数据、回滚机制无任何文档或代码证据。依赖文件仅部分固定版本(deepspeed、ray、torch、transformers固定,vllm用>约束),无漏洞说明或审计,得1分。

可靠稳定3 / 14 · 1.1/5

安装说明仅给出pip install -r requirements.txt并要求用户自行完成OpenRLHF、Ray、vLLM的安装,依赖可用性支持单薄,得1分。README内部基本自洽(目录、脚本路径与examples结构一致),但MARTI-v2提及的许多技术(GSPO、TIS、overlong buffer)无代码级佐证,自一致性得1分。所提供的文件中完全没有失败消息或错误处理文档,得0分。

适用触发6 / 18 · 1.7/5

目标受众(RL研究者)与场景(代码生成、数学推理训练)描述清晰,得2分;但触发精度对训练框架不适用,得0分。能力边界部分有说明(硬件要求8×80G GPU起),但缺乏第三方集成(AutoGen/CAMEL)成熟度的明确标注(仅experimental),得1分。环境适配仅给出粗略硬件需求,未说明操作系统、CUDA版本等,得1分。

规范维护8 / 18 · 2.2/5

信息架构良好:目录完整、文档分章、图表齐备,得2分。安装说明过薄——仅两行命令加'自行参照依赖安装说明',得1分。命名稳定(MARTI/MARS²一致)。示例仅以脚本文件名指向,无FAQ,得1分。已知局限完全缺失,得0分。MIT许可证存在且完整,但README页脚'All rights reserved'与MIT条款表述有轻微冲突,得2分。无版本号或CHANGELOG,仅以News条目代替,得1分。维护责任明确(Tsinghua + Shanghai AI Lab、联系人、后续论文与更新时间线),得2分。

有效结果6 / 13 · 2.3/5

输出可用性:实验结果以图片呈现,无表格化可复现数据或训练曲线数值,得1分。边际价值:将树搜索RL与多智能体训练统一到OpenRLHF基础设施上,相对单智能体RL框架确有差异化贡献,得2分。成本收益:最低8×80G GPU、多智能体需3节点H200集群,成本极高而收益描述以论文指标为主,普通使用者难以获益,得1分。

证据核验3 / 8 · 1.9/5

性能声明(4.6%/8.0%提升等)指向arXiv技术报告与OpenReview,但仅以截图图片呈现,仓库内无可核验的评估脚本或数据表,得1分。跨源佐证:引用了ICLR接收与第三方项目(ReviewRL、CoMAS)使用该框架,外部链接存在但静态审查无法核验,得1分。事实与推断区分一般:新闻时间线与硬件要求为事实,但部分'Key Features'更像宣传性断言,得1分。

风险与缓解建议
  • 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
  • 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
  • 保守提示:README中部分性能提升数字仅以图片呈现,仓库内未提供可核验的评估脚本或数据表,采用前应对照论文与代码自行验证。
  • 安装文档过薄:OpenRLHF、vLLM等核心依赖需用户自行安装且版本耦合复杂,torch/transformers/vllm版本组合可能存在兼容风险,建议在隔离环境中锁定版本。
  • wandb默认存在于依赖中,使用前应确认实验数据的上报范围,避免训练数据或指标意外外传。
  • 硬件门槛极高(单任务8×80G起,多智能体需3节点H200),中小团队需先评估成本收益。
  • README页脚'All rights reserved'与MIT许可证表述不完全一致,商业使用前建议向维护者确认许可意图。
  • 第三方集成(AutoGen、CAMEL)标注为experimental,生产使用前需额外验证。
证据充分度: 评估于 2026年9月12日 审查版本 093c151ecab8
查看完整评分方法 →

常见问题

最低硬件要求是多少?
README 写明单智能体训练约需 8×80G GPU,多智能体训练每个智能体约需 8×80G GPU;论文实验用 3 个节点、每节点 8 块 H200,每个智能体独占一个节点。
它是一个可以直接部署的推理服务吗?
不是。MARTI 是训练与推理框架,产出的是经多智能体 RL 训练后的模型权重;仓库未提供 API 服务或托管部署方案。
支持哪些模型和 RL 算法?
RL 算法包括 PPO、GRPO、REINFORCE++、TTRL;已发布实验涉及 Qwen3-8B/14B、AreaL-boba-2-8B/14B、DeepCoder-14B,标签中还提及 DeepSeek-R1、Gemma、Llama、Qwen 系列。
能否接入我已有的 AutoGen 或 CAMEL 工作流?
README 列出对 AutoGen 和 CAMEL 的第三方集成为实验性支持,可用但成熟度有限,建议先评估稳定性。
有没有社区项目基于它?
有:ReviewRL(EMNLP 2025)和 CoMAS 两个工作在 README 中声明基于 MARTI 构建。
在 GitHub 查看 ↗ 安装 ↓

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents