MARTI:多智能体强化学习训练与推理框架
让 LLM 多智能体系统通过强化学习进行可扩展训练与树搜索增强推理,覆盖辩论、智能体链、混合智能体等工作流。
- Star 数
- ★ 560
- 最近更新
- 1 个月前
- License
- MIT
- 主语言
- Python
- FA 评分
- 36/100 · 缺口较多
30 秒速览
- 可在哪里用
- 通用 · 跨平台
- 开始前需要
- 典型场景
- 研究人员想在多智能体辩论或混合智能体设置下,用 GRPO/PPO 对 LLM 做可复现的强化学习训练实验
- 主要局限
- 硬件门槛高:单智能体约需 8×80G GPU,多智能体每个智能体再需 8×80G,论文实验使用 3 节点各 8×H200,个人或小团队难以复现
这个 Agent 能做什么,适合哪些场景?
MARTI 是清华大学与上海人工智能实验室开源的 LLM 多智能体强化学习(MARL)训练与推理框架,已被 ICLR 2026 接收。框架遵循“集中式多智能体交互 + 分布式策略训练”原则,包含多智能体世界(Multi-Agent World)、集中式奖励(Centralized Rewarding)和单智能体训练器(Single Agent Trainer)三大模块,底层基于 OpenRLHF,并支持 vLLM v1 引擎与 Hybrid Engine。最新版本 MARTI-v2 引入树搜索增强强化学习(MARS²),面向代码生成等复杂推理任务,提供异步多智能体 MCTS 训练,并集成 GSPO 损失、TIS 修正、动态数据过滤和超长序列缓冲等训练技术,支持最高 32K token 序列与异构多智能体(如 Qwen3-8B + AreaL-boba-2-8B)联合训练。框架内置辩论、智能体链、混合智能体等图式工作流,实验性支持 AutoGen 与 CAMEL 第三方框架。在 LCB 代码生成基准上,多智能体 MCTS 使 Qwen3-8B 相对基础模型提升 8.0%、相对 Vanilla GRPO 提升 4.4%。注意这是一套研究性训练框架,而非开箱即用的推理服务。
MARTI 读取配置与训练脚本(examples/ 目录下的 bash 脚本),通过 OpenRLHF 基础设施与 vLLM 引擎执行多智能体强化学习训练。集中式的 Multi-Agent World 模块负责智能体间交互与奖励分配,Centralized Rewarding 模块实现信用分配与奖励塑形,Single Agent Trainer 对每个智能体的策略进行分布式训练。支持 PPO、GRPO、REINFORCE++、TTRL 等 RL 算法,以及辩论、Chain-of-Agents、Mixture-of-Agents、Review-RL 等工作流。MARTI-v2 的 MARS² 模块执行异步多智能体 MCTS 树搜索,通过自适应节点扩展与精炼探索解空间,产出高质量推理轨迹用于策略更新,支持 GSPO 序列级优化、TIS 采样修正、按智能体的动态样本过滤和超长 token 惩罚缓冲。训练产物是经过多智能体 RL 优化的模型权重(如 Qwen3-8B/14B、DeepCoder-14B 等)。
- 研究人员想在多智能体辩论或混合智能体设置下,用 GRPO/PPO 对 LLM 做可复现的强化学习训练实验
- 算法工程师需要训练代码生成模型,希望用 MCTS 树搜索代替朴素 rollout 来提升 LCB 类基准的 Pass@1
- 团队要联合训练多个异构模型(如 Qwen3-8B + AreaL-boba-2-8B),各智能体拥有独立角色、训练策略和样本过滤
- 已有 AutoGen 或 CAMEL 工作流的用户,想把现有编排接入 RL 训练管线(实验性支持)
- 需要异步工具调用(Async Tool Use)和多轮智能体 RL(如代码/数学多轮 RL)的研究场景
如何安装或部署这个 Agent?
安装步骤(来自仓库):
- 克隆仓库并安装依赖:
git clone https://github.com/TsinghuaC3I/MARTI.git
cd MARTI
pip install -r requirements.txt- 按仓库说明配置依赖,包括 OpenRLHF、Ray 和 vLLM。
硬件门槛:单智能体训练约需 8×80G GPU;多智能体训练每个智能体约需 8×80G GPU。仓库未提供 Docker 镜像或托管服务,需自行准备 GPU 集群环境。
如何使用这个 Agent?
在脚本中设置路径后运行对应示例脚本:
ROOT_DIR="/path/to/MARTI"
MODEL_DIR="/path/to/models"# 单智能体 MCTS 训练(MARS²)
bash examples/mars2/run_train_single_mcts.sh# 多智能体 MCTS 训练
bash examples/mars2/run_train_multi_mcts.sh# 异步多轮代码 RL(单智能体)
bash examples/single-agent/run_train_code_async.sh# 多智能体辩论
bash examples/multi-agent/run_train_mad.sh
# Chain-of-Agents (MathChat)
bash examples/multi-agent/run_train_mathchat.sh
# Review-RL
bash examples/reviewrl/run_train_reviewrl_async.sh文档位于 docs/ 目录(Overview、Workflows Integration、Reward and Training、Experiments)。
这个 Agent 有哪些优点和局限?
- ICLR 2026 论文支撑,并提供 arXiv 技术报告(2602.07848),方法有同行评审背书
- 多智能体训练与单智能体 RL 在同一框架内统一,内置信用分配与奖励塑形,省去自行拼装管线
- MARS² 提供异步多智能体 MCTS 训练,LCB 基准上多智能体相对 Vanilla GRPO 提升最高 4.4%,且支持 32K 超长序列与异构智能体训练
- 支持 PPO、GRPO、REINFORCE++、TTRL 多种 RL 算法,并实验性兼容 AutoGen/CAMEL 现有编排
- 硬件门槛高:单智能体约需 8×80G GPU,多智能体每个智能体再需 8×80G,论文实验使用 3 节点各 8×H200,个人或小团队难以复现
- 研究性框架,AutoGen/CAMEL 集成为实验性,生产化程度未知
- 无托管服务或 Docker 部署方案,需要自行维护 OpenRLHF/Ray/vLLM 依赖栈
- 对模型家族有具体实验证据(Qwen3、AreaL-boba、DeepCoder、DeepSeek-R1、Gemma、Llama 出现在主题标签中),其他模型的实际效果缺乏公开验证
这个 Agent 与同类方案有什么区别?
MARTI 明确构建于单智能体 RL 框架 OpenRLHF 与 verl 之上,与它们的关系是扩展而非替代:OpenRLHF/verl 面向单智能体策略训练,MARTI 在此之上增加集中式多智能体交互、奖励分配与多智能体树搜索(MARS²)。README 未提及其他具名多智能体 RL 竞品。
与相关度最高的同类 agent 并排比较关键指标。
| Agent | 源码审查 | Star | 最近更新 | 主语言 | 完整支持的平台 |
|---|---|---|---|---|---|
| MARTI:多智能体强化学习训练与推理框架 当前 | 36 · 缺口较多 | ★ 560 | 1 个月前 | Python | — |
| AgentsMeetRL——智能体强化学习资源大全 | 29 · 缺口较多 | ★ 1.8k | 8 天前 | HTML | — |
| Hands-On Modern RL 实战教程 | 30 · 缺口较多 | ★ 4.4k | 20 天前 | Python | — |
| rLLM:大语言模型智能体强化学习框架 | 0 · 缺口较多 | ★ 5.8k | 11 天前 | Python | OpenAI API |
FollowAgents 如何评估这个 Agent?
查看各维度的扣分理由
该仓库是面向研究者的多智能体强化学习训练框架,而非部署型Agent。来源归属方面证据充分:致谢、OpenRLHF/vLLM/Ray等上游依赖、贡献者名单与联系方式齐全,得3分。权限方面仅见到requirements.txt与训练脚本,未见明显的最小权限设计或说明;未发现凭据窃取或隐蔽外传代码,wandb为常见实验遥测但未说明其数据上报内容,扣分点在于数据流向未文档化。敏感数据、回滚机制无任何文档或代码证据。依赖文件仅部分固定版本(deepspeed、ray、torch、transformers固定,vllm用>约束),无漏洞说明或审计,得1分。
安装说明仅给出pip install -r requirements.txt并要求用户自行完成OpenRLHF、Ray、vLLM的安装,依赖可用性支持单薄,得1分。README内部基本自洽(目录、脚本路径与examples结构一致),但MARTI-v2提及的许多技术(GSPO、TIS、overlong buffer)无代码级佐证,自一致性得1分。所提供的文件中完全没有失败消息或错误处理文档,得0分。
目标受众(RL研究者)与场景(代码生成、数学推理训练)描述清晰,得2分;但触发精度对训练框架不适用,得0分。能力边界部分有说明(硬件要求8×80G GPU起),但缺乏第三方集成(AutoGen/CAMEL)成熟度的明确标注(仅experimental),得1分。环境适配仅给出粗略硬件需求,未说明操作系统、CUDA版本等,得1分。
信息架构良好:目录完整、文档分章、图表齐备,得2分。安装说明过薄——仅两行命令加'自行参照依赖安装说明',得1分。命名稳定(MARTI/MARS²一致)。示例仅以脚本文件名指向,无FAQ,得1分。已知局限完全缺失,得0分。MIT许可证存在且完整,但README页脚'All rights reserved'与MIT条款表述有轻微冲突,得2分。无版本号或CHANGELOG,仅以News条目代替,得1分。维护责任明确(Tsinghua + Shanghai AI Lab、联系人、后续论文与更新时间线),得2分。
输出可用性:实验结果以图片呈现,无表格化可复现数据或训练曲线数值,得1分。边际价值:将树搜索RL与多智能体训练统一到OpenRLHF基础设施上,相对单智能体RL框架确有差异化贡献,得2分。成本收益:最低8×80G GPU、多智能体需3节点H200集群,成本极高而收益描述以论文指标为主,普通使用者难以获益,得1分。
性能声明(4.6%/8.0%提升等)指向arXiv技术报告与OpenReview,但仅以截图图片呈现,仓库内无可核验的评估脚本或数据表,得1分。跨源佐证:引用了ICLR接收与第三方项目(ReviewRL、CoMAS)使用该框架,外部链接存在但静态审查无法核验,得1分。事实与推断区分一般:新闻时间线与硬件要求为事实,但部分'Key Features'更像宣传性断言,得1分。
- 源码中未见:敏感信息处理使用专用、低权限、可随时吊销的 API 密钥,不要复用生产凭据,也不要让密钥出现在日志里。
- 源码中未见:回滚或恢复路径运行前先备份,或在 git 分支、快照上操作,确保改动可以撤销。
- 保守提示:README中部分性能提升数字仅以图片呈现,仓库内未提供可核验的评估脚本或数据表,采用前应对照论文与代码自行验证。
- 安装文档过薄:OpenRLHF、vLLM等核心依赖需用户自行安装且版本耦合复杂,torch/transformers/vllm版本组合可能存在兼容风险,建议在隔离环境中锁定版本。
- wandb默认存在于依赖中,使用前应确认实验数据的上报范围,避免训练数据或指标意外外传。
- 硬件门槛极高(单任务8×80G起,多智能体需3节点H200),中小团队需先评估成本收益。
- README页脚'All rights reserved'与MIT许可证表述不完全一致,商业使用前建议向维护者确认许可意图。
- 第三方集成(AutoGen、CAMEL)标注为experimental,生产使用前需额外验证。