Relax 全模态强化学习引擎
面向文本、视觉与音频模型的异步分布式强化学习训练引擎。
按维度查看评分与理由
架构、跨集群传输、HTTP 扩缩容、指标上报、通知以及模型和数据下载等外部数据流有较清楚的说明;动态引擎删除具有保护、排空、取消和回滚机制,客户端测试也验证了取消时发送 abort。会话密钥不进入网关错误文本的测试为敏感数据处理提供了具体证据。扣分在于未见完整权限清单、密钥生命周期或存储说明,也未见训练、联网、遥测和扩缩容操作的统一用户确认策略。依赖大量未锁定,CI 甚至容许 requirements 安装失败,并以内部 TransferQueue 桩替代真实包,无法证明供应链控制充分。来源标为 Xiaohongshu AI Infra Team、Relax Team/Contributors,但发布者身份未经验证,维护主体和归属仍不完全明确。
README、工作流与客户端测试共同展示异步轮询、稳定请求 ID、重试、取消、协议版本、输入校验及无效 JSON 错误处理;健康检查和两级恢复也有明确设计说明。扣分在于生产级恢复主张主要来自 README,未由所给实现或测试覆盖;关键 TransferQueue 在 CI 中不可获取而被桩替代,GPU 依赖被跳过,且 `pip install -r requirements.txt || true` 会掩盖安装失败,因此普通环境中的依赖可用性证据较弱。
文本、视觉、音频、多轮代理、单机同步、全异步、混合及跨集群场景均有明确受众、模型、算法和硬件示例,环境接口、终止条件和执行模式也界定得较好。扣分在于部分能力边界只通过链接到未提供文档表达;Agentic 环境的触发和动作约束没有形成完整策略,环境适配依赖 Ray、Megatron、SGLang、GPU、特定模型与内部 TransferQueue,通用部署能力有限。
README 的安装、快速入门、架构、算法、模型、功能、示例、贡献、引用和许可证组织完整,命名总体稳定;Apache-2.0 元数据与完整 LICENSE 一致,可给满分。更新表和 Versioneer 提供更新及版本路径,但没有给出正式发布记录或兼容性承诺。安装说明依赖 `latest` Docker 标签且没有镜像摘要;没有集中 FAQ、故障排查或系统化已知限制。维护责任仅以团队和 Contributors 泛称,且发布者身份未知,缺少明确联系人、支持范围和安全报告路径。
提供可直接使用的训练脚本、资源规模、预期日志、检查点格式和转换工具,输出对目标用户具有实际可用性;统一多模态、异步训练、弹性推理和可插拔奖励相对于手工拼接组件具有明显增量价值。扣分在于吞吐量、恢复效果和“生产就绪”等收益没有所给基准或实现证据,成本只通过 8/16 GPU 示例和减少 GPU 浪费的定性描述体现,缺少资源预算、性能数据及运营开销比较。
多数具体操作主张能追溯到命令、文件路径、接口名或测试,协议、取消、重试、输入验证和秘密不进入错误信息得到测试交叉支持;许可证也由元数据和 LICENSE 相互印证。扣分在于大量架构与性能陈述只在 README 中出现,所给源码覆盖范围很窄,CI 对依赖失败采取容忍和桩替代。宣传性表述如“高性能”“生产就绪”“最大吞吐量”“少数系统之一”没有与推断或测量结果清晰分离。
- 不要把 `latest` Docker 镜像或未锁定的 Python/Node 依赖视为可复现或经过供应链验证;部署前应固定镜像摘要和完整依赖版本并进行漏洞扫描。
- CI 允许 requirements 安装失败,并用桩替代关键的 TransferQueue 内部依赖;绿色 CI 不能证明真实 GPU、分布式或跨集群路径可用。
- 系统可下载外部模型和数据、连接跨集群服务,并向 WandB、ClearML、Apprise 等服务发送指标或通知;使用前应审查网络出口、凭据范围、数据分类和遥测配置。
- 扩缩容和 abort/rollback 有局部证据,但训练检查点恢复、全局重启的数据一致性及外部副作用回滚未在所给材料中得到完整验证。
- 发布者身份未知;采用前应独立确认维护渠道、安全披露流程、镜像所有权和长期更新责任。
这个 Agent 能做什么,适合哪些场景?
Relax 是小红书 AI Infra 团队开源的多模态大模型强化学习后训练框架,支持文本、图像、视频和音频处理。它采用六层服务化架构,将 Actor、Rollout、Critic、ActorFwd、Advantages 和 GenRM 等角色部署为独立的 Ray Serve 服务,并由 Controller、Service 和 Registry 负责训练循环、生命周期及角色映射。训练端使用 Megatron-LM,推理端使用 SGLang,TransferQueue 负责流式数据交换,DCS 负责训练与推理组件之间的权重同步。系统提供同步共置、完全异步和混合三种执行模式,可运行 PPO、GRPO、M2PO、RLOO、REINFORCE++、GSPO、SAPO、CISPO 及在策略蒸馏。训练输出为 Megatron DCP 格式检查点,并提供脚本将其转换为 Hugging Face 权重;部署边界是用户自管的单机或多节点 GPU/Ray 环境。
入口脚本 train.py 解析命令行参数、处理信号、连接 Ray 集群并启动 Controller。Rollout 通过 SGLang 生成样本并写入 TransferQueue,StreamingDataLoader 将流式样本交给 Actor;Actor 使用 Megatron-LM 执行训练,ActorFwd、Reference、Advantages 和可选 GenRM 分别完成前向计算、参考策略计算、优势估计与生成式裁判奖励。每个训练步骤后,DCS 可通过 NCCL 将权重广播到 Rollout、ActorFwd 和 Reference,并允许用 --max-staleness 控制异步样本的新旧程度。Agentic RL 流程通过 BaseInteractionEnv 的 reset、step 和 format_observation 接口执行多轮“执行—观察—决策”,使用损失掩码区分模型输出与环境观察,并累积 VLM 多模态上下文。系统还能通过 HTTP REST API 动态增加或移除 SGLang 推理引擎,输出训练指标、告警和 Megatron DCP 检查点。
- 拥有 8 张 GPU、希望用 GRPO 在 DAPO 数学数据上后训练 Qwen3-4B 的研究或工程团队。
- 需要针对视觉问答和图像理解任务,用 Qwen3-VL 与自定义或内置奖励进行强化学习的多模态团队。
- 拥有两节点、16 张 GPU,准备对 Qwen3-Omni 进行图像与音频联合强化学习训练的基础设施团队。
- 需要把搜索、软件工程环境或其他交互环境接入多轮闭环训练,并精确屏蔽环境观察损失的 Agentic RL 研究者。
- Rollout 成为吞吐瓶颈、希望不中断训练便动态扩缩 SGLang 推理引擎的集群运营团队。
- 需要训练 MoE 或超大模型,并依赖张量、流水线、上下文和专家并行策略的分布式训练团队。
这个 Agent 有哪些优点和局限?
- 同一框架覆盖文本、视觉和音频强化学习,并明确提供 Qwen3-Omni 图像加音频的端到端训练配方。
- 训练与推理解耦:Megatron-LM、SGLang、TransferQueue 和 DCS 分担训练、采样、流式传输及权重同步,可选择同步、完全异步或混合执行。
- 算法覆盖面具体且较广,包括 PPO、GRPO、M2PO、RLOO、两种 REINFORCE++、GSPO、SAPO、CISPO 和在策略蒸馏。
- 具备面向长任务的多轮交互、损失掩码、灵活终止条件以及视觉上下文累积机制。
- 提供 HealthManager 自动恢复、集中式指标、Apprise 通知和在线弹性扩缩 Rollout 等生产运维能力。
- 入门配方硬件门槛较高:文本和视觉示例均要求 8 张 GPU,全模态示例要求两节点共 16 张 GPU。
- 核心运行栈依赖 Ray Serve、Megatron-LM、SGLang、TransferQueue、DCS、NCCL/GLOO 及容器化 GPU 环境,部署和排障复杂度较高。
- 已列出的模型均通过 Megatron 后端运行;新增架构需要实现 Megatron Bridge 所需的采样、训练和权重转换钩子,不能假定任意模型可直接使用。
- 完全异步模式会引入样本陈旧度,需要通过 --max-staleness 在吞吐量与在策略准确性之间做取舍。
- 检查点默认是 Megatron DCP 格式,若下游需要 Hugging Face 权重还必须执行额外转换。
如何安装或部署这个 Agent?
推荐使用官方 Docker 镜像;需要可用的 NVIDIA GPU、兼容的 GPU 驱动、Docker、网络访问和本地工作目录。源码未说明需要 API 密钥或其他凭据。执行:
docker pull ghcr.io/redai-studio/relaxrl:latestdocker run -it --gpus all --ipc=host --network=host -v /path/to/your/workspace:/root ghcr.io/redai-studio/relaxrl:latest bash进入容器后执行:
git clone https://github.com/redai-studio/Relax.git /root/Relaxcd /root/Relax && pip install -e .
官方镜像包含匹配版本的 CUDA、PyTorch、Megatron-LM、SGLang 和 Ray 依赖;项目标注 Python 3.12。
如何使用这个 Agent?
最小的已文档化文本训练示例需要 8 张 GPU。先在容器内下载数据集和模型:
hf download --repo-type dataset zhuzilin/dapo-math-17k --local-dir /root/dapo-math-17k
hf download Qwen/Qwen3-4B --local-dir /root/Qwen3-4B然后启动 GRPO 训练:
cd /root/Relax && export EXP_DIR=/root
bash scripts/training/text/run-qwen3-4B-8xgpu.sh运行后应出现类似“Finish rollout 0/200”和“training step 0/200”的日志。检查点采用 Megatron DCP 格式,可用 scripts/tools/convert_torch_dist_to_hf_bridge.py 转换为 Hugging Face 权重。视觉语言任务另有 scripts/training/multimodal/run-qwen3-vl-4B-8xgpu.sh;Qwen3-Omni 示例要求 16 张 GPU、两个节点,并通过 scripts/entrypoint/spmd-multinode.sh 启动。