标签「grpo」的 Agents

共 9 个结果
grpo ×
数据与分析

Relax 全模态强化学习引擎

面向文本、视觉与音频模型的异步分布式强化学习训练引擎。

★ 621 FS 64 存在缺口 6 天前 Apache-2.0
开发与工程

HUD

为 AI 智能体构建强化学习环境与评测的平台:一次定义环境,即可对任意模型进行评测与训练。

★ 302 FS 63 存在缺口 4 天前 MIT
开发与工程

MARTI:多智能体强化学习训练与推理框架

让 LLM 多智能体系统通过强化学习进行可扩展训练与树搜索增强推理,覆盖辩论、智能体链、混合智能体等工作流。

★ 560 FS 36 缺口较多 1 个月前 MIT
数据与分析

ART 智能体强化训练器

用 GRPO 从实际任务经验中持续训练多步智能体。

★ 11k FS 34 缺口较多 今天 Apache-2.0
开发与工程

Hands-On Modern RL 实战教程

从经典控制到 LLM 后训练与智能体强化学习的实践优先课程。

★ 4.4k FS 30 缺口较多 20 天前 NOASSERTION
开发与工程

AgentsMeetRL——智能体强化学习资源大全

系统收录并分类开源 LLM 智能体强化学习项目,助你快速寻找框架、算法、奖励与环境参考。

★ 1.8k FS 29 缺口较多 8 天前
数据与分析

Open-AgentRL

面向推理、工具调用与交互环境的强化学习训练框架。

★ 641 FS 28 缺口较多 3 个月前 Apache-2.0
数据与分析

AReaL 异步强化学习平台

面向推理与工具型模型的异步强化学习训练基础设施。

★ 5.8k FS 0 缺口较多 今天 Apache-2.0
开发与工程

rLLM:大语言模型智能体强化学习框架

统一的智能体强化学习框架,支持任意 harness、任意沙箱,一键切换训练后端。

★ 5.8k FS 0 缺口较多 11 天前 Apache-2.0