AgileRL 强化学习库
以 RLOps 理念简化强化学习:通过进化式超参数优化,免去大量调参实验,实现最高约 10 倍的训练提速。
Relax 全模态强化学习引擎
面向文本、视觉与音频模型的异步分布式强化学习训练引擎。
HUD
为 AI 智能体构建强化学习环境与评测的平台:一次定义环境,即可对任意模型进行评测与训练。
MetaClaw
通过本地代理把个人智能体对话转化为技能、记忆和可选的 LoRA 持续学习。
MobileGym
以可编程状态和确定性判定评测、训练移动 GUI 智能体。
Agentic RL 最详细入门
一套从基础概念、代码实战到前沿论文的 Agentic RL 学习与工程实践资料库,帮你系统掌握多轮工具调用与信用分配技术。
通义深度研究
面向长链路网络检索、资料分析与研究问答的开源模型及推理系统。
AWorld 智能体编排平台
把领域知识转化为可构建、评估并持续改进的多智能体工作流。
MARO 资源优化平台
用仿真、强化学习和分布式组件优化资源配置决策。
Memora 智能体记忆框架
为智能体自动整理、更新并检索兼顾细节与抽象的长期记忆。
IR-SIM 智能机器人模拟器
基于 Python 的轻量级机器人模拟器,支持导航、控制与学习,通过 YAML 快速配置场景。
skrl:模块化强化学习库
用PyTorch、JAX和NVIDIA Warp实现的高度模块化、可读性强的强化学习库。
gym-pybullet-drones:四旋翼强化学习环境
基于PyBullet物理引擎、兼容Gymnasium的多智能体四旋翼控制强化学习环境。
Agent Lightning
为现有 AI 智能体采集轨迹并训练提示词或策略资源。
MARTI:多智能体强化学习训练与推理框架
让 LLM 多智能体系统通过强化学习进行可扩展训练与树搜索增强推理,覆盖辩论、智能体链、混合智能体等工作流。
RLinf 强化学习基础设施
面向具身机器人与智能体的大规模强化学习训练基础设施。
ART 智能体强化训练器
用 GRPO 从实际任务经验中持续训练多步智能体。
AI 工程从零到精通
免费开源课程,503 课、20 阶段,从数学到自主智能体,手把手教你构建并部署 AI 系统。
ChatArena
用于构建、运行和评估多智能体语言游戏的 Python 框架。
veRL Agent RL 训练框架
面向长程 LLM/VLM 交互任务的多轮强化学习训练扩展。
AgentFlow 智能体优化框架
用 Flow-GRPO 在线训练规划器,提升多工具长程推理的规划与调用可靠性。
Hands-On Modern RL 实战教程
从经典控制到 LLM 后训练与智能体强化学习的实践优先课程。
Mobile-Agent:多平台GUI智能体系列
由阿里通义实验室推出的强大图形界面智能体系列,支持手机、桌面与网页的自动化操作。
AgentsMeetRL——智能体强化学习资源大全
系统收录并分类开源 LLM 智能体强化学习项目,助你快速寻找框架、算法、奖励与环境参考。