标签「benchmark-evaluation」的 Agents

共 7 个结果
benchmark-evaluation ×
开发与工程

Apache Maka

面向真实项目、保留可恢复执行记录的本地优先智能体工作区。

★ 5.6k FS 82 表现良好 今天 Apache-2.0
开发与工程

FrontierAgent

开源终端智能体运行时:一个 ReAct 智能体或协调者加并行子智能体团队,在沙盒中完成长周期研究与文件交付。

★ 4.5k FS 74 存在缺口 今天 Apache-2.0
数据与分析

通义深度研究

面向长链路网络检索、资料分析与研究问答的开源模型及推理系统。

★ 20k FS 49 缺口较多 6 个月前 Apache-2.0
开发与工程

A-Evolve

通过评测反馈自动迭代 Agent 工作区中的提示词、技能与记忆。

★ 803 FS 38 缺口较多 1 个月前
数据与分析

RecursiveMAS

以潜空间递归连接多角色模型的多智能体训练与评测框架。

★ 938 FS 31 缺口较多 2 个月前 MIT
数据与分析

MiroThinker

面向复杂检索、证据整理与预测问题的可部署深度研究智能体。

★ 8.4k FS 27 缺口较多 6 个月前 Apache-2.0
开发与工程

rLLM:大语言模型智能体强化学习框架

统一的智能体强化学习框架,支持任意 harness、任意沙箱,一键切换训练后端。

★ 5.8k FS 0 缺口较多 11 天前 Apache-2.0