标签「benchmarking」的 Agents

共 12 个结果
benchmarking ×
开发与工程

Sprix SAGE Router

为执行中的 A2A 任务选择继续、协作或移交路径。

★ 3.8k FS 69 存在缺口 26 天前 MIT
开发与工程

LongHorizon-Harness

为 Claude Code、Codex、OpenCode 和 DeepSeek Harness 提供长期运行循环,让 AI 代理跨桌面应用和终端持续工作数小时。

★ 1.6k FS 66 存在缺口 1 个月前 MIT
开发与工程

HUD

为 AI 智能体构建强化学习环境与评测的平台:一次定义环境,即可对任意模型进行评测与训练。

★ 302 FS 63 存在缺口 4 天前 MIT
自动化与运维 ✓ Microsoft · 官方

OpenRCA 软件故障根因分析

让大模型跨指标、链路与日志定位软件故障根因。

★ 424 FS 58 缺口较多 5 个月前 MIT
开发与工程

Xcode 构建优化 Agent 技能

通过基准测试和构建设置优化,加速 Xcode 干净构建与增量构建。

★ 1.2k FS 57 缺口较多 9 天前 MIT
开发与工程

RAI 具身智能机器人框架

一个供应商中立的智能体框架,让开发者通过 ROS 2 为实体机器人快速构建多模态 AI 能力。

★ 592 FS 55 缺口较多 13 天前 Apache-2.0
数据与分析

MobileGym

以可编程状态和确定性判定评测、训练移动 GUI 智能体。

★ 794 FS 50 缺口较多 26 天前 Apache-2.0
开发与工程

PhyAgentOS — 具身智能会话中心运行时

认知-物理解耦的会话中心运行时,一套代码适配任意机器人硬件,内置多重安全与审计。

★ 2.5k FS 47 缺口较多 2 天前 MIT
开发与工程

Multi-SWE-bench

用 Docker 验证多语言代码修复补丁的议题解决基准。

★ 362 FS 46 缺口较多 9 个月前 Apache-2.0
开发与工程 ✓ Microsoft · 官方

Memora 智能体记忆框架

为智能体自动整理、更新并检索兼顾细节与抽象的长期记忆。

★ 250 FS 44 缺口较多 3 个月前 MIT
数据与分析

ReLE中文大模型能力评测与缺陷库

持续更新的中文AI大模型能力评测,覆盖7大领域300+细分维度,提供排行榜和超200万缺陷样本库。

★ 6.4k FS 14 缺口较多 7 天前
自动化与运维

Cua:跨操作系统计算机使用与虚拟化平台

为 AI 代理提供可扩展的跨操作系统计算机使用、沙箱和基准测试。

★ 26k FS 0 缺口较多 今天 MIT