标签「agent-evaluation」的 Agents

共 18 个结果
agent-evaluation ×
开发与工程

Strands Evals SDK

评测、诊断并改进 AI Agent 与大模型应用。

★ 201 FS 64 存在缺口 5 天前 Apache-2.0
开发与工程

HUD

为 AI 智能体构建强化学习环境与评测的平台:一次定义环境,即可对任意模型进行评测与训练。

★ 302 FS 63 存在缺口 4 天前 MIT
开发与工程

Designing Multi-Agent Systems(PicoAgents)

从零构建 LLM 多智能体系统:一本书加一套完整可运行的教学框架,带你掌握从单个 Agent 到自主编排的全套核心模式。

★ 1.3k FS 59 缺口较多 1 个月前 Apache-2.0
开发与工程 ✓ Google · 官方

Google Agents CLI

让编程助手具备构建、评估并部署 Google Cloud ADK 智能体所需的 CLI 与技能。

★ 6k FS 56 缺口较多 1 天前 Apache-2.0
自动化与运维

iFixAi 智能体审计器

在约120秒内审计 AI 智能体的治理缺陷与运行风险。

★ 16k FS 56 缺口较多 5 天前 Apache-2.0
开发与工程

寓言方法论(Fable Method)——可蒸馏的智能体工作流

把 Claude Fable 5 的工作方式蒸馏成可执行的技能、循环和验证器,用一套陷阱测试集保证诚实。

★ 2.3k FS 55 缺口较多 2 个月前 MIT
开发与工程

Hello-Agents 智能体教程

从基础原理、框架实现到多智能体项目,系统学习如何构建 AI 原生智能体。

★ 81k FS 54 缺口较多 1 天前 NOASSERTION
开发与工程

PenguinHarness

在桌面或服务器上构建、运行并持续优化智能体应用。

★ 2.3k FS 52 缺口较多 5 天前 Apache-2.0
自动化与运维

Future AGI

统一追踪、评测、仿真和防护,让 AI 应用可观测、可改进。

★ 2.1k FS 51 缺口较多 1 天前 Apache-2.0
开发与工程

从零构建邮件智能体

循序构建具备邮件分流、人工审批、评测与长期记忆的助手。

★ 2.3k FS 49 缺口较多 1 个月前 MIT
数据与分析

ClawBench 浏览器智能体评测

在真实网站上运行并评估浏览器智能体的日常任务能力。

★ 835 FS 48 缺口较多 4 天前 Apache-2.0
开发与工程

AnyAgent

用统一 Python 接口运行并评估多种智能体框架。

★ 1.2k FS 41 缺口较多 4 个月前 Apache-2.0
开发与工程

PandaProbe

为 AI Agent 提供追踪、评估与监控的自托管工程平台。

★ 786 FS 41 缺口较多 1 天前 Apache-2.0
开发与工程

Strands Agents 示例集

用 Python 和 TypeScript 快速学习并验证 Strands Agents SDK 的开发与部署模式。

★ 852 FS 40 缺口较多 22 天前 Apache-2.0
数据与分析

Meta ARE

在持续变化的真实任务中评测可多步推理的 AI 代理。

★ 557 FS 37 缺口较多 29 天前 MIT
开发与工程

Youtu-Agent

面向开源模型的可配置智能体构建、评测与持续优化框架。

★ 4.6k FS 27 缺口较多 6 个月前 NOASSERTION
自动化与运维

Coze Loop

面向 AI Agent 的自托管开发、评测与运行链路观测平台。

★ 5.7k FS 26 缺口较多 1 天前 Apache-2.0
效率与协作

KwaiAgents

可通过 OpenAI 或本地模型执行信息检索任务的轻量级智能体系统。

★ 1.2k FS 0 缺口较多 2 年前 NOASSERTION