标签「evaluation」的 Agents

共 13 个结果
evaluation ×
开发与工程 ✓ NVIDIA · 官方

NVIDIA NeMo Agent Toolkit

为任意AI代理框架增添智能,通过企业级可观测性与持续学习提升速度、准确性和决策能力。

★ 2.6k FS 65 存在缺口 今天 Apache-2.0
开发与工程

Yao Meta Skill

把重复工作流工程化为可评测、可治理、可移植的智能体技能。

★ 2.6k FS 65 存在缺口 1 个月前 MIT
自动化与运维

Arize Phoenix

开源AI可观测性平台,用于追踪、评估和调试LLM应用。

★ 12k FS 61 存在缺口 今天 NOASSERTION
开发与工程

ControlKeel

把团队的工程习惯转化为可执行的策略、审查关卡与持久化证据。

★ 11 FS 59 缺口较多 今天 NOASSERTION
开发与工程 ✓ Microsoft · 官方

RAMPART

一个 pytest 原生的 AI 智能体应用安全测试框架,用熟悉的测试工作流覆盖对抗攻击与良性失败场景。

★ 413 FS 51 缺口较多 7 天前 MIT
开发与工程

上下文工程智能体技能集

用于构建、优化和调试生产级智能体的开源技能集合,专注于上下文管理和多智能体架构。

★ 18k FS 49 缺口较多 14 天前 MIT
自动化与运维

RagaAI Catalyst

用 Python SDK 对 LLM 与多智能体应用进行评测、追踪、调试和安全测试。

★ 16k FS 46 缺口较多 7 个月前 Apache-2.0
开发与工程

AI Agents 权威指南(配套代码库)

O'Reilly 图书《AI Agents - The Definitive Guide》的官方配套代码库,用十二章可运行的 Jupyter 笔记本覆盖从 LLM 到生产级智能体的完整学习路径。

★ 2.4k FS 45 缺口较多 1 个月前
开发与工程

Rogue — AI 智能体测评与红队平台

在攻击者之前对你的 AI 智能体进行压力测试,自动化评估与红队演练。

★ 1.1k FS 43 缺口较多 4 个月前 NOASSERTION
开发与工程

Judgeval

面向Agent的持续改进栈,通过生产数据检测失败、定位根因并上线修复。

★ 1.1k FS 40 缺口较多 1 天前 Apache-2.0
开发与工程

IntellAgent:诊断与优化对话智能体的仿真框架

通过高仿真的合成交互,全面诊断和优化您的对话智能体,发现隐藏盲点,确保可靠部署。

★ 1.3k FS 33 缺口较多 10 天前 Apache-2.0
开发与工程

AI 系统设计指南

面向生产级 AI 系统的实战参考,覆盖 RAG、LLM 工程、Agentic AI 与面试准备。

★ 3.3k FS 27 缺口较多 1 个月前 MIT
自动化与运维

BISHENG 企业级 LLM 应用开发运维平台

面向企业场景的开源 LLM 应用平台,提供工作流编排、RAG、智能体、模型管理与精细化调优等全链路能力。

★ 12k FS 0 缺口较多 1 天前 Apache-2.0