标签「model-evaluation」的 Agents

共 5 个结果
model-evaluation ×
自动化与运维

MLflow

统一追踪、评估、监控和优化生产级智能体、LLM 应用与机器学习模型。

★ 28k FS 64 存在缺口 1 天前 Apache-2.0
开发与工程

Meta-Harness

自动搜索并优化固定基础模型周边的任务专用执行框架。

★ 1.6k FS 44 缺口较多 15 天前 MIT
数据与分析

Cache-to-Cache

让不同大模型绕过文本,以 KV 缓存直接交换语义。

★ 686 FS 43 缺口较多 7 天前 Apache-2.0
数据与分析

ToolBench 与 ToolLLaMA

用真实 REST API 数据、检索与 DFSDT 训练评估模型调用能力。

★ 5.8k FS 32 缺口较多 1 年前 Apache-2.0
开发与工程

Voice Lab

用可配置场景和指标评测语音智能体的语言模型与提示词。

★ 176 FS 27 缺口较多 1 年前 Apache-2.0