标签「llm-benchmarking」的 Agents

共 2 个结果
llm-benchmarking ×
数据与分析

EDSL(Expected Parrot 领域特定语言)

用 Python DSL 设计、运行并分析由大量 AI 代理和多个大语言模型作答的调查与实验,模拟社会科学和市场研究。

★ 502 FS 63 存在缺口 今天 MIT
开发与工程

PinchBench 智能体基准测试

用 53 个真实任务衡量大模型作为 OpenClaw 编码智能体的实际表现。

★ 1.4k FS 42 缺口较多 3 个月前 MIT