开发与工程 inference-proxyreasoning-optimizationopenai-compatiblemctsmixture-of-agentschain-of-thoughtllm-router

OptiLLM 推理优化代理

无需训练的 OpenAI 兼容代理,集成 20+ 推理优化技术,可将推理任务的准确率提升 2-10 倍。

FollowAgents 评估 · FARS-2.1
不推荐
45/ 100 五分制 2.3 / 5
1 2 3 4 5 6
1信任安全7 / 29 · 1.2/5

证据显示:默认绑定127.0.0.1,提供API密钥认证选项,有隐私插件可匿名化PII,有SSL配置说明。但缺少用户确认机制,数据流透明度有限,依赖未固定版本,外部效果(如代码执行、URL读取)缺乏明确警告,回滚机制未提及,发布者身份未验证。扣分原因:用户确认缺失,数据流描述不完整,依赖安全未充分处理。

2可靠稳定6 / 14 · 2.1/5

证据显示:README和代码中技术名称一致,有测试脚本但依赖外部服务器,失败消息在测试中有错误处理。扣分原因:依赖可用性未验证,失败消息在文档中不充分。

3适用触发12 / 18 · 3.3/5

证据显示:面向开发者和研究人员,支持多种场景,技术触发方式多样(前缀、extra_body、提示标签),支持多种环境(pip、docker、本地推理)。扣分原因:能力边界描述不完整,环境适配有警告但未全面。

4规范维护10 / 18 · 2.8/5

证据显示:README结构清晰,安装说明详细,命名稳定,有示例和FAQ,许可证明确,版本号存在但无changelog,维护责任未明确。扣分原因:已知限制不充分,版本变更日志缺失,维护责任不明确。

5有效结果7 / 13 · 2.7/5

证据显示:输出为OpenAI兼容格式,易于使用,提供多种优化技术有边际价值。扣分原因:成本效益分析不足,基准测试结果未独立验证。

6证据核验3 / 8 · 1.9/5

证据显示:README中有基准测试结果,但未提供复现细节,跨来源验证不足,事实与推断未明确分离。扣分原因:声明可追溯性弱,跨来源佐证不足,事实与推断分离不清晰。

证据充分度: 评估于 2026年8月11日 审查版本 eaf171aa6da5
源码中未见的安全控制:执行前用户确认、回滚或恢复路径
使用前请注意
  • 依赖未固定版本,存在供应链风险。
  • 外部效果(如代码执行、URL读取)缺乏明确警告,需谨慎使用。
  • 发布者身份未验证,需自行评估信任度。
  • 基准测试结果未独立验证,需谨慎对待性能声明。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

OptiLLM 是一个开源推理优化代理,作为 OpenAI API 的即插即用替代品,通过 20 多种技术(如 MARS、CePO、MOA、MCTS 等)在推理时增强 LLM 的推理能力,适用于数学、编程和逻辑推理任务,可在无需微调的情况下显著提升准确率。它支持多种提供商(OpenAI、Anthropic、Google、Cerebras 等)和本地模型,可部署在本地或 Docker,并可作为独立服务器运行。项目提供了详细的基准测试结果,展示在 AIME、GPQA 等任务上的显著提升。

OptiLLM 作为代理服务器运行,接收符合 OpenAI API 的 /v1/chat/completions 请求。它根据请求中选择的技术(如 moa, mcts, bon)调用基础模型,通过多次采样、自我反思、规划搜索等方法生成多个候选响应,并选择或组合最佳结果返回。它支持通过环境变量配置 API 密钥,可路由到 OpenAI、Cerebras、Azure OpenAI 等提供商,也支持通过 LiteLLM 集成更多模型。

  1. 数据科学家在开发数学推理模型时,使用 OptiLLM 的 MARS 技术提高 AIME 基准上的准确率。
  2. 软件工程师在代码生成任务中,利用 PlanSearch 或 CePO 技术提升代码通过率。
  3. 企业将 OptiLLM 作为内部 API 网关,为多个 LLM 提供商提供统一的 OpenAI 兼容接口。
  4. 研究人员在评估多个推理技术时,通过 OptiLLM 快速比较不同技术的性能。
  5. 开发者利用插件生态(如 web_search, memory)扩展 LLM 的功能,实现长上下文处理。

这个 Agent 有哪些优点和局限?

优点
  • 无需训练即可获得显著的推理准确率提升(如 AIME 上 +30 分)
  • 支持多种优化技术和插件,包括 MCTS、MOA、CePO 等
  • 为 OpenAI API 兼容,易于集成到现有工具和框架
  • 提供 Docker 镜像和本地推理服务器,支持多提供商
局限
  • 推理时计算开销大,可能增加延迟和成本
  • 需要额外的 API 密钥和配置环境变量
  • 部分技术(如 moa)可能需要多个模型调用,增加调用量
  • 文档深入,但某些高级功能(如自定义插件开发)可能需要额外学习

如何安装或部署这个 Agent?

使用 pip 安装:pip install optillm,或使用 Docker:docker pull ghcr.io/algorithmicsuperintelligence/optillm:latest。也可以从源码安装:克隆仓库后,运行 pip install -r requirements.txt

如何使用这个 Agent?

安装后,设置环境变量(如 export OPENAI_API_KEY=...),然后运行 optillm 启动服务。之后,修改 OpenAI 客户端的 base_urlhttp://localhost:8000/v1,并在模型名称前添加技术前缀(如 moa-gpt-4o-mini)来选择优化技术。也可以使用 extra_body 或提示词中的特殊标签。

这个 Agent 与同类方案有什么区别?

OptiLLM 与 LiteLLM 类似,但更专注于推理优化。LiteLLM 主要提供统一接口,而 OptiLLM 提供多种推理增强技术。

常见问题

OptiLLM 支持哪些 LLM 提供商?
支持 OpenAI、Cerebras、Azure OpenAI、Google(通过 LiteLLM)等,以及任何提供 OpenAI 兼容 API 的服务。
使用 OptiLLM 需要多少计算资源?
取决于使用的技术和基础模型。例如,MCTS 可能需要进行多次模拟,会增加延迟和计算成本。
OptiLLM 可以用于非推理任务吗?
是的,它也支持通用任务,但优化效果在推理任务上表现更明显。
如何自定义优化技术?
可以通过命令行参数(如 --approach)或配置文件自定义参数,也可以开发新的插件。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents