开发与工程 apple-siliconmlxggufopenai-apianthropic-apiollama-apispeculative-decodingmedia-generation

mlx-serve:Apple Silicon 本地模型推理引擎

在 Mac 上原生运行任意 LLM,兼容 OpenAI、Anthropic 与 Ollama API,无需 Python,速度超越 LM Studio。

FollowAgents 评估 · FARS-2.1
不推荐
48/ 100 五分制 2.4 / 5
1 2 3 4 5 6
1信任安全10 / 29 · 1.7/5

证据显示:SECURITY.md 明确说明无认证、默认绑定 127.0.0.1、文件工具限制在工作目录,但 shell 命令不受限;MLX Core 有按工具审批和沙箱选项,但未提供默认强制或用户确认的细节。数据流透明度有限,README 提及数据去向 FAQ 但未提供具体内容。敏感数据处理未详细说明。依赖安全方面,CI 固定了 Zig 和 mlx 版本,但未提供依赖漏洞扫描证据。外部影响方面,agent 模式可执行 shell 命令,但 SECURITY.md 警告仅用于可信模型。回滚机制未提及。来源归属良好,README 致谢了第三方代码并附 NOTICE。扣分原因:缺少默认最小权限、用户确认机制不明确、数据流和敏感数据处理细节不足、依赖安全证据不足、外部影响控制依赖用户自觉、无回滚机制。

2可靠稳定8 / 14 · 2.9/5

证据显示:README 和测试脚本描述一致,功能列表与测试覆盖相符,但未提供实际运行结果。依赖可用性方面,CI 脚本固定了 Zig、mlx、llama.cpp 版本,但未提供依赖可用性保证。失败消息方面,测试脚本有错误输出,但服务器错误处理细节未提供。扣分原因:静态审查无法验证实际运行,失败消息证据不足。

3适用触发10 / 18 · 2.8/5

证据显示:README 明确目标用户为 Apple Silicon 上的开发者,场景包括聊天、agent、媒体生成等。能力边界在 SECURITY.md 和 README 中有说明,如无认证、仅限本地。触发精度方面,工具调用测试覆盖了多种场景,但未提供触发条件的精确描述。环境适配方面,明确要求 macOS 26.2+ 和 Apple Silicon,并提供 Homebrew 和源码构建方式。扣分原因:触发精度证据不足,环境适配仅限特定硬件。

4规范维护10 / 18 · 2.8/5

证据显示:README 结构清晰,提供文档链接和 FAQ。安装说明详细,包括 Homebrew、源码构建。命名稳定性方面,版本号在 README 和 CI 中出现,但未提供命名规范。示例和 FAQ 丰富,但未提供 FAQ 内容。已知限制在 SECURITY.md 和 README 中有提及,如无认证、仅限本地。许可证为 MIT,但元数据为 NOASSERTION,且 LICENSE 文件包含第三方许可说明。版本变更日志存在 CHANGELOG.md,但未提供内容。维护责任方面,有 SECURITY.md 和 CI,但未明确维护者。扣分原因:命名稳定性证据不足,版本变更日志内容未提供,维护责任不明确。

5有效结果7 / 13 · 2.7/5

证据显示:输出可用性方面,提供多种 API 兼容和媒体生成,测试脚本验证了基本功能。边际价值方面,对比表显示相对 LM Studio 等的优势,但未提供独立验证。成本效益方面,免费开源,但未提供性能数据或资源消耗细节。扣分原因:性能声明未验证,成本效益证据不足。

6证据核验3 / 8 · 1.9/5

证据显示:README 中的声明部分有文档链接,但未提供具体数据来源。交叉验证方面,测试脚本和 CI 提供了一些验证,但未提供独立来源。事实与推断分离方面,README 区分了性能声明和推测,但未明确标注。扣分原因:声明缺乏可追溯数据,交叉验证不足,事实与推断分离不清晰。

证据充分度: 评估于 2026年9月7日 审查版本 539a39ebd83d
源码中未见的安全控制:回滚或恢复路径
使用前请注意
  • 静态审查无法验证实际运行,所有性能声明和功能可用性均未独立测试。
  • SECURITY.md 明确无认证,仅限本地使用,切勿暴露到网络。
  • Agent 模式可执行 shell 命令,且不受工作目录限制,需谨慎使用。
  • 许可证元数据为 NOASSERTION,实际为 MIT,但需注意第三方组件许可。
查看完整评分方法 →

这个 Agent 能做什么,适合哪些场景?

mlx-serve 是一款面向 Apple Silicon 的原生 Zig 推理服务器,能够运行 MLX 格式模型和 Hugging Face 上的全部 GGUF 模型,同时支持 Qwen、Llama、Mistral、Gemma、DeepSeek V4 Flash 等主流架构。它原生支持 OpenAI、Anthropic 与 Ollama 三种 API 接口,可无缝接入 Claude Code、OpenAI SDK、Cursor、Open WebUI 等工具。除文本生成外,该服务器还内置图像、视频、音乐、语音合成(含声音克隆)和 3D 模型生成能力,均基于 MLX 实现。仓库同时提供 MLX Core,一款菜单栏 macOS 应用,带有聊天、代理模式、MCP 工具调用和模型管理功能,所有代码采用 MIT 许可证。

该工具在 Apple Silicon 上启动一个本地 HTTP 服务,默认端口为 11234,支持 /v1/chat/completions、/v1/messages 及 /api/chat 等端点。它能够流式输出文本、结构化工具调用、JSON-schema 约束解码、视觉输入以及思考过程。在媒体的生成上,它通过 /v1/images、/v1/audio、/v1/video 和 /v1/3d 端点分别实现图像、语音、视频和 3D 模型的生成。引擎内置多种推测解码技术、连续批处理、KV 缓存量化以及前缀缓存,以提升推理速度。开发者可通过命令行(mlx-serve run、pull、serve)或 MLX Core 应用来管理模型下载与本地启动。它还能通过 Bonjour 协议与其他 Mac 共享模型,实现局域网上的模型复用。

  1. macOS 开发者(Apple Silicon)希望在本地运行 LLM 并用于 coding agent(如 Claude Code、Cursor)而无需云端依赖。
  2. 研究者和数据科学家需要在不联网的环境下测试多种 MLX 和 GGUF 模型,并借助其低内存占用和媒体生成功能进行快速原型构建。
  3. 内容创作者希望利用本地图像、视频、语音和音乐生成能力进行离线创作,同时保留对模型输出的完整控制。
  4. 团队希望在其 Mac 工作站上共享同一套本地模型,避免每个成员重复下载,降低网络与存储压力。
  5. 使用 Ollama 生态的用户(如 Obsidian 或 Raycast 扩展)希望无缝切换到更快且兼容的引擎,而无需修改现有工作流。

这个 Agent 有哪些优点和局限?

优点
  • 原生支持 MLX 并嵌入 llama.cpp,可同时运行大量 MLX 和 GGUF 模型,且无需 Python 运行时。
  • 同时提供 OpenAI、Anthropic 与 Ollama 兼容 API,兼容多种现有工具链。
  • 针对 Apple Silicon 优化的解码速度表现(基准测试中,同等 MLX 权重下比 LM Studio 平均快 26%)。
  • 集成了推测解码、KV 缓存量化、连续批处理等优化,并提供清晰基准测试。
  • 内置图像、视频、音乐、语音克隆和 3D 生成能力,功能集中。
局限
  • 严格限定于 Apple Silicon 和 macOS 26.2+,不适用于其他操作系统或芯片。
  • 项目仍处于活跃开发阶段,涉及大量复杂功能,使用前需要了解一定的命令行或配置知识。
  • 高级功能需要支持特定的芯片和充足内存,例如运行大模型可能需要几十 GB RAM。
  • 虽然扩展了多种媒体生成,但其质量和性能尚未与业界专业工具进行公开基准对比。
  • 尽管核心引擎采用 MIT 许可,但部分第三方组件(如同 JIT)基于 Apache-2.0,需要用户确保合规性。

如何安装或部署这个 Agent?

需要 macOS 26.2+ 且为 Apple Silicon。推荐通过 Homebrew 安装 cask:brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve 然后 brew install --cask mlx-core(应用)或 brew install mlx-serve(CLI)。也可以手动下载并打开已签名的不透明 MLX Core.app 文件。

如何使用这个 Agent?

打开 MLX Core 应用并从模型浏览器中选择一个模型下载,随后应用会自动在 http://localhost:11234 启动服务器。在终端中,运行 'mlx-serve run gemma4' 即可下载并启动 Gemma 4 E4B,并在同一命令行下进行交互式聊天。要将 Claude Code 指向该服务,使用 'mlx-serve launch claude-code' 或手动设置环境变量(如 ANTHROPIC_BASE_URL)。对于支持 OpenAI API 的工具,只需将 base URL 配置为 'http://localhost:11234'。

这个 Agent 与同类方案有什么区别?

在速度对比方面,参考与 LM Studio、Ollama、mlx-lm 等的性能对比。使用基准相同权重时,MLX 解码速度比 LM Studio 快 26%。Ollama 无法原生运行 MLX 模型,而 LM Studio 仅部分支持 Anthropic API,且两者都缺少媒体生成和内置代理模式。

常见问题

mlx-serve 是否为免费软件?
是,核心引擎采用 MIT 许可证,同时保留第三方组件(如 Apache-2.0)的许可。应用接受赞助用于购买更强的测试机,但不限制任何功能。
我可以使用它替代 Ollama 吗?
可以,它实现了 Ollama API(/api/chat 等),因此现有的 Ollama 客户端(如 Raycast、Open WebUI)只需调整端点即可使用。
它需要 GPU 吗?
它针对 Apple Silicon 的 GPU(Metal)进行了优化,要求使用 M 系列芯片,但不适用于 Intel Mac 或 AMD 等外部 GPU。
运行模型所需的存储空间如何?
模型大小取决于你选择的模型,例如 Gemma 4 E4B 大约需要 4 GB,而 DeepSeek V4 Flash 则可能占用数十 GB。工具会管理存储并支持断点续传。

对比同类 Agent

用同一套 FARS 评审,横向比较这个 Agent 所属的短名单。

相关 Agents