oMLX icon

oMLX

oMLX 是一款基于 MLX 的原生 macOS 推理服务器,适用于 Apple Silicon Mac 本地运行模型。支持 SSD 缓存 KV、连续批处理,并兼容 OpenAI 和 Anthropic 端点,可用于 Claude Code、OpenClaw、Cursor 等工具。

oMLX

oMLX 的功能

oMLX 是一款适用于 Apple Silicon Mac 本地 LLM 使用的原生 macOS 推理服务器。它基于 MLX 构建,旨在减少编码代理在会话中使上下文失效时反复重新计算的开销。

它的主要差异化在于分页式 SSD KV 缓存:该功能将缓存块持久化到磁盘,因此之前使用过的前缀可以在多个请求之间,甚至在服务器重启后快速恢复。该产品还加入了连续批处理、多模型服务,以及兼容 OpenAI 和 Anthropic 的 API,供本地工具和客户端使用。

核心能力

分页式 SSD KV 缓存

oMLX 会将 KV 缓存块以 safetensors 格式存储到 SSD 上,而不是只保留在 RAM 中。热块保留在内存里,冷块移到磁盘上,之前见过的前缀可在请求之间以及服务器重启后恢复。

连续批处理

服务器通过 mlx-lm 的 BatchGenerator 处理并发请求,因此多个生成任务不必在单个请求后排队等待。主页显示在 8× 并发下最高可达 4.14× 的加速。

原生 macOS 应用和仪表板

oMLX 包含一个原生 macOS 菜单栏应用,用于启动、停止和监控服务器。配套仪表板支持模型管理、聊天和实时指标,而且应用经过签名、公证并支持自动更新。

多模型服务

仪表板可同时提供多种模型类型,包括 LLM、VLM、embedding 和 reranker。它还支持在内存紧张时进行 LRU 淘汰,并可通过界面浏览和下载模型。

即插即用 API 兼容性

oMLX 同时提供兼容 OpenAI 和兼容 Anthropic 的 API,包括 /v1/chat/completions 和 /v1/messages。网站称它可作为 Claude Code、OpenClaw、Cursor 以及其他 OpenAI 兼容客户端的即插即用后端。

工具调用与 MCP 支持

该产品支持 JSON、Qwen、Gemma、GLM 和 MiniMax 等主流工具调用格式,还支持 MCP 集成,以及针对过大输出的可配置工具结果裁剪。

oMLX 的实际使用方式

  • 运行具有反复上下文切换的编码代理

    将 oMLX 用作会反复回到早期上下文的编码助手的本地后端。SSD 支持的缓存旨在保留并恢复先前的前缀,而不是在代理每次调整路径时都重新计算。

  • 将现有开发工具接入本地模型服务器

    利用即插即用的 API 支持,将 Claude Code、OpenClaw 或 Cursor 连接到本地 macOS 推理服务器。网站称仪表板可以为每个工具生成精确的配置命令。

  • 在一台 Mac 上整合多个本地模型

    在同一台机器上同时提供多种模型类型,例如用于聊天的 LLM、用于图像感知工作的 VLM,以及用于检索任务的 embedding 或 reranker 模型。仪表板让你可以在一个地方浏览、下载和管理模型。

  • 通过原生 macOS 界面管理本地推理

    使用菜单栏应用和网页仪表板启动服务器、监控状态并查看实时指标,而无需切换到单独的桌面应用。对于希望本地推理在工作期间始终可用的用户来说,这很有用。

  • 复用已有的本地模型缓存

    复用 Hugging Face 缓存文件夹或 LM Studio 目录中已存在的模型,然后在本地提供服务,无需再次下载。这使 oMLX 适合那些已经在磁盘上维护本地模型库的用户。

Pros and Cons

Pros

  • 将 KV 缓存块持久化到 SSD,有助于在长时间编码会话中前缀重复出现时避免完全重新计算。
  • 同时支持兼容 OpenAI 和兼容 Anthropic 的端点,更容易连接现有客户端。
  • 可复用标准 Hugging Face 缓存位置和 LM Studio 文件夹,从而减少重复下载和重复存储。
  • 作为经过签名、公证的原生 macOS 应用运行,提供菜单栏界面、网页仪表板和自动更新。
  • 通过连续批处理支持并发请求,主页还公布了批处理加速数据。

Cons

  • 该产品仅限于 Apple Silicon 和 macOS 15+,因此不是跨平台服务器。
  • 来源建议在使用更大模型时配备 64GB 以上内存会更舒适,因此内存较小的 Mac 在重负载下可能不太实用。
  • 最强的性能说法展示在 M3 Ultra 512GB 系统上,这可能无法代表性能较弱硬件上的结果。

FAQ

oMLX 用于什么?

oMLX 是一款基于 MLX 的原生 macOS 推理服务器。它提供兼容 OpenAI 和 Anthropic 的端点,因此 Claude Code、OpenClaw 和 Cursor 等工具可以连接到本地后端。

oMLX 需要什么硬件?

源文表示 oMLX 支持运行 macOS 15+ 的 Apple Silicon Mac。最低内存为 16GB,但为了更舒适地使用更大的模型,建议使用 64GB 或更高内存。

我可以将 oMLX 与 Claude Code、OpenClaw 或 Cursor 一起使用吗?

可以。主页说明 oMLX 可作为 Claude Code、OpenClaw 和 Cursor 的即插即用后端,也可与任何使用 localhost:8000 的 OpenAI 兼容客户端配合使用。

我需要重新下载模型吗?

不需要。FAQ 说明 oMLX 会读取标准的 Hugging Face 缓存,因此已经下载到共享缓存位置的模型可以直接复用,无需重新下载。它也可以识别 LM Studio 文件夹和自定义目录。

支持哪些类型的模型?

网站说明支持来自 HuggingFace 的任何 MLX 格式模型,包括 LLM、VLM、embedding 和 reranker 模型,并会自动处理若干推理模型格式。

Quick Facts

类别
开发者工具
平台
Apple Silicon Macs,macOS 15+
核心工作流
使用 SSD 支持的 KV 缓存和连续批处理进行本地 LLM 推理
API 兼容性
兼容 OpenAI 和 Anthropic 的端点
源域名
omlx.ai
许可证
Apache 2.0