oMLX icon

oMLX

oMLX 是一款基於 MLX 的原生 macOS 推論伺服器,專為 Apple Silicon Mac 上執行本地模型而設,支援 SSD 快取、持續批次處理,以及相容 OpenAI/Anthropic 的端點,適用於 Claude Code、OpenClaw、Cursor 等工具。

oMLX

oMLX 的功能

oMLX 是一款基於 MLX 的原生 macOS 推論伺服器,供 Apple Silicon Mac 上的本地 LLM 使用。它專為減少編碼代理在工作階段中因上下文失效而反覆重新計算所造成的負擔而設計。

它的主要差異化功能是分頁式 SSD KV 快取,會將快取區塊持久化到磁碟上,使先前使用過的前綴能在不同請求之間快速還原,甚至在伺服器重新啟動後也可以恢復。產品同時加入持續批次處理、多模型服務,以及相容 OpenAI 與 Anthropic 的 API,供本地工具與用戶端使用。

核心功能

分頁式 SSD KV 快取

oMLX 會將 KV 快取區塊以 safetensors 格式儲存在 SSD 上,而不是全部只保留在 RAM 中。熱區塊會留在記憶體中,冷區塊會移到磁碟,先前看過的前綴可在不同請求之間,甚至在伺服器重新啟動後重新載入。

持續批次處理

伺服器透過 mlx-lm 的 BatchGenerator 處理並行請求,因此多個生成工作不必排在單一請求後方等待。首頁聲稱在 8 倍並發下最高可達 4.14× 的加速。

原生 macOS 應用程式與儀表板

oMLX 內建原生 macOS 選單列應用程式,可用來啟動、停止與監控伺服器。搭配的儀表板支援模型管理、聊天與即時指標,而且應用程式經過簽署、公證,並可自動更新。

多模型服務

儀表板可同時提供多種模型類型,包括 LLM、VLM、embedding 與 reranker。它也支援在記憶體不足時進行 LRU 淘汰,以及從介面瀏覽/下載模型。

即插即用的 API 相容性

oMLX 提供相容 OpenAI 與相容 Anthropic 的 API,包括 /v1/chat/completions 和 /v1/messages。網站表示它可以作為 Claude Code、OpenClaw、Cursor 及其他相容 OpenAI 用戶端的即插即用後端。

工具呼叫與 MCP 支援

產品支援多種主要工具呼叫格式,例如 JSON、Qwen、Gemma、GLM 和 MiniMax,並支援 MCP 整合,以及可設定的工具結果裁剪,用於過大的輸出。

oMLX 的實際使用方式

  • 為具有反覆上下文變動的編碼代理提供服務

    將 oMLX 作為會反覆回到先前上下文的編碼助理之本地後端。SSD 支援的快取旨在保留並還原先前前綴,而不是在代理修正路徑時每次都重新計算。

  • 將既有開發工具連接到本地模型伺服器

    透過即插即用的 API 支援,將 Claude Code、OpenClaw 或 Cursor 連接到本地 macOS 推論伺服器。網站表示,儀表板可以為每個工具產生 دقیق的設定指令。

  • 在一台 Mac 上整合多個本地模型

    在同一台機器上提供多種模型類型,例如用於聊天的 LLM、用於影像感知工作的 VLM,以及用於檢索任務的 embedding 或 reranker 模型。儀表板可讓你在同一處瀏覽、下載與管理模型。

  • 透過原生 macOS 介面操作本地推論

    使用選單列應用程式與網頁儀表板來啟動伺服器、監控狀態並查看即時指標,而不必切換到另一個桌面應用程式。這對希望本地推論在工作時持續可用的人很有幫助。

  • 重用既有的本地模型快取

    重用 Hugging Face 快取資料夾或 LM Studio 目錄中已存在的模型,然後在本地提供服務,而不需要再次下載。這使得 oMLX 很適合已經在磁碟上保有本地模型庫的使用者。

Pros and Cons

Pros

  • 將 KV 快取區塊持久化到 SSD,有助於在長時間編碼工作階段中前綴重複出現時避免完整重新計算。
  • 同時支援相容 OpenAI 與相容 Anthropic 的端點,讓既有用戶端更容易連接。
  • 可重用標準 Hugging Face 快取位置與 LM Studio 資料夾,減少重複下載與重複儲存。
  • 以經過簽署、公證的原生 macOS 應用程式形式執行,提供選單列介面、網頁儀表板與自動更新。
  • 透過持續批次處理支援並行請求,且首頁公布了批次加速表現。

Cons

  • 產品僅限於 Apple Silicon 與 macOS 15+,因此不是跨平台伺服器。
  • 來源建議為了舒適地使用較大型模型,需 64GB 以上 RAM,因此記憶體較小的 Mac 在重度工作負載下可能不太實用。
  • 最強的效能聲稱展示於 M3 Ultra 512GB 系統上,這可能無法反映在較弱硬體上的結果。

FAQ

oMLX 是用來做什麼的?

oMLX 是一款基於 MLX 的原生 macOS 推論伺服器。它提供相容 OpenAI 與 Anthropic 的端點,讓 Claude Code、OpenClaw 和 Cursor 等工具可以連線到本地後端。

oMLX 需要什麼硬體?

來源指出 oMLX 支援執行 macOS 15+ 的 Apple Silicon Mac。最低記憶體需求為 16GB,而若要更舒適地使用較大的模型,建議 64GB 以上。

我可以將 oMLX 與 Claude Code、OpenClaw 或 Cursor 一起使用嗎?

可以。首頁說 oMLX 可作為 Claude Code、OpenClaw 和 Cursor 的即插即用後端,也能搭配任何在 localhost:8000 上支援 OpenAI 相容的用戶端使用。

我需要重新下載模型嗎?

不需要。FAQ 表示 oMLX 會讀取標準 Hugging Face 快取,因此已在共用快取位置下載的模型可以重複使用,不必重新下載。它也可以辨識 LM Studio 資料夾與自訂目錄。

支援哪些類型的模型?

網站表示支援任何 HuggingFace 的 MLX 格式模型,包括 LLM、VLM、embedding 與 reranker 模型,並可自動處理數種推理模型格式。

Quick Facts

類別
開發工具
平台
Apple Silicon Macs,macOS 15+
核心工作流程
具 SSD 快取 KV 與持續批次處理的本地 LLM 推論
API 相容性
相容 OpenAI 與相容 Anthropic 的端點
來源網域
omlx.ai
授權
Apache 2.0