模型 / 資料集
raullenchai/Rapid-MLX avatar
raullenchai/Rapid-MLX

Rapid-MLX:在 Apple Silicon 上把本機推論包成 OpenAI 相容端點

The fastest local AI engine for Apple Silicon. 4.2x faster than Ollama, 0.08s cached TTFT, 100% tool calling. 17 tool parsers, prompt cache, reasoning separation, cloud routing. Drop-in OpenAI replacement. Works with Claude Code, Cursor, Aider.

3,752 個 Star415 個 ForkPythonNOASSERTION

秒懂

它是什麼?
Rapid-MLX 是一套針對 M 系列 Mac 的推論引擎,主打 OpenAI 與 Anthropic 相容 API、工具呼叫解析與提示快取。它解決的是「本機模型接不進既有 agent 工具鏈」這件事,但它的適用範圍被硬體與平台牢牢框住。
適合誰用?
如果你的開發機是 M 系列 Mac,而且你用的 agent 用戶端只認 OpenAI 或 Anthropic 端點,Rapid-MLX 值得裝起來試,因為它把「本機模型」與「既有工具鏈」之間那層轉接工作直接吃掉了。若你在 Linux、Windows 或 CUDA 機器上工作,這個專案對你沒有用,它的安裝路徑只有 Homebrew、安裝腳本與 PyPI,而且 README 明說 Windows 與 Linux 桌面版尚未提供。
可以商用嗎?
請先確認。這個儲存庫使用的授權不在我們自動分類的範圍內,商用前請閱讀儲存庫中的 LICENSE 檔案。
還在維護嗎?
有在維護。儲存庫在最近一天內有新的提交。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

它要解決的是轉接問題,不是模型問題

在本機跑模型這件事本身已經不難,難的是讓 Claude Code、Cursor、Aider 這類工具願意把請求送過去。這些用戶端大多只認兩種介面:OpenAI 的 /v1/chat/completions,或 Anthropic 的 messages 端點。於是多數人卡在同一段重複勞動上:自己寫一層 FastAPI 轉接、自己處理串流格式、自己在模型吐出的文字裡撈工具呼叫。Rapid-MLX 把這段做成產品,README 的定位句是「Drop-in OpenAI / Anthropic API」,並列出 Codex CLI、Claude Code、OpenCode、Qwen Code、OpenHands、Hermes Agent、Aider、Kilo Code、DeepSeek Harness、GitHub Copilot、Factory Droid、Kimi Code、LangChain、PydanticAI、smolagents 等一串用戶端。目標讀者很清楚:手上已經有 agent 工作流、只是想把後端從雲端換成本機的開發者。它不打算說服你放棄雲端模型,只打算讓切換成本降到改一個 base URL。

工具呼叫解析器是這個專案真正的工程量

README 標題列裡有一項容易被忽略的數字:17 tool parsers。這比任何吞吐量數字都更能說明專案把力氣花在哪。不同開源模型輸出工具呼叫的格式並不統一,有的走模型自家的特殊 token,有的混在一般文字裡,有的用 JSON 區塊。用戶端要的是結構化的 tool_calls 欄位,中間這段落差只能靠針對每個模型家族各寫一個解析器來補。Rapid-MLX 選擇把這件事做進引擎,而不是丟給使用者。同一個標題列還提到 reasoning separation,意思是把模型的思考段落與最終回答分開處理,避免思考內容污染回傳給用戶端的答案。prompt cache 對應的是快取命中時的 TTFT,README 用「0.08s cached TTFT」描述這個情境,注意它限定在快取命中。至於「4.2x faster than Ollama」與「up to 3× Ollama's throughput」,README 把後者標註為 measured 並連到自家部落格上的 benchmark 頁面。這類由專案方自行發布的比較數字,我沒有獨立驗證,讀者也不該把它當成中性量測。

安裝路徑只有三條,而且都綁在 macOS

CLI 與伺服器的安裝方式在 README 裡寫得很直接。Homebrew 路線是 brew install rapid-mlx,README 註明這是來自 homebrew-core 的 prebuilt bottle。另一條是引導式安裝腳本:curl -fsSL https://rapidmlx.com/install.sh | bash,它會偵測 RAM 並推薦入門模型。兩者裝的是同一個 rapid-mlx CLI。README 另外提到可以用 uv 或 pip,並建議想先檢查腳本內容的人去看 alternative install methods 與 SECURITY.md,這個提醒在 curl 管線進 bash 的場合是合理的。引導式安裝的模型選擇邏輯值得記下來:它優先使用這台 Mac 上已經快取、且符合 RAM 分級的模型;否則首次對話會下載 lfm2.5-1b-4bit(低於 16 GB)或 qwen3.5-4b-4bit(16 GB 以上)。想要更好的品質,得透過 rapid-mlx recipe 與模型選擇器手動挑。桌面版是另一條路,從 rapidmlx.com/desktop 下載,簽章版本放在 GitHub releases,查詢字串是 rapid-mac-v。

平台邊界寫得很明白,不要自己想像

這個專案的限制不是藏在細節裡,而是直接寫在 README 上:桌面版需要 M 系列 Mac,Windows 與 Linux 桌面版尚未提供。CLI 與伺服器同樣掛在 macOS (Apple Silicon) 標題下。這代表如果你的團隊有 Linux 開發機、CI runner 或 CUDA 伺服器,Rapid-MLX 不是一個可以橫向部署的選項,它只覆蓋你手上那台 Mac。第二個限制是記憶體分級決定模型選擇:引導式安裝在 16 GB 以下只給 1B 等級的模型,這個規模的模型在複雜 agent 任務上的可靠性本來就有限,工具呼叫解析器寫得再好也補不回模型本身的能力。第三個是授權狀態。README 的 badge 顯示 Apache 2.0,但倉庫的授權標記是 NOASSERTION,兩者不一致。這不代表有問題,但代表在把它放進公司流程之前,應該直接讀 LICENSE 檔案的原文,而不是看 badge。我不提供法律意見,只指出這個不一致存在。

與 Ollama 的差別在介面層,不在模型層

最直接的替代品是 Ollama。兩者都跑本機模型、都提供本機端點,差別在設計重心。Ollama 的介面是自家的 API,社群再另外寫相容層去接 OpenAI 格式;Rapid-MLX 反過來,把 OpenAI 與 Anthropic 相容當成第一等公民,README 的說法是「If a client accepts an OpenAI- or Anthropic-compatible endpoint, it can usually use Rapid-MLX without an adapter」。這個差異在實際使用上會放大:當你要接的是 Claude Code 這種吃 Anthropic 格式的工具,或 Aider 這種對工具呼叫格式敏感的用戶端,Rapid-MLX 那 17 個解析器與 reasoning separation 就是直接省下來的工作。反過來說,如果你的需求只是偶爾在終端機問模型幾個問題,這些工程對你沒有價值,Ollama 的模型庫與跨平台支援反而更實用。選哪個取決於你要接的是工具鏈還是只想聊天。

維護成本與版本節奏

從材料看,這個專案的釋出節奏相當密。最近的版本是 v0.13.4(2026-09-03),同時發布了 rapid-mac-v0.13.4 這個桌面版標籤,前一個 v0.13.3 在兩天前。最後一次推送時間是 2026-09-09。這種密度意味著兩件事:上游在積極推進,以及你如果跟版,會需要處理相對頻繁的升級。對本機推論工具來說,升級通常牽涉重新驗證你依賴的那個工具解析器是否還正常,因為模型輸出格式與解析邏輯是綁在一起的。README 提到有五個 Tier-1 agent 在發布前會用真實權重做端到端測試,並連到一份 tested compatibility matrix 說明各 API 的覆蓋狀況與設定狀態。那份矩陣是你升級前該看的東西,因為它比 README 的用戶端 logo 牆具體。

什麼情況下該直接跳過

有幾種情況不必浪費時間評估。你的機器不是 Apple Silicon,跳過。你的團隊需要把推論服務部署在共享伺服器上給多人用,跳過,這個專案的安裝與桌面路徑都是單機 Mac 導向。你需要的是能跑滿大型模型的吞吐量,先確認你的統一記憶體夠不夠,因為引導式安裝在 16 GB 以下只會給你 1B 等級的模型。你依賴的工具呼叫格式不在它支援的 17 個解析器裡,先去看 compatibility matrix 再決定,因為解析器不支援就等於工具呼叫不會動。最後,如果你的採用流程需要明確的授權結論,LICENSE 檔案與 NOASSERTION 標記之間的落差必須先釐清,這是採購與法務流程上的前置條件,不是技術問題。

編輯結論

如果你的開發機是 M 系列 Mac,而且你用的 agent 用戶端只認 OpenAI 或 Anthropic 端點,Rapid-MLX 值得裝起來試,因為它把「本機模型」與「既有工具鏈」之間那層轉接工作直接吃掉了。若你在 Linux、Windows 或 CUDA 機器上工作,這個專案對你沒有用,它的安裝路徑只有 Homebrew、安裝腳本與 PyPI,而且 README 明說 Windows 與 Linux 桌面版尚未提供。採用前先確認三件事:LICENSE 檔案的實際內容與倉庫標記的 NOASSERTION 是否一致、你要用的模型是否落在該 RAM 分級的建議清單內、以及你依賴的那個工具解析器是否在它列出的 17 個之中。這三項沒確認完,其餘的效能說法都不必先看。

官方來源

  1. Issues
  2. Project website
  3. raullenchai/Rapid-MLX on GitHub
  4. README
  5. Releases
社群筆記

社群筆記