模型 / 資料集
lemonade-sdk/lemonade avatar
lemonade-sdk/lemonade

Lemonade 評測:把 Ryzen AI 與 Radeon 的 NPU 包成 OpenAI 相容端點

Lemonade helps users discover and run local AI apps by serving optimized LLMs right from their own GPUs and NPUs. Join our discord: https://discord.gg/5xXzkMu8Zk

5,721 個 Star501 個 ForkC++Apache-2.0

秒懂

它是什麼?
Lemonade 是一套以 C++ 撰寫的本地推論伺服器,主打在 AMD 的 NPU 與 GPU 上跑量化 LLM,並對外提供 OpenAI、Anthropic、Ollama 三種 API 介面。它的價值不在模型本身,而在把 Ryzen AI、Radeon、Strix Halo 這些硬體差異收斂成一個端點。
適合誰用?
如果你的機器是 Ryzen AI、Radeon 或 Strix Halo,而且你希望既有工具鏈(Open WebUI、n8n、Claude Code、AnythingLLM)不必改一行程式就能接上本地模型,Lemonade 值得先裝來驗證。若你跑的是 NVIDIA 或純 CPU 環境,或者你需要跨節點的多使用者排程與模型並行,這個專案目前的定位不是為你設計的。
可以商用嗎?
可以。Apache-2.0 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫在最近一天內有新的提交。
用什麼語言寫的?
主要是 C++(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

它解決的是硬體碎片,不是模型匱乏

本地跑 LLM 的門檻早就不是「找不到模型」,而是「同一份模型在每台機器上要換一套後端」。CUDA 有 llama.cpp 與 vLLM,Apple Silicon 有 MLX,到了 AMD 就變成 ROCm、Vulkan、ONNX Runtime 與 NPU 驅動各走各的路。Lemonade 的定位就是把這段收斂掉:README 把它描述為「the local AI server that gives you the same capabilities as cloud APIs」,並強調由 AMD 工程師針對 Ryzen AI、Radeon、Strix Halo 做最佳化。

它的目標讀者有兩類。第一類是手上已經有 AMD 筆電或桌機、想把本地模型接進既有工作流的開發者,因為 Lemonade 同時提供 OpenAI、Anthropic、Ollama 三種 API 格式,應用端通常不需要改寫呼叫邏輯。第二類是把 AI 功能包進自己產品的人:專案另外提供 Embeddable Lemonade,README 稱它是一個可攜式 binary,能依使用者 PC 的硬體自動調整。第一類是現在就能受益的,第二類要看你的發佈流程能不能接受多帶一份推論執行檔。

三種 API 介面與模型庫,是它真正的黏著層

從 README 能確認的架構有兩個層次。對外,Lemonade Server 以服務形式安裝,同時吐出 OpenAI、Anthropic、Ollama 三種 API;這意味著像 Open WebUI、AnythingLLM、n8n、Claude Code、GitHub Copilot 這類已經支援其中任一種格式的應用,只要把 base URL 指過來即可。專案把這批整合整理成 marketplace 清單,README 也直接寫明「Want your app featured here? Just submit a marketplace PR!」,代表這份清單是社群維護、可外部提交的。

對內,是 Model Manager 與內建的 chat、image gen、speech gen 介面。README 的 Getting Started 把流程拆成安裝、取得模型、生成、連線四步,模型是透過 Model Manager 瀏覽與下載,而不是要你自己去 Hugging Face 抓 GGUF 再手動放到某個目錄。這個設計的實際影響是:模型清單由專案維護,你換模型的自由度取決於清單涵蓋範圍。

值得注意的是 repo 的 topics 同時列出 onnxruntime、rocm、vulkan、npu,這表示後端不只一條路徑,而是依硬體挑選。至於什麼情況下選哪一條,README 與提供的材料沒有說明,這部分需要查官方文件才能確定。它同時掛了 mcp 與 mcp-server 這兩個 topic,但提供的材料沒有交代 MCP 在架構中的位置,我不會替它補上推測。

安裝路徑與平台覆蓋範圍

README 提供的安裝入口分得很細,Windows 直接指向 lemonade.msi,Linux 與 macOS 走各自的下載頁,另外有 Docker 映像與從原始碼建置的 getting-started 文件。Linux 這邊的支援平台表列了 Arch Linux 與 Debian Trixie 以後的版本,並各自附上 GitHub Actions 的建置狀態徽章,代表這兩個發行版有 CI 在建。

這裡有個容易被忽略的細節:Debian 標的是 Trixie 以上。如果你的環境還停在 Bookworm,依照這份表格並不在支援範圍內,硬裝的結果不在專案承諾之內。Arch 與 Debian 之外的發行版,README 的表格沒有列出,我不會替它宣稱支援。

從原始碼建置的路徑放在 docs/dev/getting-started.md,貢獻指南在 docs/dev/contribute.md。要提醒的是,這兩個檔案的路徑是 README 給的,我沒有實際開啟,內容深度無法確認。若你的計畫是從原始碼編譯而非用安裝檔,建議先讀這兩份文件再評估編譯依賴,因為 C++ 專案在 AMD 堆疊上的建置依賴通常不會只有編譯器。

Embeddable 版本與 Server 版本是兩種不同的維護負擔

README 把兩種形態講得很清楚:Lemonade Server 是安裝成服務、供本機或區網內應用連線;Embeddable Lemonade 是可攜式 binary,讓你包進自己的應用,替使用者的 PC 提供多模態本地 AI。

這兩條路的成本結構完全不同。用 Server,你繼承的是服務的生命週期:安裝、更新、連接埠、模型下載都交給 Lemonade 處理。用 Embeddable,你繼承的是發佈與相容性:你得跟著它的 release 走,並承擔使用者機器上 NPU 驅動版本不一致的風險。README 沒有交代 Embeddable 的 ABI 穩定性或版本綁定策略,這是評估嵌入前必須先問清楚的事。

版本節奏也值得看一眼。提供的 release 資料顯示 v11.8.0、v11.8.1、v11.9.0 分別落在 2026 年 8 月 26 日、8 月 28 日與 9 月 2 日,兩週內三個版本。這種密度對想跟上 AMD 新硬體的人是好事,對需要凍結版本的產品團隊則意味著你得自己挑一個版本鎖住,並且在升級前確認模型庫與 API 行為沒有變動。專案沒有提供 LTS 分支的資訊,材料中也看不到長期支援承諾。

什麼情況下它會讓你失望

第一個限制寫在 README 自己身上:這個專案「built by the community for every PC, with optimizations by AMD engineers」,最佳化的重心明確落在 Ryzen AI、Radeon、Strix Halo。如果你的推論機器是 NVIDIA 顯卡,這條最佳化路徑對你沒有意義,你得到的只是一個額外的服務層,而你原本用 vLLM 或 llama.cpp 可能更直接。

第二個限制是模型選擇權。模型透過 Model Manager 取得,代表你在清單內挑,而不是任意權重都能丟進去。新模型從釋出到進到清單之間有時間差,這段時間你就是等。

第三個是規模。README 描述的是「your own GPUs and NPUs」與「your user's PC」,整個敘事是單機、個人或桌機情境。材料中沒有任何關於多節點、多使用者併發排程或模型並行的敘述。如果你的需求是十幾個人共用一台推論機,這個專案的設計意圖跟你的需求不在同一條線上,硬套會遇到資源排程與佇列管理的空白。

第四個是硬體相依的失敗模式。NPU 路徑依賴驅動,驅動版本不對時的行為,材料中沒有說明。這類問題通常不會在安裝階段就炸開,而是在載入模型時才出現,除錯成本不低。

與 Ollama 的差異:API 相容,但重心不同

最直接的對照是 Ollama。兩者都提供本地模型服務,Lemonade 甚至直接支援 Ollama API,這代表它並不排斥被當成 Ollama 的替身使用。差別在重心。

Ollama 的模型庫與 CLI 體驗是它的核心,硬體支援以通用性為主,Mac 與 NVIDIA 是主戰場。Lemonade 把力氣放在 AMD 的加速路徑上,包含 NPU 這條 Ollama 不在架構敘事裡的路。所以選擇的判準不是「哪個功能多」,而是你的硬體是哪一種。

另一個差異是介面廣度。Lemonade 同時提供 OpenAI 與 Anthropic 兩種格式,README 的 marketplace 清單裡直接列了 Claude Code 與 GitHub Copilot 這類以 Anthropic 或 OpenAI 格式為主的工具。Ollama 原生是自家 API,其他格式靠相容層。如果你的既有工具吃 Anthropic 格式,Lemonade 少一層轉接。

反過來說,如果你的機器不是 AMD,或你已經有一套跑得很順的 Ollama 工作流,換過來得到的邊際效益有限,還要付出重新下載模型與重新驗證相容性的成本。

編輯結論

如果你的機器是 Ryzen AI、Radeon 或 Strix Halo,而且你希望既有工具鏈(Open WebUI、n8n、Claude Code、AnythingLLM)不必改一行程式就能接上本地模型,Lemonade 值得先裝來驗證。若你跑的是 NVIDIA 或純 CPU 環境,或者你需要跨節點的多使用者排程與模型並行,這個專案目前的定位不是為你設計的。動手前先確認三件事:你的 NPU 驅動是否已被支援平台清單涵蓋、你要的模型是否在 Model Manager 的模型庫裡、以及你要接的應用是否在 marketplace 清單中。這三項都能在官方文件查到,查不到就別假設它會動。

官方來源

  1. lemonade-sdk/lemonade on GitHub
  2. License: Apache-2.0
  3. Project website
  4. README
  5. Releases
社群筆記

社群筆記