開源專案
antirez/ds4 avatar
antirez/ds4

DwarfStar:一個聚焦的本地推理引擎,用於 DeepSeek V4 與 GLM 5.2

適用於 Metal、CUDA 和 ROCm 的 DeepSeek 4 Flash 和 PRO 本地推理引擎。

22,421 個 Star2,125 個 ForkCMIT
GitHub

秒懂

它是什麼?
一個以 C 撰寫的推理引擎,針對 Metal、CUDA 與 ROCm 上的特定 DeepSeek 與 GLM 模型,支援 SSD 串流與分散式模式。
適合誰用?
README 沒有提供生產環境使用者清單、安全稽核,或除其發布的具體基準之外的任何效能聲明。它指出軟體處於 beta 品質,可能出現不穩定。
可以商用嗎?
可以。MIT 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 1 天前。
用什麼語言寫的?
主要是 C(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月15日)與我們的分析,不構成法律意見。

開源專案深度解析

DwarfStar 是什麼

DwarfStar 是一個以 C 撰寫的小型原生推理引擎,首先針對 DeepSeek V4 Flash 最佳化。它也支援 GLM 5.2,在記憶體非常高的機器上支援 DeepSeek V4 PRO。README 將其描述為刻意狹窄,而不是通用的 GGUF 執行器:模型載入、提示渲染、工具呼叫、KV 狀態、HTTP 伺服器與編碼代理是共同建置與測試的。支援的後端包括 Metal(主要目標,適用於 96 GB 或更高記憶體的 Mac)、NVIDIA CUDA(包括多 GPU 系統與 DGX Spark),以及 ROCm(適用於 Strix Halo 系統,如 Framework Desktop)。專案承認 llama.cpp 與 GGML 是它的重要參考,並保留了一些來自它們的原始碼片段,依據 MIT 授權。

驗收 DwarfStar 時,先依 README 的模型與硬體條件選定 DeepSeek V4 Flash GGUF,在 `ds4-bench`、`ds4-eval` 和 `QA_BEFORE_RELEASES.md` 指定的路徑留下輸出。若測 SSD 串流,記錄 `--ssd-streaming-cache-experts`;若測多機,檢查 TCP 網路是否受信任,並把自報吞吐量與自己的 token 結果分開。 第 1 次檢查應保留實際輸入、輸出與錯誤訊息,讓這個專案的限制能和文件中的能力逐項對照。

模型支援與量化選擇

該引擎僅適用於 README 中列出的 DeepSeek V4 與 GLM 5.2 的 GGUF 檔案。任意的 GGUF 檔案不會具有引擎期望的張量佈局、量化混合、中繼資料或可選的 MTP 狀態。根據 README,提供的 2 位元量化被驗證為高品質:它們表現良好,能在編碼代理下工作,並可靠地呼叫工具。2 位元量化使用不對稱方案,僅量化路由的 MoE 專家,up/gate 使用 IQ2_XXS,down 使用 Q2_K,而其他元件如共享專家、投影與路由保持不變。MXFP4 GGUF 保留了 DeepSeek 發布的路由專家權重,而不是重新量化,支援 Metal 與 CUDA,Blackwell CUDA 裝置使用原生 FP4 矩陣指令進行批次專家工作。GLM 5.2 支援僅限於經過測試的特定 GGUF 佈局,其他 GLM 量化佈局在被刻意新增並評分之前被視為不支援。

驗收 DwarfStar 時,先依 README 的模型與硬體條件選定 DeepSeek V4 Flash GGUF,在 `ds4-bench`、`ds4-eval` 和 `QA_BEFORE_RELEASES.md` 指定的路徑留下輸出。若測 SSD 串流,記錄 `--ssd-streaming-cache-experts`;若測多機,檢查 TCP 網路是否受信任,並把自報吞吐量與自己的 token 結果分開。 第 2 次檢查應保留實際輸入、輸出與錯誤訊息,讓這個專案的限制能和文件中的能力逐項對照。

開發狀態與專案方法

README 說明該軟體變化非常快,應視為 beta 品質。每次發布前都會執行大型 QA 執行,但仍可能出現不穩定。作者解釋,AI 輔助開發塑造了這個專案:它是在 GPT 5.5、5.6 與 Claude Fable 的強力協助下建構的,人類主導了想法、測試與除錯。README 說,如果你不喜歡 AI 開發的程式碼,這個軟體不適合你。專案也歸功於 llama.cpp 與 GGML;它不連結 GGML,但使用了那裡開發的核心、量化格式、GGUF 生態系統與工程知識。一些原始碼片段根據 MIT 授權被保留或改編,並且 GGML 作者的版權聲明保留在 LICENSE 檔案中。

驗收 DwarfStar 時,先依 README 的模型與硬體條件選定 DeepSeek V4 Flash GGUF,在 `ds4-bench`、`ds4-eval` 和 `QA_BEFORE_RELEASES.md` 指定的路徑留下輸出。若測 SSD 串流,記錄 `--ssd-streaming-cache-experts`;若測多機,檢查 TCP 網路是否受信任,並把自報吞吐量與自己的 token 結果分開。 第 3 次檢查應保留實際輸入、輸出與錯誤訊息,讓這個專案的限制能和文件中的能力逐項對照。

透過 SSD 串流執行大於記憶體的模型

正常的 Metal 路徑試圖讓模型駐留在 GPU 可定址記憶體中,這是最快的路徑。DwarfStar 在 Metal 上以及 GLM 5.2 在 ROCm 上也有 SSD 串流模式。在這種模式下,非路由模型權重保持駐留,而路由的 MoE 專家儲存在記憶體快取中,並在快取未命中時從 GGUF 檔案載入。README 指出,串流不如將完整模型裝入 RAM 快,但它很有用,因為路由專家主導了模型大小,而現代 Mac SSD 夠快,使快取未命中可以容忍。自動快取預算取後端建議工作集的 80%,減去非路由權重,然後套用路由預填充餘量。使用者也可以使用 --ssd-streaming-cache-experts NGB 明確設定路由專家快取。README 給出了 64GB 與 128GB MacBook 的範例,包含具體的下載與執行命令。

驗收 DwarfStar 時,先依 README 的模型與硬體條件選定 DeepSeek V4 Flash GGUF,在 `ds4-bench`、`ds4-eval` 和 `QA_BEFORE_RELEASES.md` 指定的路徑留下輸出。若測 SSD 串流,記錄 `--ssd-streaming-cache-experts`;若測多機,檢查 TCP 網路是否受信任,並把自報吞吐量與自己的 token 結果分開。 第 4 次檢查應保留實際輸入、輸出與錯誤訊息,讓這個專案的限制能和文件中的能力逐項對照。

使用管線平行進行分散式推理

管線平行讓 DwarfStar 能夠透過將變壓器層拆分到多台機器上,執行對單台機器來說太大的模型。README 的主要範例是在兩台 128 GB MacBook 上執行完整的 4 位元 Flash 量化:每個程序只對應自己的層切片,啟用透過 TCP 傳送,協調器保持正常的 CLI/API 行為。預填充可以透過同時在多個 GPU 上處理不同的微批次來加速,但生成嚴格是自迴歸的,每個 token 至少支付一次跨機器啟用跳轉,因此比單個本機程序慢。分散式協定使用控制與資料 TCP 連線,沒有加密或認證,尚未達到發布穩定;協調器與工作者應從同一提交建置,並在受信任的網路中使用。README 也提供了網路連結比較表,顯示 Thunderbolt 5、WiFi 與 Internet/VPN 的效能。

RDMA 張量並行和 CUDA 張量並行

基於 RDMA 的張量並行在兩台透過 Thunderbolt 5 電纜連接的 Mac 上執行單一解碼,將繁重的逐層工作拆分到兩個 GPU 之間,並在同步閘處交換部分和。兩台機器同時處理同一個 token,這減少了每 token 的延遲,而容納更大的模型。每台機器保留路由專家的一半連續部分,而稠密、注意力、共享專家、嵌入與輸出權重被複製。README 給出了在兩台 128 GB MacBook 上執行 GLM 5.2 的範例,包括用於 RDMA 的 sysctl 與 ifconfig 設定,並報告了測量的解碼與預填充速度。在單台伺服器上,CUDA 張量並行模式使用 --cuda-tensor-parallel 將 DeepSeek V4 Flash 拆分到偶數個 GPU 上,裝置順序要求所有主裝置在前,所有夥伴裝置在後。測試的主機使用八張 L40S 卡與 imatrix Q4 模型。

基準測試、評估、代理與伺服器

該倉庫包含多個工具。ds4-bench 在上下文前沿測量即時預填充與生成吞吐量,而不是整個執行的平均值,在行之間儲存與恢復 KV 狀態。ds4-eval 是一個真實模型整合基準,包含 92 個問題的子集,來自 GPQA Diamond、經過審核的 SuperGPQA、AIME 2025 與 COMPSEC;README 明確表示它不是排行榜執行器,不應報告為官方基準分數。原生代理在代理內部執行推理,沒有插座或 API 邊界,將工作階段儲存在 ~/.ds4/kvcache 中,並支援 /save、/list、/switch、/del 與 /strip。伺服器以本機 OpenAI/Anthropic 相容伺服器啟動,並支援 --batched-session N 用於多個駐留 KV 工作階段。README 指出該專案仍是 beta,代理還需要更多工作才能成熟。

編輯結論

README 沒有提供生產環境使用者清單、安全稽核,或除其發布的具體基準之外的任何效能聲明。它指出軟體處於 beta 品質,可能出現不穩定。授權為 MIT,授予使用、複製、修改、合併、發布、散布、再授權與銷售副本的權限,但軟體以「原樣」提供,不作任何形式的保證。README 也要求擁有編碼代理的使用者考慮自行修改軟體,因為其設計初衷是作為最大使用場景的工作模板。 適合先按 ds4 README 的具體入口做小規模檢查,不適合把文件未說明的相容性或效能當成承諾;先觀察 ds4 的實際輸入、輸出與錯誤訊息,再決定是否納入工作流程。

官方來源

  1. Official README
  2. Project repository
社群筆記

社群筆記