开源项目
antirez/ds4 avatar
antirez/ds4

DwarfStar (ds4):为 DeepSeek V4 和 GLM 5.2 量身定制的本地推理引擎

适用于 Metal、CUDA 和 ROCm 的 DeepSeek 4 Flash 和 PRO 本地推理引擎。

22,421 个 Star2,125 个 ForkCMIT
GitHub

秒懂

它是什么?
antirez 的新项目 DwarfStar 是一个只支持少数模型的 C 语言推理引擎,优先适配 Metal、CUDA 和 ROCm。它刻意不做通用 GGUF 加载器,而是围绕 DeepSeek V4 Flash 和 GLM 5.2 的量化特性深度优化,适合有明确硬件配置、愿意接受 beta 质量并可能借助编码代理进行二次开发的用户。
适合谁用?
DwarfStar 适合两类人:一是有 96 GB 以上内存 Mac 或 DGX Spark、Strix Halo 等特定硬件的个人用户,希望在本机跑 DeepSeek V4 Flash 或 GLM 5.2,且不介意 beta 质量;二是拥有旧款 Ada Lovelace CUDA 卡、想用 ds4-server 搭建多用户 LLM 服务的公司,文档中给出了 8xL40S 的实测配置。不适合需要通用 GGUF 支持、追求稳定 API 或不愿接触 AI 辅助开发代码的人。
能商用吗?
可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 1 天前。
用什么语言写的?
主要是 C(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

一个只为少数模型而生的引擎

DwarfStar 解决的问题很具体:在个人电脑上高效运行 DeepSeek V4 Flash 和 GLM 5.2,而不是像 llama.cpp 那样支持成千上万种模型。作者 antirez 在 README 里明确说,这是“self-contained and deliberately narrow”,不是通用 GGUF runner。它把模型加载、提示词渲染、工具调用、KV 状态、HTTP 服务器和编码代理捆绑在一起开发,这意味着每个部件都针对特定模型调优,但也意味着你无法随意换模型。目标用户是拥有 128 GB 笔记本或 512 GB 工作站的人,或者想用旧 CUDA 卡搭建内部 LLM 服务器的公司。文档提到,用 8 张 L40S 配合 ds4-server 的微批处理,可以达到 120 t/s 的聚合生成速度和 2000 t/s 的预填充速度,但这是作者自述的测试结果,没有独立验证。

从 llama.cpp 借力,但不链接 GGML

DwarfStar 的 C 源码(ds4.c)并不链接 GGML,但它大量借鉴了 llama.cpp 的设计。README 的致谢部分说,项目保留了 GGUF 量化布局和表格、CPU 量化/点积逻辑以及某些内核,这些代码来自 GGML 作者,并在 LICENSE 中保留了版权声明。这解释了为什么它能支持 GGUF 格式:它复用了生态的量化格式,而不是从头发明。但注意,它只支持项目自己提供的 DeepSeek V4 和 GLM 5.2 GGUF 文件,因为引擎期待特定的张量布局、量化混合和元数据,甚至可能包含可选的 MTP(multi-token prediction)状态。如果你拿一个普通的 GGUF 文件喂给它,它会失败,这不是 bug,而是设计边界。

安装与运行:没有一键脚本,但有明确路径

README 没有给出编译命令,但项目结构暗示了使用方式。你需要克隆仓库,然后根据后端选择构建目标:Metal 是首要目标,要求 Mac 有 96 GB 或更多内存,小内存机器可以用 SSD 流式;CUDA 支持多 GPU 和 DGX Spark;ROCm 针对 Strix Halo 系统(如 Framework Desktop)。模型权重必须从项目列出的 GGUF 文件获取,这些文件包含 2 bit 量化,README 声称这些量化“verified to be actually high quality”,尤其适合编码代理和工具调用。运行方式涉及多个子工具:gguf-tools 用于离线生成 GGUF 和收集 imatrix,speed-bench 用于跑基准,dir-steering 用于方向性引导。由于没有现成的 install 脚本,你需要自行阅读子 README 来拼出完整流程,这对不熟悉构建系统的用户是个门槛。

量化策略:非对称路由专家量化

DwarfStar 的关键技术点是对路由专家(routed experts)做激进的非对称量化。README 提到,DeepSeek V4 Flash 和 PRO 以及 GLM 5.2 能容忍这种量化,所以 2 bit 量化也能保持可用性。具体做法是:对路由专家使用更低的位宽,而对共享专家或注意力部分保留更高精度。imatrix(重要性矩阵)用于校准量化,gguf-tools/imatrix 子目录有专门说明。这种设计让模型能在 128 GB 内存的机器上运行,但代价是量化误差可能影响输出质量,尤其是长上下文或数学推理场景。文档没有给出与 4 bit 或 8 bit 的对比数据,所以你需要自己用 quality-testing 工具跑官方延续向量来评估。

并行与内存扩展:多 GPU 和流水线并行

除了单机 Metal,DwarfStar 支持两种并行方式。一是张量并行,README 提到可以用两台 MacBook M5 Max 或 M3 Ultra 通过 RDMA 连接,运行 4 bit 的 DeepSeek Flash 或 GLM 5.2,这需要硬件支持 RDMA,普通以太网不行。二是流水线并行,可以把多台机器串联起来,累加内存以运行更大的模型,比如 DeepSeek V4 PRO,但 README 说 PRO 需要“very high-memory machines”,没有给出具体内存下限。这种设计让用户能突破单机内存限制,但配置复杂度高,而且文档没有提供详细的网络设置步骤,只暗示了代码可以作为“working template”供修改。

AI 辅助开发的透明声明与 beta 质量

README 开篇就声明,这个软件是在 GPT 5.5、5.6 和 Claude Fable 的强力协助下开发的,人类主导想法、测试和调试。作者明确说,如果你对 AI 开发的代码不满意,这个项目不适合你。这不是客套,而是对代码质量的诚实预判。项目状态被标记为 beta,且“very fast changing”,每次发布前有 QA 运行,但“instabilities are definitely possible”。这意味着你可能会遇到崩溃或行为变化。维护成本方面,由于模型支持是机会主义的,当更好的权重出现时,旧模型可能被移除,所以你的工作流可能需要跟随项目更新。许可证是 MIT,但注意源码中保留了 GGML 的版权声明,这不影响你使用,但如果你要分发修改版,需要保留这些声明。

与 llama.cpp 的对比:窄而深 vs 宽而浅

最直接的替代方案是 llama.cpp,因为 DwarfStar 本身就借鉴了它。llama.cpp 是通用 GGUF 加载器,支持大量模型和硬件,但针对特定模型(如 DeepSeek V4)的优化不如 DwarfStar 深入。DwarfStar 的 README 明确说它“not a general GGUF runner”,这意味着你无法用它跑 Llama 3 或 Mistral。如果你需要多模型支持,llama.cpp 是更稳妥的选择,但它的量化方案可能不够激进,导致 DeepSeek V4 在 128 GB 机器上跑不动。另一个区别是开发理念:DwarfStar 鼓励用户用编码代理修改代码来适配自己的硬件,而 llama.cpp 更偏向于传统社区贡献。如果你不想依赖 AI 辅助修改,llama.cpp 的成熟度更高,但如果你愿意定制,DwarfStar 的代码结构可能更容易针对特定 GPU 做优化。

编辑结论

DwarfStar 适合两类人:一是有 96 GB 以上内存 Mac 或 DGX Spark、Strix Halo 等特定硬件的个人用户,希望在本机跑 DeepSeek V4 Flash 或 GLM 5.2,且不介意 beta 质量;二是拥有旧款 Ada Lovelace CUDA 卡、想用 ds4-server 搭建多用户 LLM 服务的公司,文档中给出了 8xL40S 的实测配置。不适合需要通用 GGUF 支持、追求稳定 API 或不愿接触 AI 辅助开发代码的人。采用前需要验证三件事:你的硬件是否在支持列表内(Metal 96 GB 起,CUDA 需 Ada Lovelace,ROCm 仅限 Strix Halo);你的模型权重是否来自项目提供的 GGUF,因为任意 GGUF 不会兼容;你是否接受项目快速变化带来的不稳定,以及需要阅读 QA_BEFORE_RELEASES.md 了解发布前的测试矩阵。若这些条件满足,DwarfStar 可能是当前在消费级硬件上运行 DeepSeek V4 家族最直接的选择,但别忘了它依赖 llama.cpp 的生态遗产,许可证为 MIT,但源码中保留了 GGML 的版权声明。

官方来源

  1. Official README
  2. Project repository
社区笔记

社区笔记