模型 / 資料集
intel/auto-round avatar
intel/auto-round

AutoRound:面向 LLM 與 VLM 的低比特量化工具鏈

英特爾 AutoRound 是一款用於量化工作流程的模型最佳化工具包,可降低推理成本,同時保持人工智慧部署的準確性。

1,614 個 Star175 個 ForkPythonApache-2.0
GitHub

秒懂

它是什麼?
Intel 開源 Python 工具包,以符号梯度下降调整权重舍入,连接多種量化方案、導出格式和推理運行时。
適合誰用?
AutoRound 适合需要實驗 2 至 4 比特权重量化,並能控制校准數據、硬件和推理運行时的模型工程团队。不适合把 README 的 scheme 表当成统一精度保證。
可以商用嗎?
可以。Apache-2.0 是寬鬆授權:你可以使用、修改並販售以它為基礎的軟體,只需保留著作權與授權聲明。
還在維護嗎?
有在維護。儲存庫最近一次提交在 1 天前。
用什麼語言寫的?
主要是 Python(依據 GitHub 的語言統計)。

以上回答依據專案的 GitHub 資料(最近同步於 2026年9月14日)與我們的分析,不構成法律意見。

開源專案深度解析

针對 2 至 4 比特权重的符号梯度下降方法 · intel-auto-round-deep-analysis

AutoRound 是一個面向大语言模型(LLM)和视觉语言模型(VLM)的 Python 量化工具包。README 將核心算法描述為符号梯度下降,它在量化過程中调整权重的舍入方式,而不是重新训练模型。声明的适用范围是每個权重 2 至 4 比特,並声稱在最少调優的情况下即可达到该范围。两篇论文為该方法提供了依據:SignRoundV1,日期為 2023 年 9 月;SignRoundV2,日期為 2025 年 12 月,两者均從 README 鏈接。该仓庫也覆盖 VLM,但 README 说明默認只量化文本模块,通過名為 quant_nontext_module 的標志量化整個模型属于實驗性功能,支持有限。

更新日志反映的近期開發 · intel-auto-round-deep-analysis

README 保留了一份带日期的更新列表,是了解項目進展的主要來源。2026 年 7 月,torch.compile 在 Windows 之外默認啟用以加速量化,同时说明编译優化可能带來微小的數值差异,並提供禁用標志。2026 年 6 月,AutoScheme 混合精度生成器针對 GGUF 精度做了改進,代价是额外调優成本;同月还加入了 vLLM-Omni 集成。2026 年 5 月增加了无模型量化,並作為 auto-round-rtn 配方的默認路径。2026 年 3 月增加了块級 FP8,推荐使用 rtn 模式,还有一個 pull request 增加了 MTP 層量化。這些條目中未出現發布版本号,因此日期和鏈接的 pull request 是 README 提供的唯一时間線。

硬件目標與安装命令 · intel-auto-round-deep-analysis

README 列出 CPU(Xeon)、CUDA GPU、Intel XPU 與 HPU Gaudi 為支持目標。CPU 和 CUDA 的安装命令是 pip install auto-round;夜間構建包為 auto-round-nightly。HPU 需要在 Gaudi Docker 容器内安装,使用 pip install auto-round-hpu。XPU 需要先從 XPU 索引安装 torch,再执行 pip install auto-round。從源码構建也覆盖了三條路径:CPU/CUDA 使用 pip install .,HPU 使用 python setup.py install hpu,XPU 则先安装 torch 再执行 pip install .。README 未说明要求的 Python 版本或 torch 版本,這一点需要在别處核實。

通過命令行或 Python API 量化模型 · intel-auto-round-deep-analysis

命令行入口為 auto-round,完整参數列表可通過 auto-round -h 查看。文檔给出的最小示例是 auto-round --model Qwen/Qwen3-0.6B --scheme W4A16 --format auto_round --output_dir ./tmp_autoround。另有三種配方:auto-round-best 追求最佳精度,運行时間约為三倍;auto-round-light 提速两到三倍,在 W4 有轻微精度损失、W2 损失更大;auto-round-opt-rtn 是優化後的最近舍入基線。README 建议 W4A16 使用 auto-round,W2A16 使用带 enable_alg_ext 的 auto-round-best。Python API 與此對應:實例化 AutoRound(model_name_or_path, scheme="W4A16"),然後调用 quantize_and_save(output_dir, format="auto_round")。文檔列出的超参數包括 iters、lr、batch_size、group_size、sym、nsamples、seqlen 與 device_map,校准數據集默認為 NeelNanda/pile-10k,128 個樣本,序列長度 2048。

支持的 scheme 與導出格式 · intel-auto-round-deep-analysis

README 中的 scheme 表按導出格式組织。對于原生 auto_round 格式,文檔列出的 scheme 從 W2A16 到 W8A16,另有 MXFP4、MXFP8、NVFP4、FP8_STATIC 與 BF16。其他導出格式為 auto_awq、auto_gptq、llm_compressor 與 gguf,各有自己的 scheme 列表;仅 gguf 一行就列出了從 Q2_K_S 到 Q8_0 的十四個 scheme。表格用灰色標记缺少内核或仅有参考内核的格子,README 还说明 MXFP4 與 NVFP4 没有真實内核,推荐將這两種導出為 llm_compressor 格式。fake 格式保留给研究用途,支持所有 scheme。表格本身不提供精度數據,README 指向 Hugging Face 排行榜和单独的精度文檔,因此仅凭该表无法确定精度對比。

運行时集成與许可的邊界 · intel-auto-round-deep-analysis

推理示例覆盖三個運行时。vLLM 使用標准 LLM 类加載量化模型,示例模型名為 Intel/DeepSeek-R1-0528-Qwen3-8B-int4-AutoRound。SGLang 使用相同的模型名配合 sgl.Engine,README 提醒 MoE 與视觉语言模型支持有限。Transformers 覆盖 CPU、Intel GPU、Gaudi 與 CUDA,並警告推理期間不要手动將量化模型移动到其他設备。項目采用 Apache-2.0 许可,授予永久、全球、非独占、免版税的版权许可及相應專利许可,並允许按许可條款再分發。所提供的许可摘錄未涉及支持、保修或安全,README 也没有就這些方面作出任何声明。實践中應先用 `auto-round --model Qwen/Qwen3-0.6B --scheme W4A16 --format auto_round --output_dir ./tmp_autoround` 生成一個小模型,再分别用 Transformers、vLLM 或 SGLang 加載,核對输出目錄中的权重格式、設备映射和推理日志。W4A16 可從 `auto-round` 配方開始,W2A16 再评估 `auto-round-best` 與 `enable_alg_ext` 的成本;`auto-round-light` 虽能缩短时間,却可能带來 W4 和 W2 精度损失。VLM 默認只量化文本模块,`quant_nontext_module` 属于實驗路径,不能把文本模型的结果直接外推到视觉模块。校准數據集默認是 NeelNanda/pile-10k,樣本數與序列長度也会影响内存和结果。README 没有明确 Python 與 torch 版本,CPU、CUDA、XPU 和 Gaudi 環境必须分别记錄依赖、显存或内存占用、量化耗时和下游任務指標。導出到 GGUF、AutoAWQ、AutoGPTQ 或 llm_compressor 後,还要确認目標運行时是否有真實内核;表格中標為参考或缺少内核的組合不能直接当成可用结论。 AutoRound 的實驗應把量化方案、硬件和運行时一起固定。先以 Qwen/Qwen3-0.6B 的 W4A16 方案建立基線,记錄校准樣本、序列長度、group size、迭代次數、量化耗时和输出文件,再比较 W2A16、auto-round-best、auto-round-light 與 opt-rtn。精度不能只看单個生成示例,还要使用目標任務的困惑度、准确率或结構化输出指標。VLM 默認只處理文本模块,打開非文本模块量化後,應单独检查图像输入、视觉编码器和端到端输出。CPU、CUDA、XPU 和 Gaudi 的安装路径不同,README 没有给出 Python 與 torch 版本,所以依赖锁定和設备映射必须寫進實驗记錄。導出到 GGUF、AutoAWQ、AutoGPTQ 或 llm_compressor 时,重点检查目標内核是否真實可用、模型能否被加載,以及 vLLM、SGLang 和 Transformers 對 MoE 或 VLM 的限制。 量化评估还要关注首 token 延迟、吞吐、显存占用和長上下文稳定性。相同模型在不同導出格式和硬件上的结果不能混合比较,测试报告應寫明完整方案與運行时。 量化输出的大小下降不能单独作為成功標准。應同时观察生成质量、長文本行為、首 token 延迟、吞吐、显存和加載时間,並把同一模型的浮点基線保留下來。不同 scheme、導出格式和運行时的比较必须使用相同输入與硬件,VLM 的實驗还要分開报告文本模块和视觉模块的结果。 当结果不稳定时,應先检查校准數據、設备映射和導出内核,再判断算法或模型本身是否造成差异。 這比单看文件大小更可靠。 實驗报告还應固定模型、數據、設备、方案和運行时,分别保存基線输出與量化输出,避免不同條件下的數字被误讀。

編輯結論

AutoRound 适合需要實驗 2 至 4 比特权重量化,並能控制校准數據、硬件和推理運行时的模型工程团队。不适合把 README 的 scheme 表当成统一精度保證。先用目標硬件安装對應 torch 與 AutoRound,對同一模型運行 W4A16 和 W2A16,保存日志與输出目錄,再在 vLLM、SGLang 或 Transformers 中分别检查加載、显存、速度和结果质量。

官方來源

  1. Official README
  2. Project repository
  3. Release notes
社群筆記

社群筆記