模型 / 数据集
ymcui/Chinese-LLaMA-Alpaca avatar
ymcui/Chinese-LLaMA-Alpaca

Chinese-LLaMA-Alpaca:给原版 LLaMA 打中文补丁的 LoRA 方案,以及它为何停在 2023 年

中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)

18,941 个 Star1,836 个 ForkPythonApache-2.0

秒懂

它是什么?
Chinese-LLaMA-Alpaca 通过扩充中文词表和 LoRA 二次预训练,让原版 LLaMA 具备中文能力,并提供了完整的合并、量化、部署脚本。但项目已明确将重心转向 Llama-2 和 Llama-3 的后续项目,新用户需要先看清这个版本边界。
适合谁用?
适合以下人群使用:需要基于 LLaMA 1 做中文续写或指令理解、且愿意手工完成 LoRA 合并的研究者,以及想在老式 CPU 笔记本上体验量化中文模型的爱好者。不适合以下人群:追求最新模型效果、需要开箱即用完整权重、或希望长期获得维护更新的生产环境用户。
能商用吗?
可以。Apache-2.0 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 150 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它解决的问题:原版 LLaMA 的中文分词效率太低

原版 LLaMA 的词表以英文和拉丁语系为主,直接处理中文时会把常用汉字切分成多个 token,导致序列变长、推理变慢,语义理解也受限。Chinese-LLaMA-Alpaca 的做法是扩充中文词表,把词表大小提升到 49953,然后用中文语料做二次预训练。它只发布 LoRA 权重,不提供完整模型,用户必须自己准备原版 LLaMA 并合并。这个约束来自 Meta 的许可限制,README 里写得很清楚:原版 LLaMA 禁止商用,官方没有正式开源权重。

核心机制:词表扩充与 LoRA 合并的完整链路

项目的技术报告标题是 Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca,核心思路是保留原版 LLaMA 的结构,只扩展 embedding 层以容纳新增的中文 token。训练分两步:先用中文通用语料做传统语言模型训练,得到中文 LLaMA;再用指令数据精调,得到中文 Alpaca。由于只训练 LoRA 低秩矩阵,计算开销远小于全量预训练。用户下载的是 LoRA 权重,需要执行合并脚本 scripts/merge_llama_with_chinese_lora.py。模型分 7B、13B、33B 三种规模,各有基础版、Plus 版和 Pro 版。Alpaca 需要输入模板,基座模型不需要。

部署路径:从合并到 CPU 量化的具体命令

部署流程在 README 中有明确步骤。第一步合并模型,运行 python scripts/merge_llama_with_chinese_lora.py,用 --base_model 指向原版 LLaMA,用 --lora_model 指向 LoRA 权重。第二步量化,项目推荐使用 llama.cpp 转换为 GGML 格式,支持 4-bit 量化,让无 GPU 的笔记本也能跑。llama.cpp 下中文 LLaMA 用 -p 参数续写,中文 Alpaca 用 -ins 参数进入指令模式。若走 transformers 路线,推理脚本是 scripts/inference/inference_hf.py,Alpaca 需要加 --with_prompt。网页演示用 gradio_demo.py,text-generation-webui 则用 --cpu 参数。这些命令都依赖具体文件路径,没有一键脚本。

效果验证:C-Eval 解码脚本与 Arena 竞技场

项目在 v4.1 版本添加了 C-Eval 解码脚本,v4.0 发布了 C-Eval 结果。C-Eval 是中文选择题评估集,覆盖多学科,脚本位于 scripts/evaluation 目录。README 没有给出具体分数,只提供了 Arena 竞技场,地址是 http://llm-arena.ymcui.com/,用户可在线对比模型输出。人工评测比单一分数更有参考价值,因为中文指令理解难以用自动指标完全衡量。但注意,这些结果基于 2023 年的 LLaMA 1 架构,其推理能力远不如后来的版本。

维护现状:主线已迁移到 Llama-2 和 Llama-3

仓库最后推送是 2026 年 4 月,但最新 release 停在 2023 年 7 月的 v5.0。新闻区从 2024 年 4 月 30 日起就指向 Chinese-LLaMA-Alpaca-3,明确推荐所有用户升级。本仓库事实上已冻结,代码和权重不再更新。v5.0 是最后的版本,发布了 Alpaca-Pro 系列。对想复现论文的研究者,冻结意味着版本稳定;对想跟进技术的开发者,应直接转向二期或三期项目。

局限性与错误使用场景

中文 LLaMA 基座模型不适合指令理解,只能做文本续写。中文 Alpaca 则不适合自由生成,因为它的训练目标是跟随指令。混淆这两类模型是常见错误。另一个局限是硬件需求,33B 模型即使量化后也需要大内存,README 没有列出具体数值,但 7B 的 4-bit 量化在 8GB 内存笔记本上勉强可跑,13B 需要 16GB 以上。LoRA 合并也容易出错,原版权重来源不明时输出质量无法保证。项目只支持 LLaMA 1 架构,不支持 GQA 机制,无法套用后续优化。

替代方案:二期和三期项目在架构上的差异

最直接的替代是 Chinese-LLaMA-Alpaca-2,基于 Llama-2,支持 7B 和 13B。二代模型使用 GQA 分组查询注意力,推理更快,且 Llama-2 许可允许商用。更进一步的替代是 Chinese-LLaMA-Alpaca-3,基于 Llama-3,开源了 8B 和 Instruct 版本。三代模型继承了词表扩充思路,但基础架构完全不同。区别在于:一代用 LoRA 补丁需手动合并,二代和三代直接提供完整权重或更成熟的流程。新用户应优先选择二代或三代。

编辑结论

适合以下人群使用:需要基于 LLaMA 1 做中文续写或指令理解、且愿意手工完成 LoRA 合并的研究者,以及想在老式 CPU 笔记本上体验量化中文模型的爱好者。不适合以下人群:追求最新模型效果、需要开箱即用完整权重、或希望长期获得维护更新的生产环境用户。在采用前,务必先确认三件事:第一,你能否合法获取原版 LLaMA 权重,因为本项目只发布 LoRA 补丁,没有原版模型就无法合并;第二,你的任务是否需要指令理解,若只需要文本续写,中文 LLaMA 基座模型即可,不必使用 Alpaca 版本;第三,检查 Chinese-LLaMA-Alpaca-2 和 Chinese-LLaMA-Alpaca-3 的模型列表,若你的硬件支持 13B 以上规模,二代或三代模型在效果和维护上更值得投入。这个项目的历史价值在于它展示了词表扩充加 LoRA 的可行路径,但它的代码和模型已经定格在 2023 年,新项目不应从这里起步。

官方来源

  1. License: Apache-2.0
  2. Project website
  3. README
  4. Releases
  5. ymcui/Chinese-LLaMA-Alpaca on GitHub
社区笔记

社区笔记