Chinese-LLaMA-Alpaca : une greffe de vocabulaire chinois sur des poids LLaMA que vous devez posséder
中文LLaMA&Alpaca大语言模型+本地CPU/GPU训练部署 (Chinese LLaMA & Alpaca LLMs)
En bref
- De quoi s’agit-il ?
- Le dépôt publie des adaptateurs LoRA pour LLaMA et Alpaca, pas des poids complets. La fusion avec le modèle Meta d'origine est une étape obligatoire, et la documentation oriente désormais vers la troisième génération du projet.
- À qui s’adresse-t-il ?
- Ce dépôt convient aux équipes qui possèdent déjà des poids LLaMA et veulent une base chinoise entraînable sur une seule machine, avec des scripts de pré-entraînement et d'instruction tuning fournis. Il ne convient pas à qui cherche un modèle prêt à l'emploi : sans les poids d'origine, les fichiers publiés ne servent à rien.
- Puis-je l’utiliser commercialement ?
- Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
- Est-il encore maintenu ?
- Oui. Les derniers commits datent d’il y a 150 jours.
- En quel langage est-il écrit ?
- Principalement Python, d’après les statistiques de langage de GitHub.
Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.
ANALYSE OPEN SOURCE APPROFONDIE
Un correctif de tokenizer avant d'être un modèle de dialogue
Le problème visé n'est pas la compréhension du chinois par LLaMA, mais le coût de son encodage. Le projet annonce avoir étendu le vocabulaire chinois du modèle d'origine et l'avoir soumis à un second pré-entraînement sur des données chinoises. La conséquence pratique est arithmétique : à texte égal, un tokenizer mieux adapté produit moins de tokens, donc moins de pas de décodage et une fenêtre de contexte effective plus longue. Le public visé est celui qui travaille en chinois sur du matériel modeste, pas celui qui cherche le meilleur score de benchmark. Le dépôt fournit deux familles distinctes. Les modèles Chinese-LLaMA sont des bases entraînées en modélisation de langage classique, sans gabarit d'entrée. Les modèles Chinese-Alpaca sont des versions affinées sur des instructions, qui attendent un format de prompt précis. Le README présente cette séparation comme un choix d'usage : la base pour la continuation de texte, l'instruct pour les questions, la rédaction et le contexte multi-tours. Confondre les deux conduit à des sorties décevantes, pas à un bug.
Ce que contient réellement le dépôt : des patchs, pas des poids
C'est le point que beaucoup de visiteurs manquent. La page rappelle que la licence LLaMA publiée par Facebook interdit l'usage commercial et que les poids officiels ne sont pas distribués librement. En conséquence, le dépôt ne publie que des poids LoRA, décrits comme un correctif à appliquer sur le modèle LLaMA d'origine. Un adaptateur LoRA seul est inutilisable : il faut le fusionner avec les poids de base pour reconstruire un modèle complet. La procédure de fusion occupe donc une section entière de la documentation, positionnée avant les instructions de déploiement local. Le catalogue couvre les tailles 7B, 13B et 33B, chacune déclinée en version de base, Plus et Pro. Le journal des versions situe la sortie de la série Pro et des Plus-33B en juillet 2023, avec pour objectif affiché des réponses plus longues et de meilleure qualité. Les scripts de pré-entraînement et d'affinage sur instructions sont également dans le dépôt, ce qui distingue ce projet d'un simple dépôt de poids : on peut repartir de la recette.
Vocabulaire, gabarit et paramètres de lancement
L'architecture visible dans le matériel tient en trois éléments. D'abord un tokenizer étendu : le tableau du README indique une taille de vocabulaire de 49953 pour Chinese-LLaMA et de 49954 pour Chinese-Alpaca, l'unité supplémentaire correspondant à un token de remplissage. Ensuite un second pré-entraînement sur corpus chinois, puis, pour la branche Alpaca, un affinage sur données d'instructions. Enfin un gabarit d'entrée obligatoire côté Alpaca, absent côté LLaMA. Ce gabarit se retrouve dans les paramètres de lancement. Avec llama.cpp, la documentation indique le paramètre -p pour fournir un contexte au modèle de base, et -ins pour activer le mode instruction et conversation sur Alpaca. Avec le script d'inférence Hugging Face du dépôt, la différence se joue sur un drapeau : --with_prompt doit être ajouté pour Alpaca, rien pour LLaMA. Dans text-generation-webui, le README déconseille le mode chat pour les modèles de base et signale que --cpu permet de fonctionner sans carte graphique. LlamaChat demande de choisir LLaMA ou Alpaca au chargement. Ces détails ne sont pas cosmétiques : un gabarit manquant dégrade la qualité perçue bien plus qu'un changement de quantification.
Quantifier et exécuter sur une machine personnelle
Le projet met en avant le déploiement local sur ordinateur portable, CPU ou GPU, via quantification. Le README renvoie à une capture animée présentée comme une démonstration de vitesse et de qualité du modèle Chinese-Alpaca-Plus-7B après quantification sur CPU. Je n'ai pas reproduit cette mesure et je ne peux donc citer aucun débit ni aucune latence : la seule information vérifiable est que la démonstration existe et qu'elle porte sur la variante 7B. L'écosystème pris en charge est large et nommé : transformers, llama.cpp, text-generation-webui, LlamaChat, LangChain et privateGPT, avec des exemples dédiés pour les deux derniers. Le dépôt contient aussi un script de démonstration Gradio, présenté comme gérant le multi-tours avec un modèle Alpaca. Deux notes de version méritent l'attention de qui doit tenir une longue fenêtre de contexte. En juin 2023, une discussion documente un support 8K sous llama.cpp sans modification du modèle. Un PR référencé la même période concerne un contexte de 4K et plus sous transformers. Ce sont des pistes communautaires, pas des garanties de qualité constante sur toute la fenêtre.
La limite qui décide de tout : vous devez déjà avoir LLaMA
Le cas où ce dépôt est le mauvais outil est simple à énoncer. Si vous n'avez pas accès aux poids LLaMA d'origine, rien ici ne fonctionne : les fichiers publiés sont des adaptateurs, et la fusion est une condition d'entrée, pas une option. Cela écarte d'emblée les équipes qui cherchent un modèle à télécharger et à interroger le jour même. La licence ajoute une contrainte de même nature. Le README rappelle que LLaMA interdit l'usage commercial et que la publication en LoRA est une manière de respecter ce cadre. Le dépôt lui-même est sous Apache-2.0, mais cette licence couvre le code et les scripts, pas les poids dérivés : la question de l'usage commercial se règle du côté de la licence LLaMA, et je ne peux pas trancher ce point à partir des seuls éléments fournis. Deuxième limite, plus discrète : les modèles de base ne suivent pas d'instructions et les modèles Alpaca ne sont pas faits pour de la génération libre non contrainte. Le README le dit explicitement dans son tableau comparatif. Choisir la mauvaise variante pour son cas d'usage produit des sorties hors sujet, et l'erreur est fréquente parce que les deux familles portent des noms proches.
Où regarder ailleurs, et pourquoi le dépôt vous y envoie
La concurrence la plus directe vient de l'auteur lui-même. Le README ouvre sur l'annonce de Chinese-LLaMA-Alpaca-3, publié en avril 2024, avec Llama-3-Chinese-8B et Llama-3-Chinese-8B-Instruct, et recommande à tous les utilisateurs des deux premières générations de migrer. Le journal des versions va dans le même sens : la série 2 a été publiée à l'été 2023, puis la 3 en 2024. La différence d'approche est structurelle. La première génération part de LLaMA 1, dont les poids ne sont pas redistribuables, ce qui impose le détour par LoRA et la fusion. La troisième génération s'appuie sur Llama 3, distribué sous une licence qui autorise la redistribution des poids dérivés, ce qui supprime l'étape de fusion et la dépendance à un accès Meta. Pour un nouveau projet lancé aujourd'hui, choisir la première génération revient à accepter une contrainte de licence et une étape manuelle que la génération suivante n'impose plus. Une alternative externe existe aussi : les modèles chinois publiés directement en poids complets, hors de la lignée LLaMA. Ils évitent la fusion, mais on perd les scripts d'entraînement et l'écosystème d'outils présentés ici.
Ce que coûte la maintenance, et ce qu'il faut vérifier avant de s'engager
Le dépôt est actif : le dernier push est daté d'avril 2026 et il n'est pas archivé. Mais l'activité récente porte surtout sur la redirection vers les générations suivantes. La dernière version publiée listée est v5.0, en juillet 2023. Autrement dit, un lecteur qui adopte cette base hérite d'une lignée LLaMA 1 dont le développement est clos, avec un successeur désigné et une migration recommandée par les mainteneurs eux-mêmes. Le coût de mise à jour n'est pas nul : passer à la génération 3 change le modèle de base, donc les poids, les procédures de fusion et probablement les scripts d'inférence. Sur le plan des licences, la situation se lit en deux couches. Apache-2.0 s'applique au code du dépôt et permet de le réutiliser, y compris dans un contexte commercial, avec conservation des mentions. Les poids dérivés, eux, restent soumis à la licence LLaMA d'origine selon le README, ce qui interdit l'usage commercial. Je ne formule pas d'avis juridique : ce sont les termes que le projet énonce lui-même. Avant d'investir du temps, deux vérifications concrètes s'imposent. Confirmer que votre accès aux poids LLaMA couvre l'usage prévu, puis lire la section de fusion du README et l'avis de migration vers Chinese-LLaMA-Alpaca-3 en tête de page. Si l'une des deux réponses est défavorable, le reste du dépôt devient sans objet.
Conclusion éditoriale
Ce dépôt convient aux équipes qui possèdent déjà des poids LLaMA et veulent une base chinoise entraînable sur une seule machine, avec des scripts de pré-entraînement et d'instruction tuning fournis. Il ne convient pas à qui cherche un modèle prêt à l'emploi : sans les poids d'origine, les fichiers publiés ne servent à rien. Avant tout, vérifiez que votre accès à LLaMA couvre l'usage envisagé, puis lisez l'avis en tête du README qui recommande de migrer vers Chinese-LLaMA-Alpaca-3.
Notes de la communauté