ERNIE 4.5 et ERNIEKit : ce que le dépôt officiel propose réellement
The official repository for ERNIE 4.5 and ERNIEKit – its industrial-grade development toolkit based on PaddlePaddle.
En bref
- De quoi s’agit-il ?
- Le dépôt PaddlePaddle/ERNIE regroupe la famille de modèles ERNIE 4.5 et ERNIEKit, sa boîte à outils d'entraînement. Voici ce que la documentation couvre, ce qu'elle laisse dans l'ombre, et à quelles conditions l'adopter.
- À qui s’adresse-t-il ?
- ERNIEKit convient aux équipes déjà engagées sur PaddlePaddle qui doivent faire du SFT ou du LoRA sur un modèle ERNIE 4.5, y compris les variantes VL, avec un besoin de contexte long. Il ne convient pas à qui veut un chemin court vers un déploiement vLLM ou une intégration transformers standard, ni à qui cherche un fine-tuning complet du 424B : la documentation ne décrit que du SFT et du LoRA sur les modèles VL.
- Puis-je l’utiliser commercialement ?
- Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
- Est-il encore maintenu ?
- Oui. Les derniers commits datent d’il y a 53 jours.
- En quel langage est-il écrit ?
- Principalement Python, d’après les statistiques de langage de GitHub.
Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.
ANALYSE OPEN SOURCE APPROFONDIE
Un dépôt qui contient deux choses distinctes
Le dépôt ne publie pas un modèle mais une famille, et il l'accompagne d'une boîte à outils. La famille compte dix variantes selon le README : quatre LLM texte (300B-A47B et 21B-A3B, en Base et en version instruct), quatre modèles vision-langage (VL-424B-A47B et VL-28B-A3B, également en Base et instruct), et deux modèles denses dont le 0.3B. Tous partagent une fenêtre de contexte de 128K d'après le tableau du README. ERNIEKit, de son côté, est présenté comme la boîte à outils de développement, avec une branche par défaut release/v1.5 et des notes de version qui s'échelonnent de v1.0 en juin 2025 à v1.5 en novembre 2025. La cible est donc double : ceux qui veulent servir un modèle pré-entraîné, et ceux qui veulent l'adapter sur leurs propres données. C'est le second usage qui structure l'essentiel du dépôt, puisque la section Training pointe vers docs/erniekit.md et que le déploiement est renvoyé vers un autre dépôt, PaddlePaddle/FastDeploy.
MoE à modalités hétérogènes : le mécanisme annoncé
L'architecture décrite est un mélange d'experts. Le README donne deux échelles : 47B et 3B de paramètres actifs, le plus grand modèle atteignant 424B de paramètres totaux. La particularité revendiquée est une structure de modalités hétérogènes : le routage partage des paramètres entre modalités tout en réservant des paramètres propres à chacune. L'argument avancé est qu'un tel partage améliore la compréhension multimodale sans dégrader les tâches textuelles. Le chiffre de 47 % de MFU (Model FLOPs Utilization) concerne le pré-entraînement du plus grand modèle de langage, pas l'entraînement que vous ferez avec ERNIEKit. Cette distinction compte : un taux d'utilisation des FLOPs mesuré sur un pré-entraînement à grande échelle ne se transpose pas à un SFT sur quelques GPU. Le README ne détaille pas la granularité du routage, le nombre d'experts par couche ni la façon dont les paramètres partagés sont initialisés. Pour un lecteur qui doit décider d'une adoption, ces éléments manquent.
ERNIEKit : ce que les notes de version documentent
Les notes de version forment la partie la plus concrète du dépôt. La v1.4 ajoute une stratégie padding-free : les données d'un lot sont regroupées en une séquence pour éviter le remplissage, ce qui réduit la mémoire GPU et accélère l'entraînement selon la note. La v1.2 ajoute une interface WebUI pour l'entraînement et la conversation avec les modèles VL 28b et 424b, un format question-réponse dans les données d'entraînement VL, et le support matériel des GPU iluvatar. La v1.1 introduit le SFT et le LoRA pour la série ERNIE-4.5-VL. Les versions v1.3 et v1.5 ajoutent le SFT et l'entraînement au function call pour les variantes Thinking, dont ERNIE-4.5-VL-28B-A3B-Thinking en v1.5. Le dépôt corrige aussi des bugs visibles dans les notes : un problème pp+recompute+moe sous AutoParallel, un bug de sauvegarde de checkpoint, un bug LoRA en entraînement 128k. Une note de version qui liste des correctifs de ce type indique un projet en usage réel, pas une vitrine.
Mise en route : ce que le dépôt donne comme point d'entrée
Le README oriente vers docs/erniekit.md pour l'entraînement et vers cookbook/ pour les exemples. Il ne donne pas de commande d'installation complète dans l'extrait disponible, et c'est une limite réelle : la page d'accueil ne permet pas de reconstituer un pipeline de bout en bout. Le déploiement, lui, est explicitement délégué à PaddlePaddle/FastDeploy, ce qui signifie que le dépôt ERNIE ne couvre pas l'inférence en production au-delà des scripts fournis. Deux points sont confirmés : la branche par défaut est release/v1.5, donc les instructions de la page d'accueil correspondent à cette version, et ERNIEKit est versionné indépendamment des modèles, avec des notes allant de v1.0 à v1.5. Si vous clonez la branche par défaut, vous obtenez ERNIEKit v1.5 ; si vous suivez un tutoriel écrit pour la v1.3, attendez-vous à des écarts. Le nom de la boîte à outils et les chemins (docs/erniekit.md, cookbook/) sont les seuls repères stables fournis ici.
La limite qui décide de l'adoption : PaddlePaddle
Tout le dépôt repose sur PaddlePaddle, et le README le présente comme un choix : le framework permet l'inférence haute performance et un déploiement simplifié. Vu depuis une équipe déjà outillée autour de PyTorch, c'est un coût de migration, pas un détail. Les modèles sont publiés sous Apache 2.0, ce qui autorise l'usage commercial et la modification, mais la licence du code et celle des poids doivent être vérifiées séparément sur chaque page de modèle Hugging Face : le dépôt donne le nom baidu/ERNIE-4.5-VL-28B-A3B-Thinking et PaddlePaddle/PaddleOCR-VL, sans reproduire les conditions propres à chaque dépôt. Autre limite : la documentation ne couvre, dans les notes de version, que du SFT et du LoRA pour les modèles VL. Rien n'indique qu'un fine-tuning complet du 424B soit outillé ici. Enfin, les modèles de 300B et 424B de paramètres totaux imposent une infrastructure que le dépôt ne chiffre pas.
Face à une pile transformers classique
L'alternative la plus évidente est l'écosystème Hugging Face : charger un modèle avec transformers, l'entraîner avec PEFT pour le LoRA, le servir avec vLLM ou TGI. La différence n'est pas le résultat mais le chemin. Une pile transformers vous donne des interfaces stables, un large choix de quantifications et de moteurs d'inférence, et des modèles ERNIE y sont hébergés. ERNIEKit, lui, apporte des éléments que cette pile n'expose pas directement : la stratégie padding-free au niveau du chargement des données, le support d'AutoParallel avec recalcul et MoE, le support de matériel iluvatar, et une WebUI dédiée aux modèles VL. Le choix se joue donc sur le matériel et sur le framework, pas sur la qualité intrinsèque des modèles. Si votre parc est constitué de GPU iluvatar ou que vous exploitez déjà PaddlePaddle, ERNIEKit a un avantage concret. Sinon, l'alternative transformers reste plus simple à intégrer, au prix des optimisations propres à ERNIEKit.
Coût de maintenance et rythme de publication
Le dépôt n'est pas archivé et la dernière poussée date de juillet 2026 selon les métadonnées. Entre juin 2025 et novembre 2025, ERNIEKit est passé de v1.0 à v1.5, soit environ une version par mois. Ce rythme a deux conséquences. La première est que les notes de version servent de journal de bord fiable : on y lit des ajouts de modèles, des correctifs AutoParallel et des corrections de bugs LoRA. La seconde est qu'un rythme mensuel implique de suivre les tags plutôt que la branche par défaut si vous voulez des builds reproductibles. La branche release/v1.5 est un point d'ancrage, mais rien n'indique une politique de support à long terme pour les versions antérieures. Sur le plan juridique, Apache-2.0 couvre le code du dépôt ; les poids des modèles sont distribués ailleurs, sur Hugging Face et AI Studio, et leurs conditions doivent être lues à la source. Je ne peux pas, à partir de ce matériel, affirmer que ces conditions sont identiques.
Conclusion éditoriale
ERNIEKit convient aux équipes déjà engagées sur PaddlePaddle qui doivent faire du SFT ou du LoRA sur un modèle ERNIE 4.5, y compris les variantes VL, avec un besoin de contexte long. Il ne convient pas à qui veut un chemin court vers un déploiement vLLM ou une intégration transformers standard, ni à qui cherche un fine-tuning complet du 424B : la documentation ne décrit que du SFT et du LoRA sur les modèles VL. Avant de vous engager, vérifiez deux points précis : la disponibilité du fichier d'exemple dans cookbook/ pour votre variante exacte, et la version de PaddlePaddle requise par le tag ERNIEKit que vous installez.
Notes de la communauté