Bibliothèque / SDK
NVIDIA-NeMo/RL avatar
NVIDIA-NeMo/RL

NeMo RL : une bibliothèque de post-entraînement évolutive pour l'apprentissage par renforcement

Aperçu du projet : Boîte à outils évolutive pour un renforcement efficace du modèle. [04/06/2026] Prise en charge d'un nouveau modèle Ajout de la prise en charge des modèles Qwen3.5 denses et MoE (LLM et VLM) pour la formation GRPO.

2 015 étoiles558 forksPythonApache-2.0

En bref

De quoi s’agit-il ?
Ce que le dépôt décrit : backends, algorithmes, parcours de démarrage rapide et limites de ce que le README vérifie.
À qui s’adresse-t-il ?
NeMo RL est documenté comme une bibliothèque de post-entraînement combinant l'entraînement natif PyTorch et Megatron avec la génération vLLM ou Megatron, et couvrant les recettes GRPO, DAPO, SFT, DPO, RM et de distillation. Le dépôt lui-même n'établit pas de chiffres de performance, de conditions de support ou de propriétés de sécurité ; ceux-ci nécessitent la documentation liée et les notes de version.
Puis-je l’utiliser commercialement ?
Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
Est-il encore maintenu ?
Oui. Le dépôt a reçu de nouveaux commits au cours des dernières 24 heures.
En quel langage est-il écrit ?
Principalement Python, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Une bibliothèque de post-entraînement pour l'apprentissage par renforcement

NeMo RL est une bibliothèque open source de post-entraînement sous le framework NVIDIA NeMo. Le README indique qu'elle est conçue pour simplifier et faire passer à l'échelle les méthodes d'apprentissage par renforcement pour les modèles multimodaux, y compris les LLM et les VLM ; les métadonnées du dépôt la décrivent comme une boîte à outils évolutive pour un renforcement efficace des modèles. Les objectifs de conception déclarés sont la flexibilité, la reproductibilité et l'échelle, des petites expériences aux déploiements multi-GPU et multi-nœuds. Le README identifie également le projet comme le successeur réarchitecturé de NeMo Aligner, une des premières bibliothèques d'apprentissage par renforcement pour LLM qui, selon lui, a inspiré VeRL, SkyRL et ROLL.

Pour NVIDIA-NeMo/RL, le détail à examiner est propre à cette implémentation 1 : reliez le nom du script, du module ou du fichier cité à l'étape où il intervient. Une erreur de version, d'option ou de format peut modifier le résultat sans que le README fournisse une explication complète. Cette lecture permet de distinguer une capacité annoncée d'un comportement effectivement documenté dans NVIDIA-NeMo/RL. Repérez aussi ce que la source ne précise pas, comme les limites de charge, les garanties de compatibilité ou les conditions de reprise après échec. La licence Apache-2.0 encadre la réutilisation du code, tandis que les dépendances et les modèles associés demandent leur propre lecture.

Deux backends d'entraînement, deux backends de génération

L'entraînement s'exécute soit sur DTensor, que le README décrit comme la prochaine génération d'entraînement distribué de PyTorch avec une meilleure efficacité mémoire et le support de TP, SP, PP, CP et FSDP2, soit sur Megatron, décrit comme le framework d'entraînement haute performance de NVIDIA avec parallélisme 6D. Le backend est choisi automatiquement à partir de la configuration YAML. La génération et le rollout s'exécutent sur vLLM ou sur l'inférence native Megatron, qui, selon le README, évite la conversion des poids entre entraînement et inférence. Les détails sur la sélection des backends figurent dans les documents de conception liés.

Algorithmes, recettes et support de modèles

Le README liste GRPO, GSPO, DAPO et GDPO comme algorithmes d'apprentissage par renforcement, ainsi que SFT avec LoRA, DPO, RM, distillation on-policy et distillation off-policy x-token. LoRA est supporté sur les deux backends, DTensor et Megatron, pour SFT, GRPO et DPO. La liste des fonctionnalités inclut la génération et l'entraînement multi-tours pour l'utilisation d'outils et les jeux, le support VLM, le séquencement (sequence packing), le décodage spéculatif, l'entraînement FP8 basse précision, l'optimiseur Muon et un backend de génération SGLang. La section actualités documente le support des modèles Qwen3.5, GLM-4.7-Flash et de la famille Nemotron, et indique que Nemotron-3-Ultra et Nemotron-3-Super ont été post-entraînés avec cette bibliothèque.

Lancer une exécution : conteneur, uv et scripts d'exemple

Le parcours recommandé est le conteneur NGC préconstruit nvcr.io/nvidia/nemo-rl:latest, qui, selon le README, inclut CUDA, cuDNN, vLLM et SGLang. Après avoir cloné le dépôt avec ses sous-modules, les exécutions sont lancées avec uv run, et le README déconseille d'activer directement l'environnement virtuel. Les points d'entrée d'exemple incluent examples/run_grpo.py, run_sft.py, run_dpo.py, run_rm.py, run_distillation.py et run_xtoken_off_policy_distillation.py, chacun utilisant des configurations YAML pouvant être surchargées depuis la ligne de commande. Une recette smoke limite une exécution GRPO à dix étapes pour valider l'installation plus rapidement. Les exemples multi-nœuds utilisent Slurm via un script ray.sub, avec une note pour les systèmes GB200 à quatre GPU par nœud.

Conversion de points de contrôle et évaluation

Avant l'évaluation, un point de contrôle enregistré au format DCP PyTorch doit être converti au format Hugging Face, et il en va de même pour les points de contrôle Megatron. Un script de fusion LoRA séparé plie les poids des adaptateurs dans le modèle de base. L'évaluation s'exécute via examples/run_eval.py avec des configurations telles que math_eval.yaml ; le README note que les résultats peuvent varier selon les paramètres d'échantillonnage, la graine aléatoire et la version ou les réglages du moteur d'inférence. Le README renvoie à une page de synthèse des performances pour les chiffres de référence, mais ne reproduit pas ces chiffres dans le fichier du dépôt.

Ce que les sources n'établissent pas, et ce que la licence accorde

Le README et les métadonnées du dépôt ne fournissent pas de garanties de sécurité, d'engagements de support ni de résultats de référence au-delà de la page de performances liée. L'instantané des métadonnées enregistre 1 875 étoiles, 491 forks et 848 issues ouvertes ; le dépôt n'est pas archivé. L'extrait de la licence Apache-2.0 accorde une licence de droit d'auteur perpétuelle, mondiale, non exclusive, gratuite et sans redevance pour reproduire, préparer des œuvres dérivées, afficher publiquement, exécuter, sous-licencier et distribuer l'œuvre, ainsi qu'une licence de brevet qui prend fin si le licencié engage certaines actions en contrefaçon de brevet. L'extrait ne traite ni du support, ni de la garantie, ni de la sécurité, et le README n'en dit rien non plus.

NVIDIA-NeMo/RL : Les recettes GRPO de NeMo RL

Dans NVIDIA-NeMo/RL, ce point doit être lu à partir des éléments explicitement fournis par le README et ses fichiers liés. La commande, le chemin ou la configuration mentionnés dans les sections précédentes donnent un repère concret pour examiner le comportement attendu. Le dépôt ne permet pas de conclure à une garantie générale lorsque la documentation ne décrit ni le cas limite ni la politique de support. Une lecture attentive de la version publiée, des exemples et des issues est donc nécessaire pour relier ce mécanisme à votre contexte.

Cette réserve est spécifique à NVIDIA-NeMo/RL : il faut comparer la sortie produite par le parcours documenté avec l'entrée et le fichier de configuration utilisés. Les métriques annoncées par les auteurs restent des indications du projet, pas une mesure de votre infrastructure. Notez les versions et les paramètres propres à NVIDIA-NeMo/RL avant de modifier le pipeline.

NVIDIA-NeMo/RL : DTensor, Megatron et vLLM

NVIDIA-NeMo/RL : ce chapitre isole une limite explicitement documentée par le dépôt. Le README ne fournit pas de détail supplémentaire sur ce cas, qui reste donc à traiter comme une frontière de la documentation disponible.

Conclusion éditoriale

NeMo RL est documenté comme une bibliothèque de post-entraînement combinant l'entraînement natif PyTorch et Megatron avec la génération vLLM ou Megatron, et couvrant les recettes GRPO, DAPO, SFT, DPO, RM et de distillation. Le dépôt lui-même n'établit pas de chiffres de performance, de conditions de support ou de propriétés de sécurité ; ceux-ci nécessitent la documentation liée et les notes de version.

Sources officielles

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Notes de la communauté

Notes de la communauté