Modèle / jeu de données
thinkwee/AgentsMeetRL avatar
thinkwee/AgentsMeetRL

AgentsMeetRL : la liste qui classe les dépôts de RL pour agents LLM par catégorie technique

Awesome List for Agentic RL

1 842 étoiles73 forksHTMLLa licence varie

En bref

De quoi s’agit-il ?
AgentsMeetRL recense des dépôts open source qui entraînent des agents LLM par apprentissage par renforcement. Le projet ne fournit aucun code d'entraînement : c'est un index HTML, organisé par taxonomie et par choix techniques (framework, algorithme, récompense, environnement).
À qui s’adresse-t-il ?
À adopter si vous cherchez un point d'entrée documenté vers des dépôts de RL pour agents LLM et que vous voulez voir quels frameworks, quels algorithmes et quels types de récompense les projets retenus utilisent. À écarter si vous attendez du code exécutable, des benchmarks reproductibles ou une liste exhaustive : la sélection est restreinte par construction, et l'auteur signale lui-même des cas potentiellement infidèles.
Puis-je l’utiliser commercialement ?
Pas sans autorisation. GitHub ne trouve aucun fichier de licence dans ce dépôt, et sans licence tous les droits sont réservés par défaut : vous pouvez lire le code, mais pas le réutiliser. Consultez le README ou demandez l’accord des auteurs avant de l’utiliser.
Est-il encore maintenu ?
Oui. Le dépôt a reçu de nouveaux commits au cours des dernières 24 heures.
En quel langage est-il écrit ?
Principalement HTML, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Un index, pas une bibliothèque d'entraînement

Le problème visé est simple à énoncer : la littérature sur l'entraînement par renforcement d'agents LLM est dispersée entre frameworks génériques, environnements de test et projets applicatifs, et rien ne permet de comparer rapidement leurs choix techniques. AgentsMeetRL répond par un catalogue. Le dépôt se décrit comme une awesome list qui résume des dépôts open source destinés à entraîner des agents LLM par RL. Le langage principal déclaré est HTML, ce qui correspond à un site statique accompagné de tableaux, et non à une base de code d'apprentissage. Le public visé est le chercheur ou l'ingénieur qui doit choisir une base de départ, un algorithme ou un environnement, et qui veut savoir ce que d'autres projets ont retenu avant d'investir du temps. La page d'accueil du projet pointe vers un tableau de bord interactif hébergé sur thinkwee.top/amr/. Le README précise aussi que le dépôt accepte les contributions par issues et pull requests.

Le critère d'entrée : interaction multi-tour ou usage d'outils

Toutes les listes de ce genre vivent ou meurent sur leur règle d'inclusion, et celle-ci est explicite. Un projet est retenu comme projet d'agent s'il possède au moins une des deux propriétés suivantes : des interactions multi-tour, ou l'usage d'outils. Le README en tire une conséquence directe : les projets de TIR, Tool-Integrated Reasoning, sont considérés comme des agents et donc inclus. C'est un choix défendable, mais il faut en voir le revers. Un modèle de raisonnement à un seul tour qui appelle un solveur externe entre dans la liste au même titre qu'un agent qui pilote un navigateur pendant vingt étapes. La catégorie Reasoning, avec 18 entrées annoncées, mélange donc des objets qui n'ont pas le même profil d'ingénierie. Le critère a le mérite d'être vérifiable dans le code, contrairement à des définitions plus floues de ce qu'est un agent. Il exclut en revanche les travaux de RLHF classiques sans outil ni multi-tour, ce qui est cohérent avec le titre du dépôt.

Seize catégories et une couche de détails techniques

La taxonomie compte seize catégories, chacune affichée dans le README avec un compteur. Base Framework en annonce 29, General/MultiTask 21, Search & RAG 50, Web & GUI 32, Tool-Use 26, Code & SWE 26, Reasoning 18, Multi-Agent RL 14, Memory 8, Embodied 7, Domain-Specific 12, Reward & Training 11, Safety 9, VLM Agent 30, Self-Evolution 18 et Environment 64. Ces nombres proviennent des badges du README et datent de la dernière mise à jour affichée, le 26 août 2026. La partie la plus utile n'est pas la répartition mais la couche de détails : sous chaque tableau figure un lien vers les détails techniques, et le README indique que le projet se concentre en particulier sur les frameworks de RL, les algorithmes, les récompenses et les environnements dont dépendent les projets retenus. Une énumération des types de récompense est fournie : vérificateur externe comme un compilateur ou un solveur mathématique, règles comme un parseur LaTeX avec score d'exactitude, modèle comme un LLM vérificateur entraîné, ou récompense personnalisée. C'est cette grille, plus que la liste elle-même, qui permet de comparer deux projets.

Comment consulter le dépôt

Il n'y a rien à installer. Le dépôt ne publie aucune release, et le README ne décrit ni script d'installation, ni commande de build, ni clé de configuration. La consultation se fait de deux manières. La première est le site, accessible à l'adresse https://thinkwee.top/amr/, présenté dans le README comme un tableau de bord interactif. La seconde est la lecture directe du README sur la branche main, où chaque catégorie apparaît sous forme de tableau suivi du lien de détails techniques. Pour contribuer, le README renvoie aux issues et aux pull requests, et invite à soumettre son propre projet. La citation, elle, passe par le bouton Cite this repository de la barre latérale, ce qui suppose un fichier de citation dans le dépôt. Aucune licence n'est indiquée dans les métadonnées fournies, ce qui a des conséquences pratiques : sans licence explicite, la réutilisation du contenu de la liste reste juridiquement indéterminée, et il faut vérifier le dépôt lui-même avant d'en reprendre des parties.

La sélection est construite par analyse de code, avec les erreurs que cela implique

C'est le point le plus important du README, et il est assumé. Le projet indique qu'il repose sur une analyse de code de dépôts open source réalisée à l'aide d'agents de codage LLM, et que ce processus peut produire des cas non fidèles. Une relecture manuelle est mentionnée, sans garantie d'exhaustivité, avec un appel à signaler les erreurs. Autrement dit, une entrée de cette liste n'est pas une validation indépendante : c'est le résultat d'une lecture automatisée, partiellement revue. Pour un lecteur qui doit décider d'adopter un dépôt, cela signifie que la fiche technique sert de piste, pas de preuve. Le cas inverse est mieux traité : les articles dont le code n'est pas encore publié sont écartés et renvoyés vers une section Under Review. Les mises à jour de 2026 le montrent, avec des listes nominatives de projets non retenus faute de code disponible, comme Qwen-UI-Agent, Qwen-CUA, UI-Mate, SearchMaster, RoMeRL, Agon, SINKFLEX-RL, GRASP, MAVEN, EviBack ou ChemWorld. Ce tri est un signal de rigueur sur la disponibilité du code, mais il ne dit rien de la qualité de ce code.

Un rythme de mise à jour élevé, donc un coût de maintenance réel

Les entrées de mise à jour donnent la mesure du travail. Juin 2026 : 43 nouveaux dépôts sur 11 catégories. Juillet 2026 : 13 dépôts sur 8 catégories. Août 2026 : 23 dépôts sur 9 catégories, dont 8 environnements, 5 projets Search & RAG, 3 frameworks de base, 2 projets Self-Evolution, et un ajout par catégorie pour Code & SWE, Reward & Training, VLM Agent, Memory et Tool-Use. Le README précise aussi que chaque dépôt a été ouvert et confirmé comme contenant du vrai code d'entraînement RL, ou du code d'environnement exécutable, et que les Safety, Embodied et Multi-Agent RL n'ont produit aucun nouveau dépôt qualifiant sur la fenêtre d'août. Cette cadence implique une maintenance continue : une liste de cette taille se périme vite, et l'absence de release publiée signifie qu'il n'existe pas de version figée à citer. Pour un usage en documentation interne, il faut donc dater explicitement la consultation. La section Self-Evolution porte d'ailleurs un avertissement : sa définition est encore en évolution dans la communauté, ce qui rend la frontière de cette catégorie instable.

Ce qu'une alternative comme Papers with Code apporte différemment

L'alternative la plus proche n'est pas un autre dépôt de RL mais un index généraliste de publications et de code, du type Papers with Code. La différence de méthode est nette. Un index généraliste part des articles, y attache le code quand il existe, et couvre l'ensemble du machine learning sans critère d'agent. AgentsMeetRL fait l'inverse : il part des dépôts, applique un filtre d'entrée explicite (multi-tour ou usage d'outils), puis remonte aux choix techniques internes, framework, algorithme, type de récompense, environnement. Le premier est plus large et plus régulièrement alimenté par la communauté scientifique. Le second est plus étroit mais répond à une question que le premier ne pose pas : parmi les projets qui entraînent réellement des agents par RL, lesquels utilisent veRL, OpenRLHF ou trl, et avec quel type de récompense. Un lecteur qui cherche un article précis n'a rien à faire ici. Un lecteur qui cherche une base de code à réutiliser y trouvera un point de départ, à condition de vérifier lui-même chaque dépôt.

Conclusion éditoriale

À adopter si vous cherchez un point d'entrée documenté vers des dépôts de RL pour agents LLM et que vous voulez voir quels frameworks, quels algorithmes et quels types de récompense les projets retenus utilisent. À écarter si vous attendez du code exécutable, des benchmarks reproductibles ou une liste exhaustive : la sélection est restreinte par construction, et l'auteur signale lui-même des cas potentiellement infidèles. Avant de vous appuyer sur une entrée, ouvrez le dépôt concerné et vérifiez que le code d'entraînement RL est bien présent, car la liste exclut explicitement les articles dont le code n'est pas publié.

Sources officielles

  1. Issues
  2. Project website
  3. README
  4. thinkwee/AgentsMeetRL on GitHub
Notes de la communauté

Notes de la communauté