Modèle / jeu de données
MLGroupJLU/LLM-eval-survey avatar
MLGroupJLU/LLM-eval-survey

LLM-eval-survey : une bibliographie structurée pour l'évaluation des grands modèles de langage

The official GitHub page for the survey paper "A Survey on Evaluation of Large Language Models".

1 610 étoiles103 forksUnknownLa licence varie

En bref

De quoi s’agit-il ?
Le dépôt accompagne l'article A Survey on Evaluation of Large Language Models. Il ne s'agit pas d'un outil exécutable mais d'une classification de la littérature, organisée selon les axes du survey. Voici ce qu'elle couvre, comment elle est structurée et ce qu'elle ne fait pas.
À qui s’adresse-t-il ?
À adopter si vous cherchez un point d'entrée bibliographique pour cadrer un protocole d'évaluation, en particulier sur les axes NLP, raisonnement, éthique et applications médicales. À éviter si vous attendez du code, des métriques ou un harnais reproductible : le dépôt ne contient rien de tel.
Puis-je l’utiliser commercialement ?
Pas sans autorisation. GitHub ne trouve aucun fichier de licence dans ce dépôt, et sans licence tous les droits sont réservés par défaut : vous pouvez lire le code, mais pas le réutiliser. Consultez le README ou demandez l’accord des auteurs avant de l’utiliser.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 3 jours.
En quel langage est-il écrit ?
GitHub n’indique pas de langage principal pour ce dépôt.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Un index de lectures, pas un banc d'essai

Le dépôt se présente comme une collection d'articles et de ressources liés à l'évaluation des grands modèles de langage. Le README le formule ainsi : une collection de papers et de ressources liés aux évaluations sur les grands modèles de langage. Il n'y a donc rien à installer pour obtenir un résultat d'évaluation. Le contenu utile est une arborescence de références bibliographiques, chacune accompagnée d'un lien vers arXiv, ACL, SSRN ou une page de projet. Le public visé est celui qui doit écrire une section « évaluation » dans un article, préparer une revue de littérature, ou choisir un protocole avant de lancer ses propres mesures. Un ingénieur qui cherche un script pour comparer deux modèles sur un jeu de données n'y trouvera rien. Un chercheur qui veut savoir quelles dimensions ont déjà été instrumentées, et par qui, y trouvera une carte.

La taxonomie du survey comme plan de classement

L'organisation du dépôt suit explicitement le plan de l'article. Le README indique que les articles sont organisés selon le survey A Survey on Evaluation of Large Language Models, et précise que l'article arXiv ne peut pas être mis à jour en temps réel, ce qui fait du dépôt la version la plus à jour. La première grande division est « What to evaluate ». Elle se décline en sept blocs : le traitement du langage naturel, la robustesse, l'éthique, les biais et la fiabilité, les sciences sociales, les sciences naturelles et l'ingénierie, les applications médicales, les applications d'agents, puis une catégorie « autres applications ». Le bloc NLP est lui-même subdivisé en compréhension du langage, avec sentiment analysis, text classification, natural language inference et une rubrique « Others », puis en raisonnement. Ce découpage est le vrai apport : il rend visible le fait que l'évaluation d'un LLM n'est pas une tâche unique mais une famille de protocoles distincts, chacun avec ses jeux de données et ses conventions.

Deuxième axe : où l'on évalue

La table des matières comporte une seconde division, « Where to evaluate », distincte de « What to evaluate ». C'est un point que le README ne développe pas dans le texte fourni, et il faut le dire clairement : le contenu de cette section n'est pas visible dans l'extrait dont je dispose, seul son intitulé et son lien apparaissent. On peut en déduire l'intention (l'endroit où l'évaluation se déroule, par exemple un benchmark public, un environnement contrôlé ou un déploiement réel), mais pas le détail. Toute personne qui cite ce dépôt pour justifier un choix d'environnement d'évaluation doit donc ouvrir la section elle-même plutôt que se fier à la description. C'est une limite de la documentation, pas du dépôt : le README est un sommaire, et un sommaire n'est pas un contenu.

Comment on récupère le contenu

Il n'y a ni installation, ni commande, ni fichier de configuration documentés dans le README. La seule opération possible est de cloner le dépôt ou de le consulter sur GitHub, puis de suivre les liens. Les entrées se présentent sous une forme régulière : un titre d'article en italique avec les auteurs, une mention de venue (arXiv suivi d'une année, ACL 2023 Findings, SSRN 2023), puis un lien vers le papier. Par exemple, dans la sous-section sentiment analysis, la première entrée est A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity de Yejin Bang et al., arXiv 2023, avec un lien vers arxiv.org/abs/2302.04023. Le même article de Laskar et al. apparaît dans plusieurs sous-sections, ce qui est cohérent avec un classement par dimension évaluée plutôt que par publication. Le dépôt référence aussi deux projets liés : PromptBench, décrit comme un benchmark de prompts pour la robustesse des LLM, et une page LLM-eval. Ce sont ces projets, pas le survey, qui contiennent du code.

Ce que la liste ne dit pas

Une bibliographie annotée sans annotations reste une bibliographie. Ici, chaque entrée se limite à un titre, des auteurs, une venue et un lien. Aucune colonne ne précise la taille du jeu de données, la langue couverte, la métrique utilisée, ni si le protocole est reproductible. Pour un lecteur qui doit trancher entre deux benchmarks de raisonnement, cette absence est coûteuse : il devra ouvrir les deux papiers. Autre point, la couverture est datée. Les entrées visibles dans l'extrait sont majoritairement de 2022 et 2023, avec un article de 2023 sur la prévision des mouvements de cours boursiers classé dans une sous-section de NLP, ce qui surprendra plus d'un lecteur. Les deux annonces de news portent sur juillet 2023. Le dernier commit est daté de septembre 2026 selon les métadonnées du dépôt, mais l'extrait du README ne permet pas de vérifier ce qui a été ajouté après 2023. La seule façon de le savoir est de consulter l'historique des commits.

Face à un catalogue de benchmarks

L'alternative la plus directe n'est pas un autre survey mais un catalogue exécutable, du type de celui vers lequel ce dépôt renvoie lui-même. La différence d'approche est nette. Un catalogue de benchmarks fournit un identifiant de tâche, une commande d'installation et une métrique reproductible ; il permet de comparer deux modèles sur une échelle commune, au prix d'un périmètre figé. Le survey fournit l'inverse : un périmètre large, aucune exécution. Il sert à décider quoi mesurer, pas à mesurer. Utiliser l'un quand on attend l'autre est l'erreur la plus probable avec ce dépôt. Si votre besoin est de produire un chiffre comparable à ceux publiés ailleurs, la liste de références ne vous aidera qu'à choisir lequel, pas à l'obtenir.

Maintenance, licence et citation

Le dépôt ne contient pas de code au sens où on l'entend d'ordinaire, mais il est distribué sous une licence qui n'est pas indiquée dans les métadonnées fournies. C'est un point à vérifier avant toute réutilisation d'un extrait substantiel de la liste, même si la citation académique reste l'usage normal. Le README prévoit d'ailleurs une section Citation et une section Acknowledgements, et indique que les contributions par pull request ou issue sont bienvenues, avec mention des contributeurs dans les remerciements. Cela décrit un mode de maintenance communautaire, sans cycle de version : aucune release n'est référencée. La conséquence pratique est qu'il n'existe pas de version stable à épingler. Si vous citez ce dépôt dans un article, la date de consultation fait partie de la référence, et c'est la seule ancre dont vous disposez.

Conclusion éditoriale

À adopter si vous cherchez un point d'entrée bibliographique pour cadrer un protocole d'évaluation, en particulier sur les axes NLP, raisonnement, éthique et applications médicales. À éviter si vous attendez du code, des métriques ou un harnais reproductible : le dépôt ne contient rien de tel. Avant de vous appuyer dessus, vérifiez la date du dernier commit par rapport à la version de l'article que vous citez, et contrôlez que les entrées de la section qui vous intéresse pointent bien vers les versions publiées et non vers des préprints remplacés.

Sources officielles

  1. Issues
  2. MLGroupJLU/LLM-eval-survey on GitHub
  3. Project website
  4. README
Notes de la communauté

Notes de la communauté