Aleph-Alpha-Research
eval-framework
Comprehensive LLM evaluation at scale: A production-ready framework for evaluating large language models across multiple benchmarks.
41 étoiles6 forksPythonApache-2.0
Fraîcheur des données
Classification
Comprehensive LLM evaluation at scale: A production-ready framework for evaluating large language models across multiple benchmarks.
Le contexte du projet sur cette page est accessible gratuitement. Le dépôt GitHub d’origine reste la référence ; la connexion n’est nécessaire que pour enregistrer ou rejoindre la discussion.
Notes de la communauté