Modèle / jeu de données
SemiAnalysisAI/InferenceX avatar
SemiAnalysisAI/InferenceX

InferenceX transforme le benchmark d'inférence en mesure continue, pas en instantané : lecture pratique du dépôt

Plateforme de recherche de référence d'inférence continue Open Source, Kimi K2.7-Code, MiniMax M3, DeepSeekv4, GLM5 - GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72 et bientôt TPUv6e/v7/Trainium2/3 | , Kimi K2.7-Code MiniMax M3 DeepSeekv4 GLM5 - GB200 NVL72 contre MI355X contre B200 contre GB300 NVL72 TPUv6e/v7/Trainium2/3.

1 676 étoiles294 forksPythonApache-2.0

En bref

De quoi s’agit-il ?
Une plateforme de recherche open source qui teste en continu des frameworks d'inférence LLM courants sur du matériel NVIDIA et AMD, avec d'autres accélérateurs prévus.
À qui s’adresse-t-il ?
Ce projet convient au profil décrit par son README : Une plateforme de recherche open source qui teste en continu des frameworks d'inférence LLM courants sur du matériel NVIDIA et AMD, avec d'autres accélérateurs prévus.. Avant adoption, vérifiez dans ce dépôt les commandes, fichiers de configuration et contraintes mentionnés, puis observez le résultat propre à votre environnement.
Puis-je l’utiliser commercialement ?
Oui. Apache-2.0 est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 1 jour.
En quel langage est-il écrit ?
Principalement Python, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 14 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Le projet et son tableau de bord public

InferenceX, anciennement InferenceMAX, est une plateforme de recherche sur les performances d'inférence. Le README la décrit comme un benchmark continu des frameworks d'inférence open source utilisés par les grands opérateurs de modèles, avec pour objectif d'enregistrer les performances réelles à mesure que la pile logicielle évolue. Un tableau de bord public est accessible à inferencex.com, et les métadonnées du dépôt indiquent la même adresse comme page d'accueil. Le README renvoie aussi à un dépôt distinct de tableau de bord open source et contient des badges pour DeepWiki et les étoiles GitHub. Les métadonnées listent Python comme langage principal, avec 1 318 étoiles, 247 forks et 210 problèmes ouverts au moment de la collecte. Le README précise que seul le dépôt SemiAnalysisAI/InferenceX contient les résultats officiels, que tous les autres forks et dépôts sont non officiels et doivent être étiquetés comme tels.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « Le projet et son tableau de bord public », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

Pourquoi le benchmark doit continuer à évoluer

Le projet part du constat que la performance d'inférence évolue à deux vitesses. Le matériel produit des sauts lorsque de nouveaux GPU ou systèmes d'accélération apparaissent, tandis que le logiciel s'améliore en continu par petites versions, parfois à quelques jours d'intervalle. Le README cite SGLang, vLLM, TensorRT-LLM, CUDA et ROCm comme exemples de logiciels qui ajoutent des optimisations au niveau des kernels, des stratégies d'inférence distribuée et des changements d'ordonnancement. Un benchmark ponctuel devient vite obsolète et ne reflète pas les performances obtenues avec les derniers paquets. InferenceX est donc conçu comme un benchmark automatisé et continu, plutôt qu'un instantané figé. Le README utilise l'expression Speed is the Moat, mais ne précise ni la fréquence d'exécution, ni la charge de test, ni la part respective du matériel et du logiciel.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « Pourquoi le benchmark doit continuer à évoluer », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

Matériel pris en charge et modèles dans les actualités

La liste du matériel officiellement pris en charge inclut GB300 NVL72, GB200 NVL72, MI355X, B300, B200, MI325X, MI300X, H200 et H100. Plusieurs éléments sont marqués comme à venir, dont TPUv7x Ironwood Ghostfish, MI455 UALoE72, Vera Rubin NVL72, Rubin NVL8 et des puces sans nom de quatre fournisseurs non identifiés, sans dates annoncées. Les actualités mentionnent des benchmarks continus pour MiniMax M3, DeepSeek V4 Pro 1.6T, Qwen3.5 397B, Kimi K2.5, GLM5 et MiniMax M2.5, avec liens vers le tableau de bord. Les dates vont d'octobre 2025 à juin 2026. GB300 NVL72 a été ajouté en février 2026 et testé en continu, avec un billet de blog LMSYS lié à un mainteneur SGLang. Le README ne donne pas les métriques de mesure, les réglages de concurrence ni les définitions de latence et de débit; ces détails doivent être vérifiés dans le code source ou le tableau de bord.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « Matériel pris en charge et modèles dans les actualités », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

État du dépôt et processus de contribution

Les métadonnées montrent 1 318 étoiles, 247 forks et 210 problèmes ouverts, avec la branche main par défaut et du code en Python. Le README accueille les pull requests et renvoie à CONTRIBUTING.md pour le processus de revue, à docs/PR_REVIEW_CHECKLIST.md pour la liste de contrôle et à un processus de fusion documenté. Le badge indique PRs welcome. Il ne liste pas les noms des mainteneurs, les délais de réponse ni un code de conduite. Le README ne décrit pas non plus comment installer le benchmark en local ni comment lancer le tableau de bord; les commandes d'installation et d'utilisation ne sont donc pas disponibles dans cette source. Les métadonnées ne contiennent ni date de dernier commit ni nombre de mainteneurs actifs.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « État du dépôt et processus de contribution », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

Remerciements et soutien matériel

Les remerciements citent Lisa Su et Anush Elangovan d'AMD pour les GPU MI355X et CDNA3, ainsi que Jensen Huang et Ian Buck de NVIDIA pour avoir aidé à fournir un rack GB200 NVL72 via OCI et des GPU B200. La section remercie aussi des contributeurs non nommés des équipes inférence et Dynamo de NVIDIA, des contributeurs AMD qui ont aidé à déboguer, optimiser et valider les performances sur GPU AMD, les mainteneurs de SGLang, vLLM et TensorRT-LLM, et les fournisseurs de calcul Crusoe, CoreWeave, Nebius, TensorWave, Oracle et TogetherAI. Un lien vers la liste complète des soutiens et citations est présent à inferencex.semianalysis.com/quotes. Le README ne dit pas si ces organisations contrôlent la direction du projet, disposent de droits de commit ou influencent la conception des benchmarks.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « Remerciements et soutien matériel », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

Apache-2.0 et ce que le matériel source ne couvre pas

Le dépôt est sous licence Apache-2.0, selon les métadonnées. L'extrait de licence accorde une licence de droit d'auteur perpétuelle, mondiale, non exclusive, gratuite et sans redevance pour reproduire l'œuvre, préparer des œuvres dérivées, l'afficher et l'exécuter publiquement, la sous-licencier et la distribuer. Il accorde aussi une licence de brevet pour les contributions, qui prend fin si une action en contrefaçon est intentée contre un licencié. L'extrait inclut les définitions, la licence de droit d'auteur et la licence de brevet, mais les conditions de redistribution ne sont présentes qu'au début de la section 4. Ni le README ni l'extrait de licence ne fournissent de garantie, d'engagement de support, de garantie de sécurité ou de méthodologie de benchmark, et ils ne décrivent pas comment les résultats officiels sont audités.

InferenceX veut transformer le benchmark d inférence en observation continue. Son périmètre cite plusieurs modèles et accélérateurs, notamment Kimi, MiniMax, DeepSeek, GLM, GB200, B200 et MI355X, avec d autres cibles annoncées. Cette largeur rend les comparaisons intéressantes, mais les résultats restent liés au matériel, au moteur, à la version du modèle et aux paramètres de mesure. Le README permet surtout de comprendre le tableau de bord et le processus de contribution ; il ne faut pas interpréter chaque chiffre comme une mesure universelle. Dans la section « Apache-2.0 et ce que le matériel source ne couvre pas », ce point doit être relié aux choix concrets du dépôt, notamment à sa configuration et à ses commandes.

Conclusion éditoriale

Ce projet convient au profil décrit par son README : Une plateforme de recherche open source qui teste en continu des frameworks d'inférence LLM courants sur du matériel NVIDIA et AMD, avec d'autres accélérateurs prévus.. Avant adoption, vérifiez dans ce dépôt les commandes, fichiers de configuration et contraintes mentionnés, puis observez le résultat propre à votre environnement.

Sources officielles

  1. Official documentation
  2. Official README
  3. Project repository
  4. Release notes
Notes de la communauté

Notes de la communauté