Modèle / jeu de données
WeiboAI/VibeThinker avatar
WeiboAI/VibeThinker

VibeThinker : ce que le dépôt WeiboAI contient vraiment, et ce qu'il ne contient pas

Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B

1 576 étoiles116 forksPythonMIT
GitHub

En bref

De quoi s’agit-il ?
Le dépôt GitHub de VibeThinker héberge deux modèles de raisonnement de 1,5 et 3 milliards de paramètres sous licence MIT. Le README annonce des scores de benchmarks, mais il ne décrit aucune procédure d'installation : voici ce que l'on peut vérifier, et ce qui manque avant tout déploiement.
À qui s’adresse-t-il ?
VibeThinker vise les équipes qui veulent un modèle de raisonnement mathématique et compétitif tenant sur une seule carte et publié sous MIT, mais le dépôt GitHub n'est pas un paquet installable : avant d'engager quoi que ce soit, ouvrez la fiche Hugging Face WeiboAI/VibeThinker-1.5B et vérifiez que les poids, le tokenizer et la carte de configuration y sont bien présents, car rien dans le README du dépôt ne le garantit.
Puis-je l’utiliser commercialement ?
Oui. MIT est une licence permissive : vous pouvez utiliser, modifier et vendre un logiciel qui en dépend, à condition de conserver les mentions de droit d’auteur et de licence.
Est-il encore maintenu ?
Oui. Les derniers commits datent d’il y a 32 jours.
En quel langage est-il écrit ?
Principalement Python, d’après les statistiques de langage de GitHub.

Ces réponses reposent sur les données GitHub du projet (dernière synchronisation le 15 septembre 2026) et sur notre analyse. Elles ne constituent pas un avis juridique.

ANALYSE OPEN SOURCE APPROFONDIE

Deux modèles, un seul dépôt, aucune bibliothèque

Le dépôt WeiboAI/VibeThinker est écrit en Python et publié sous licence MIT. Il ne s'agit pas d'un framework ni d'une bibliothèque que l'on installe avec pip. Le README sert de page d'index : il renvoie vers deux modèles, VibeThinker-1.5B et VibeThinker-3B, hébergés sur Hugging Face et sur ModelScope, et vers deux rapports techniques. La section Model Downloads donne exactement deux liens par modèle, un par plateforme. Aucun script d'entraînement, aucun fichier de configuration d'inférence, aucune commande n'apparaît dans la partie du README fournie.

Le public visé est donc précis : des ingénieurs qui veulent évaluer un modèle de raisonnement compact, pas des développeurs qui cherchent une dépendance à ajouter à un projet. Le README positionne explicitement les deux modèles sur des tâches à signal de vérification fiable : raisonnement mathématique, programmation compétitive, raisonnement STEM, et suivi d'instructions avec contraintes explicites. C'est une délimitation utile, car elle exclut d'emblée les usages conversationnels ou génératifs ouverts, pour lesquels aucun résultat n'est présenté.

Spectrum-to-Signal : la méthode derrière le nom

Le principe mis en avant pour VibeThinker-1.5B s'appelle Spectrum-to-Signal Principle (SSP). Le README le décrit en deux étapes. La phase SFT utilise une Two-Stage Diversity-Exploring Distillation, présentée comme un moyen de produire un large spectre de solutions. La phase RL applique ensuite MaxEnt-Guided Policy Optimization (MGPO), dont le rôle annoncé est d'amplifier le signal correct parmi ces solutions.

L'idée directrice est donc que la diversité des sorties n'est pas un défaut à réduire mais une matière première à filtrer. Le nom du dépôt reprend d'ailleurs cette logique : Tiny Model, Big Logic, Diversity-Driven Optimization Elicits Large-Model Reasoning Ability. Pour VibeThinker-3B, le README parle d'un pipeline SSP mis à niveau, combinant SFT curriculaire, RL multi-domaines, auto-distillation hors ligne et RL orienté instructions. Le modèle de base est Qwen2.5-Coder-3B.

Ce que le README ne fournit pas, c'est le détail algorithmique : ni la fonction de perte, ni les hyperparamètres, ni la composition exacte des données. Ces éléments sont renvoyés aux rapports techniques et aux articles arXiv. Toute reproduction de l'entraînement dépend donc de la lecture de ces documents, pas du dépôt.

Les chiffres avancés, et leur périmètre réel

Pour VibeThinker-3B, le README annonce 94,3 sur AIME26, 89,3 sur HMMT25, 80,2 en Pass@1 sur LiveCodeBench v6, et un taux d'acceptation de 96,1 % sur des concours LeetCode hebdomadaires et bihebdomadaires inédits entre le 25 avril et le 31 mai 2026. Une stratégie de test-time scaling nommée Claim-Level Reliability Assessment (CLR) est présentée comme relevant AIME26 de 94,3 à 97,1 et HMMT25 de 89,3 à 95,4.

Pour VibeThinker-1.5B, le README cite AIME24 à 80,3, AIME25 à 74,4 et HMMT25 à 50,4, en comparaison avec DeepSeek R1-0120 à 79,8, 70,0 et 41,7. Ces valeurs proviennent du rapport technique, pas d'une exécution reproductible dans le dépôt. Aucun script d'évaluation n'est fourni dans la partie visible du README, ce qui signifie qu'un lecteur ne peut pas recalculer ces scores sans reconstruire lui-même la procédure d'évaluation à partir des articles.

C'est la limite la plus concrète du dépôt : il publie des résultats, pas de quoi les vérifier. Un score de benchmark sans harnais d'évaluation associé reste une déclaration, aussi détaillée soit-elle.

Le coût d'entraînement annoncé et ce qu'il recouvre

Le README avance un chiffre qui mérite d'être isolé : 7 800 dollars pour l'entraînement de VibeThinker-1.5B, contre 294 000 dollars pour DeepSeek R1 et 535 000 dollars pour MiniMax-M1, soit un facteur de réduction de 30 à 60. C'est l'argument économique central du projet, et il est cohérent avec la taille du modèle : 1,5 milliard de paramètres contre plus de 600 milliards.

Reste à savoir ce que ce montant couvre exactement. Le README ne précise pas s'il s'agit du seul post-entraînement, du pré-entraînement, ou de l'ensemble du cycle. Il ne dit rien non plus du matériel utilisé, du nombre de GPU-heures, ni de la durée. Or un coût en dollars sans décomposition matérielle est difficile à transposer : le même budget n'a pas le même sens selon qu'il s'agit de GPU loués à l'heure ou de matériel possédé en propre.

Pour un lecteur qui envisage de reproduire la méthode, ce chiffre est donc un ordre de grandeur, pas un budget. La comparaison avec DeepSeek R1 et MiniMax-M1 porte sur des modèles de tailles très différentes, ce qui rend l'écart attendu plutôt qu'informatif sur l'efficacité de la méthode elle-même.

Mise en route : ce que le README permet réellement de faire

Il faut être direct : la partie du README fournie ne contient aucune commande d'installation, aucun extrait de code d'inférence, aucune clé de configuration. Les seules actions documentées sont des téléchargements depuis deux URL : huggingface.co/WeiboAI/VibeThinker-1.5B et modelscope.cn/models/WeiboAI/VibeThinker-1.5B, avec les équivalents pour la variante 3B.

Concrètement, la mise en route passe donc par l'écosystème Hugging Face, pas par le dépôt GitHub. Le format des poids, la présence d'un tokenizer, la compatibilité avec transformers ou avec un moteur d'inférence particulier : rien de tout cela n'est indiqué dans le matériel disponible. Je ne peux pas affirmer que le modèle se charge avec une commande donnée, ni qu'il fonctionne avec tel ou tel runtime, parce que le README ne le dit pas.

C'est un point à vérifier avant tout engagement. La page Hugging Face du modèle est le seul endroit où ces informations peuvent figurer, et elle n'est pas incluse dans ce que j'ai pu consulter. Un dépôt dont la documentation s'arrête aux liens de téléchargement laisse tout le travail d'intégration à l'utilisateur.

Là où VibeThinker n'est pas le bon outil

Le README est explicite sur un point : les modèles sont conçus pour des tâches à signal de vérification fiable. Mathématiques, programmation compétitive, STEM, instructions à contraintes explicites. Cette restriction n'est pas un détail marketing, c'est une contrainte de conception. La méthode SSP repose sur la capacité à distinguer une solution correcte d'une solution incorrecte, ce qui suppose une réponse vérifiable automatiquement.

Pour une tâche sans vérificateur, comme la rédaction, la synthèse de documents ou le dialogue ouvert, l'argument central du projet ne s'applique plus. Rien dans le README ne suggère que ces modèles y soient compétitifs, et aucun résultat n'est présenté dans cette direction. Un modèle de 1,5 milliard de paramètres entraîné sur des trajectoires de raisonnement longues peut par ailleurs produire des sorties verbeuses, ce qui est un coût en latence et en tokens pour des cas d'usage où la concision compte.

Autre cas défavorable : si vous avez besoin d'un modèle avec un support commercial, une garantie de maintenance ou une feuille de route. Le dépôt n'a pas de releases publiées, pas de page d'accueil, et le README ne mentionne aucun canal de support. Le dernier push daté est le 14 août 2026, ce qui indique une activité, mais rien ne garantit la continuité.

Face à quoi le comparer

L'alternative la plus directe est le modèle dont VibeThinker-3B dérive : Qwen2.5-Coder-3B. La différence d'approche est nette. Qwen2.5-Coder-3B est un modèle de base orienté génération de code, disponible avec sa propre documentation et son propre écosystème. VibeThinker-3B part de ces poids et leur ajoute un post-entraînement en plusieurs étapes pour développer le raisonnement vérifiable. Si votre besoin est la complétion de code classique, le modèle de base suffit et évite une couche d'entraînement dont vous ne maîtriserez ni les données ni les biais.

L'autre point de comparaison cité dans le README est DeepSeek R1, avec un écart de taille supérieur à 400 fois pour la variante 1.5B. Le choix se joue alors sur le déploiement : un modèle de 1,5 milliard de paramètres tient sur du matériel modeste, ce qui n'est pas le cas d'un modèle de plusieurs centaines de milliards. Si votre contrainte est la mémoire GPU ou le coût d'inférence, l'écart de taille est l'argument décisif, indépendamment des scores.

Si votre contrainte est la robustesse sur des tâches variées, un modèle plus grand et plus généraliste reste probablement le choix par défaut. VibeThinker est un outil spécialisé, et le README ne prétend pas autre chose.

Licence, maintenance et coût de suivi

La licence du dépôt est MIT, ce qui est permissif : utilisation, modification et redistribution sont autorisées, y compris dans un produit commercial, sous réserve de conserver la mention de copyright et le texte de la licence. Cette appréciation porte sur le dépôt de code. Les poids des modèles sont hébergés sur Hugging Face et ModelScope, et le README ne précise pas sous quelle licence ils sont distribués. C'est une distinction qui compte : la licence du dépôt GitHub ne s'applique pas automatiquement aux fichiers de poids publiés ailleurs. Il faut consulter la fiche du modèle sur chaque plateforme pour le savoir.

Sur la maintenance, les éléments disponibles sont limités. Aucune release n'est répertoriée. Le dépôt n'est pas archivé. Le dernier push est daté du 14 août 2026. Le journal de nouveautés du README mentionne la sortie de VibeThinker-3B le 16 juin 2026 et une publication sur l'évaluation de fiabilité au niveau des affirmations le 12 août 2026, avec un dépôt de code séparé. Cela suggère un projet actif, mais rien n'indique une cadence de mise à jour ni un engagement de compatibilité.

Le coût de suivi réel dépend donc de votre capacité à suivre les rapports techniques plutôt que le dépôt. Toute évolution de la méthode SSP ou du pipeline MGPO apparaîtra dans un article arXiv avant d'apparaître dans le code, puisque le code d'entraînement n'est pas publié ici.

Conclusion éditoriale

VibeThinker vise les équipes qui veulent un modèle de raisonnement mathématique et compétitif tenant sur une seule carte et publié sous MIT, mais le dépôt GitHub n'est pas un paquet installable : avant d'engager quoi que ce soit, ouvrez la fiche Hugging Face WeiboAI/VibeThinker-1.5B et vérifiez que les poids, le tokenizer et la carte de configuration y sont bien présents, car rien dans le README du dépôt ne le garantit.

Sources officielles

  1. Issues
  2. License: MIT
  3. README
  4. WeiboAI/VibeThinker on GitHub
Notes de la communauté

Notes de la communauté