Outils

Compteur de tokens OpenAI

Comptez les tokens d’un prompt exactement comme le fait le tokenizer d’OpenAI, et voyez où chaque token commence et se termine.

S’exécute dans le navigateurOutils de développement IA843
Gratuit

Entrée

0 B

Résultat

Le résultat apparaîtra ici.

Les limites de contexte, les limites de débit et la facture se mesurent en tokens, pas en caractères, et le rapport entre les deux varie beaucoup selon la langue : l’anglais tourne autour de quatre caractères par token, alors que le chinois s’approche souvent d’un seul. Cet outil compte les tokens de n’importe quel texte avec les mêmes tables d’encodage BPE (byte-pair encoding) que les modèles d’OpenAI — o200k_base pour GPT-4o, GPT-4.1, GPT-5 et la série o, cl100k_base pour GPT-4, GPT-3.5 et les modèles text-embedding-3. Il s’appuie sur gpt-tokenizer (niieani/gpt-tokenizer, MIT), un portage en JavaScript pur d’openai/tiktoken dont la sortie correspond à celle de tiktoken token pour token ; nos tests le comparent à tiktoken lui-même sur de l’anglais, du chinois, du texte mixte et du code.

Comment ça marche

  • Seul l’encodage que vous choisissez est téléchargé, dans un fichier séparé de quelques mégaoctets ; ensuite, le comptage se fait dans votre navigateur et le texte n’est jamais envoyé nulle part.
  • La vue des frontières sépare les tokens par │ et affiche les sauts de ligne en ↵ et les tabulations en →. Un caractère chinois ou un emoji que l’encodage découpe en plusieurs tokens d’octets n’est affiché qu’une fois, avec un petit exposant indiquant le nombre de tokens qu’il a pris.
  • Des chaînes comme <|endoftext|> sont comptées comme du texte ordinaire au lieu d’être rejetées, ce qui correspond au traitement de l’API lorsqu’elles apparaissent dans un message.
  • La vue des identifiants liste les ID numériques que le modèle reçoit réellement ; les deux vues affichent les 20 000 premiers tokens, et le total couvre toujours l’ensemble du texte.

Où vont vos données

Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.

Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.

Ce que ça coûte

Cet outil est gratuit, sans connexion ni points.

Questions fréquentes

Le compte est-il exact pour Claude, Gemini, Llama ou DeepSeek ?
Non. Chaque éditeur entraîne son propre tokenizer, si bien que le même texte donne un nombre de tokens différent chez chacun. Le compte o200k_base est une estimation raisonnable pour les autres modèles récents sur du texte anglais, en général à 10–20 % près, mais l’écart peut être plus grand sur du chinois ou du code. Pour un chiffre exact, utilisez le point de comptage de l’éditeur lui-même, comme count_tokens chez Anthropic ou countTokens chez Gemini.
Quel encodage choisir ?
o200k_base pour tout ce qu’OpenAI propose actuellement : GPT-4o, GPT-4.1, GPT-5 et les modèles de raisonnement o1/o3/o4. cl100k_base pour GPT-4, GPT-4 Turbo, GPT-3.5 Turbo et les modèles d’embedding text-embedding-3 et ada-002. o200k_base a un vocabulaire deux fois plus grand, donc un même texte non anglais demande en général nettement moins de tokens avec lui.
Pourquoi une requête de chat consomme-t-elle plus de tokens que ce qui est affiché ici ?
Parce que l’API enveloppe chaque message de quelques tokens de mise en forme qui lui sont propres — environ trois par message, plus trois pour amorcer la réponse — et que les définitions de fonctions ou d’outils sont comptées aussi. Cet outil compte le texte que vous collez, ce dont vous avez besoin pour raccourcir un prompt ; pour une requête complète, ajoutez ces quelques tokens par message.
Pourquoi un caractère chinois compte-t-il parfois pour deux ou trois tokens ?
Les encodages BPE travaillent sur les octets UTF-8, et un caractère chinois occupe trois octets. Les caractères et les mots courants ont leurs propres tokens, mais un caractère plus rare est découpé en morceaux d’octets, et chaque morceau est un token. L’exposant de la vue des frontières, par exemple ⁽²⁾, signale précisément ces caractères.

L’open source derrière

Cet outil fonctionne grâce à niieani/gpt-tokenizer, publié sous licence MIT. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.

niieani/gpt-tokenizer

Aussi appelé

  • compteur de tokens
  • compter les tokens
  • tokenizer OpenAI en ligne
  • token counter
  • tiktoken en ligne
  • o200k_base
  • nombre de tokens GPT