实用工具

OpenAI Token 计算器

用 OpenAI 官方同款分词表精确统计提示词的 Token 数,并逐个显示每个 Token 的起止位置。

浏览器本地运行AI 开发工具843
免费

输入

0 B

结果

结果会显示在这里。

上下文长度、速率限制和账单都按 Token 计,而不是按字数计,而且两者的比例因语言差别很大:英文大约 4 个字符一个 Token,中文往往接近一个字一个 Token。这个工具用 OpenAI 模型实际使用的 BPE 分词表统计任意文本的 Token 数——o200k_base 对应 GPT-4o、GPT-4.1、GPT-5 和 o 系列,cl100k_base 对应 GPT-4、GPT-3.5 和 text-embedding-3 系列。底层是 gpt-tokenizer(niieani/gpt-tokenizer,MIT),openai/tiktoken 的纯 JavaScript 移植版,结果与 tiktoken 逐 Token 一致;我们的测试在英文、中文、中英混排和代码上与 tiktoken 本身做过比对。

它是怎么工作的

  • 只下载你选中的那一套编码表,单独一个几 MB 的分包;之后的计数全部在浏览器里完成,文本不会发送到任何地方。
  • “Token 边界”视图用 │ 分隔每个 Token,换行显示为 ↵、制表符显示为 →。被拆成多个字节 Token 的汉字或 emoji 只显示一次,并用上标注明它占了几个 Token。
  • 像 <|endoftext|> 这样的特殊标记字符串按普通文本计数而不会报错,这和它们出现在消息正文里时 API 的处理方式一致。
  • “Token ID”视图列出模型实际收到的数字编号;两种视图最多显示前 20,000 个 Token,而统计数字始终覆盖全文。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

对 Claude、Gemini、Llama、DeepSeek 也准吗?
不准。每家厂商都训练了自己的分词器,同一段文本在不同模型上的 Token 数各不相同。对英文来说,o200k_base 的结果可以作为其他新模型的粗略估计,一般相差 10%–20%,但中文和代码可能差得更多。需要精确数字时,请用厂商自己的计数接口,比如 Anthropic 的 count_tokens 或 Gemini 的 countTokens。
该选哪种编码?
OpenAI 当前的模型都选 o200k_base:GPT-4o、GPT-4.1、GPT-5 以及 o1/o3/o4 推理模型。GPT-4、GPT-4 Turbo、GPT-3.5 Turbo 和 text-embedding-3、ada-002 向量模型选 cl100k_base。o200k_base 的词表大一倍,同样的中文文本用它通常能少用不少 Token。
为什么一次对话请求消耗的 Token 比这里显示的多?
因为 API 会给每条消息包上几个格式 Token——大约每条 3 个,再加 3 个用于引导回复——函数或工具定义也要计入。这个工具统计的是你粘贴的文本本身,适合用来压缩提示词;估算整个请求时,按消息条数把这几个 Token 加上即可。
为什么有的汉字算两三个 Token?
BPE 分词器处理的是 UTF-8 字节,一个汉字占 3 个字节。常用字和常用词有自己的 Token,生僻一些的字就会被拆成字节片段,每个片段算一个 Token。边界视图里的上标(例如 ⁽²⁾)标出的正是这些字。

背后的开源项目

本工具运行在 niieani/gpt-tokenizer 之上,以 MIT 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

niieani/gpt-tokenizer

也常被称作

  • token计算器
  • token数量计算
  • openai tokenizer
  • tiktoken 在线
  • gpt token 计算
  • o200k_base
  • cl100k_base