實用工具

OpenAI Token 計算器

用與 OpenAI 分詞器完全相同的方式計算提示詞的 Token 數,並看清每個 Token 從哪裡開始、到哪裡結束。

瀏覽器本機執行AI 開發工具843
免費

輸入

0 B

結果

結果會顯示在這裡。

上下文長度上限、速率限制和帳單,計量單位都是 Token 而不是字元,而兩者的比例會隨語言大幅變動:英文大約四個字元一個 Token,中文則常常接近一個字就一個 Token。這個工具使用與 OpenAI 模型相同的位元組對編碼(BPE)表來計算任何文字的 Token 數——GPT-4o、GPT-4.1、GPT-5 和 o 系列用 o200k_base,GPT-4、GPT-3.5 以及 text-embedding-3 模型用 cl100k_base。底層是 gpt-tokenizer(niieani/gpt-tokenizer,MIT),這是 openai/tiktoken 的純 JavaScript 移植版,輸出與 tiktoken 逐個 Token 一致;我們的測試會在英文、中文、中英混合文字和程式碼上直接拿它與 tiktoken 比對。

它是怎麼運作的

  • 只會下載你選擇的那一種編碼,它是一個獨立的程式碼區塊,大小約數 MB;下載之後,計算全在你的瀏覽器中進行,文字不會傳送到任何地方。
  • Token 邊界檢視以 │ 分隔各個 Token,換行顯示為 ↵、定位字元顯示為 →。被編碼拆成多個位元組 Token 的中文字或 emoji 只顯示一次,並以小小的上標註明它佔了幾個 Token。
  • 像 <|endoftext|> 這類字串會當成一般文字計算而不會被拒絕,這與它出現在訊息內容中時 API 的處理方式相同。
  • Token ID 檢視列出模型實際收到的數字 ID;兩種檢視都只顯示前 20,000 個 Token,但計數永遠涵蓋全部文字。

你的資料去了哪裡

哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。

本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

對 Claude、Gemini、Llama 或 DeepSeek 來說,這個數字準確嗎?
不準確。每家廠商都訓練自己的分詞器,同一段文字在各家模型上會得到不同的 Token 數。對其他現代模型的英文文字而言,o200k_base 的數字是合理的估計,通常誤差在 10–20% 以內,但中文或程式碼可能差得更多。需要精確數字時,請用廠商自己的計數端點,例如 Anthropic 的 count_tokens 或 Gemini 的 countTokens。
該選哪一種編碼?
OpenAI 目前的模型都選 o200k_base:GPT-4o、GPT-4.1、GPT-5,以及 o1/o3/o4 推理模型。GPT-4、GPT-4 Turbo、GPT-3.5 Turbo,以及 text-embedding-3 和 ada-002 嵌入模型則選 cl100k_base。o200k_base 的詞彙表大了一倍,所以同一段非英文文字用它通常會少掉相當多的 Token。
為什麼一次聊天請求用掉的 Token 比這裡顯示的多?
因為 API 會替每則訊息包上幾個自己的格式 Token——每則訊息約三個,另外還有三個用來引導回覆——函式或工具定義也會計入。這個工具計算的是你貼上的文字,也就是精簡提示詞時需要的數字;要估算完整請求時,請替每則訊息再加上這幾個 Token。
為什麼一個中文字有時會算成兩三個 Token?
位元組對編碼處理的是 UTF-8 位元組,而一個中文字佔三個位元組。常用的字和詞有自己專屬的 Token,但比較罕見的字會被拆成幾個位元組片段,每個片段各算一個 Token。邊界檢視中的上標(例如 ⁽²⁾)標示的正是這些字。

背後的開源專案

本工具執行在 niieani/gpt-tokenizer 之上,以 MIT 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。

niieani/gpt-tokenizer

也常被稱作

  • token 計算
  • openai token 計算器
  • gpt token 數
  • tiktoken 線上
  • o200k_base
  • 中文 token 數