實用工具

語音轉文字(瀏覽器內執行 Whisper)

在瀏覽器裡執行 OpenAI Whisper,把音訊或影片轉成純文字或 SRT 字幕,檔案不必上傳。

瀏覽器本機執行AI 開發工具1.6萬
免費
把檔案拖到這裡

或點選選擇檔案。檔案只在目前分頁裡處理,不會上傳到任何伺服器。

Whisper 是 OpenAI 以 openai/whisper 開源發布的語音辨識模型,多數逐字稿工具都建立在它之上。本頁透過 huggingface/transformers.js 在分頁裡執行它:瀏覽器先解碼錄音的音軌,重新取樣成 16 kHz 單聲道,模型再以每 30 秒為一段進行轉寫。想要快就選 tiny,想要準就選 base,知道語言的話就指定一下,最後得到純文字或帶時間軸的 SRT 字幕。它免費、檔案不上傳,但速度比雲端 API 慢得多。

它是怎麼運作的

  • 量化後的模型在第一次使用時從 Hugging Face 下載,tiny 約 40 MB、base 約 77 MB,之後由瀏覽器快取。
  • 長音訊會切成每段 30 秒、相鄰重疊 5 秒,這是 Whisper 處理超過自身視窗長度的音訊的標準做法。
  • 翻譯模式會讓 Whisper 不論說的是哪種語言都輸出英文;Whisper 只能翻成英文,沒有其他目標語言。

你的資料去了哪裡

哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。

本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。

它要花多少

本工具完全免費,不需要登入,也不消耗點數。

常見問題

轉寫要多久?
取決於你的 CPU,因為模型跑在 WebAssembly 上,而不是資料中心的 GPU。在較新的筆電上,base 模型大約要花掉錄音長度相當可觀的一部分時間,手機上則會慢得多。好幾個小時的音訊,用雲端 API 或在自己電腦上跑 whisper.cpp 比較實際;本頁適合短片段和會議錄音。
模型一直下載不完,是怎麼回事?
模型權重來自 huggingface.co,ONNX Runtime 檔案來自 jsDelivr,在某些網路環境下(包括中國大陸)這兩個位址都可能很慢甚至連不上,下載完成之前工具無法開始。只要成功下載過一次,瀏覽器快取就能讓它之後不依賴網路直接啟動。
支援哪些檔案格式?
瀏覽器能解碼的都可以:MP3、WAV、M4A、AAC、OGG、FLAC,多數瀏覽器還能讀取 MP4 和 WebM 影片裡的音軌。解碼失敗時,先把音訊抽出來,例如用 ffmpeg -i input.mov -vn audio.m4a。檔案上限 100 MB,因為解碼後的整條音軌都要放在記憶體裡。

背後的開源專案

本工具執行在 huggingface/transformers.js 之上,以 Apache-2.0 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。

huggingface/transformers.js

也常被稱作

  • 語音轉文字
  • 線上語音轉文字免費
  • whisper 線上
  • 音檔轉文字
  • 影片轉字幕
  • srt 字幕產生