實用工具
把檔案拖到這裡
或點選選擇檔案。檔案只在目前分頁裡處理,不會上傳到任何伺服器。
Whisper 是 OpenAI 以 openai/whisper 開源發布的語音辨識模型,多數逐字稿工具都建立在它之上。本頁透過 huggingface/transformers.js 在分頁裡執行它:瀏覽器先解碼錄音的音軌,重新取樣成 16 kHz 單聲道,模型再以每 30 秒為一段進行轉寫。想要快就選 tiny,想要準就選 base,知道語言的話就指定一下,最後得到純文字或帶時間軸的 SRT 字幕。它免費、檔案不上傳,但速度比雲端 API 慢得多。
它是怎麼運作的
- 量化後的模型在第一次使用時從 Hugging Face 下載,tiny 約 40 MB、base 約 77 MB,之後由瀏覽器快取。
- 長音訊會切成每段 30 秒、相鄰重疊 5 秒,這是 Whisper 處理超過自身視窗長度的音訊的標準做法。
- 翻譯模式會讓 Whisper 不論說的是哪種語言都輸出英文;Whisper 只能翻成英文,沒有其他目標語言。
你的資料去了哪裡
哪也沒去。本工具完全在你的瀏覽器裡執行:你貼上的文字由頁面處理,不會傳輸到任何伺服器,也不會寫進任何紀錄。
本工具免費且免登入,執行結果只存在於你目前的頁面裡,不會被儲存到任何地方。
它要花多少
本工具完全免費,不需要登入,也不消耗點數。
常見問題
- 轉寫要多久?
- 取決於你的 CPU,因為模型跑在 WebAssembly 上,而不是資料中心的 GPU。在較新的筆電上,base 模型大約要花掉錄音長度相當可觀的一部分時間,手機上則會慢得多。好幾個小時的音訊,用雲端 API 或在自己電腦上跑 whisper.cpp 比較實際;本頁適合短片段和會議錄音。
- 模型一直下載不完,是怎麼回事?
- 模型權重來自 huggingface.co,ONNX Runtime 檔案來自 jsDelivr,在某些網路環境下(包括中國大陸)這兩個位址都可能很慢甚至連不上,下載完成之前工具無法開始。只要成功下載過一次,瀏覽器快取就能讓它之後不依賴網路直接啟動。
- 支援哪些檔案格式?
- 瀏覽器能解碼的都可以:MP3、WAV、M4A、AAC、OGG、FLAC,多數瀏覽器還能讀取 MP4 和 WebM 影片裡的音軌。解碼失敗時,先把音訊抽出來,例如用 ffmpeg -i input.mov -vn audio.m4a。檔案上限 100 MB,因為解碼後的整條音軌都要放在記憶體裡。
背後的開源專案
本工具執行在 huggingface/transformers.js 之上,以 Apache-2.0 授權發布。如果你需要在自己的程式裡實作同樣的能力,直接用這個函式庫。
huggingface/transformers.js也常被稱作
- 語音轉文字
- 線上語音轉文字免費
- whisper 線上
- 音檔轉文字
- 影片轉字幕
- srt 字幕產生