ツール

音声文字起こし(ブラウザで動く Whisper)

タブの中で動く OpenAI の Whisper で音声や動画を文字起こしし、プレーンテキストまたは SRT 字幕として出力します。

ブラウザ内で実行AI 開発ツール1.6万
無料
ここにファイルをドロップ

またはファイルを選択してください。ファイルはこのタブの中で処理され、どのサーバーにもアップロードされません。

OpenAI が openai/whisper として公開した Whisper は、多くの文字起こしツールの土台になっているオープンな音声モデルです。このページは huggingface/transformers.js を使ってタブの中で Whisper を実行します。ブラウザが録音の音声トラックをデコードして 16 kHz のモノラルにリサンプリングし、モデルが 30 秒単位のウィンドウで文字起こしします。速さ重視なら tiny、精度重視なら base を選び、分かっていれば言語を指定すると、プレーンテキストかタイムスタンプ付きの SRT ファイルが得られます。無料でプライバシーも守られますが、クラウド API よりは遅くなります。

動作のしくみ

  • 量子化されたモデルは初回使用時に Hugging Face からダウンロードされ(tiny は約 40 MB、base は約 77 MB)、ブラウザにキャッシュされます。
  • 長いファイルは 5 秒ずつ重なる 30 秒のチャンクに分割します。これは、ウィンドウより長い音声を Whisper で扱うときの標準的な方法です。
  • 翻訳モードでは、話されている言語にかかわらず Whisper が英語で書き出します。Whisper には英語以外の翻訳先言語はありません。

データの行き先

どこにも行きません。このツールは完全にブラウザ内で動作します。貼り付けたテキストはページが処理し、サーバーに送信されることも、ログに記録されることもありません。

このツールは無料で登録不要です。結果は開いているページの中にだけあり、どこにも保存されません。

必要なポイント

このツールは無料です。ログインもポイントも必要ありません。

よくある質問

どのくらい時間がかかりますか?
モデルはデータセンターの GPU ではなく WebAssembly で動くため、お使いの CPU によって変わります。最近のノートパソコンでは、base モデルで録音時間のかなりの割合の時間がかかると考えてください。スマートフォンではさらに長くかかります。何時間もの音声なら、クラウド API か自分のマシンで動かす whisper.cpp が現実的です。このページは短いクリップや会議の録音に向いています。
モデルのダウンロードがいつまでも終わらないのはなぜですか?
重みは huggingface.co から、ONNX Runtime のファイルは jsDelivr から取得します。中国本土を含む一部のネットワークでは、どちらも遅かったり接続できなかったりすることがあり、ダウンロードが完了するまでツールは開始できません。一度動作すれば、ブラウザのキャッシュによってネットワークなしでも開始できます。
どんなファイルを読み込めますか?
ブラウザがデコードできるものなら何でも読み込めます。MP3、WAV、M4A、AAC、OGG、FLAC に加え、ほとんどのブラウザでは MP4 や WebM 動画の音声トラックも扱えます。デコードに失敗する場合は、ffmpeg -i input.mov -vn audio.m4a などで先に音声を取り出してください。デコードしたトラック全体をメモリに保持するため、ファイルサイズの上限は 100 MB です。

背後にあるオープンソース

このツールは huggingface/transformers.js(Apache-2.0)の上で動作しています。同じ処理を自分のプログラムに組み込みたい場合は、そのライブラリを使ってください。

huggingface/transformers.js

別の呼び方

  • 音声 文字起こし
  • 音声 テキスト 変換
  • whisper オンライン
  • 文字起こし 無料
  • 動画 字幕 srt 作成
  • whisper ブラウザ