实用工具

语音转文字(浏览器内运行 Whisper)

在浏览器里运行 OpenAI Whisper,把音频或视频转成纯文字或 SRT 字幕,文件不上传。

浏览器本地运行AI 开发工具1.6万
免费
把文件拖到这里

或者点击选择文件。文件只在当前标签页里处理,不会上传到任何服务器。

Whisper 是 OpenAI 以 openai/whisper 开源发布的语音识别模型,大多数转写工具都建立在它之上。本页用 huggingface/transformers.js 在标签页里运行它:浏览器先解码录音的音轨,重采样成 16 kHz 单声道,模型再按 30 秒一段进行转写。想快选 tiny,想准选 base,知道语种就指定一下,最后得到纯文字或带时间轴的 SRT 字幕。它免费、不上传,但速度比云端 API 慢得多。

它是怎么工作的

  • 量化后的模型首次使用时从 Hugging Face 下载,tiny 约 40 MB、base 约 77 MB,之后由浏览器缓存。
  • 长音频会切成 30 秒一段、相邻重叠 5 秒,这是 Whisper 处理超过自身窗口长度的音频的标准做法。
  • 翻译模式会让 Whisper 不管说的是什么语言都输出英文;Whisper 只能翻译成英文,没有别的目标语言。

你的数据去了哪里

哪也没去。本工具完全在你的浏览器里运行:你粘贴的文本由页面处理,不会传输到任何服务器,也不会写进任何日志。

本工具免费且无需登录,运行结果只存在于你当前的页面里,不会被保存到任何地方。

它要花多少

本工具完全免费,不需要登录,也不消耗积分。

常见问题

转写要多久?
取决于你的 CPU,因为模型跑在 WebAssembly 上,而不是数据中心的 GPU。在较新的笔记本上,base 模型大约要花掉录音时长相当可观的一部分时间,手机上会慢得多。几个小时的音频,用云端 API 或在自己电脑上跑 whisper.cpp 更现实;本页适合短片段和会议录音。
模型一直下载不完,怎么回事?
模型权重来自 huggingface.co,ONNX Runtime 文件来自 jsDelivr,在一些网络环境下(包括中国大陆)这两个地址都可能很慢甚至打不开,下载完成之前工具无法开始。只要成功下载过一次,浏览器缓存就能让它之后不依赖网络直接启动。
支持哪些文件格式?
浏览器能解码的都行:MP3、WAV、M4A、AAC、OGG、FLAC,大多数浏览器还能读取 MP4 和 WebM 视频里的音轨。解码失败时先把音频提出来,比如用 ffmpeg -i input.mov -vn audio.m4a。文件上限 100 MB,因为解码后的整条音轨都要放在内存里。

背后的开源项目

本工具运行在 huggingface/transformers.js 之上,以 Apache-2.0 许可发布。如果你需要在自己的程序里实现同样的能力,直接用这个库。

huggingface/transformers.js

也常被称作

  • 语音转文字
  • 在线语音转文字免费
  • whisper在线
  • 音频转文字
  • 视频转字幕
  • srt字幕生成