Rescript:把视频剪辑变成删字,浏览器里的转录式编辑器
项目速览:位于浏览器中的开源、基于转录的视频/音频编辑器。
秒懂
- 它是什么?
- Rescript 是一个开源的转录式媒体编辑器,在浏览器或桌面端本地运行,通过删除转录文本中的词来剪切视频和音频。本文分析其工作机制、使用方式和适用边界。
- 适合谁用?
- Rescript 适合播客制作者、访谈记录整理者、课程剪辑师,以及任何把大量口述内容剪掉填充词和停顿当作主要工作的人。它不适合需要精确到帧的视觉剪辑、多轨混音或色彩调整的专业后期流程,因为核心交互围绕文字,时间线操作只是补充。
- 能商用吗?
- 请先确认。这个仓库使用的许可证不在我们自动归类的范围内,商用前请阅读仓库里的 LICENSE 文件。
- 还在维护吗?
- 在维护。仓库最近一次提交在 1 天前。
- 用什么语言写的?
- 主要是 TypeScript(依据 GitHub 的语言统计)。
以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。
开源项目深度解析
它解决什么问题:给口语内容做粗剪
传统视频编辑器把时间线当作核心,你要在波形或画面上找点下刀。Rescript 把这件事倒过来:先转录,再让你在文本上删字。删除一个词,对应的画面或音频片段就被标记为剪切区。对播客、访谈、会议录像这类以说话为主的内容,粗剪的大部分工作就是去掉口误、重复和停顿,文本交互比拖时间线快得多。它的目标用户很明确:不需要复杂视觉效果,只需要把说话内容剪干净的人。视频只是附带,音频文件同样支持,所以它也适用于纯音频编辑。
本地处理流程:从解码到导出的四步
README 给出了清晰的流水线。第一步,ffmpeg.wasm 把音轨解码成 16 kHz 单声道 PCM。第二步,Whisper 模型在 Web Worker 里运行,开启 word 级时间戳,边转录边输出文本,同时 pyannote 分割模型给每个词分配说话人标签。你可以在 Whisper Base 和 Whisper Small 之间选,也可以跳过转录,直接导入 SRT、VTT 或 JSON 字幕文件。第三步是编辑,删除词会产生剪切范围,预览播放器实时跳过这些范围,时间线上用红色显示。第四步导出,ffmpeg 用 filter graph 把保留区间拼接并重新编码,默认 libx264 和 aac。整个流程都在设备本地完成,不上传文件。
实际运行:命令行与两种使用形态
Rescript 提供 Web 应用和 Electron 桌面应用两种形态。Web 版直接访问 getrescript.com,桌面版从 GitHub Releases 下载,支持 macOS、Windows 和 Linux,Mac 版有签名和公证。想自己跑开发环境,README 给了具体命令:npm install 会同时把 ffmpeg 和 onnxruntime 的 WASM 文件复制到 public/vendor,npm run dev 启动 Next.js 开发服务器,npm run electron:dev 启动 Electron 壳加开发服务器,npm run build 做生产构建,npm run dist 生成未签名的安装包。依赖管理走 npm,状态管理用 zustand,前端是 Next.js 加 React 加 TypeScript。
浏览器约束:SharedArrayBuffer 和 WebGPU 是硬门槛
这不是一个随便什么浏览器都能跑的网页应用。README 明确写了,Web 版需要 Chromium 内核浏览器,因为要用 SharedArrayBuffer,服务器必须带 COOP 和 COEP 头。推理优先用 WebGPU,不可用时回退到 WASM。桌面版通过 Electron 内置 Chromium,并在 app:// 协议上设置同样的隔离头。这意味着如果你用 Firefox 或 Safari 访问 Web 版,很可能直接不可用。另外,Whisper Small 模型在纯 WASM 模式下运行,CPU 负载和内存占用都不低,低配机器上转录长视频会等很久。这是转录式编辑的固有代价,文本交互的便利建立在一次完整转录之上。
编辑能力:文字为主,时间线为辅
删除词是核心操作,但 Rescript 也提供了超出字面删除的精细控制。时间线有波形和词条,支持拖动词条的边缘调整时间,当 Whisper 的对齐不准确时,你可以缩放后拖动单词边界来修正。剪切区的边缘也可以单独拖拽,绕过 Whisper 的时间戳做微调,双击则重置。还有 Split 工具,在播放头位置切开片段,拖拽片段边缘可以做出比单词更细的裁剪。一键移除填充词(um、uh 等)和一键移除 0.3 秒以上的静音,这两个功能对播客粗剪非常实用。导出格式覆盖视频(MP4/WebM,720p 到 4K)、音频(M4A/MP3/WAV)、字幕(SRT/VTT/JSON)以及 NLE 时间线(Resolve/Premiere XML、FCPXML、AAF)。
一个明显的权衡:许可证从 MIT 变成了非商业
仓库的元数据写着 MIT,但 README 的 License 部分说得很清楚:当前版本使用 PolyForm Noncommercial License 1.0.0。非商业用途可以自由使用、修改和分享,但商业使用,包括转售或收费分发,都不允许,需要联系作者获取商业许可。之前以 MIT 发布的版本仍然保持 MIT。这对个人用户和开源爱好者没有影响,但对想把它集成到商业产品里的团队是个硬约束。你下载 v1.1.8 的源码,默认就是非商业授权,除非你明确去找旧版本。这个变化也说明项目在商业化探索阶段,后续版本可能继续调整授权方式。
替代方案:Descript 和本地 Whisper 工作流
最接近的替代品是 Descript,它也是转录式编辑器,但那是闭源 SaaS,文件要上传到云端处理,隐私模型完全不同。Rescript 的卖点恰恰是本地处理,文件不出设备。另一个替代方案是自己搭 Whisper 加剪辑工具的工作流:用 openai-whisper 或 faster-whisper 生成带词级时间戳的转录,再用 SRT 导入任何传统编辑器。这个方案更灵活,模型选择更多,但你没有词级剪切交互,得手动在时间线上对着字幕找点,效率低很多。Rescript 把转录和编辑整合在一个界面里,省去了中间转换步骤。如果你对隐私敏感且不想订阅 SaaS,Rescript 是目前少数能本地完成全流程的选项。
维护与升级:版本节奏和遥测
从最近的发布记录看,项目维护活跃,v1.1.8、v1.1.7、v1.1.6 在 2026 年 8 月的一周内连续发布,修复和迭代速度很快。桌面版通过 GitHub Releases 自动更新,这意味着你一旦安装,后续版本推送是自动的,但要注意自动更新可能带来行为变化,比如模型或导出参数调整。关于遥测,README 明确说默认开启匿名使用统计和崩溃报告,崩溃报告走 Sentry,包含堆栈、应用版本和平台。你可以到 Settings 里的 Privacy 选项关闭,关闭后立即生效且永久停止。对于强调隐私的项目,默认开启遥测是个值得注意的矛盾点,虽然数据匿名,但如果你对隐私要求极高,安装后第一件事应该是去关掉它。
编辑结论
Rescript 适合播客制作者、访谈记录整理者、课程剪辑师,以及任何把大量口述内容剪掉填充词和停顿当作主要工作的人。它不适合需要精确到帧的视觉剪辑、多轨混音或色彩调整的专业后期流程,因为核心交互围绕文字,时间线操作只是补充。也不适合有商业分发需求的组织,因为当前许可证是 PolyForm Noncommercial 1.0.0,商用需单独联系作者。采用前先验证三件事:你的浏览器是否支持 SharedArrayBuffer 和 WebGPU,因为 Web 版依赖这些;你的机器内存是否足够运行 Whisper Small 模型,长视频可能吃力;你的素材语言是否在 Whisper 支持范围内。如果这些条件都满足,Rescript 的文本优先交互确实能大幅缩短粗剪时间。
社区笔记