模型 / 数据集
HUANGCHIHHUNGLeo/claude-real-video avatar
HUANGCHIHHUNGLeo/claude-real-video

claude-real-video 评测:让 LLM 真正看到画面,而不是只读字幕

Let Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames + transcript, from a URL or local file. Runs locally, MIT.

2,144 个 Star189 个 ForkPythonMIT
GitHub

秒懂

它是什么?
这是一个本地运行的视频预处理工具,用 ffmpeg 做场景切分与去重,把视频压成一组关键帧加转录文本,再交给 LLM 阅读。它解决的是固定帧率采样漏掉快切镜头的问题,代价是你得自己管好 ffmpeg 依赖和帧宽的取舍。
适合谁用?
如果你的工作流是把视频内容交给 LLM 提问,而且素材里有快切、幻灯片或长时间屏幕共享,crv 的场景检测加去重比固定 1 fps 采样更省 token 也更少漏帧,值得装。反过来,如果你需要的是逐帧精确分析、运动轨迹、音频事件或镜头语言层面的信息,这个免费版本不提供,README 明确把这类能力划给了付费的 crv Pro,你应该先确认自己的需求是否落在免费版范围内。
能商用吗?
可以。MIT 是宽松许可证:你可以使用、修改并销售基于它的软件,只需保留版权和许可证声明。
还在维护吗?
在维护。仓库最近一次提交在 5 天前。
用什么语言写的?
主要是 Python(依据 GitHub 的语言统计)。

以上回答依据项目的 GitHub 数据(最近同步于 2026年9月15日)和我们的分析,不构成法律意见。

开源项目深度解析

它补的是固定帧率采样留下的那个洞

把 YouTube 链接丢给 ChatGPT,模型读到的是转录文本,不是画面。Claude 本身不接受视频文件。Gemini 能原生读视频,但按 README 的说法,它要把文件上传到 Google,并且以固定间隔采样,默认 1 fps,快速剪辑的镜头会被跳过。claude-real-video 的切入点就在这里:不做固定配额,而是按场景变化取帧,再把近似重复的帧丢掉。README 给了一组对比,同一个 58 秒的片段,固定 1 fps 采样得到 58 帧,crv 保留其中 26 帧真正有差异的,用 --grid 打包成 3 张联系表。目标用户很明确:需要把视频内容喂给 LLM 做问答的工程师,以及把 Claude Code、Cursor、Codex 这类编码代理当日常工具的人。它对使用者的实际要求是接受一个前置步骤,先跑一遍命令行或本地网页,拿到一个文件夹,再手动或通过 skill 把内容交给模型。

处理链路:ffmpeg 找切点,Whisper 听声音,输出一个可读目录

从 README 描述的输出结构看,一次运行会生成 crv-out/frames/*.jpg、frames.json(逐帧时间戳)、transcript.txt 与 transcript.json,以及 MANIFEST.txt。数据流是单向的:输入是 URL 或本地文件,中间经过 ffmpeg 做场景检测与抽帧、去重,音频走 Whisper 转录,最后落盘成一组静态文件,交给外部 LLM 阅读。所有处理在本机完成,README 强调源视频不会被上传,只有你之后主动粘贴给云端模型的那部分帧和文本会离开本机。几个参数各自对应一类素材:--from 28:00 --to 43:00 用来截取片段,README 说明 ffmpeg 会直接 seek 而不是解码整个文件,Whisper 只处理窗口内的音频,帧预算也花在窗口内,但输出的时间戳仍然是源视频时间码。--frame-width 1600 针对文字密集的画面,README 的判断是帧选择本身已经做对了,640px 下 1920 宽的屏幕录制会把关键细节丢掉。--adaptive 针对缓慢变化的内容,按滚动邻域而不是固定阈值取帧,让两三秒的形变动作也能被捕捉。--text-anchors 在字幕时间点强制插帧,前提是有 sidecar 的 .srt/.vtt 或内嵌字幕轨,烧录进画面的字幕无法检测,且每秒最多强制一帧。--speakers 给每行转录打上 [SPEAKER_00] 这类标签,运行一个 45 MB 的本地说话人分离模型。

装起来要跑哪些命令,以及那个可选的本地查看器

最小安装是 pip install "claude-real-video[whisper]",之后 crv "<url>" 就能直接用在命令行场景。要在编码代理里用,README 给的是一条 npx skills add HUANGCHIHHUNGLeo/claude-real-video,声称可装入 Claude Code、Cursor、Codex、Copilot、Gemini CLI 以及其他兼容 agentskills.io 的宿主。Claude Code 插件市场走 /plugin marketplace add HUANGCHIHHUNGLeo/claude-real-video 加 /plugin install claude-real-video@claude-real-video。不想碰终端的人可以跑 crv-web,打开一个本地页面,界面提供繁体中文、简体中文和英文,粘贴 YouTube 或 Reels 链接或文件路径,点 Analyze 后打开结果查看器。想先看看模型会看到什么,加 --viewer 会写出一个本地 viewer.html,README 说双击即可打开,不需要网络也不需要额外安装。说话人分离要单独装 pip install "claude-real-video[speakers]"。手动安装的路径是 clone 仓库后把 skills/claude-real-video 复制到 ~/.claude/skills/。Python 版本要求 3.10 以上。

免费版和付费版的边界是画出来的,不是模糊的

README 把能力切得很直接:免费版让 AI 看到视频,crv Pro 让 AI 理解视频,后者包含拍摄方式(剪辑节奏、镜头运动)以及一帧画面无法承载的时间轴信息,包括手势、表情、语音音高变化、情绪和声音事件。这个划分意味着一个具体的限制:如果你要分析的是表演、访谈中的语气变化,或者音频里发生了什么,免费版给不了。另一个限制来自 --text-anchors 的前提条件,它依赖字幕轨或 sidecar 字幕文件,硬字幕视频用不了这个开关。去重这件事本身也有代价,被判定为近似重复而丢弃的帧不会进入输出,如果你的问题是关于某个被丢弃瞬间的细节,那一帧不在文件夹里。README 提到 crv 也可以当通用关键帧提取器用,不做 LLM 相关工作,场景检测加去重,不需要下载任何 ML 模型,但这条路径同样继承上面的取舍。

和 Gemini 原生视频输入比,差别在采样策略和信任边界

最直接的对照是 Gemini 的原生视频能力。两者都能让模型接触到画面,但机制不同:Gemini 在云端按固定间隔采样,文件要上传给 Google;crv 在本地按场景变化取帧,帧和文本由你自己决定要不要发出去。前者的优势是流程短,贴一个链接就结束,不需要装 ffmpeg、不需要跑命令行、也不需要管帧宽。后者的优势是采样点落在切点上而不是时间网格上,快切镜头不容易被跳过,并且源视频不出本机。代价是你要承担预处理这一步的操作成本和本地环境依赖。这不是哪个更好的问题,是你在意采样密度还是在意流程长度的问题。如果你的素材是长镜头、变化缓慢、没有快切,固定采样和场景采样出来的结果差别不大,那 Gemini 那条路更省事。

维护节奏与许可

仓库以 MIT 许可发布,Python 包名是 claude-real-video,短名 crv。最近三个版本都在 2026 年 8 月下旬到月底之间发布:v0.10.3 修的是字幕标题栏不再展开转录,v0.10.2 让 URL 运行使用源视频自带的字幕,v0.10.1 是窗口相关的修复。从版本号和提交节奏看,这是一个仍在频繁调整细节的项目,不是冻结状态。这对使用者的含义是升级时值得看一眼 release note,尤其是 v0.10.2 这类改动会直接影响 URL 场景下转录文本的来源。MIT 许可本身对商用和修改都比较宽松,但 README 里提到的 crv Pro 是独立售卖的付费附加组件,走 Capafy 和 Lemon Squeezy,与 MIT 代码库不是一回事,采购前要分清你买的是哪一部分。以上只是对许可条款的转述,具体合规判断请咨询法务。

什么时候它是对的,什么时候它是错的工具

素材里有快切、有幻灯片、有长时间屏幕共享,而且你的问题是关于画面内容的,这是它最合适的位置。--from/--to 让它能在一场 90 分钟的会议里只处理 28 分钟到 43 分钟那段屏幕共享,Whisper 只听这段,帧预算也只花在这段,同时输出的还是源时间码,可以直接引用给同事。反过来说,需要逐帧精确分析、需要运动轨迹、需要音频事件时间轴,这些免费版不覆盖。另一个容易被忽略的失败场景是:视频本身没有字幕轨也没有 sidecar 字幕文件,而你又指望 --text-anchors 给每段话配一张图,那这个开关不会生效。还有一点,README 提到 crv 上过 Hacker News 首页,但这属于传播情况,和代码质量无关,判断是否采用还是要看它在你自己的素材上跑出来的帧。

编辑结论

如果你的工作流是把视频内容交给 LLM 提问,而且素材里有快切、幻灯片或长时间屏幕共享,crv 的场景检测加去重比固定 1 fps 采样更省 token 也更少漏帧,值得装。反过来,如果你需要的是逐帧精确分析、运动轨迹、音频事件或镜头语言层面的信息,这个免费版本不提供,README 明确把这类能力划给了付费的 crv Pro,你应该先确认自己的需求是否落在免费版范围内。上手前先验证三件事:本机 ffmpeg 是否可用且版本够新,目标视频是否有可读的字幕轨或 sidecar 字幕文件(烧录在画面里的字幕无法被 --text-anchors 检测到),以及 --frame-width 设成多少才能在屏幕录制里看清终端和表格文字。

官方来源

  1. HUANGCHIHHUNGLeo/claude-real-video on GitHub
  2. Issues
  3. License: MIT
  4. README
  5. Releases
社区笔记

社区笔记