阅影 · 让 AI 看视频
Claude 读不了视频文件,但能读文字和图片。yueying 命令把视频拆成:带时间戳的文字稿(平台字幕优先,没有就本地语音识别,支持中英日韩法德俄等多语言)+ 关键帧图片(场景切换处抽帧,左下角烧了编号和时间)+ 九宫格总览图 + 一份 report.md 索引。
步骤
运行(第一次跑语音识别会下载模型,可能要几分钟;长视频识别需要一些时间,耐心等):
yueying "<视频路径或链接>" --out "<输出目录>"- 输出目录建议放在当前项目下,如
./yueying_out/<视频名>;不传--out也会用这个默认值。 - 视频里没人说话、只想看画面:加
--no-asr。只要文字不要画面:加--no-frames。 - 已知语言可加
--lang zh/--lang en等,识别更稳。 - 画面细节多(代码、PPT、操作演示)想看得更密:加
--interval 2(每 2 秒抽一帧);默认按时长自动,1 分钟内每 2 秒、10 分钟内每 6 秒、更长每 12 到 20 秒。 - B站 高清或会员视频需要登录:加
--cookies-from-browser chrome(或 edge)。 - 机器慢或没显卡:加
--model small换小模型。 - 多个视频可以一次传多个路径或链接,各出各的文件夹,
--out指定的是父目录,里面会多一份index.md总目录;B站 分 P / 合集加--all全部处理。
- 输出目录建议放在当前项目下,如
用 Read 读输出目录里的
report.md。里面有简介、章节、画面总览图清单、关键帧清单、按段落带时间戳的文字稿。用 Read 看
grid_01.jpg等总览图,快速了解画面走向。需要看清某一刻的细节(代码、PPT、界面操作),再打开frames/下对应的单帧大图。文字稿和画面靠时间戳对照。按用户的需求提纯:总结、列步骤、抄代码、回答问题、写笔记。引用视频内容时带上时间点,如「(03:15)」,方便用户回看。
注意
- 语音识别可能把专有名词、代码听错,画面上出现的文字以画面为准。
- 文字稿很长时不必全读,先看章节和画面总览,再按需读对应时间段。
- 如果命令不存在:
pip install yueying然后yueying --install-skill;有 NVIDIA 显卡再加pip install yueying[cuda]。