Yueying

让 AI 看视频。用户给出本地视频文件路径或视频链接(B站、YouTube、抖音、小红书等),想要总结、提取信息、答疑、照着教程操作、整理笔记时使用。先用 yueying 命令把视频转成文字稿和关键帧,再读结果完成用户的需求。

vsh5dvsch7-png Updated

File contents

阅影 · 让 AI 看视频

Claude 读不了视频文件,但能读文字和图片。yueying 命令把视频拆成:带时间戳的文字稿(平台字幕优先,没有就本地语音识别,支持中英日韩法德俄等多语言)+ 关键帧图片(场景切换处抽帧,左下角烧了编号和时间)+ 九宫格总览图 + 一份 report.md 索引。

步骤

  1. 运行(第一次跑语音识别会下载模型,可能要几分钟;长视频识别需要一些时间,耐心等):

    yueying "<视频路径或链接>" --out "<输出目录>"
    
    • 输出目录建议放在当前项目下,如 ./yueying_out/<视频名>;不传 --out 也会用这个默认值。
    • 视频里没人说话、只想看画面:加 --no-asr。只要文字不要画面:加 --no-frames
    • 已知语言可加 --lang zh / --lang en 等,识别更稳。
    • 画面细节多(代码、PPT、操作演示)想看得更密:加 --interval 2(每 2 秒抽一帧);默认按时长自动,1 分钟内每 2 秒、10 分钟内每 6 秒、更长每 12 到 20 秒。
    • B站 高清或会员视频需要登录:加 --cookies-from-browser chrome(或 edge)。
    • 机器慢或没显卡:加 --model small 换小模型。
    • 多个视频可以一次传多个路径或链接,各出各的文件夹,--out 指定的是父目录,里面会多一份 index.md 总目录;B站 分 P / 合集加 --all 全部处理。
  2. 用 Read 读输出目录里的 report.md。里面有简介、章节、画面总览图清单、关键帧清单、按段落带时间戳的文字稿。

  3. 用 Read 看 grid_01.jpg 等总览图,快速了解画面走向。需要看清某一刻的细节(代码、PPT、界面操作),再打开 frames/ 下对应的单帧大图。文字稿和画面靠时间戳对照。

  4. 按用户的需求提纯:总结、列步骤、抄代码、回答问题、写笔记。引用视频内容时带上时间点,如「(03:15)」,方便用户回看。

注意

  • 语音识别可能把专有名词、代码听错,画面上出现的文字以画面为准。
  • 文字稿很长时不必全读,先看章节和画面总览,再按需读对应时间段。
  • 如果命令不存在:pip install yueying 然后 yueying --install-skill;有 NVIDIA 显卡再加 pip install yueying[cuda]

vsh5dvsch7-png/yueying/tree/main/src/yueying/skill commit 03a825fe92

Frequently asked questions

npx skillmds@latest add vsh5dvsch7-png/yueying