Video Reader

让看不了视频的大模型能"看视频"。当用户给你一个视频文件(.mp4/.mov/.gif 等) 并希望你理解里面发生了什么——尤其是排查 App 滑动/交互问题、复现 bug、 分析用户操作录屏、看动态过程、定位"第几秒发生了什么"时,使用本 skill。 它用纯代码做帧差初筛(自动跳过静止/无动作的片段),把视频翻译成 "带时间戳的关键帧 + 运动时间线",再由你(大模型)看图判断; 支持九宫格概览(grid,一张图看全片节奏)和可选的语音转写(transcribe, 补"画面看不到、只能听到"的旁白/口述/报错语音)。 触发词:视频、录屏、视频文件、看视频、视频里、这段视频、滑动不流畅、 交互问题、复现一下、用户操作、动态、第几秒、video、mp4、screen recording、 帮我看下这个视频、视频卡在哪、面板、手势、视频传不上去、不支持的文件类型、改后缀、压缩包、 视频里说了什么、语音转写、字幕、听听这段、全片概览、一张图看完、整体看看、九宫格、缩略图。 即使用户只是丢一个视频文件过来说"看看这个有什么问题",也应触发本 skill。 注意:很多平台(如 Mira 等)禁止直接上传视频格式,本 skill 支持用户改后缀或压成 zip 绕过上传限制后照常处理。

Job-Yang Updated

File contents

Job-Yang/jobyang-ai-skills/tree/main/skills/video-reader commit abff58bba6

Frequently asked questions

npx skillmds@latest add job-yang/video-reader