Glm 5.3 Flash Vision Video RAG

基于智谱GLM-5.3-Flash视觉大模型的视频理解与问答(video RAG)。当用户提到视频、录像、mp4、监控、游戏录像、影片、动画,并想提问、查找、定位、总结或理解其内容,或问"什么时候发生的"、"某一秒在干什么"、要时间戳定位、片段回放时,使用本skill。支持剧情理解、事件时间线、OCR字幕/HUD识别;回答带 [MM:SS] 时间戳引用,并生成可播放片段与关键帧展示给用户。无音频分析能力。(GLM 版本;DeepSeek 版为 deepseek-v4-flash-vision-video-rag)

liangdabiao Updated

File contents

liangdabiao/glm-5.3-flash-vision-rag/tree/main/glm-5.3-flash-vision-video-rag commit 2bc853632b

Frequently asked questions

npx skillmds@latest add liangdabiao/glm-5-3-flash-vision-video-rag