01 · 能力缺口
模型看得见图片,
却看不见事情如何发生。
很多 App 问题只存在于一段动态过程里。均匀抽帧会留下大量重复画面, 真正出问题的瞬间反而可能一次都没被选中。
均匀抽帧
六张几乎相同的画面,问题发生的 11.2 秒不在里面。
运动区间
先找变化,再让模型只看真正有信息的瞬间。
02 · 方法
不是看更多,
而是先选对。
0token 用于选择关键帧
01Grid
先看完整视频的节奏
02Scan
用帧差定位运动区间
03Zoom
放大可疑的几秒
04Judge
让模型理解发生了什么
03 · 一次真实诊断
结论落到具体时间,
而不是“视频里好像有问题”。
开始滚动
手指停止
面板仍继续移动
结论交互状态异常,不是视频卡顿。
适合什么
- App 滚动、手势、页面跳转和状态切换问题
- 用户录屏中「第几秒发生了什么」的定位
- 长视频先看九宫格,再缩小排查范围
- 需要把讲解音频和画面变化对齐的场景
它不适合判断帧率和卡顿。截图会抹掉帧间时间,性能问题应该看日志、Perfetto 或其他性能数据。它也不负责猜业务预期;要判断对错,仍需要提供用户诉求或正确行为。
安装
npx skills add https://github.com/Job-Yang/video-reader.git
装好后,不需要自己记脚本命令。把视频交给 Agent,直接说:
看一下这段录屏,第几秒开始不对?
Skill 会根据视频长度和问题类型选择 grid、scan 或 zoom。底层使用 Python、OpenCV 和 NumPy,不依赖系统安装的 ffmpeg;缺少基础依赖时会先做自检。
边界
Video Reader 不判断帧率和性能卡顿。截图会抹掉帧间时间,这类问题应该使用日志、Perfetto 或其他性能数据。
它也不猜业务预期。底层只负责交付画面变化;判断行为是否正确,仍需要用户诉求或正确行为作为上下文。