← 返回全部沉淀
Visual Debugging Skill

Video Reader

把一段录屏翻译成带时间戳的关键帧,让 Agent 真正看懂第几秒发生了什么。

连续的透明时间切片中,一个关键瞬间被琥珀色光线选中

模型看得见图片,
却看不见事情如何发生。

很多 App 问题只存在于一段动态过程里。均匀抽帧会留下大量重复画面, 真正出问题的瞬间反而可能一次都没被选中。

均匀抽帧

六张几乎相同的画面,问题发生的 11.2 秒不在里面。

运动区间

先找变化,再让模型只看真正有信息的瞬间。

不是看更多,
而是先选对。

0token 用于选择关键帧
01Grid

先看完整视频的节奏

02Scan

用帧差定位运动区间

03Zoom

放大可疑的几秒

04Judge

让模型理解发生了什么

结论落到具体时间,
而不是“视频里好像有问题”。

开始滚动
手指停止
面板仍继续移动
结论交互状态异常,不是视频卡顿。

适合什么

  • App 滚动、手势、页面跳转和状态切换问题
  • 用户录屏中「第几秒发生了什么」的定位
  • 长视频先看九宫格,再缩小排查范围
  • 需要把讲解音频和画面变化对齐的场景

它不适合判断帧率和卡顿。截图会抹掉帧间时间,性能问题应该看日志、Perfetto 或其他性能数据。它也不负责猜业务预期;要判断对错,仍需要提供用户诉求或正确行为。

安装

npx skills add https://github.com/Job-Yang/video-reader.git

装好后,不需要自己记脚本命令。把视频交给 Agent,直接说:

看一下这段录屏,第几秒开始不对?

Skill 会根据视频长度和问题类型选择 gridscanzoom。底层使用 Python、OpenCV 和 NumPy,不依赖系统安装的 ffmpeg;缺少基础依赖时会先做自检。

边界

Video Reader 不判断帧率和性能卡顿。截图会抹掉帧间时间,这类问题应该使用日志、Perfetto 或其他性能数据。

它也不猜业务预期。底层只负责交付画面变化;判断行为是否正确,仍需要用户诉求或正确行为作为上下文。