claude-real-video(crv):被hacknews首页推荐过,让 Claude/任意 LLM 真正"看"视频,不按固定 1fps 采样,而是场景切换检测 + 滑动窗口去重——10 分钟静态幻灯片收成 1 帧、快切 reel 一帧不漏,更省 token 还更准,看(帧)+读(字幕/Whisper/说话人分离)+听(原声)三件事都给。 之前介绍的claude-video也是干类似的事情, claude-real-video与claude-video的核心逻辑一模一样:场景抽帧 + 去重 + 转写,本地跑完,把"该看的那几帧 + 文字"交给 LLM,这样就大大的省下了token。
真正的技术分水岭,是"怎么抽帧":
Gemini 那类固定采样有两个死穴:静态内容过采样、快切内容欠采样。一个 10 分钟的静态幻灯片,固定 1fps 会吐出约 600 张几乎一样的帧,白烧 token;一个快切 reel,帧与帧之间的镜头它根本没采到。
这两个项目都换成了场景切换检测——只在画面真的变了的时候抽帧,再把近乎重复的帧扔掉:
1、claude-video:16×16 灰度缩略图算平均像素差、跟"上一张保留帧"比,抓慢速渐变;
2、claude-real-video:降采样 RGB 真实像素差(不用感知哈希,因为哈希在纯色和等亮度换色上会瞎)+ 滑动窗口去重,A-B-A 来回切的镜头只喂模型一次。
结果都是同一句话:更少、更有意义的帧 = 更省 token、理解还更准。 crv 官方给的例子——58 秒片子,固定 1fps 是 58 帧,它只留 26 张真正不同的,这有点像文本模型的渐进式披露的内涵。
为什么值得单独说这件事?
因为它揭示了一个更大的规律:当一个能力(多模态)看似已经"内置"在大模型里,真实工程里往往还需要一层"喂对东西"的中间件。 模型能读图,不等于你该把 600 张重复帧全塞给它。这层"帧预算工程",类似于渐进式披露工程——挑哪几帧、怎么去重、要不要连原声——正在从"各家 demo 脚本"沉淀成"装进 agent 的标准件"(两个项目都能一条命令进 Claude Code / Cursor / Codex)。
同一个轮子被两拨人独立造出来、还都造成了热榜项目——这不是重复劳动,是市场在同一个缺口上盖章。下一个被这样"补中间件"的模态,大概率是长音频和实时屏幕。
#clauderealvideo#AI视频#视频理解#ClaudeCode#开源#多模态