谷歌给 Gemini 加了个视频开关:号称砍 88% token,实测静态反而便宜 26%

谷歌给 Gemini 加了个视频开关:号称砍 88% token,实测静态反而便宜 26%

88%——谷歌刚刚给 Gemini 加了一个处理视频的新开关,号称最多能砍掉 88% 的 token 消耗、66% 的分析成本,精度还反升 7%。但第三方只测了 6 条视频,就发现事情没那么简单:在「地毯式找全画面」的任务上,静态处理反而比它便宜 26%。

这场「让 AI 自己决定看什么」的升级,9 月 1 日由 Google DeepMind 通过 Gemini API 上线,覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 三个模型,官方文档现在也已把最新发布的 3.8 Flash 列入支持名单。它不是新模型,而是一个处理视频的全新工作方式——把「机器怎么读视频」从固定采样,改成了带目标的主动检索。

一、旧方式有多笨:每秒 1 帧全塞进上下文

要理解这次改了什么,先看 Gemini 原本怎么处理视频:静态模式(static processing)下,模型按固定帧率采样,默认每秒 1 帧,把采样画面连同音频一股脑放进上下文。

代价是惊人的。按谷歌自己的估算,低分辨率视频约每秒消耗 100 token,高分辨率约每秒 300 token。一小时讲座用静态模式处理,大约要烧掉 108 万个 token——这还没算反复提问、反复重看整段视频的叠加成本。开发者面对长视频只剩两个选择:要么付高昂的 token 费,要么用丢帧、跳段等取巧手段,结果漏掉关键细节。

二、新方式:AI 自己决定「看哪里、看多细」

Agentic(智能体式)视频理解改变的是这个逻辑:模型不再被动吞下每一帧,而是像一个有目的的研究员——先读字幕/音轨建立全局认知,再按需调用工具去加载视频的特定片段,用不同帧率反复检查可疑瞬间,甚至倒回去重看。

官方给出的几个核心能力都建立在「选择性观看」之上:

  • 亚秒级时刻检索:1 FPS 采样容易漏掉的瞬间状态变化、剪辑边界,现在能精准定位,可支撑自动化视频剪辑;
  • 大海捞针式长视频搜索:回答跨数小时视频的复杂问题,不再需要烧几百万 token;
  • 异常检测:对感兴趣的时间窗用更高帧率重采样,捕捉快速动作与细微画面瑕疵;
  • 动作/物体计数:以不同帧率扫描回看,准确跟踪重复动作与分散目标。

开发者只需在 API 配置里把 processing 设为 "agentic",即可启用;走标准 Gemini token 定价,不额外收取功能费。这也是继 agentic vision(让 Gemini 3 Flash「看懂图」)之后,谷歌把「模型自己决定看什么」这套范式从图像延伸到视频。

三、官方数字 vs 第三方实测:反差来了

谷歌官方基准测试口径:token 消耗最高降 88%、分析成本最高降 66%、精度最高提升 7%——注意是「最高」,不代表每条视频都这样。真正的亮点在长视频:从 10 分钟教程到 90 分钟讲座、数小时录像,agentic 模式的收益最明显。

但 9 月 3 日,PaperEdits 团队用同一款 Gemini 3.7 Flash 模型做了组独立对照实验(6 条合成 10 分钟视频,先冻结 prompt 与评分标准再测,无重试无修复):

结果喜忧参半。 Agentic 模式找回 20 个短暂事件中的 18 个(静态只找回 15 个),剪辑决策的宏观 F1 达 0.68 vs 静态 0.55——定向找东西确实更强。但在「广泛时刻检索」上静态反而更高(F1 0.30 vs 0.27),且静态模式少用 26.42% 的 token、成本低 23.01%;6 次 agentic 输出里还有 1 次没跑出要求的 JSON 格式。

换句话说:谷歌的「省 88%」是挑选过的最大收益场景(长视频 + 精确提问),换成「我要把整段视频从头到尾看明白」的宽覆盖任务,agentic 的导航开销反而可能让它更贵。谷歌自己也承认:agentic 模式对短于 5 分钟的视频可能增加首 token 延迟,文档明确建议——短片段、延迟敏感、需要逐帧全覆盖的任务,仍用静态处理。

四、为什么说这是「视频理解的 token 战争」

把视角拉远,这一招的战略意图很清楚。

对开发者:视频 API 的算账逻辑被改写了。过去处理视频 = 按秒数烧 token,长视频几乎不可用;现在长视频成本可能降一个数量级。谷歌给了个对比:一小时讲座静态约 108 万 token,agentic 可能只要约 10.8 万——接近 90% 的差距。这对视频审核、媒体归档、会议纪要、课程内容理解等长视频场景是实打实的降本。

对行业:这是谷歌在「AI 读懂物理世界」上的关键落子。视频是仅次于文本的第二大 token 消耗场景,谁先让视频分析便宜一个量级,谁就抢到下一波多模态应用的地板。别忘了 OpenAI 刚在 9 月 3 日发布 GPT-6 Astra——号称 1.05M 上下文、主打 computer-use 多模态,两家在同一条赛道贴身肉搏。而 Gemini 3.8 Flash(9 月 2 日发布,DeepSWE v1.1 拿下 73.7% 逼近 Claude Opus 5)也已支持这一模式,谷歌的「Flash 家族」正在用高频迭代+低价多模态打组合拳。

对普通用户:谷歌预告该能力将陆续进入 Gemini App,未来数月还会接入 YouTube 的「Ask YouTube」功能——以后对着几小时视频直接提问,底层用的就是这套「选择性观看」技术。AI 读视频这件事,正在从「按秒计费的重活」变成「按问题计费的轻活」。

五、判断

Agentic 视频理解不是营销噱头:它把「AI 看视频」从固定成本变成了按需成本,方向是对的——让模型像人一样「带着问题去看」,而不是「先把整段背下来」。但要泼一盆冷水:官方 88% 的省 token 宣传是最大场景口径,真实收益高度依赖任务类型;想无脑省钱、逐帧全覆盖的开发者,现阶段反而可能多花钱。

给开发者的实操建议:长视频 + 精确检索(找某个瞬间、数某个动作、查某段内容)→ 开 agentic;短视频 + 延迟敏感 + 全画面覆盖 → 老老实实静态。两个模式共存于同一个 API,按任务切换即可。

谷歌这一手,把「视频理解的 token 成本战」正式打响了。对做视频类 AI 应用的团队,现在正是重新算账的时候。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

快手可灵AI融资近30亿美元、估值180亿:视频大模型打响商业化第一枪

快手可灵AI融资

2026 年 7 月 2 日晚,快手在港交所发布公告:旗下视频生成大模型可灵 AI(Kling AI)完成近 30 亿美元的独立融资,投后估值约 180 亿美元(约合人民币 1300 亿元),创下全球视频 / 多模态大模型单轮融资纪录。本轮由 CPE 源峰、国方创投、BlueFive、腾讯、中关村科学城基金(联合国科投资)、中信证券联合领投,阿里云、百度等产业资本,以及华策影视、芒果(厚为资本)等文娱产业方共同参与。据多家媒体报道,可灵 AI 已是全球少数实现规模化商业营收的 AI 视频产品之一。

为什么值得关注

这笔融资的信号意义,远不止”又一笔大额融资”那么简单。它至少揭示了三件事:

第一,AI 视频从”技术演示”跨入”商业决战”。过去两年视频生成模型层出不穷,但多数停留在 demo 与免费额度阶段。可灵 AI 凭 B 端 API 与 C 端会员双轮驱动,率先跑出真实营收,说明视频生成的付费意愿与场景已经成立——资本因此愿意用 180 亿美元为其未来定价。

第二,”BAT 同台”意味着大厂把 AI 视频视为必争之地。领投与跟投名单里同时出现腾讯、阿里云、百度,三家在模型路线上各有侧重,却在可灵这一票上达成罕见一致。这往往是一个赛道被确认为”战略级”的前兆:谁掌握下一代视频生产力,谁就掌握内容生态的入口。

第三,文娱产业资本入局,AI 视频开始向影视工业化渗透。华策影视、芒果等头部内容方的参与,不只是财务投资,更指向”AI 辅助影视制作”的真实需求。当内容公司亲自下场,视频生成就不再只是玩具,而会成为产能工具。

分角色实操建议

对内容创作者 / 短视频团队:可灵类视频生成 API 已能稳定产出可商用的营销短片。建议把”AI 生成 + 人工精修”嵌入工作流,先用它做脚本分镜、素材量产与多语言版本,把人力集中到创意与把关环节,单条内容成本可显著下探。

对影视 / 广告公司:别把这次融资只看作文娱新闻。它意味着”AI 视频产能”正在被资本快速武装,未来 12–18 个月可能出现产能碾压式竞争者。现在就该评估:哪些环节可被生成式视频替代、团队结构如何重排、以及如何把自有素材库训练成差异化壁垒。

对投资者:AI 视频是继基础大模型之后的下一个资本高地,关注”模型能力 × 算力供给 × 内容生态”的三角组合,而非单一模型参数。但也要警惕估值高企带来的泡沫——当一笔融资就能撑起 180 亿美元估值,赛道热度与真实现金流之间需要更严苛的折现检验。

对普通从业者:“会写提示词、懂镜头语言”正在成为新刚需。视频生成的竞争终局不是取代人,而是放大少数懂导演思维者的产能。趁工具还在红利期,先建立自己的 AI 视频工作流,比观望更划算。

结语:关注 AI 商业快讯,每天一篇深度解读

可灵 AI 的 30 亿美元融资,是 AI 视频商业化的一面旗:它证明”用 AI 生成视频”已经是一门能撑起千亿估值的生意,而不只是实验室里的炫技。对内容与文娱行业来说,真正的洗牌可能才刚刚开始。

关注 AI 商业快讯,每天一篇 AI 热点深度解读,帮你把技术动态翻译成可落地的商业判断。

相关阅读