OpenRouter 免费大模型全量拆解:447 个模型里 25 个免费,最贵的三笔账不在价格表上

OpenRouter 免费大模型全量拆解:447 个模型里 25 个免费,最贵的三笔账不在价格表上

OpenRouter 上的「免费大模型」,价格是 0,但从来不是没有代价。今天官方模型接口返回 447 条记录,输入与输出价格同时为 0 的只有 25 条,占 5.6%。我把这 25 个逐条拉了下来——模型页、端点、延迟、吞吐、供应商数量、数据条款——结论是:免费池真正的成本,写在三张不在价格表上的账单里。(文中价格、额度与性能数据截至 2026-09-19,下单前请以官网为准)

免费额度怎么算:20 次/分钟、50 次/天,充值 10 美元换 1000 次/天

OpenRouter 做的是模型路由:一个 key、一份账单,覆盖 447 个模型、88 家供应商。2026 年 8 月它被 Stripe 以 70 亿美元收购,成为支付巨头押注的「模型路由入口」。

免费模型在这套体系里的位置,官方规则一共三档:

档位 每分钟 每天 条件
免费变体(累计充值少于 10 美元) 20 次 50 次 注册即可
免费变体(累计充值至少 10 美元) 20 次 1000 次 一次性充值 10 美元
付费变体 无平台级请求上限 不适用 按 token 计费

这 25 条免费记录里,22 个是带 :free 后缀的文本变体,2 个是 Google Lyria 音乐生成模型,1 个是随机路由。三个细节决定了这套规则的真实手感。第一,:free 不是一个开关,而是模型目录里单独的一行,有自己的定价、上下文长度和端点。第二,开小号没有意义——官方原文是「额外账号或 API key 不会改变限流,容量按全局治理」。第三,免费额度不花 OpenRouter 的钱,端点由供应商自己挂:NVIDIA 5 个、Google AI Studio 4 个、Novita 3 个,其余 9 家各 1 到 2 个,一共 24 个免费端点,外加一个随机路由的 openrouter/free。

换句话说,免费池是供应商拿算力换曝光、换数据、换榜位的地方。这直接决定了下面三张账单。

账单之一:8 个免费模型,由「可能拿你的数据训练」的供应商托管

OpenRouter 给 88 家供应商都标了数据条款。整张表里,承认可能用提示词训练模型的只有 4 家:DeepSeek、Liquid、Thinking Machines、NVIDIA。除 DeepSeek 之外的 3 家正是免费池主力,一共托管了 8 个免费模型,占免费池的三分之一。

另外 10 个免费端点属于「保留提示词但不训练」:Google AI Studio 保留 55 天、Nex AGI 保留 30 天、Cohere 保留 30 天,Poolside 与 AtlasCloud 没有给出天数。真正零保留的只有 6 个:Novita 的 3 个 Ling、ModelRun 托管的小参数 Qwen、OpenInference 托管的是 DeepSeek V4 Flash、以及 Decart 托管的 GLM-5.2。

这里有个容易被忽略的开关:账户设置里,付费模型与免费模型的「允许训练」是两套独立设置。你关掉它,那 8 个免费模型会直接从可用列表里消失——免费档的「免费」,一部分就是用数据条款换来的。

账单之二:免费版只有一个供应商,付费版最多 26 个

这是全量拉取后最扎眼的一组数字。24 个免费端点,每一个都只有单一供应商;同一个模型的付费版本却动辄十几二十个源:DeepSeek V4 Flash 有 26 个、GLM-5.2 有 23 个、Qwen3.8 27B 有 16 个、Gemma 4 31B 有 12 个。付费端点的多源意味着挂了会自动切到别家,免费端点没有 fallback,供应商一抖就整个不可用。

还有 7 个免费模型在 OpenRouter 上根本没有付费版本:Nex-N2.5 的大小两档、Ling 3.0 Flash Sante、Dots3-Note Preview、LFM 2.5、Cohere North Mini Code、Nemotron 3 Nano。对它们来说,免费是唯一入口。

规格也不是同一份。免费的 GLM-5.2 上下文只有 32768,付费版是 1048576,相差 32 倍;免费的 Qwen3.8 27B 是 262144,付费 1000000;反过来 Nemotron 3 Ultra 的免费端点上下文 100 万,比付费版的 262144 还大。免费端点不是付费端点的打折通道,而是另一套参数完全不同的部署。

可用率同样不均匀。24 个端点里有 3 个状态异常;过去三天,Nemotron 3 Nano 的日可用率是 80.1%、83.8%、83.8%,Inkling 最低 88.2%,DeepSeek V4 Flash 最低 94.0%。72 个「模型乘日期」的样本里,19 个低于 99%。

账单之三:免费最强只有旗舰的 64.6%,而且用量榜第一并不是分数第一

模型接口自带 Artificial Analysis 的智能指数,全部 447 个模型里有 145 个给出了分数。把这 25 个免费模型放进去排序是这样的:

免费模型 上下文 智能指数 p50 往返延迟 吞吐 免费端点数据条款
DeepSeek V4 Flash 0731 1.05M 34.5 2064 ms 25 tok/s 零保留
GLM-5.2 32768 34.0 1164 ms 37 tok/s 零保留
Qwen3.8 27B 262K 33.9 626 ms 28 tok/s 零保留
Inkling 1.05M 25.5 1840 ms 35 tok/s 可能训练
Ling 3.0 Flash VL 262K 25.0 2361 ms 60 tok/s 零保留
Nemotron 3 Ultra 1M 23.4 3143 ms 19 tok/s 可能训练
Ling 3.0 Flash Fin 262K 23.0 1342 ms 136 tok/s 零保留
Gemma 4 31B 262K 15.4 1291 ms 22 tok/s 保留 55 天
Nemotron 3.5 Lightning 1M 13.6 5134 ms 16 tok/s 可能训练
Cohere North Mini Code 256K 9.9 601 ms 80 tok/s 保留 30 天

三个结论。免费最强 34.5 分,在 145 个有分模型里排第 40,只有付费旗舰 53.4 分的 64.6%——免费档够做事,但够不到第一梯队。用量榜第一不等于能力榜第一:官方按近 7 天真实 token 用量排的免费榜,第一是 Nemotron 3 Ultra(4.32T tokens),智能指数只有 23.4;分数第一的 DeepSeek V4 Flash 用量排第 4;分数第二的 GLM-5.2 连前 16 都没进。延迟与吞吐也和分数无关,最快的 LFM 2.5(2.6B 参数)吞吐 185 tok/s,最慢的 Lyria 只有 4 tok/s。

延迟高有一半要怪拥挤:官方 30 分钟统计窗口里,免费池一共处理了约 50.1 万次请求,其中 Nemotron 3 Ultra 一家 10.96 万次、DeepSeek V4 Flash 9.83 万次。这些请求共享 20 次/分钟的平台限流。

该不该用:三种用法可以,三种用法别碰

先说额度值多少钱。额度按请求数计,不按 token 计。以一次请求 800 输入加 300 输出 token 估算,同样是每天 1000 次,按各自最便宜的付费端点价折算:

免费模型 付费价(每百万 token 输入/输出) 1000 次折算 一个月折算
Inkling 0.95 / 4.05 美元 1.98 美元 59.2 美元
Nemotron 3 Ultra 0.50 / 2.20 美元 1.06 美元 31.8 美元
GLM-5.2 0.554 / 1.742 美元 0.97 美元 29.0 美元
Qwen3.8 27B 0.10 / 1.80 美元 0.62 美元 18.6 美元
Gemma 4 31B 0.09 / 0.34 美元 0.17 美元 5.2 美元
DeepSeek V4 Flash 0731 0.04 / 0.08 美元 0.06 美元 1.7 美元

同样是一次性充 10 美元解锁每天 1000 次,选错模型,一个月的额度只值 1.7 美元;选对模型值 59.2 美元,差 34 倍。这个换算的口径是请求数不是 token 数,长上下文任务的实际价值会更高。

还要留意免费池的周转速度:这 25 个免费模型里,14 个是最近 90 天上线的,23 个在半年内上线,最早的一个也只到 2026 年 2 月。名单变得很快,今天能用不代表下个月还在——官方 FAQ 的原话是「这些模型限额低,通常不适合生产使用」。

横向看,Google AI Studio 的免费层是按项目、按模型分别限额,官方文档已经把逐模型的免费额度移出文档页;Groq 的免费层是另一套独立限流。OpenRouter 免费档的独特点在于覆盖面:一个 key 能试到 NVIDIA、Google、Cohere、DeepSeek、Qwen、GLM 全家共 24 个模型,代价就是上面那三张账单。

三种用法可以:一是原型验证与选型,一个 key 横评多个实验室的模型;二是非实时批处理,每天 50 到 1000 次足够跑小批量实验,慢一点不影响结果;三是学习与风格对比,openrouter/free 随机路由反而适合感受不同模型的差异。

三种用法别碰:一是生产环境,单源、20 次/分钟、可用率最低到 80%;二是隐私敏感内容,三分之一的免费端点来自可能保留训练权的供应商;三是需要一致性的 agent 长链,额度按请求数计,一次 agent 任务动辄几十次请求,而随机路由每次换模型,行为无法复现。

判断很明确:OpenRouter 免费档值得开,但要把定位从「省钱的生产方案」改成「低成本试模型加非敏感批处理」。它是目前最便宜的横评 24 个模型的方式;把它当生产环境用,或者把敏感代码贴进 NVIDIA、Thinking Machines、Liquid 托管的模型里,那就是在拿另一样东西付费。

相关阅读:

谷歌给 Gemini 加了个视频开关:号称砍 88% token,实测静态反而便宜 26%

谷歌给 Gemini 加了个视频开关:号称砍 88% token,实测静态反而便宜 26%

88%——谷歌刚刚给 Gemini 加了一个处理视频的新开关,号称最多能砍掉 88% 的 token 消耗、66% 的分析成本,精度还反升 7%。但第三方只测了 6 条视频,就发现事情没那么简单:在「地毯式找全画面」的任务上,静态处理反而比它便宜 26%。

这场「让 AI 自己决定看什么」的升级,9 月 1 日由 Google DeepMind 通过 Gemini API 上线,覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 三个模型,官方文档现在也已把最新发布的 3.8 Flash 列入支持名单。它不是新模型,而是一个处理视频的全新工作方式——把「机器怎么读视频」从固定采样,改成了带目标的主动检索。

一、旧方式有多笨:每秒 1 帧全塞进上下文

要理解这次改了什么,先看 Gemini 原本怎么处理视频:静态模式(static processing)下,模型按固定帧率采样,默认每秒 1 帧,把采样画面连同音频一股脑放进上下文。

代价是惊人的。按谷歌自己的估算,低分辨率视频约每秒消耗 100 token,高分辨率约每秒 300 token。一小时讲座用静态模式处理,大约要烧掉 108 万个 token——这还没算反复提问、反复重看整段视频的叠加成本。开发者面对长视频只剩两个选择:要么付高昂的 token 费,要么用丢帧、跳段等取巧手段,结果漏掉关键细节。

二、新方式:AI 自己决定「看哪里、看多细」

Agentic(智能体式)视频理解改变的是这个逻辑:模型不再被动吞下每一帧,而是像一个有目的的研究员——先读字幕/音轨建立全局认知,再按需调用工具去加载视频的特定片段,用不同帧率反复检查可疑瞬间,甚至倒回去重看。

官方给出的几个核心能力都建立在「选择性观看」之上:

  • 亚秒级时刻检索:1 FPS 采样容易漏掉的瞬间状态变化、剪辑边界,现在能精准定位,可支撑自动化视频剪辑;
  • 大海捞针式长视频搜索:回答跨数小时视频的复杂问题,不再需要烧几百万 token;
  • 异常检测:对感兴趣的时间窗用更高帧率重采样,捕捉快速动作与细微画面瑕疵;
  • 动作/物体计数:以不同帧率扫描回看,准确跟踪重复动作与分散目标。

开发者只需在 API 配置里把 processing 设为 "agentic",即可启用;走标准 Gemini token 定价,不额外收取功能费。这也是继 agentic vision(让 Gemini 3 Flash「看懂图」)之后,谷歌把「模型自己决定看什么」这套范式从图像延伸到视频。

三、官方数字 vs 第三方实测:反差来了

谷歌官方基准测试口径:token 消耗最高降 88%、分析成本最高降 66%、精度最高提升 7%——注意是「最高」,不代表每条视频都这样。真正的亮点在长视频:从 10 分钟教程到 90 分钟讲座、数小时录像,agentic 模式的收益最明显。

但 9 月 3 日,PaperEdits 团队用同一款 Gemini 3.7 Flash 模型做了组独立对照实验(6 条合成 10 分钟视频,先冻结 prompt 与评分标准再测,无重试无修复):

结果喜忧参半。 Agentic 模式找回 20 个短暂事件中的 18 个(静态只找回 15 个),剪辑决策的宏观 F1 达 0.68 vs 静态 0.55——定向找东西确实更强。但在「广泛时刻检索」上静态反而更高(F1 0.30 vs 0.27),且静态模式少用 26.42% 的 token、成本低 23.01%;6 次 agentic 输出里还有 1 次没跑出要求的 JSON 格式。

换句话说:谷歌的「省 88%」是挑选过的最大收益场景(长视频 + 精确提问),换成「我要把整段视频从头到尾看明白」的宽覆盖任务,agentic 的导航开销反而可能让它更贵。谷歌自己也承认:agentic 模式对短于 5 分钟的视频可能增加首 token 延迟,文档明确建议——短片段、延迟敏感、需要逐帧全覆盖的任务,仍用静态处理。

四、为什么说这是「视频理解的 token 战争」

把视角拉远,这一招的战略意图很清楚。

对开发者:视频 API 的算账逻辑被改写了。过去处理视频 = 按秒数烧 token,长视频几乎不可用;现在长视频成本可能降一个数量级。谷歌给了个对比:一小时讲座静态约 108 万 token,agentic 可能只要约 10.8 万——接近 90% 的差距。这对视频审核、媒体归档、会议纪要、课程内容理解等长视频场景是实打实的降本。

对行业:这是谷歌在「AI 读懂物理世界」上的关键落子。视频是仅次于文本的第二大 token 消耗场景,谁先让视频分析便宜一个量级,谁就抢到下一波多模态应用的地板。别忘了 OpenAI 刚在 9 月 3 日发布 GPT-6 Astra——号称 1.05M 上下文、主打 computer-use 多模态,两家在同一条赛道贴身肉搏。而 Gemini 3.8 Flash(9 月 2 日发布,DeepSWE v1.1 拿下 73.7% 逼近 Claude Opus 5)也已支持这一模式,谷歌的「Flash 家族」正在用高频迭代+低价多模态打组合拳。

对普通用户:谷歌预告该能力将陆续进入 Gemini App,未来数月还会接入 YouTube 的「Ask YouTube」功能——以后对着几小时视频直接提问,底层用的就是这套「选择性观看」技术。AI 读视频这件事,正在从「按秒计费的重活」变成「按问题计费的轻活」。

五、判断

Agentic 视频理解不是营销噱头:它把「AI 看视频」从固定成本变成了按需成本,方向是对的——让模型像人一样「带着问题去看」,而不是「先把整段背下来」。但要泼一盆冷水:官方 88% 的省 token 宣传是最大场景口径,真实收益高度依赖任务类型;想无脑省钱、逐帧全覆盖的开发者,现阶段反而可能多花钱。

给开发者的实操建议:长视频 + 精确检索(找某个瞬间、数某个动作、查某段内容)→ 开 agentic;短视频 + 延迟敏感 + 全画面覆盖 → 老老实实静态。两个模式共存于同一个 API,按任务切换即可。

谷歌这一手,把「视频理解的 token 成本战」正式打响了。对做视频类 AI 应用的团队,现在正是重新算账的时候。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

GPT-6 Astra 发布:ARC-AGI-3 拿下 99.9%,公平评测仅 62.7%

GPT-6 Astra 发布:ARC-AGI-3 拿下 99.9%,公平评测仅 62.7%

99.9%——这是 GPT-6 Astra 在 ARC-AGI-3 上拿到的分数,一个专门用来测量「AI 离通用人工智能还差多远」的基准。OpenAI 自己的说法很直接:这是「代际跃迁」。而就在两天前,Meta 刚用 Muse Spark 1.3 声称编码反超 Opus 5;三天前,Anthropic 发布了 Fable 5.1。72 小时内三家头部同时出牌,AI 军备竞赛进入了白热化的九月。

OpenAI 连夜发布 GPT-6 Astra:不是预告,直接开用

北京时间 9 月 3 日晚,OpenAI 正式发布 GPT-6 Astra(内部代号 Mewfour,此前流传代号 Doug)。根据官方公告与 The Verge 报道,Astra 首先向 Daybreak 计划客户开放,未来几天陆续覆盖全部 ChatGPT Plus、Pro、Business、Enterprise 用户,并同步上线 OpenAI API 与 AWS。

定价直接对标 Anthropic:输入 $10/百万 token、输出 $50/百万 token——与 Claude Fable 5/5.1 完全同价,火药味十足。这是 GPT-5.6 Sol 之后 OpenAI 的旗舰换代,Sam Altman 团队给出的关键词是「generational leap」(代际跃迁),联合创始人 Greg Brockman 亲自下场转发。

此前 8 月的多次代号泄露(数学突破 + 网络安全 Critical 级、参数规模传闻 10 万亿)终于落地——本站 8 月 19 日曾专门写过那次泄露。

真正的爆炸点:ARC-AGI-3 拿下 99.9%,但争议随之而来

ARC-AGI-3 是 ARC Prize(François Chollet 创办)今年 3 月上线的第三代智能体基准:AI 要在没有说明书的陌生抽象环境里探索、推断目标、建立世界模型并规划行动。它的设计初衷就是测量「AI 与人之间残余的智能差距」——人类可以 100% 通关。

ARC Prize 官方博客 9 月 3 日公布的结果(Greg Kamradt 执笔):

  • 标准 harness(公平同接口):Astra max 档 62.7%,花费 2.6 万美元
  • Provider Adapter harness(OpenAI 自定义上下文管理):Astra high 档 99.9%,花费 1.9 万美元
  • 对比:Claude Opus 5 标准档 30.2%,GPT-5.6 Sol 仅 7.8%

99.9% 接近满分,但前提是换上 OpenAI 自己设计的 harness——它允许模型跨请求保留「不透明的推理状态」并用 compaction 压缩长对话,等于让模型把之前的工作记在私有草稿本上。标准 harness 下 Astra 只有 62.7%,虽然仍是 SOTA,但远非「碾压」。

ARC Prize 的态度很明确:两种 harness 回答两个不同的问题,今后排行榜会同时标注两种结果。而社区(Hacker News、Reddit)已经吵翻——有人指出 GPT-5.6 Sol 的 7.8% 是因为 ARC 默认 harness 在轮次间丢掉了推理 token,「这是很糟的 harness 设计」。

除了基准分,Astra 真正可怕的是三件事

ARC Prize 团队回放 Astra 的解题过程后发现三个超出分数本身的信号:

第一,行动效率超过人类。 Astra(max)在 96% 的关卡里动作数少于人类测试者中位数,平均少用 51.7% 的动作。ARC Prize 原本假设「行动效率」会长期是人与 AI 的分水岭——人类看一眼就懂,AI 要反复试探。Astra 打破了这个假设:一旦理解机制,它执行起来比人还利落。

第二,自己发明符号语言。 面对陌生游戏,Astra 会把场景压缩成紧凑的类代码符号模型——自创坐标、规则、状态跟踪的速记法(例如「extend8 to3; retract10 to2」这样的多步计划)。这不是人类教的,是它在解题现场生成的领域专用语言。

第三,按需写工具。 在 PRO-LONG harness 下,Astra 会为每个游戏现场编写小工具库:棋盘解析器、寻路算法、规划器、巡逻模型——一个带守卫的迷宫关卡,它先后写出了 maze_solver.py、combat_solver.py、patrol_solver.py、sync_state.py。

结合 OpenAI 此前公布的专项成绩:ExploitBench(网络安全漏洞利用)100%(GPT-5.6 Sol 78.5%)、SRE-Bench 二进制逆向四轮内 99.2%、长上下文 512K–1M token 区间 96.3%——Astra 是个能打的安全与编码全能选手。

冷静一下:它没有全赢

别急着喊 AGI。几个关键限制:

  • Artificial Analysis 智能指数:Astra 得分 61,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1(max)低 5 分,也低于 Meta 的 Muse Spark 1.3
  • ARC Prize 官方声明:饱和 ARC-AGI-3「不代表实现 AGI」——基准有边界、机制封闭,真实世界要复杂得多
  • 99.9% 依赖自家 harness:标准公平接口下是 62.7%,两种数字要一起看,任何只报 99.9% 的说法都是断章取义
  • 价格战逻辑没变:与 Fable 5 同价,意味着 OpenAI 认为 Astra 在综合能力上足以正面叫板,而不是靠低价抢量

这恰恰是当前格局的真实写照:OpenAI 的 Astra、Anthropic 的 Fable 5.1、Meta 的 Muse Spark 1.3 三强各有所长——没有一家能全维度碾压,每一家都在自己最有利的基准上做文章。GPT-5.6 Sol 反而成了新一代的「计量单位」。

判断:九月的牌桌,每 24 小时洗一次

过去 72 小时,Anthropic、Meta、OpenAI 相继亮牌。规律很清楚:发布节奏从「按季度」压缩到「按天」,基准从「论文评测」转向「实战智能体」,竞争焦点从「谁聪明」变成「谁在特定任务上更高效、更便宜、更安全」。

对开发者:Astra 通过 API 和 AWS 开放后,与 Fable 5.1、Muse Spark 1.3 的选型对比将是未来几周最值得做的事——同样的任务,三家跑一遍,成本、速度、工具调用稳定性立见高下。对普通用户:ChatGPT Plus/Pro 用户几天内就能直接用上 Astra,「代际跃迁」是真是假,自己问几个难题便知。

ARC Prize 已经在琢磨下一代基准:递归自我改进、开放式创新——专门等着 Astra 们去撞墙。这场竞赛,恐怕才刚刚开始。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Meta 发布 Muse Spark 1.3:编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol,扎克伯格预告 Watermelon 与开源权重

Meta 发布 Muse Spark 1.3:编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol,扎克伯格预告 Watermelon 与开源权重

9 月 2 日,Meta 麾下 Meta Superintelligence Labs(MSL)发布旗舰模型 Muse Spark 1.3,同步登陆 Muse Code 与 Meta Model API。Meta 首席 AI 官 Alexandr Wang 称之为「我们迄今为止在模型性能上最大的一次跃升」,并放话该模型在编程能力上「好于」OpenAI 的 GPT-5.6 Sol、与 Anthropic 刚发布的 Claude Fable 5.1 处于同一竞争梯队。同一天,CEO 扎克伯格在 X 上预告:下一代旗舰「Watermelon」与 Muse Spark 系列的开源权重都「即将到来」(coming soon)。这已是 Muse Spark 自 4 月诞生以来五个月内的第四次迭代——Meta 正以前所未有的节奏冲击前沿模型第一梯队。

一、发生了什么:五个月四次迭代,编码与长上下文双线反超

Muse Spark 1.3 是 MSL 自 4 月首秀、7 月推出 1.1、8 月推出 1.2 之后的第四次大版本更新。据官方发布与多家媒体报道,这次迭代的核心不是堆参数,而是「效率 + 长程任务能力」:

  • 成本与效率:1M token 上下文窗口,输入 $1.25/百万 token、输出 $4.25/百万 token(与 1.2 持平),缓存输入低至 $0.15;扎克伯格称其性能「便宜到几乎不用计量」(almost too cheap to meter)。相比 1.2,工具调用减少约 20%、token 消耗减少约 25%。
  • 多模态输入:原生支持文本、图像、视频与文档理解,OpenAI 兼容 API 与工具调用(tool calling)。
  • Agent 能力强化:长程任务中可自主生成上下文、主动修正计划、保留跨任务细节;提示词含糊时会主动反问澄清、卡住时求助用户、执行关键操作前先确认——官方强调「对自己能力边界的感知更准,减少幻觉式硬撑」。
  • 多任务并行:能在单一长线程中同时管理多个工作流,而不是靠多个会话硬拼。

据 Meta 公布的自家基准(officechai 等媒体汇总),Muse Spark 1.3(max 档)与 Anthropic Opus 5、OpenAI GPT-5.6 Sol 的对位如下:

基准 Muse Spark 1.3 GPT-5.6 Sol Opus 5
DeepSWE v1.1(长程 agentic 编码) 75.4(1.2 仅 55.0) — 74.0
SWEAtlas CodeBase QnA 59.4 53.5 52.7
Terminal-Bench 2.1 88.8(与 GPT 打平) 88.8 86.7
MRCR 256K–512K(长上下文) 98.5 91.5 未列
MRCR 512K–1M(超长上下文) 98.1 73.8 未列
GDPVal-AA v2(知识工作) 1754 1710 1824
DeepSearchQA(agentic 浏览) 89.4 93.0 —

数字本身是 Meta 自家 harness 跑出来的,第三方独立评测(如 Artificial Analysis)尚未出炉——但「编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol」的原始成绩单,已经足以震动市场。

二、为什么值得关注:Meta 把「开源悬念」变成了最强的竞争武器

这则新闻的商业分量不在单一模型,而在两个信号:

第一,Meta 用 5 个月完成了别人几年的追赶曲线。 去年扎克伯格挖角 Scale AI 创始人 Alexandr Wang 组建 MSL,当时外界普遍质疑 Meta 在 AI 竞赛中掉队。如今 4 月 → 9 月连发四代旗舰,DeepSWE 从 1.2 的 55.0 直接跳到 75.4,把「反超 Anthropic Opus 5」写进了自家成绩单。Wang 在接受采访时更直言,该模型「好于任何现有的中国模型」——直指开源阵营与国产模型的竞争语境。

第二,「开源权重」四个字才是真正的胜负手。 Wang 确认 1.3 的权重尚未决定是否发布,但上一代 Muse Spark 1.2 的权重仍计划开源;扎克伯格本人近期连发公开信强调「让 AI 开发更开放可及」,并在 X 上预告 Muse Spark 开源权重与下一代旗舰 Watermelon「即将到来」。一旦 Meta 把接近前沿性能的权重真正放出来,将直接复刻 Llama 当年的生态打法——用免费可下载的模型撬动开发者生态,倒逼 OpenAI、Anthropic 的闭源高价策略。对开发者与初创公司而言,这可能比任何基准分数都更重要。

三、对三类人的实操启示

对开发者和技术选型者:若你在 Muse Code 或 Meta Model API 生态内,1.3 的「省 25% token + 少 20% 工具调用」意味着同样的预算能跑更长的 agent 任务,长上下文档位(512K–1M)目前是同级最强之一,适合代码库问答、长文档智能体场景。但注意两点:一是基准均为 Meta 自测,等 Artificial Analysis 独立数据再定迁移结论;二是 1.3 权重未定是否开源,生产环境别把「可自托管」当默认假设。

对企业与 AI 应用创业者:多模型并行已是 2026 年下半年的事实——OpenAI、Anthropic、Google、Meta、Qwen 在 48 小时内连续上新(详见昨日 Claude Fable 5.1 报道)。建议把「模型可替换性」写进架构:用 OpenAI 兼容层接多供应商,哪家性价比翻转就切哪家,避免被单一实验室的定价与限流绑架。

对投资者与行业观察者:注意 Meta 的算力军备逻辑——数百亿美元基础设施投入、传闻中的云算力出租业务(Bloomberg 7 月报道)、加上 Nvidia 同时在扮演芯片商 + 云投资方 + 房东的「三角色」交易结构。模型层价格战已经开打(各厂旗舰 API 定价集体下探),真正的利润争夺正在向算力层与生态层转移。

四、潜在风险与看点

基准可信度:Meta 自家数字历史上与第三方评测有出入(1.2 曾自报 Terminal-Bench 82.9%、第三方验证差 3.8 分),1.3 的「反超」需独立数据确认。

开源承诺的摇摆:Wang 对 1.3 权重「尚未决定」,与扎克伯格「开源权重即将到来」的表态存在张力——「Watermelon」若真达到前沿水准,Meta 是否舍得放权重,将是未来数月开源社区紧盯的悬念(Spyglass 等媒体已质疑:Meta 可能用 Watermelon 蒸馏出开源版、闭源保留旗舰)。

同日发布潮的挤压:9 月 1–2 日,Anthropic Fable 5.1、Google Gemini 3.8 Flash(含 Cyber 版)、Qwen3.8-Max-0902 与 Muse Spark 1.3 扎堆登场。模型供给过剩、同质化竞争加剧,「发布即过气」的窗口期正在缩短——对下游应用方是红利,对模型层是绞杀。

五、小结

Muse Spark 1.3 本身是一次扎实的迭代:效率更高、编码与长上下文站上前沿、agent 能力更贴近真实工作流。但真正值得记住的是 Meta 的战略姿态——五个月四迭代的节奏、贴着成本打的定价、悬而未决的开源承诺。当「最强开源模型」的头衔可能再次易主,2026 下半年的 AI 竞赛已经从「谁的模型更强」转向「谁能把最强模型以最低门槛送到最多人手里」。

相关阅读:

Claude Fable 5.1 发布:科研能力翻倍、缓存成本直降 75%,Anthropic 的「耐力 + 成本 + 信任」组合拳

Claude Fable 5.1 发布:科研能力翻倍、缓存成本直降 75%,Anthropic 的「耐力 + 成本 + 信任」组合拳

9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1。这是两个名字、同一个底层模型:Fable 5.1 带生产级安全护栏、面向所有用户开放,Mythos 5.1 为经核验的网络安全与生命科学机构放宽护栏、限量开放。官方将其定位为「全球最强的编程与知识工作模型」,公告发布数小时内浏览量逼近 200 万。而 OpenAI 尚未发布的 Astra 传闻,则在过去一周占据了舆论场——Anthropic 选择在这个节点带着公开评测数据直接出货,本身就是一种表态。

长任务能力翻倍,短任务只是小幅提升

如果把 Fable 5.1 与上一代 Fable 5 对比,最直观的变化在「耐力」而非「爆发力」:在智能体科研基准 Terminal-Bench-Science 0.1 上,Fable 5.1 得分 52.6%,Fable 5 仅 24.7%,翻了一倍多;Terminal-Bench 4.0 编程测试从 42.0% 升到 55.8%;业务自动化 AutomationBench 从 17.1% 升到 31.4%,相对提升 84%。但在短周期任务上提升有限:CursorBench 只涨了约 3 个百分点,综合推理 Humanity’s Last Exam 仅涨约 1 分。业界普遍解读:这是一次「长程自主任务」的定向升级——任务越长、越需要模型独立完成,增益越明显。

价格没变,实际成本最高降近一半

Fable 5.1 的官方标价与 Fable 5 完全一致:输入 $10/百万 tokens,输出 $50/百万 tokens。真正变的是 cache reads(缓存读取)——智能体反复读取上下文是成本大头,单价从 $1.00 直降到 $0.25,降幅 75%。Anthropic 称按 8 月四周的真实用量测算,典型工作负载实际成本降低约 25%,上下文密集的智能体任务最高降 45%。此外新模型暴露了 5 档 effort(思考力度)可调:最低档科研得分约 26%、单任务成本约 $11,而旧版最高档得分 24.7%、成本约 $44——新模型最省钱的档位,用四分之一的价格打赢了旧版最贵的档位。

隐形水印上线,检测 API 进入私有预览

Fable 5.1 是 Anthropic 首批内置「统计隐形水印」的模型之一:生成文本中嵌入了人眼不可见的水印,配合检测 API 即可判定文本是否出自 Claude。水印不影响输出质量,对没有检测工具的读者完全无感;检测 API 目前处于私有预览阶段,且该水印机制适用于 2026 年 8 月 2 日之后发布的所有模型。这被视作对欧盟 AI 法案透明度要求的回应,也是 AI 内容可溯源(provenance)竞争的开场——Anthropic 选择把「谁写的」变成可验证的事实。

企业隐私架构:Enterprise Frontier Safeguards

面向大型企业的 EFS 是本次发布中商业意义最重的一块:检测高级滥用需要保留跨会话的活动数据,而受监管企业要求零数据留存,EFS 把活动日志存进客户自己的云存储(可选客户托管加密密钥),由自动化模式分析完成检测,Anthropic 员工不接触数据,每个控制项均可选开启,标记结果只交给客户安全团队。超过 100 家企业参与了设计,今秋分阶段上线,符合条件的企业在上线前享受零数据留存。早期用户反馈也印证了效率:Rogo 报告同等准确度省 20% tokens,媒体公司 Every 的 Slack agent 只用了 Opus 5 一半的 token、速度还快一倍。

小结:这不是一次均匀的智力跃升,而是「耐力 + 成本 + 信任」的组合拳

Claude Fable 5.1 的发布传递了三个信号:其一,模型竞争的重心正从「单次答题能力」转向「长程自主任务的完成经济学」——同样的任务,更少的 token、更少的重试,就是更便宜的模型;其二,effort 档位正在成为新的标准控制项,懂得「什么时候用低档够用」正在变成一项省钱技能;其三,水印与 EFS 表明,AI 产业的下一场战役不止是能力,还有可追溯性与企业信任。对开发者而言,Anthropic 官方的建议依然务实:默认从更便宜的 Opus 5 起步,当 Opus 5 开到最高 effort 仍不够时,再切换到 Fable 5.1 处理长程、智能体化、上下文密集的任务。

谷歌 Gemini 3.7 Flash 发布:价格腰斩、三周迭代,大模型”快而省”价格战开打

谷歌 Gemini 3.7 Flash 发布:价格腰斩、三周迭代,大模型"快而省"价格战开打

① 资讯摘要

北美时间 8 月 13 日,Google DeepMind 发布新一代轻量主力模型 Gemini 3.7 Flash,官方将其定位为”迄今用于编码与智能体(Agent)领域最聪明的 Flash 级模型”,主攻编程、多步骤任务、工具调用与复杂知识工作。值得注意,这距离上一代 Gemini 3.6 Flash 发布仅过去约三周,迭代节奏明显提速。据 36kr、新浪财经、网易科技等多家媒体报道,本次发布也是哈萨比斯交棒 Koray 之后,谷歌首款公开亮相的 Gemini 模型。

价格是最受关注的变化:2026 年 12 月 31 日前,Gemini 3.7 Flash 的推介价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,正好是 3.6 Flash 原价的一半;自 2027 年 1 月 1 日起,两项价格将分别回升至 1.50 美元与 7.50 美元。模型支持最高 100 万 token 上下文、最大 6.4 万 token 输出,并已同步上线 Gemini Spark 订阅,面向 160 多个国家和地区的 Google AI Pro / Ultra 用户开放。

② 为什么值得关注

这是大模型”价格战”从挑战者烧向巨头的信号。过去一年,”把单位智能成本打下来”主要是 DeepSeek、阿里等挑战者的叙事;如今谷歌主动把自家主力 Flash 的价格砍半,说明即使是算力与生态最雄厚的玩家,也不得不加入”快而省”的竞速。对依赖 API 的开发者与企业来说,这意味着同等预算能跑更多、更复杂的任务。

竞争焦点从”参数规模”转向”性价比 + 迭代速度”。三周迭代、价格腰斩、直击 Agent 场景——谷歌释放的信号很明确:下一阶段比的不是单次跑分的峰值,而是”足够聪明、足够便宜、足够快”的持续供给能力。结合本周字节 Seed 2.1 Turbo、DeepSeek V4 Pro、xAI Grok 4.6、英伟达 Nemotron 3.5 Lightning 的扎堆发布,一条”轻量高速模型”的主线已经清晰。

Agent 经济的成本拐点到了。在每天调用数十万甚至上千万次的 Agent 自动化与企业工作流里,单价腰斩会被指数级放大。模型越便宜,越多的自动化流程才”算得过账”——这正是 AI 从 demo 走向生产的关键门槛。

③ 分角色实操建议

对开发者 / 技术负责人:现在是用 Flash 级模型搭建与压测 Agent 的成本洼地。限时价持续到年底,适合把高频、可并行、对延迟敏感的调用场景(代码生成、文档处理、网页操作)迁过来做 A/B,趁低价把架构跑顺。注意把”限时价”和”2027 年翻倍价”分开测算,别把促销价当成长期成本基线。

对企业 / 产品负责人:不要把成本结构焊死在单一厂商的促销价上。更稳的做法是预留多模型路由能力(类似英伟达开源的 NeMo Switchyard 思路),按任务难度动态选模型——简单活交给便宜的 Flash,难活才上旗舰。这样即便 2027 年价格回升,整体账单依然可控。

对投资者:关注”单位智能成本”持续下降带来的应用层机会:当调用成本不再是瓶颈,受益的会是上层的工作流、SaaS 与垂直 Agent。同时,谷歌在 Koray 接棒后的产品节奏(三周一小更、价格主动下探)本身,也是观察其 AI 竞争力修复的重要窗口。

④ 结语

Gemini 3.7 Flash 的意义,不只是一款”更便宜更快”的模型,而是谷歌正式加入大模型价格战的宣言。当巨头也开始用三周迭代和价格腰斩抢开发者,AI 应用的爆发才真正有了成本基础。本篇为热点资讯解读,不含任何合作或联盟链接。

关注「AI商业快讯」,每天一篇 AI 热点深度解读,帮你用最少的精力跟上最关键的行业变化。

⑤ 相关阅读