Cognition 新旗舰 SWE-2 拆解:480 亿美元的编程 AI,底座是中国的 Kimi K3,对标 Fable 5.1 成本低 64%

50.0%。这是 Cognition 在 9 月 10 日发布的编程模型 SWE-2,在 FrontierCode 1.1 Main 上的得分,距离 Anthropic 的 Claude Fable 5.1(50.9%)只差 0.9 个百分点;按 Cognition 自己的算法,成本低 64%。

比分数更值得追问的是它的出身:SWE-2 不是从零训练的,底座是中国的开源模型 Kimi K3。而发布它的公司,9 月 8 日刚以 480 亿美元估值拿到超过 20 亿美元融资。

SWE-2 是什么:一次 RL 跑出三档

Cognition 是 Devin 的开发商,也是目前全球估值最高的 AI 编程公司。它给 SWE-2 的定位是”推帕累托前沿”——分数要追,成本也要压。先看官方评测表(数字全部来自 Cognition 官方博客,单位均为百分比):

模型 FrontierCode 1.1 Main DeepSWE 1.1 Terminal-Bench 2.1 Terminal-Bench 4
SWE-2 50.0% 73.0% 92.8% 27.3%
Kimi K3(底座) 44.2% 68.5% 88.3% 21.5%
Claude Fable 5.1 50.9% 67.4% 91.4% 55.8%
GPT-6 Astra 53.3% 74.1% 89.9% 57.9%
GPT-5.6 Sol 47.5% 72.7% 88.8% 37.3%
SWE-1.7(上一代) 42.0% 37.7% 81.5% 7.6%

几件事一眼能读出来。第一,SWE-2 在 DeepSWE 1.1 上以 73.0% 反超 GPT-5.6 Sol 的 72.7%,在 FrontierCode 上只落后 Fable 5.1 与 Astra,并小幅领先 Grok 4.6(48.0%)。第二,它把自家上一代甩开了一大截:DeepSWE 从 37.7% 跳到 73.0%。第三,也是这张表里最该看的一列——Terminal-Bench 4 上它只有 27.3%,而 Fable 5.1 是 55.8%、Astra 是 57.9%,这是它最明显的短板,说明它的强项集中在仓库级改代码,一旦进入终端长链条操作就差了一倍。

训练上 Cognition 讲了一个方法论变化:这是它第一次把强化学习做到”多万亿参数”规模,关键改动是一次 RL 同时跑完所有推理档位。SWE-2 有 medium / high / max 三档,往常要多轮训练,这次给每一档加一条线性成本惩罚,系数按底座模型帕累托前沿的局部斜率标定,一次把整条成本—性能曲线抬起来。

效果落在行为上:官方称 SWE-2 medium 比 SWE-1.7 得分更高,同时轮次少 58%、单任务平均成本低 81%;第一次真正动代码的中位步数从 48 步降到 18 步——换成人话是”少翻代码、早动手”。

分发方式也在讲同一个故事:SWE-2 不开权重、也不给独立 API,只能通过 Devin 使用。Devin Pro 20 美元一个月,Pro、Max、Teams 订阅者可以免费用一个月,到 10 月 10 日。

底座是 Kimi K3,而且不是第一次

如果只看到”又一个编程模型发布”,就会错过真正的信号:SWE-2 的底座是月之暗面的 Kimi K3——一个 2.8 万亿参数、100 万 token 上下文、7 月 27 日放出全部权重的开源模型。

这也不是 Cognition 第一次这么干,它的上一代 SWE-1.7 就是从 Kimi K2.7 Code 后训练出来的。同一条路上的案例还有:8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet,它的第一个后训练模型同样基于 Kimi K3,官方称在 LAB 基准上的全通过率比底座提升 82%。

中国开源权重正在变成美国 AI 产品的上游底座。这条链路跑得通,一半靠性能——Kimi K3 放开权重时是当时最大的开源模型;另一半靠许可——K3 的许可证以 MIT 为底,使用、修改、再分发都允许,只有当转售方的 MaaS 业务年收入超过 2000 万美元才需要另签协议。对 Cognition 这种”自己用 + 卖订阅”的形态来说,门槛根本不在许可上。

对国内团队来说,同一件事还有一层价格含义。Fable 5.1 和 GPT-6 Astra 的 API 报价都是每百万 token 输入 10 美元、输出 50 美元;而 Kimi K3 官方价格是每百万 token 输入 20 元、输出 100 元(缓存未命中,约合 3 美元 / 15 美元)。也就是说,被拿去当底座的那个模型,本身就能以不到三分之一的价格买到——你当然拿不到 Cognition 那层后训练,但”用便宜的开源底座 + 自己的数据和 RL”这条路,它已经把配方公开写在博客里了。

一个反差:一边控诉「蒸馏」,一边公开用开源

这就要说到 9 月 10 日 Anthropic 发布的那份威胁情报报告。它指控 7 家中国实验室用数千个假账号做”非法蒸馏”,其中阿里在 5 月到 7 月间与 Claude 的交互超过 1.51 亿次,月之暗面被指把部分 Kimi 用户请求转发给 Claude 代答。Anthropic 自己的口径是:蒸馏技术本身合法,违规的是用假账号绕过防护。

两件事放在同一周看,味道就出来了:一边是中国实验室被指偷偷拿美国模型的输出去训自己的模型,另一边是美国公司在公开、合法地拿中国的开放权重做后训练,还写进博客当卖点。

这不只是双标的问题,它说明能力流动的方向已经不只单向。开源权重是一门”以许可换生态”的生意:Moonshot 放弃了对模型使用的垄断权,换来的是它出现在别人的产品说明里、出现在评测榜单里、出现在 Devin 的更新日志里。彭博社 9 月 11 日的报道里,月之暗面的年化收入从 6 月的约 3 亿美元涨到 8 月的 10 亿美元以上,靠的也是这个逻辑的另一面。

第三方验证:便宜是真的,主场优势也是真的

Cognition 的 50.0% 和 64% 都出自它自己运营的 FrontierCode——那是自家基准,没有第三方完整复现过,1.1 版还改过规则,与 1.0 的分数不可比。所以更有价值的是外部数据。

9 月 12 日,Artificial Analysis 公布了对 Devin Fusion 的独立评测:SWE-2(medium)在其 Coding Agent Index v1.5 上得 61.7 分,与完整版 Claude Code 的 62.2 分基本持平,单任务成本 7.90 美元对 12.40 美元,便宜 36%。这个指数由 DeepSWE 1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三个基准等权合成,每个任务跑三次取平均。

这是本轮最重要的外部数字:便宜是真的,而且是在第三方基准上便宜。但同一份评测也再次印证了短板——指数里就包含 Terminal-Bench 4.0,而那正是 SWE-2 最弱的一项。所以更准确的说法是:它在某些任务分布上追平了前沿,在另一些上还差一倍。

480 亿美元的赌注,与编程 Agent 的阵营化

SWE-2 发布的两天前,Cognition 宣布完成 E 轮融资:融资额超过 20 亿美元,投后估值 480 亿美元,由 a16z 和 Accel 领投,Founders Fund、General Catalyst、Avenir 跟投。四个月前,它才刚以 260 亿美元估值融过一轮 10 亿美元;同期它自己的口径是,年化营收从 5 月的 4.92 亿美元涨到接近 9 亿美元。

也就是说:四个月前估值 260 亿美元的公司,现在 480 亿;营收四个月涨了约 1.8 倍;它的旗舰模型底座来自中国;而它的一位老对手(Cursor)刚被 SpaceX 以 600 亿美元整体收购。

这条赛道正在分岔:一边是独立的编程 Agent 公司靠融资把估值推高,一边是头部玩家被巨头吞掉——Cursor 被 SpaceX 收购完成后,OpenAI 在 8 月底宣布终止向 Cursor 提供模型。编程 Agent 正在从”工具市场”变成”大厂生态战”的一部分。

顺带一提这条曲线起点有多低:Devin 2024 年 3 月发布时定价 500 美元一个月,随后被曝在真实任务里 20 个只成功 3 个,一度是”AI 演示很美、落地很惨”的典型案例。两年半之后,同一家公司的新模型能贴着一线前沿跑,估值 480 亿美元——中间拉开差距的,恰好就是”后训练”这件事。

写在最后

回到最初的数字:一家估值 480 亿美元的美国 AI 公司,用中国的开源模型做底座,把后训练出来的成品追到离美国最强闭源模型 0.9 个百分点、成本低 64%;但它不发权重、不给 API,只卖 20 美元一个月的订阅。

这条链路上每一环都值得记住:开源权重是谁家的、后训练是谁做的、基准是谁定的、独立评测又说了什么。因为接下来一年,同类模型会越来越多,而”这到底是谁的模型”这个问题会越来越难回答。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

发表评论