Dashi PPT 实测:8,250 星的开源 PPT Skill,1020 套版式,一份 JSON 导出 36 页可编辑 PPTX

Dashi PPT 实测:8,250 星的开源 PPT Skill,1020 套版式,一份 JSON 导出 36 页可编辑 PPTX

做过汇报的人都有过同一种卡壳:内容早在脑子里排好了,时间全耗在把字挪进模板、调对齐、换配色。让 AI 代劳也不省心——它吐出来的 HTML 常常是「看着像 PPT,改起来像拆炸弹」,动一行样式整页崩。

所以当一个 8,250 星、97 天冲到榜单的 PPT Skill 出现在雷达里,我决定不只看它的宣传页,而是把它彻底跑一遍:不装插件、不开浏览器点选,只喂一份内容 JSON,看它能不能离线产出一份真正能改的演示稿。结论先放这里:9 页稿子跑通了,还导出成 36 页可编辑 PPTX(11MB、740 个可编辑文本对象);但它自带的校验器也会误报,这点后面细说。

它把 PPT 拆成了三层

Dashi PPT 是一个 Agent Skill,核心思路和「让大模型直接写 HTML」完全相反:模型不负责画版式,只负责填内容。

它内部有 12 套视觉主题,每套主题是一批预置版式(封面、数据、对比、流程、风险、结论……),每个版式都是一段带控件的 React 组件。生成时先由 layout:query 按「页面角色 + 主题 + 随机种子」选出候选版式,再让 Agent 写一份 PageContentPack:每页只写标题、摘要、要点、图表数据,不写任何样式。随后 goal:scaffold 为每个逻辑页产出 4 个方案——3 个模板方案(锁死版式的视觉结构,只替换文字)+ 1 个按本页内容定制的方案。最后渲染成静态 HTML,导出 PPTX。

关键在「锁模板填文案」这条约束:页面的视觉、结构、数量、显隐、配色由版式决定,Agent 只能改文字。这既是它的可控性来源,也是它的上限所在。主题清单也能看出它的取舍:轻拟态风对应企业内部汇报,深浅代码风对应技术方案,色谱图表风对应数据分析,黑金实验风对应高端发布——都不是给品牌视觉团队准备的。

真正撑起这套体系的不是模板数量,而是三个量化文件:3.5MB 的 layout-manifest.json 登记了每个版式的控件与默认值,71KB 的属性契约约束每个控件能取什么值,82KB 的 spec 校验脚本负责在渲染前拦住非法结构。前者定义「有什么」,后两者定义「不能乱来」。

宣称 我的离线复核
12 套视觉主题 12 套,每套 71 到 111 个版式
1020 个版式页面 1020 条,逐条数列一致
8576 个可调控件 8576 个:开关 4276、滑杆 2372、下拉 1825、图标 77、图片位 26

三个数字全部精确对上,没有注水。

实测:从内容 JSON 到可编辑 PPTX

我把这次评测本身写成了 9 页内容计划,然后在 Alpine/Linux 沙盒里跑完整流程:

  • 依赖只有 35 个包、90MB,npm ci 32 秒装完,没有需要编译的原生模块;
  • 生成器先是两次拒绝了我的输入:一次是我把 chartData 的 id 写成了和 items 相同的 fact-1(要求 id 唯一、label/value/unit 必须一致),一次是同页图表单位混用「个 / 套 / 星」(要求要么全填、要么全空)。这两条不是文档里的客气话,是硬拦截;
  • 通过后产出 9 页 × 4 方案的 goal.json(122KB),渲染出 index.html(601KB)+ assets(7.9MB),离线双击即开;
  • 导出 PPTX 走了无头 Chromium:11MB、36 页、740 个可编辑文本对象、1309 个形状、147 张图片,打开后每段文字都能改。

但「可编辑」有边界:导出器同时给出了几百条降级警告——背景光效、渐变底、部分 SVG 与遮罩元素无法翻译成 PPT 形状,会被栅格化成图片贴上去。也就是说,文字和基础形状是真可编辑的,那些让页面显得精致的视觉特效,到了 PPTX 里就变成了一张底图。这是所有「网页转 PPTX」方案共同的物理限制,不是它独有的毛病。

另外两点体验值得一提:一是中文并没有被打包进字体,index.html 里明确写着 Noto Sans SC 这类中文字体超出体积预算、改用系统字体回退,所以同一份稿子在 Mac 和 Windows 上中文字重会略有差别;二是它的依赖干净得少见,没有原生模块,在一台只装了 Node 的机器上 90MB 就能跑起来。

也就是说,它宣传的「HTML 能编辑、PPTX 可交付」是真的。

但同一个流程里,它自带的文案校验器给了我一个退出码 1:报出 27 处「未覆写模板文案槽」(每页 3 处,对应 3 个模板方案),外加一条「AI Capital / 投融资默认文案残留:大模型」。

我去查了这两条的成色。那条「大模型」来自我自己写的正文「让大模型直接吐 HTML」——词表把常见词当成了投融资模板的特征词。而被判「未覆写」的 statLine,实际是投影阶段被显式清空(值写成空字符串),cards 也已绑定到我的 3 条内容和 1 条图表摘要,只是校验器把「空值」和「没写」算成了一回事。渲染出来的 9 页里,我一处模板默认文案都没找到。

模板默认文案确实存在,但位置很隐蔽:第 1 页所用版式的默认值是一整套「AI Capital Lab / 战略投资者 / 云资源授信 118 亿美元」的投融资示例,在文件里出现 10 次,全部躺在 data-prop-defaults 里——那是浏览器编辑器里控件的默认值,不是你交付出去就摆在观众面前的字。换句话说,这道闸门偏保守:宁可误报,也要逼你逐槽确认。

两条路线,怎么选

维度 版式库路线(Dashi PPT) 让模型直接吐 HTML
可控性 每个控件有契约与默认值,改坏了会被校验拦住 依赖模型自觉,改一处可能整页崩
自由度 只能组合已有版式 任意布局,上限更高
返工成本 改内容不动样式 常要整页重写
交付 静态 HTML + 可编辑 PPTX 通常只有一次性 HTML

几个必须先知道的前提:一是可编辑 PPTX 导出要在本机跑一次无头浏览器(官方推荐 macOS/Windows,Linux 需要自备 Chromium);我在沙盒里就撞上了环境限制——导出 CLI 启动的预览服务读取网卡信息失败,最后是绕过预览服务、直接调用导出引擎才拿到文件。二是许可证是 AGPL-3.0,公司内部用没问题,把它包进自家产品再分发前要确认合规。三是版式覆盖的是常见汇报结构,发布会主视觉那种强定制需求仍要人工介入。

适合谁:周报月报、方案评审、产品介绍这类高频、结构固定的汇报,收益最大;需要交付 PPTX 继续人工改的团队也合适。不适合谁:追求品牌级排版的视觉团队,以及指望它一键完成「内容 + 视觉双定制」的人。

我的判断

值得放进工具箱,但别把它当成万能排版引擎。它真正的价值不在 1020 个版式,而在那套「内容与样式分离 + 生成前后双校验」的工程约束——这正是多数 AI 出图/出稿工具缺的一环。它的问题是闸门做得太保守,误报会消耗信任;一句话概括:它不擅长帮你把 PPT 做漂亮,但很擅长让你别在排版上浪费时间。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

OpenAI 133 周后反超 Anthropic:重回 OpenRouter 花销第一,Anthropic 份额从 19% 跌到 3.8%

OpenAI 133 周后反超 Anthropic:重回 OpenRouter 花销第一,Anthropic 份额从 19% 跌到 3.8%

133 周。这是 OpenAI 上一次在 OpenRouter 上拿下「花销第一」,到今天的距离。

2026 年 9 月 7 日到 13 日那一周,OpenRouter 上的开发者花在 OpenAI 模型上的钱,第一次超过了 Anthropic。OpenRouter 官方账号的说法是「2.5 年多没发生过」;公司洞察负责人 Peter Walker 给的数字更精确——OpenAI 隔了 133 周重新拿回钱包份额第一,推动它的是 9 月 3 日上线的 GPT-6 Astra。

这是 2026 年最值得盯的一条模型竞争数据:不看谁在榜单上更聪明,只看开发者的钱往哪边流。

OpenRouter 的钱包份额,为什么值得当尺子

OpenRouter 是把几百个模型收进一个 API 的聚合路由平台,开发者在上面换模型只需要改一个字符串。今年 8 月,Stripe 以 75 亿美元把它买下(关于这笔交易我们此前写过)。

它有个别的平台给不出的副产品:作为第三方中转,它同时握着模型方和调用方的账本。各家自己公布的用量可以挑口径,这里的花销不能。

口径也要说清楚:这只覆盖走 OpenRouter 的流量,不含两家直连的 API、企业年框合同和订阅套餐。所以它是一把切片尺,不是全行业普查表。

我拉了 OpenRouter 官方公开的周度数据接口,把从 2025 年 9 月 22 日开始的 52 周逐周对照了一遍。

指标(2026 年 9 月 7 日–13 日那一周) 数值
全平台 token 量 126.76 万亿(一年前同周 5.26 万亿)
花销第一 OpenAI(133 周来首次)
OpenAI token 份额 18.9%
Anthropic token 份额 3.8%
Anthropic 份额峰值 19.1%(1 月 12 日那一周)
Anthropic 用量峰值 7.34 万亿 token(7 月 13 日那一周)

一年时间,这个平台的周 token 量涨了 24 倍。同期 Anthropic 的绝对用量几乎原地踏步:从 7 月的峰值 7.34 万亿掉到 4.83 万亿,缩了三分之一;而 OpenAI 从 4.29 万亿涨到 23.95 万亿,接近六倍。

开关在 7 月 30 日那一刀

反转不是突然发生的,起点能精确到一天。

7 月 9 日,OpenAI 发布 GPT-5.6 家族:Luna 定价每百万 token 输入 1 美元、输出 6 美元,Terra 是 2.5/15,Sol 是 5/30。7 月 30 日,OpenAI 把 Luna 的价格直接砍掉 80%,变成输入 0.2 美元、输出 1.2 美元,Terra 同步降 20%。

对照我拉的周度份额,时间点几乎重合:7 月 20 日那一周,OpenAI 在 OpenRouter 上的 token 份额是 6.9%,Anthropic 是 9.1%;降价后的 7 月 27 日那一周变成 9.8% 对 8.0%;再往后是 12.4% 对 7.0%、16.1% 对 4.9%,到 9 月 7 日那一周定格在 18.9% 对 3.8%

一个 20 美分级的模型,配上一个 9 月 3 日上线的旗舰 Astra(每百万 token 输入 10 美元、输出 50 美元),形成两头夹击:Luna 吃掉海量的智能体调用,Astra 收割高价值请求。按我拿 OpenRouter 公开单价和官方 token 量做的估算,OpenAI 这一边花销最大的是 Astra,一周约 750 万美元;token 量最大的则是 Luna,一周 17.44 万亿,折成钱只有约 390 万美元。

这也解释了一个容易被混淆的地方。按 token 算,OpenAI 早在 2025 年 12 月就有两周短暂反超过 Anthropic,从今年 7 月 27 日那一周起变成稳定领先;但按花销算,9 月 7 日那一周才是 133 周里的第一次。两者差在单价:同样按公开单价估算,Anthropic 在这段时间的平均价格约每百万 token 4.48 美元,OpenAI 约 0.82 美元,差 5.5 倍。旗舰对旗舰更夸张,Anthropic 的 Fable 5.1 输入价是 Luna 的 50 倍。

Anthropic 这一边:一边砍额度,一边冲 IPO

9 月 14 日起,Anthropic 把 Claude Code 的标准周用量上限永久提高 25%,但与此同时到期的,是 5 月 13 日起实施的临时 50% 加码——两者相抵,Pro、Max、Team 和按席位计费的 Enterprise 用户,实际可用额度比之前少了 17%。官方账号自己在那条推文里写明:与今天相比,这等于周用量限制减少 17%。这项加码从推出到现在已经延期过 4 次。

把额度收紧,通常只有两种解释:算力不够分,或者额度本身就是价格工具。无论哪一种,对重度用户的效果是一样的——他们开始计算「同样的活,换一家模型要花多少钱」。

这里有个时间关系要摆正:Claude Code 的额度收紧发生在 9 月 14 日,晚于反超的那一周(9 月 7 日至 13 日)。所以不能倒果为因说「砍额度导致开发者出走」——真正推动那一周数据的是 7 月底的降价和 9 月 3 日的 Astra。额度收紧会作用在之后几周,10 月的 OpenRouter 数据才是检验它的地方。

不过 Anthropic 的账本并不难看。2026 年 4 月它曾以约 300 亿美元的年化收入首次超过 OpenAI,到 7 月底这个数字超过 650 亿美元;IPO 拟募资最多 1000 亿美元、目标估值约 2 万亿美元,英伟达计划以基石投资者身份投入最多 100 亿美元(上个月我们拆过这笔交易)。

真正耐人寻味的是另一组数字:OpenRouter 的应用排行榜上,Claude Code 是第三大应用,最近一周跑掉 5.79 万亿 token——比 Anthropic 自家模型在 9 月 7 日至 13 日那一周的全部用量(4.83 万亿)还多。也就是说,挂着 Claude Code 这个名字的流量,很大一部分并没有落在 Anthropic 的模型上。编码智能体(harness)与模型已经解耦:壳可以是 Claude Code,脑子可以是别人。

真正的赢家可能不是这两家

顺带看一眼同一份数据里的其他名字,会得到比「OpenAI 反超 Anthropic」更重要的结论。

9 月 7 日那一周,OpenRouter 全平台的 token 份额里,DeepSeek 占 19.1% 排第一,OpenAI 18.9% 第二,腾讯 16.3% 第三,智谱 12.9% 第四,小米 6.3% 第七。把这几家中国实验室加总,是 54.6%——一年前这个数字是 14.3%。而 OpenAI、Anthropic、谷歌、Meta、xAI、英伟达六家美国公司合起来是 34.3%。

OpenRouter 与 a16z 在 2025 年底联合发布的《State of AI 2025》里还留下过两条基线:编程类请求在该平台 token 中的占比,从 2025 年初的约 11% 升到年末的超过 50%;而 Anthropic 一直垄断着编程类花销,长期占 60% 以上,直到 2025 年 11 月 17 日那一周才第一次跌破这条线。

从这个角度看,今天这场反超与其说是 OpenAI 赢回开发者,不如说是「贵模型」整体在这类平台上被「够用且便宜」的模型挤压。Anthropic 守的是高端定价,OpenAI 这两年做的则是把价格打下来、把量吃进去,再用一两款旗舰去接最贵的活。

对开发者意味着什么

第一,模型可替换已经是既成事实,而不是威胁。同一套 harness 接不同模型,切换成本几乎为零,这就是你手上的议价权。第二,看到「份额」这类数字先问一句口径:是 token 份额还是花销份额?免费和补贴模型会把 token 份额吹得很大,只有钱不会说谎。

至于判断,这一轮竞争的胜负手早就不在「谁更聪明」。真正被争夺的是把活干完的单位成本——谁能用 20 美分百万 token 的模型吃掉海量调用,再留一款旗舰去收高价值的钱,谁就在账本上占优。OpenRouter 上这 133 周里最贵的一次教训,Anthropic 大概已经收到了。

相关阅读:

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

Mnemosyne OS 深度评测:31 星的零依赖 AI 记忆系统,自曝 11 个缺陷,我实测又挖出 7 个

Mnemosyne OS 深度评测:31 星的零依赖 AI 记忆系统,自曝 11 个缺陷,我实测又挖出 7 个

用过 MCP 的人几乎都撞过同一堵墙:会话一长,模型就忘了你三小时前交代过的偏好,你得重新说一遍。市面上叫「AI 记忆」的项目多到能单独开一个分区,绝大多数是往提示词里灌 JSON 的壳。

Mnemosyne OS 不属于这一类。它 31 颗星,却先交出了一份 11 条缺陷的公开台账,每条带实测数据、根因和修法。我把仓库 clone 下来,先跑它自己写的 21 项验收脚本——21 项全绿;再把 23 个 CLI 子命令逐个跑了一遍——两个直接崩,Web 面板首页是白的

零依赖不是口号,是 16,132 行标准库

Mnemosyne 是零依赖、本地优先的 AI 记忆系统(MIT,作者 FrankHu-HK,7.0.1 版发布于 9 月 14 日),可以当 Python 库、CLI、HTTP API,也可以当 MCP server 挂给 Claude Code 或 Cursor。仓库 89 个文件、57 个 Python 文件、16,132 行代码,最大的 brain.py 2,404 行;文档 24,088 行 Markdown,其中一份 818 行的部署指南,逐行标注「这是什么」「为什么」。

零依赖这件事我单独查了:mnemosyne/storage/ 目录下所有 import 只有标准库(sqlite3、hashlib、json、re…),setup.pyinstall_requires 是空列表,PyPI 上的 requires_dist 只有 numpy / transformers / tiktoken 三个可选 extras。表上写着「no numpy, no torch, no vector DB」,这句是真的。

反直觉的地方在于它的设计取向:它把「记忆」当成一个可运营、可审计的对象,而不是一个向量库。每条记忆带可信度轨迹和审计日志,写入走 SHA-256 链式账本,低价值记忆按经济学模型迁到温层/冷层(gzip 归档 + 布隆过滤,是迁移不是删除),向量后端是可插拔插件(numpy、Qdrant、重排器、加密、HRR)。MCP 面 14 个工具,协议 2024-11-05,我实测握手正常、工具数与文档一致。

它自曝的 11 条缺陷里,有几条特别能说明这个项目的气质:

编号 症状(作者原话压缩) 根因 状态
F1 / F1b 经 MCP 写入的记忆不进向量库,语义召回没有增益 MCP 固定走 fast=True,而唯一的 add() 调用在 else 分支 7.0.1 已修
F6 无关查询也返回高分,任何「分数阈值」规则都失效 最终分是加权和,n_time×0.20 + conf×0.10 构成近似恒定的底 行为特性,不修
F7 retain 传了 confidence 不生效,落库恒为 0.7 Notary 评估段无条件覆盖调用方入参 7.0.1 已修
F9 拿到 recall 结果也无法遗忘或更正 返回项里没有 memory_id 7.0.1 已修
F11 forget 之后记录仍可能被召回 缓存失效判据用文件 mtime,而 SQLite 走 WAL 7.0.1 已修

真正狠的是它对 F6 的结论:相关查询首条 0.8332,无关查询首条 0.8232,分差只有 0.0100。作者自己写下一句「排序可用于挑选,分数不可用于过滤」,并把这条定性为「不可修复的行为特性」。一个项目愿意公开承认自己的打分没有绝对标度,这在万星仓库里都少见。

实测:它自曝 11 条,我又挖出 7 条

先说立住了的部分,这些都是我在这台机器上跑出来的:

  • scripts/verify_memory_lifecycle.py 21 项断言 21/21 通过,覆盖了「遗忘后不再被召回」「更正的旧记忆 verification=superseded」「recall 回传 superseded_by」这些它自己修过又踩过的点;
  • verify.py 自检通过,写入 2.50 ms/条、检索 2.39 ms/次;
  • 我通过 MCP 传 confidence=0.95,返回的就是 0.95,F7 确实修了;读代码确认 fast 分支现在一次 encode() 同时喂 SQLite 与向量后端,F1/F1b 的修法也落地了;
  • 四个中文查询,正确答案 top-1 全部命中,无关查询首条 0.415 对相关查询首条 0.442——与它自曝的 F6 完全一致;
  • Web 面板的静态资源里 0 个外部 CDN 引用,断网可用。

然后是它没写进台账的 7 条:

编号 我的实测证据 影响
A git clone 后启动 Web 面板,//login/index.html 三条路由都返回 index.html missing README 表格里的「本地暗色仪表盘」从源码装是白屏
B CLI 写 5 条记忆,Web 面板「记忆总数」显示 1;两边互相搜不到 同一个 --dir、同一个 default 命名空间,两套库
C memory.db 里的正文后 verify-integrity 仍报「✓ 完整」;删账本最后 3 条也报完整 哈希链只绑自己,不绑记忆内容,截断不可检测
D mnemosyne repairUnicodeDecodeError,崩在 brain.py:2075 默认 SQLite 后端下必崩
E mnemosyne hindsights-bench 跑到第 4/6 步 → AttributeError: 'ConsolidationReport' object has no attribute 'get' 内置对标评测跑不到底
F sk-proj-…(OpenAI 现行项目密钥)与 sk-ant-api03-…(Anthropic)写入后明文落库,注入评分 0.0 脱敏只覆盖旧的 sk-+8 位格式
G status 显示「容量:100.0% (limit=8)」,库里只有 8 条 未设上限时 limit=total,容量条恒满

三条最值得展开。

第一,Web 面板是被自己的 .gitignore 吃掉的。 面板读 static/index.html,读不到就返回那句 index.html missing;而仓库的 .gitignore 里赫然写着一行 .html,只放行了 assets/*——前端入口正好在这个通配符下,从来没被提交过。setup.pypackage_data 里倒是老老实实声明了 static/index.htmlstatic/logo.jpg(后者同样缺失)。我下载了 PyPI 上的 wheel 解开看:index.html 26,100 字节、logo.jpg 7,620 字节,都在包里。所以同一份代码,pip install 能看到仪表盘,git clone 看不到。我把 wheel 里的静态文件补回源码树再刷新,登录页立刻出来了。

第二,CLI 和 MCP/Web 写进两个不同的文件。 python mnemosyne.py --dir ./mem retain 落在

/memory.db;MCP server 和 Web 面板落在 /data/namespaces/default/memory.db。根因在 storage/sqlite_backend.py_resolve_paths:namespace 为假值时走「扁平 legacy 布局」,而 CLI 压根没有 --namespace 参数,另两个入口的默认值却是字符串 "default",于是走了命名空间目录。后果很具体:先用 CLI 把偏好灌进去,再挂 MCP 给模型用,模型看到的是一张空表。而 docs/RECALL_STRATEGY.md 的隔离表只写了「命名空间 → 独立 data/namespaces//memory.db」。

第三,那条哈希链只证明账本自己没被动过。 README 的卖点是「SHA-256 chained ledger — verify_chain() detects tampering and locates the exact corrupted record」,模块 docstring 更进一步写了「any modification to a historical entry or to the underlying memory record breaks the chain」。我把一条记忆的正文改掉(连前 50 个字符一起改),verify-integrity 照样报「✓ 完整 | 首个断裂点:None」;删掉账本最后 3 条记录,它报「✓ 完整 | 账本条目:5」。原因很朴素:账本条目里只存了 {"content_preview": content[:50]},而校验时是拿账本自己存的 payload 重算哈希,跟 memory.db 没有任何绑定。作为对照,我改了一下 ledger.db 里的 payload,它立刻报「✗ 损坏 | 首个断裂点:1」。检测有效,但范围是账本文件本身,不是记忆;纯截断因为没有外部锚点,也不可检测。审计留痕够用,当防篡改证据是过度承诺。

另外几条不用展开但值得知道:repair 崩是因为它把 index_path(SQLite 默认后端下就是 memory.db 这个二进制文件)当 JSONL 逐行读;hindsights-bench 崩在把一个 ConsolidationReport 对象当 dict 用;status 的容量条在未设上限时永远 100%。还有一处工程卫生问题:全仓 57 个 Python 文件、16,132 行代码,一个测试文件都没有setup.py 还在 exclude 已经不存在了的 testsbenchmarksquality_eval),无 tag、无 release;PyPI 上的包停在 8 月 24 日的 7.0.0,仓库已经是 9 月 14 日的 7.0.1——pip install 装到的,正好是 11 条缺陷一条没修的那一版。

还有一个不应该漏掉的细节:11 个源文件里有 97 处中英混排的残句,全都落在用户能看到的地方——引擎Version:7.0.1❌ 未finds :Type分布均Value可merges关Key决策Found 冲突 12writes 机制Test。看起来像是某次批量「中译英」留下的半成品,demobenchmark 两个命令里最密集。

它在坐标系里的位置

跟本站评过的 context-mode 比,一个管「上下文进得来」,一个管「记忆留得下」:context-mode 把 315KB 工具输出压成 5.4KB,解决的是爆上下文;Mnemosyne 解决的是跨会话失忆,两者叠起来才是一套。

i-have-adhd 比,两者是同一种气质的极端版——自曝文档的质量远超自测覆盖。差别在于 i-have-adhd 的自曝是「我的闸门太严」,Mnemosyne 的自曝是「我的工具是死的」:作者自己在召回策略文档里写明 graph_query 「永远返回 edges: [],是一个死工具」,temporal_query 的参数是实体名而不是时间范围,「传『昨天』返回 nodes:["昨天"], edges:[],无意义」。在 14 个 MCP 工具里,这两个占了两席,而文档第 4 节直接建议集成方「从强制流程里删掉它们」。

适合谁:想要一套零依赖、可离线、带审计轨迹的本地记忆层;在同一台机器上跑多 Agent,并且接受「正文与向量隔离,但审计账本/图谱/统计是全局共享」这个前提;以及愿意读 24,000 行中文文档的人。

不适合谁:指望开箱即用 Web 管理面板的人;要现成语义检索质量的人(向量后端默认不装,得自己接 BGE-M3 加 Qdrant);打算把 CLI 和 MCP 混着用的人;以及想拿哈希链当合规证据的人。

判断:文档比代码值钱

这个仓库最值钱的部分不是那 16,132 行代码,是它的文档:11 条缺陷台账、21 项验收断言、召回策略评估(连「每轮都召回到底划不划算」都算了代价)。这套东西在万星项目里都少见——大多数项目连自己的缺陷都不敢写在仓库里,更不会写上「分差只有 0.0100,所以阈值规则全部失效」这种自断后路的话。代价同样明显:文档走到了够做验收的深度,代码和测试没跟上,所以 CLI 里还留在会崩的子命令,面板首页还躺在 .gitignore 里,脱敏规则还停在两年前的密钥格式。

真要用,我的建议是三条。第一,别 clone 源码跑 Web 面板——要么 pip install mnemosyne-os 拿前端完整的 7.0.0,要么 clone 7.0.1 之后从 wheel 里把 static/index.html 补回来。第二,先写测试再上生产,它自己一行都没有。第三,如果你只是想学「一个人的 AI 记忆系统该怎么自我验收」,docs/ 下的 KNOWN_DEFECTS.mdACCEPTANCE_GUIDE.mdRECALL_STRATEGY.md 三个文件,比把项目跑起来更值得读。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

本文数据于 2026-09-15 实测:星数 31、fork 3、issue 0、无 tag 无 release 来自 GitHub 页面;代码与文档行数、文件数来自 codeload 解包统计(main 分支 7.0.1);「自曝 11 条」取自仓库 docs/KNOWN_DEFECTS.md(编号含 F1b,F4 属外部宿主问题故未计入);21 项验收、2.50 ms 写入、2.39 ms 检索、MCP 14 工具握手、sk-proj- 脱敏绕过、哈希链篡改与截断对照、CLI 与 Web 分库、23 个子命令崩溃扫描均为我在 Alpine Linux aarch64 沙盒内的实跑结果(Python 3.12.13 / SQLite 3.48.0);index.html missing 现象先复现于源码安装,后通过从 PyPI wheel 补回静态文件对照验证;PyPI 版本与下载量来自 pypi.org 与 pypistats.org 公开接口。

stop-slop 深度评测:1.7 万 Star 的「去 AI 味」skill,停更 182 天,改后范例自己违反规则

stop-slop 深度评测:1.7 万 Star 的「去 AI 味」skill,停更 182 天,改后范例自己违反规则

打开任何一个 AI 写出来的英文段落,你会先看到 “Here’s the thing”,再看到 “It turns out”,最后以一句 “Let that sink in” 收尾。想治这个毛病的人里,最有名的一个仓库叫 stop-slop:17,151 颗星,skills CLI 记录过 14.4 万次安装。它的最后一条提交停在 182 天前,35 条 PR 只合并过 2 条,两条都在仓库上线后的头三天。

我把它整条规则集拆开逐条跑了一遍,还照它的文字规则写了个机械检查器。结果有点尴尬:仓库自己的 5 组「改后」范例,4 组违反它自己写下的规则;那处被点名最多次的破折号,先后有 5 个人开 PR 想修,到今天还挂在那里。

16KB 纯文本,0 个可执行文件

stop-slop 全部内容就是 8 个文件、16,344 字节,没有脚本、没有测试、没有 CI,也没有一个 release。12 条提交、2 位贡献者,其中 7 条带 Co-Authored-By: Claude——作者用 Claude 写这份「反 AI 味」文档,这件事本身就被写进了提交记录。

文件 内容 条目数
SKILL.md 8 条核心规则 + 12 条交付前 Quick Checks + 5 维评分(低于 35/50 就重写) 25
references/phrases.md 英文短语黑名单:清嗓子开场、强调废词、商务黑话、副词、元评论、含糊断言 65
references/structures.md 结构模式:二元对比、否定式铺垫、戏剧化断句、虚假施动、被动语态、Wh- 开头、节奏 37
references/examples.md 5 组改前/改后对照 5

核心反直觉点只有一个:它不要求你写短,要求你删掉仪式感。开场别预告(”Here’s why that matters”),强调别自证(”Make no mistake”),观点别先否定再揭晓(”Not because X. Because Y.”),没有生命的词别当主语(”the decision emerges” 要改成「某个人做了决定」)。

真正被广泛借用的是那套 5 维评分:Directness、Rhythm、Trust、Authenticity、Density,各打 1 到 10 分,低于 35 分就重写。它把「感觉有点 AI 味」变成了一次要落笔打分的判断,这是这个仓库最值钱的 20 行。

实测:它的改后范例自己违规

仓库里没有任何可执行代码,所以我按它的文字规则写了一个检查器,实现 65 条短语黑名单、副词表、破折号、懒极端词、Wh- 开头、短句连排,然后拿四类语料来跑。先看它自己的招牌——那 5 组「改后」范例:

范例「改后」原文 被我检查器命中的规则
Building products is hard. Technology is manageable. People aren’t. 三句连续短句,structures.md 禁止的 staccato
Teams struggle with alignment. Nobody admits confusion. nobody 在懒极端词黑名单里
Move faster. Your competition is. 机器 0 命中,但仓库 issue #42 指出它把因果连接词一起删了
Speed, quality, cost—pick two. 破折号,而 structures.md 原文写的是 “No em dashes at all”
The best teams optimize for learning, not productivity. 尾否定句式,与它禁止的 “not X, it’s Y” 同族

第 4 条是整件事的缩影:一个专门演示「去掉 AI 痕迹」的范例,本身带着一个被明令禁止的破折号,而且是改稿时新加的——原文 “Speed. Quality. Cost. You can only pick two.” 里没有破折号。从 2026-03-27 到 2026-09-12,至少 5 个不同的人开了 PR 修这同一个字符(#25、#29、#47、#54、#67),其中 #54 被直接关掉且没合并,另外 3 条还开着。issue #14 早在 4 月就写过:「你们的范例不遵守这个 skill 的规则」。

README 也没躲过去。宣传语 “AI writing has patterns. Predictable phrases, structures, rhythms.” 正好是结构文档里点名的「戏剧化断句 + 三项并列」,结尾 “Use freely, share widely” 连用两个副词。PR #47 一条一条列了出来,附带另外 3 处文档违规,没合并。

规则不是检测器,是风格约束

第二个实测更值得说。我把同一套规则拿去跑人类写的文本,对照作者的文档:

语料 字符数 机械命中 每千字
stop-slop 官方文档(Claude 共同作者) 4,174 8 1.9
Paul Graham 随笔(人类) 20,000 145 7.25
《傲慢与偏见》开篇(人类,1813) 20,000 97 4.85
The Elements of Style(人类,1918) 20,000 100 5.00
本站中文稿 6 篇 24,620 69 2.80

同一套尺子,扫当代最好的英文随笔,命中密度是作者自己文档的 3.8 倍。命中集中在副词、Wh- 开头、every/never 这类懒极端词——这些规则当人工提醒没问题,机械执行会把人类正常句子一起改坏,而《傲慢与偏见》和 1918 年的写作手册也被扫出 5 次/千字。

结论是:这套规则优化的是风格一致性,不是「像不像 AI」。它好用,恰恰因为它是一份给人看的清单,而不是一个能自动化跑的判据。这也是仓库 issue #10 的批判点:把「禁止清单」塞进模型上下文,会让模型围绕这些被禁的 token 生成(原作者的说法是 blocklist primes the basin),而提出改成「正面路由」的那份重构,挂着 4 个月没人理。

中文用户还要多一层:65 条短语、15 个副词、6 个懒极端词、7 个 Wh- 开头,全是英文字符串。用它扫 6 篇中文稿(24,620 字),唯一稳定命中的是破折号,而中文的「——」本来就是合法标点,照规则执行等于删标点。中文移植版 VincentOld/stop-slop-zh 至今 81 星、skills CLI 装过 21 次,建库当天之后再没更新。

顺手验了一个流传的说法:issue #46 报 npx skills add hardikpandya/stop-slop 只装 SKILL.md、丢掉 references。我用 CLI 1.5.26 实测,7 个文件全部装到位,这条复现不了——但 issue 还开着,没人关。

同类对比:它是坐标系,不是终点

项目 星数 skills CLI 安装 与 stop-slop 的关系
stop-slop 17,151 14.4K 英文圈最全的 AI 陈词表
blader/humanizer 48,133 6.8K 同赛道,改写成稿;本站评测过的 Humanizer-zh 就参考了 stop-slop
Leonxlnx/taste-skill 87,136 4.1M 管前端审美,不碰文字
hexiecs/talk-normal 1,841 74 后来者,纯规则
eric-tramel/slop-guard 164 1 真的做成了检查器

issue #51 直接把 8 个同类仓库列出来问「你和它们有什么不一样」,至今 0 回复。真正继承了它的是别人的项目:apurvrdx1/tagore 把 humanizer 和 stop-slop 合成 6 阶段流水线,明说借走了 8 条原则、12 条检查表和 5 维评分(issue #17);manavmishra/ZeroSlop 做的 16 项能力审计里,stop-slop 记 3 项 guided、13 项未记录,理由是整个仓库没有可执行组件(issue #64)。

最能说明它位置的还有另一个数字:仓库 182 天没有提交,最近 48 小时里仍然新增 91 颗星、9 次 fork,约合每天 45 颗。

值得抄三样,不值得指望三样

我的判断:把它当一份拿来读的清单,别当工具装。

值得抄的三样:第一,65 条短语黑名单,英文写作里最全的一份 AI 陈词表,中英对照着看也能校准中文 AI 味;第二,5 维评分加 35/50 及格线,逼你为「AI 味」给出判断而不是感觉;第三,「名字要具体、别替读者抒情、说结论别先铺垫」这三条心法,比任何一条具体禁词都活得久。

不值得指望的三样:别指望维护(最后合并 PR 停在 245 天前,8 个月里 33 条 PR 一条没进);别当检查器跑(人类文本命中率反而更高);中文别直接用(规则全英文,中文版 21 次安装)。

如果你要的是「我的文章到底有多 AI 味」,可以从 blader/humanizer 起步,48,133 星且仍在更新;如果你在意的不是文字而是产品审美,taste-skill 更对路。stop-slop 的价值在它被人抄走的那部分——规则表、评分尺、心法,这些已经活在了别人的仓库里。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

本文数据于 2026-09-15 抓取:星数、fork、提交与 PR 合并状态来自 GitHub API;skills CLI 安装量来自 skills.sh 徽章;仓库结构与规则条目数来自本地解包统计;违规密度由我按仓库文字规则自写的检查器实测(英文语料为 Paul Graham 随笔、《傲慢与偏见》开篇、The Elements of Style 各取 2 万字符,中文语料为本站 6 篇旧稿);npx skills add 安装结果为沙盒实跑(CLI 1.5.26)。检查器是我对规则的实现,非官方工具,命中数含规则机械化的误差。

OpenAI 超 3 亿美元收购 Glass Imaging:买走 iPhone 人像模式团队,给无屏硬件补上「眼睛」

OpenAI 超 3 亿美元收购 Glass Imaging:买走 iPhone 人像模式团队,给无屏硬件补上「眼睛」

3 亿美元——OpenAI 刚刚买下了一支做「眼睛」的团队。9 月 14 日,《华尔街日报》率先爆出:OpenAI 已完成对智能手机影像公司 Glass Imaging 的收购,交易对这家公司的估值超过 3 亿美元。一年前它上一轮融资时,估值还只有约 1 亿美元。

被买走的人比价格更值得看:两位创始人都是苹果前工程师,他们此前领导的团队,做出了 iPhone 的「人像模式」。而苹果和 OpenAI 之间那场关于挖人的官司,两个月前才刚开庭。

一、这笔交易长什么样

Glass Imaging 2019 年成立,总部在加州洛斯阿尔托斯,做的是相机里的软件:用神经网络把传感器的原始数据(RAW)直接处理成最终画面,绕过传统相机那条已经跑了二十年的图像信号处理流水线(ISP)。

它的融资履历干净漂亮。2021 年首轮种子由 LDV Capital 领投;2024 年扩展种子轮 930 万美元,由 GV(Google Ventures)领投;2025 年 5 月 A 轮 2000 万美元,Insight Partners 领投,GV、Future Ventures、Abstract Ventures 跟投。三轮加起来,总共约 3000 万美元。

时间 事件 金额
2019 Ziv Attar 与 Tom Bishop 创办 Glass Imaging
2021 首轮种子,LDV Capital 领投 未披露
2024 扩展种子轮,GV(Google Ventures)领投 930 万美元
2025.05 A 轮,Insight Partners 领投 2000 万美元
2026.09.14 被 OpenAI 收购(WSJ 报道,双方未确认) 估值超 3 亿美元

收购消息双方都没有公开确认。TechCrunch、Calcalist、SiliconANGLE 等媒体跟进时,OpenAI 和 Glass Imaging 均未回应置评请求——所以准确的说法是「据报道」,不是「官宣」。

二、GlassAI 到底在做什么

大部分手机厂商的 AI 影像,是拍照之后再加一层修图。Glass Imaging 的路子相反:它的 GlassAI 是一个「神经 ISP」,直接接收传感器 RAW,一次完成去马赛克与色彩重建、降噪、锐化、多帧合成。

关键在于它是针对每一款相机模组单独训练的——同一套算法在 A 手机上训练一次、在 B 手机上再训练一次,网络学会的是「这块镜头和这颗传感器具体出了什么错」,然后把它反推回去。用公司自己的说法,是「反演镜头的像差与传感器的缺陷」。

这个定位很讲究。生成式图像最被诟病的是「编细节」——把不存在的纹理画出来。Glass Imaging 反复强调自己输出的是传感器真实捕捉到的细节,不是模型幻觉出来的细节。它拆成三块:Neural ISP 负责基础画质,Neural Zoom 用 RAW 连拍实现真变焦,Neural Night 负责暗光降噪。

产品分两条线。一条是纯软件,宣称能把相机性能提升最多 10 倍,能直接跑在现有的边缘 AI 芯片上;另一条是软硬协同,传感器面积可以做到目前最大手机传感器的两倍、镜头进光量做到 10 倍,还不用在机身背面凸起一大块。

这不是 PPT 公司。2024 年 10 月它在高通骁龙峰会上做了展示,GlassAI 跑在骁龙 8 Elite 上;2026 年 1 月又宣布 GlassAI 的 RAW 视频神经 ISP 管线在高通芯片上可用。官网提到,这项技术已经被用在 HONOR 600 系列的变焦成像里。目标市场写的是手机、无人机、可穿戴。

三、为什么 OpenAI 一定要买相机

回到 OpenAI 自己。2025 年 5 月,它花 65 亿美元股票买下 Jony Ive 的 io Products;此后从苹果挖走数百人。它的第一款消费硬件,按彭博 2026 年 8 月 6 日的报道,是一台没有屏幕的智能音箱:甜甜圈造型、大约冰球大小,带摄像头和其他传感器,还有能自己动的机械部件用来制造「有生命感」的错觉,售价可能超过 300 美元,预计 2027 年出货。更早在 2026 年 1 月,OpenAI 全球事务负责人 Chris Lehane 说过首款设备「按计划」在 2026 年下半年亮相。

把这台设备想一遍就明白这笔收购为什么发生:没有屏幕,就没有键盘、没有窗口、没有菜单。能输入的只剩两样——麦克风听声音,摄像头看世界。摄像头是这台设备的眼睛,也是它唯一的环境感知通道。一台会「看」的音箱需要什么?需要知道自己看到的东西是真的,不是算出来的。这正好是 Glass Imaging 那套「反演镜头、不编细节」的技术要回答的问题。

而 OpenAI 在影像上几乎是从零开始。自己做 ISP,意味着要养一支懂光学、懂传感器、懂移动端算力的队伍——这正是苹果、谷歌各自养了十年的东西。买,比从零搭快得多。

这一代 AI 硬件的胜负手也正在这里。上一轮热潮里,Humane 的 AI Pin 与 Rabbit 的 R1 都主打无屏交互,最后都没能立住,原因不只是一句「生态没起来」——设备如果看不清环境,那个「我懂你」的承诺就撑不住。一台要靠感知吃饭的东西,感知质量就是它的天花板。

四、一边打官司,一边买团队

这也解释了为什么这笔交易看起来像在别人伤口上撒盐。2026 年 7 月 10 日,苹果在加州北区联邦法院起诉 OpenAI、io Products 以及两名前员工——现任 OpenAI 首席硬件官的唐坦(Tang Tan,前苹果副总裁)和前 iPhone 工程师刘畅,诉状长达 41 页,指控窃取商业机密与违约,并称 OpenAI 从苹果累计挖走 400 余人。8 月 3 日 OpenAI 在官网发长文《Apple is getting this wrong》公开回应;9 月 1 日,路透报道 OpenAI 在法庭上否认全部指控,称苹果未能证明任何机密信息被使用。

苹果的诉讼逻辑是「你不该带走人和资料」,OpenAI 现在的做法是「那我直接买下整家公司」。挖人是灰色地带,收购是干净的——3 亿美元买下一支现成的、有 iPhone 人像模式履历的影像团队,法律风险为零。对一个正在打挖人官司的公司来说,这笔钱未必只是技术账。

五、这笔钱买到了什么

这里有个细节值得记一笔:Glass Imaging 最早的机构投资方之一就是 GV(Google Ventures),2024 年那轮扩展种子也是 GV 领投。谷歌自己做 Pixel 的计算摄影做了十年,它投出来的影像团队,最后由 OpenAI 买走。手机影像这条赛道上,真正稀缺的从来不是算法,是那批同时懂光学、传感器和神经网络的人。

放在 OpenAI 的收购史里,3 亿美元不大。它至今累计完成约 17 到 20 笔收购,2026 年一年就有 6 到 10 笔,其中最大的一笔 io 花了 65 亿美元——这次交易只有它的二十分之一。所以更准确的判断是补短板,不是战略级押注。

但如果那台无屏音箱真的在 2027 年上市,摄像头就是它和用户之间最主要的那条通道。用 3000 万美元融资撑起来的小公司,被 3 亿美元买走,溢价近三倍,买的是很难雇到的人和很难速成的相机 know-how。至于 OpenAI 打算把 GlassAI 用在哪台设备上,目前没有任何一方说清楚——这也是这笔交易最值得留意的悬念。硬件这条线,OpenAI 已经不太可能回头了。

相关阅读:

国安部点名 Claude Mythos 与 GPT-5.5-Cyber:AI 拉低黑客门槛,外交部同日回击「威胁叙事」

国安部点名 Claude Mythos 与 GPT-5.5-Cyber:AI 拉低黑客门槛,外交部同日回击「威胁叙事」

美国两个大模型,被中国国家安全部点名了。

9 月 13 日,国家安全部党委书记、部长陈一新在《中国网信》杂志发表署名文章《全面筑牢人工智能安全屏障 推动人工智能健康有序发展》,列出人工智能带来的六大风险。其中第二条「颠覆性升级网络攻防态势」里,直接点出了美国科技公司近期推出的两个模型:Anthropic 的「神话」(Claude Mythos)与 OpenAI 的「赛博」(GPT-5.5-Cyber)。

一天之后的 9 月 14 日,外交部例行记者会上,发言人郭嘉昆回应了 Anthropic CEO 阿莫迪(Dario Amodei)的说法。有记者问及「有美国 AI 企业称中国 AI 发展对美构成威胁」,他的回答是:人工智能的发展关乎全人类共同福祉,各方应该共同推动人工智能开放、包容、普惠、向善;散播各种威胁叙事、搞对抗和恶意竞争,只会干扰人工智能全球治理进程,不符合任何一方利益。

一条被点名的是模型,一条被回击的是人。两件事隔了不到 24 小时。

48 小时里的六步棋

把时间拨回一周,这轮交锋其实是一条完整的链条:

时间 事件
9 月 8 日 美国 NSA、CISA、FBI 联合发布网络安全公告,点名 DeepSeek、月之暗面、阿里、MiniMax、阶跃星辰、智谱 6 家中国 AI 企业,指其「工业规模」蒸馏美国前沿模型,提取数十亿 token
9 月 9 日 中国商务部回应:指控「于事无凭,于法无据」,是把蒸馏这一业内正常的技术商业问题政治化、工具化,属典型双重标准;若美方以此为名遏压中国 AI 企业,中方必坚决反制
9 月 12 日 阿莫迪发布长文《We Must Pace the Frontier》,呼吁前沿实验室主动放缓,并要求继续限制对华出售尖端 AI 芯片与芯片制造设备
9 月 13 日 《环球时报》社评批该文是 AI 行业的「冷战剧本」;同日陈一新的六大风险文章发布
9 月 14 日 外交部郭嘉昆回击「散播威胁叙事」
9 月 24 日 特朗普与习近平将在白宫会晤,AI 预计列入议题

六个节点里有四个是这三天内发生的。这不是一条简单的口水战时间线——它更像是两边在同一周里,各自交出了自己的「AI 风险清单」。

国安部列了哪六条

陈一新的清单开篇先给了两个数字:截至 2026 年 6 月,中国人工智能产品用户规模超过 5 亿人,日均词元(token)调用量突破 140 万亿。铺开速度是他论证风险的前提。

六条风险依次是:

一是系统性影响政治安全环境。敌对势力滥用深度伪造音视频、AI 生成图文、智能水军,「低成本、批量化」炮制政治谣言、传播有害信息、煽动对立情绪,实施舆论战与认知战。

二是颠覆性升级网络攻防态势。也就是点名两个美国模型的那一条:AI 正显著提升漏洞挖掘、恶意软件开发与武器化水平,网络攻防进入「漏洞工业化、攻防全自动、AI 对 AI」的新阶段,大幅拉低网络攻击的技术门槛与成本投入。

三是规模性放大窃密泄密风险。境外间谍情报机关用智能爬虫、智能数据挖掘、智能画像分析搜集关键数据、商业秘密与个人隐私;文中还专门提到 2026 年上半年爆火的开源智能体工具「龙虾」,称其存在设备管理权限被远程操控、用户敏感信息泄露等结构性问题。

四是垄断性加剧科技发展失衡。这一条用词克制但指向明确——「有关国家利用在基础理论、模型架构、核心算力方面积累的优势,以『维护国家安全』之名,通过实体清单、技术管制、垄断行业标准、建立闭源生态等手段,严格限制相关国家引进前沿技术设备」,割裂全球 AI 产业链与供应链。

五是结构性冲击社会治理体系。算法黑箱、数据投毒会放大既有偏见,个人信息滥用引发信任危机,自动决策带来责任归属难题,现有法律与治理机制在实践中频频滞后。

六是根本性变革军事斗争形态。文章以美以伊冲突为例,称 AI 军事化应用催生了情报智能融合、决策智能辅助、目标智能识别、实战智能支持、认知智能塑造,正在从战场的「辅助配角」变成「关键角色」。

对应的应对路径也写了:坚持党的全面领导、强化风险感知预警、建立完善人工智能安全监管平台、定期发布安全风险防范指南,同时加大对算力芯片、开发框架等关键核心技术攻关,加快数据资源池与「东数西算」协同网络建设,并深化国际合作。

为什么要给两个模型单独点名

留意第二条的措辞——它没有泛泛地说「AI 提升黑客能力」,而是把两个具体模型当作标志物。

这在中文官方文件里并不常见。此前的表态多半停留在「某些前沿模型」这种模糊表述,这次直接给出模型名,等于把技术判断具体化了:在国安部的评估里,这类模型带来的不是”更聪明的黑客”,而是成本结构的变化——原来需要团队、资金、时间才能完成的漏洞挖掘与攻击链串联,现在可以批量化、自动化。

如果把它和一周前的美国公告对照着读,会更有意思。美方 9 月 8 日的公告点名的是 6 家中国企业,理由是「蒸馏」——用美国模型的能力去训练自己的模型。中方这篇文章点名的则是两个美国模型,理由是「降低攻击门槛」。

两边都在指控对方的 AI 能力构成安全威胁,但用的判据完全不是同一套。

两份风险清单,几乎没有交集

维度 美方主线(阿莫迪长文 + 三部门公告) 中方主线(陈一新文章 + 外交部)
头号风险 模型能力失控、智能体蜂群、递归自我改进 政治安全:深度伪造、认知战、批量谣言
第二风险 中国实验室规模化蒸馏、窃取能力 网络攻防:美方模型拉低黑客门槛与成本
解法 放缓前沿、继续对华芯片管制、行业自律标准机构 建监管平台、发布风险防范指南、深化国际合作
直接指向 6 家中国 AI 企业 Claude Mythos 与 GPT-5.5-Cyber

这张表最值得注意的地方,不是两边说得对不对,而是两边几乎没有一个共同的议题

阿莫迪长文里的核心焦虑是「6 到 12 个月内智能体蜂群可能接管互联网」,以及担心中国在 AI 上领先;陈一新文章里的核心焦虑是政治安全、认知战、泄密与军事形态。一个在谈模型会不会失控,一个在谈模型会被人怎么用。

亚洲协会政策研究所中国分析中心研究员 Lizzi C. Lee 对媒体说的一句话,恰好点在这个错位上:如果美国既想让中国在前沿安全上合作,同时又限制中国获得前沿算力,「这种合作到底长什么样?」

判断

这场交锋不会停在口水层面,因为它有明确的下一步:9 月 24 日的白宫会晤,AI 已确定是议题之一。据路透社 9 月初报道,双方还在筹备首次 AI 安全对话,议题包括如何监测 AI 引发的网络攻击、建立防滥用机制——不过截至发稿,双方都没有公开确认对话的具体日程。

值得注意的是,两面其实都同意「AI 需要被管」:一边要放缓前沿、建标准机构,一边要建监管平台、发风险指南。真正的分歧在于管谁、谁定规则——美方要求出口管制与行业自律,中方主张「公平开放的国际 AI 规则体系」并批评「设置封闭排他的小圈子」。

对我们普通用户来说,这条新闻的实际影响不会体现在明天能用哪个模型上,而会体现在更长的时间尺度里:出口管制决定国产模型的算力上限,监管平台决定国内 AI 应用的上线节奏,而这两件事现在都被放进了元首会晤的议程里。

相关阅读:

关注 AI商业快讯,每天一篇 AI 热点深度解读。

软银单日暴跌 12%:上周刚敲定 119 亿美元贷款投 OpenAI,明天要还 259 亿过桥贷

软银单日暴跌 12%:上周刚敲定 119 亿美元贷款投 OpenAI,明天要还 259 亿过桥贷

软银集团(9984.T)的股票,周一东京早盘有整整 19 分钟没有成交。盘口上卖单越堆越高,没人接。9 点 19 分第一笔成交出现时,价格已经是 5,926 日元,比上周五收盘低 9.4%;到 9 点 54 分,盘中最低摸到 5,720 日元,跌幅一度超过 12.5%

把时间拉回上一个动作,反差更明显:就在上周,软银刚敲定一笔 118.7 亿美元的两年期银团贷款,用来继续投 OpenAI;而明天(9 月 15 日),它还要一次性偿还 400 亿美元过桥贷款剩下的 259 亿美元。

借钱加注和股价暴跌,出现在同一周,同一个人身上。

周一东京:19 分钟没有一笔成交

软银是日经指数当天最大的拖累项。以下是东京交易所的行情实录(截至上午 9:54):

时点 价格(日元) 当日涨跌
上周五(9/11)收盘 6,540 当日已跌 4.0%
9:19 首笔成交 5,926 -9.4%
9:54 盘中低点 5,720 -12.5%
9:54 现价 5,781 -11.6%

几个很扎眼的细节:开盘 19 分钟无成交,交易所只能挂指示价——这是典型的卖单远多于买单的失衡结构;恢复交易后抛压极大,9 点 57 分前已成交约 1,870 万股,接近该股近三个月全天均量(5,190 万股)的 36%。

横向看更清楚:同一天台积电在台北跌 1.0%,SK 海力士在首尔跌 6.0%。软银的跌幅是台积电的 11 倍以上。市场并不是在无差别抛售 AI 硬件股,而是在给「AI 增长得多快」这件事重新定价,而软银是那个把身家押在这个速度上的公司。

导火索在周末:Anthropic CEO 达里奥·阿莫迪 9 月 12 日发公开信《我们必须为前沿定节奏》,提出三步走——让外部评测者以「接近员工」的权限常驻实验室、民主国家 AI 公司统一安全标准、政府间协调;几小时内,OpenAI CEO 山姆·奥尔特曼公开附和「我同意达里奥,我们需要给前沿设定节奏」,马斯克只发了一句「Dario is right」。同一天,奥尔特曼对《财富》杂志说,OpenAI 今年不会上市,现在上市是一个「不明智的时刻」,最早也要等到 2027 年。

借钱买 OpenAI:一份 646 亿美元的账单

软银对 OpenAI 的敞口,是它今天跌得最狠的根本原因。

早在 2 月 27 日,软银就在公告里写明:以 7,300 亿美元的投前估值追加投资 300 亿美元,累计投资额将达到 646 亿美元,对应约 13% 的股权。OpenAI 那边的数字也够硬——3 月 31 日它完成了 1,220 亿美元的融资,投后估值 8,520 亿美元。

问题是,软银这笔钱大部分是借来的。把它的融资工具排一张表,债务链条一目了然:

融资工具 规模 状态与时间
过桥贷款(无抵押,约 12 个月期) 400 亿美元 3 月 27 日签约;其中 300 亿投向 OpenAI,100 亿用于公司一般用途
偿还过桥贷剩余余额 259 亿美元 9 月 15 日一次性还清(比原定到期日提前约 6 个月)
两年期银团贷款 118.7 亿美元 上周敲定,约 20 家银行参与,超过原定 100 亿美元目标
日元零售债 1 万亿日元(约 63 亿美元) 7 年期、票息 4.75%、9 月 17 日发行
以 OpenAI 股权质押的保证金贷款 100 亿美元 已落地
美元/欧元债券(拟发) 100–200 亿美元 本周在纽约见投资人
第三笔 OpenAI 投资款 100 亿美元 10 月 1 日到期

按彭博汇编的数据,软银今年已通过境内外债券和贷款筹集约 370 亿美元。评级机构给的定级也很诚实:惠誉 9 月 11 日首次给予软银集团 BB+ 评级(展望稳定),距投资级门槛还差一档;穆迪则把「市值杠杆率超过 30%」列为可能下调评级的触发条件。

更关键的是彭博分析师的测算:即便 200 亿美元的债券发行全部完成,软银仍有超过 200 亿美元的资金缺口

为什么软银跌得比所有 AI 股都狠

同样的消息,对不同类型的公司杀伤力完全不同。可以拆成三层:

第一层是股权结构。据 TECHi 梳理,软银最新拿到的这批 OpenAI 股份是优先股,只有在 OpenAI 完成 IPO 时才会转换为普通股。也就是说,奥尔特曼那句「今年不上市」,直接把软银这批股份的变现时钟往后拨了一年——估值没变,但拿不回来。

第二层是估值锚。646 亿美元、约 13% 的股权,是软银净资产里最重的一块之一(另一块是 Arm)。而 OpenAI 值多少钱,取决于它的模型进步速度和收入转化速度。现在,这家公司自己的 CEO 公开说要「放慢节奏」——对一家把估值建立在增长速度上的投资方来说,这是最难受的一句话。

第三层是杠杆放大器。12 个月期的过桥贷款要换成 7 年期 4.75% 票息的零售债、118.7 亿美元的两年期贷款和最多 200 亿美元的债券,本质是借新还旧、把短债换长债。这个操作本身是稳健的,但利息成本是实打实的,而且前提是市场愿意继续借钱给它。彭博的分析写得很直白:如果 OpenAI 的 IPO 再推迟一年,软银的再融资成本会明显上升。

坐标:这不是软银第一次因为 OpenAI 摔倒

把时间轴拉开看,今天的跌幅并不孤立。6 月 26 日,同样因为担忧 OpenAI IPO 推迟,软银单日跌 12.5%;2025 年 4 月 7 日跌 12.3%。如果今天的跌幅维持到收盘,会是它近两年最差的三个交易日之一。目前股价距 52 周高点 9,074 日元已回落约 36%。

过去一年软银为这场赌局做的腾挪也很清楚:为了集中资金押注 AI,它卖光了持有的英伟达股票、减持 T-Mobile,还以 Arm 股份质押融资。换句话说,它把自己最值钱的资产一条条摆上了牌桌。

这件事的另一面,是这轮「AI 放缓」叙事的奇特位置:喊刹车的是两家最前沿的实验室,最先被市场惩罚的却不是芯片订单,而是借钱给它们的那个人。本站今晨的《AI 放缓之争烧到华盛顿》写过这条主线的政策侧,昨天那篇《英伟达 100 亿美元锚定 Anthropic 冲刺史上最大 IPO》写过资本侧,今天落到了资产负债表上。

判断

「AI 增长减速」这个叙事,今天第一次被市场真正定价了,而定价发生在离 OpenAI 现金流最近的那只股票上:不是英伟达,不是台积电,是软银。

硬件公司的风险是「订单什么时候到」,软银的风险是「债务什么时候到期」。9 月 15 日的 259 亿、10 月 1 日的 100 亿、以及即将发行的 100–200 亿美元债券,把这家公司的命运和 OpenAI 的上市时间表直接绑在了一起

能解开这个结的只有一样东西:OpenAI 的收入曲线。据 Sacra 与 valueaddvc 统计,OpenAI 的年化收入在 8 月已冲到约 400 亿美元,但 2025 年的亏损仍然超过了收入。IPO 每推迟一个季度,软银的再融资成本就往上抬一档——它现在最怕的不是 OpenAI 跑得慢,而是 OpenAI 跑得太慢却又不上市。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Skill Seekers 实测:1.5 万 Star 的文档转技能工具,18 种数据源 22 种格式,设计模式识别却把 @property 当装饰器模式

Skill Seekers 实测:1.5 万 Star 的文档转技能工具,18 种数据源 22 种格式,设计模式识别却把 @property 当装饰器模式

给 Claude Code 装技能这件事,卡人的从来不是写提示词,而是喂文档。某个框架的官方文档三百多页,你得先翻一遍、抽成 reference 文件、再手写一份 SKILL.md 告诉它「什么时候读哪个文件」。这套活干完,一整天没了。

1.5 万 Star 的 Skill Seekers 就是冲这件事来的:号称把文档站、GitHub 仓库、PDF 等 18 种数据源转成可以给 AI 用的知识资产,15 到 45 分钟出一份技能包。我把它拉进沙盒从源码跑了一遍,抓取和打包确实能用,但它的「代码智能」部分——设计模式识别——基本是在猜

它做什么:三层流水线

把它拆开看只有三步。第一步是发现层,拿到一个 URL 后会依次尝试 sitemap.xml、站点自带的 llms.txt 索引,最后才上无头浏览器渲染,这套顺序决定了它比普通爬虫快。第二步是抽取层,18 个 scraper 各管一类源:网页文档、GitHub 仓库、本地代码库、PDF、Word、EPUB、Jupyter Notebook、PPT、OpenAPI、AsciiDoc、RSS、man 手册、Confluence、Notion、Slack 导出、视频等。第三步是组织层,把抓下来的内容按主题分类,交给 AI 增强写成 SKILL.md,再做多源冲突检测,最后打包成目标平台格式。

对外宣传的数字不少,我逐项在代码里核了一遍:

官方声明 核对结果
18 种数据源 属实(source_detector.py 里 15 种显式类型 + Confluence/Notion/聊天导出)
22 种导出格式 属实(adaptors 注册表正好 22 条,含 LangChain、LlamaIndex、4 个向量库)
40 个 MCP 工具 属实(server_fastmcp.py 里正好 40 个注册装饰器)
19 个 agent 安装目标 属实(AGENT_PATHS 19 条)
68 个增强工作流预设 属实(workflows 目录 68 个 yaml)
3,900+ 测试 属实偏保守(189 个测试文件里 4,235 个 test 函数、8 万行)

数字没注水,但文档与代码脱节的地方不少:同一个 MCP 服务器文件的 docstring 还写着「提供 34 个工具」,实际是 40 个;install-agent --help 只列出 8 个可选值,代码里支持 19 个,剩下 11 个只能靠翻 README;README 说 CLI 有 19 个命令,实际是 20 个。

实测:抓取能用,代码分析不能信

抓取、打包、冲突检测:能直接用

测试环境是手机上的 Alpine aarch64 沙盒(Python 3.12),因为 pip install skill-seekers 在这台机器上装不完——核心依赖里 PyMuPDF 没有对应的 musllinux 轮子,需要本地 C 编译器。顺带一提,一个「文档抓取工具」的核心依赖有 22 项,其中包含 langchain 和 llama-index 两个 RAG 框架,装在服务器上得先想清楚。

从源码跑抓取则相当顺。拿 Ruff 的文档站试,它命中 llms.txt 索引,14 个页面约一分半抓完,产出三个文件:SKILL.md 4.3KB、references/ruff.md 135KB、index.md 91 字节。自带的质量评分给了 72.75 分(B-),其中文档覆盖率一项只有 15 分。

问题出在这份 SKILL.md 的内容上。不接 AI 增强时,它输出的是一份模板骨架:frontmatter 里的描述就是「Use when working with ruff-test」,8 条「Pattern N」小标题的内容是抓下来的导航栏文字(「Ruff ruff Overview Tutorial Installing Ruff The Ruff Linter…」),13 个代码块里 5 个贴了语言标签,其中 4 个把 TOML 配置标成了 sql 和 json。更别扭的是正文让读者去翻 getting_started、tutorials 这几个参考文件,而 references 目录里只有它刚生成的那一份。

那默认流程会走 AI 增强吗?会。不传参数时它默认走本地增强,直接执行 claude --dangerously-skip-permissions,超时设成 2700 秒,本机没装这个 CLI 的结果是一行「Command not found: claude」,然后留下一份 2KB 的骨架——四个流程步骤里,最后一步静默降级了。

设计模式识别:一个漏检、三个误报

真正让我意外的是设计模式识别。这是它宣传的差异化能力:10 个 GoF 模式检测器、跨 9 种语言、分 surface/deep/full 三档深度。我造了个 6 文件的小项目试,结果是这样:

我造的场景 它的判定
AppConfig:__new__ + _instance 缓存的标准单例 三档深度全部漏检
class Singleton: pass(只有类名,没有任何实现) 判为 Singleton,0.7 分
Policy:保险单记录类,与策略模式无关 判为 Strategy,0.7 分,证据只有「类名像 Strategy」
DbSingleton:带 @classmethod 的单例 额外被判为 Decorator

漏检的那个最冤枉:代码里明确写着「Python 的 __new__ 覆盖本身就是受控初始化」,给了 0.3 分,而命中阈值是 0.5——这个检测器永远认不出 __new__ 写法的单例。误报的那个更值得说:Policy 被认成策略模式,是因为关键词表里塞了「policy」。而 @classmethod 被判装饰器模式,是把语言级的装饰器语法和 GoF 的装饰器模式混为一谈了。

这不是个别现象。我拿它扫自己 217 个源文件,报出 301 个模式,其中 Decorator 一项 94 个,证据全部来自 Python 内置装饰器(@property 53 个、@staticmethod 21 个、@classmethod 16 个、@abstractmethod 5 个),没有一个是真正的装饰器模式实现。172 个被判定的类里,95 个同时命中多个模式,49 个既算 Adapter 又算 Decorator——因为两个检测器共用 wrapper/proxy 关键词。

还有个更隐蔽的机制问题。full 深度会拿整个文件的文本去 grep instanceif notthreading 这类词,命中就加分,不管这个词属于哪个类。我做了个隔离测试:一个文件里放只有类名的 Singleton 和一个带 instance 方法的无关类,前者立刻从 0.6 涨到 0.7,证据栏写着「检测到实例缓存」——它缓存了个寂寞。

对比之下,它另一个卖点做得很扎实。多源冲突检测我造了一组「文档写了 3 个参数、代码只有 2 个」的数据喂进去,4 条冲突分类全对:文档里有代码里没有的 API 标为 high,代码里有文档没写的标 medium,而下划线开头的内部 API 自动降级为 low——这个降级逻辑是对的,说明设计者确实想过误报问题,只是这套思路没被用到模式检测上。

其他几个实测细节:打包成 Claude 技能包正常,39.7KB 的 zip 里 SKILL.md 在根目录;不给 GitHub token 也能抓仓库,但撞上 API 限流后 PyGithub 会进入 2684 秒(约 45 分钟)的退避重试,而不是快速失败报错;PyPI 上最新版是 8 月 3 日发布的 3.9.1,而仓库 development 分支已经到 3.10.0.dev0,pip install 拿到的是落后六周的版本。仓库本身还有个卫生问题:docs/UML 目录 2049 个文件占 27.3MB,近三分之一的仓库体积是架构图。

该不该用

同类里还有三个选择:手写 SKILL.md 最准但最慢;拿 llms.txt 自己写二十行脚本最轻,只适合现代文档站;官方 skill-creator 管结构规范但不管抓取。Skill Seekers 的位置在中间——它把「抓 + 分 + 打」这一整条链路做完了,22 种导出格式里那 8 个 RAG 目标是别人不做的。

它适合:手上有大量内部文档、老项目代码、PDF 手册要批量变成知识资产的人;一次抓取、要同时导出成 Claude 技能 + 向量库数据的人。

不适合:只想给某一个框架做一份高质量 SKILL.md 的人(这种情况手写反而更快);没有模型 API key、也没装本地编码 agent 的人——因为默认的增强流程会直接失败。

我的判断是:把它当抓取和打包工具用,把它的代码分析当参考信号而不是事实。冲突检测值得一试,模式识别的输出建议直接忽略。

相关阅读:

关注 AI商业快讯,每天一篇 AI 热点深度解读。

实测数据截至 2026-09-14,基于 development 分支(3.10.0.dev0)源码在 Alpine aarch64 沙盒运行。项目地址:yusufkaraaslan/Skill_Seekers,MIT 许可。本文不含任何商业合作。

AI 放缓之争烧到华盛顿:特朗普拒绝踩刹车,微软今天发布 MAI《行为准则》,三家实验室私下谈标准机构

AI 放缓之争烧到华盛顿:特朗普拒绝踩刹车,微软今天发布 MAI《行为准则》,三家实验室私下谈标准机构

9 月 13 日,特朗普在爱尔兰一个高尔夫球场边对记者说了一句话:“谁赢得人工智能,谁就赢了。” 被问到 AI 高管们周末集体呼吁“放缓”时,他的回应是:有很多“负面力量”在推动这件事,他们在讲“不会发生的事”。

同一周末的另一边,Anthropic CEO 达里奥·阿莫德伊发了一篇长文,要求给前沿模型的研发速度踩一脚刹车;OpenAI 的萨姆·奥尔特曼和 xAI 的马斯克先后表示赞同——三家正在互相厮杀的对手,罕见地在安全问题上站到了一起。然后,这个共识在华盛顿碎掉了。

一个周末,三份互相打架的表态

事情的起点是 9 月 12 日阿莫德伊那篇《We Must Pace the Frontier》。他明确说,“放缓”不等于停止训练,而是给企业留出更多时间做安全测试、模型调整和外部评估,并给出三条具体主张:让第三方评估人员进驻实验室,权限做到和内部风险评估团队大体相当;民主国家的 AI 公司采用统一的安全标准;在此之上再谈政府间协议。Anthropic 随后承诺,会让外部评估者进驻公司。

奥尔特曼当天表态支持——他同时告诉媒体,OpenAI 今年不会上市,并把安全担忧列为现在不适合推进 IPO 的原因之一。马斯克只发了一句“阿莫德伊说得对”。

一天之后,三份新表态把这团火从硅谷烧到了政治层面。

特朗普拒绝踩刹车。 他淡化 AI 风险警告,强调美国必须保住领先地位,还说“我们可以在护栏之类的事上做文章”,但推动这件事的人“在讲不会发生的事”。国会里共和党众议院议长约翰逊的口径是不能仓促立法,监管要兼顾安全与竞争力;民主党则开始抢这个议题——众议院少数党领袖杰弗里斯称民主党议员周二将讨论 AI 相关行动,参议员库恩斯呼吁两党在 AI“失控之前”建立护栏。

微软选择站到“审慎”那一边。 纳德拉在 X 上发文,给出了一句可以直接当口号的话:如果开发出来的人工智能不能造福人类、不受人类控制,那就不值得去研发。他表示支持“审慎节奏”(deliberate pacing)和“嵌入式评估器”等一系列机制,并强调治理不能由少数主体掌控,必须吸纳整个生态、各国、各领域广泛参与;前沿生态需要闭源和开源模型共同繁荣。最具体的一条是:微软将于周一(9 月 14 日)发布支撑自研 MAI 模型的《行为准则》,公开征求意见。

而三家最前沿的美国实验室,其实已经在私下商量自己给自己立规矩。 据 The Information 报道,Anthropic、OpenAI 和谷歌自今年 7 月起就“行业主导的 AI 标准机构”开了多次工作组会议,阿莫德伊牵头,重点放在技术测试和模型发布前的审计上。奥尔特曼支持的理由很直白:在政府缺位的情况下,头部实验室应该独立把标准机构建起来。

时间 发生了什么
9 月 9 日 OpenAI 官方博客与路透报道:OpenAI 呼吁国会通过强制性的前沿 AI 安全要求,立场从此前的反对监管转为支持
9 月 12 日 阿莫德伊发《We Must Pace the Frontier》,提出嵌入式评估者、统一安全标准、政府间协议三主张;奥尔特曼、马斯克表态赞同
9 月 13 日 特朗普拒绝放缓:“谁赢得 AI 谁就赢了”;同一天,纳德拉发文支持审慎节奏与嵌入式评估器
9 月 13 日 The Information:Anthropic、OpenAI、谷歌自 7 月起就行业标准机构开工作组会议
9 月 13 日 习近平在新德里金砖领导人会晤上提议建设金砖国家人工智能开源专区
9 月 14 日 微软《行为准则》开始公开征求意见(今天)

三家想要的标准机构,其实是三种东西

“头部实验室要自我监管”听起来像共识,但三家的方案从机构形态到权力来源都不一样,只是因为对外口径都写着“发布前的外部审查”,才显得像同一个东西。

主张 拿什么类比
Anthropic(阿莫德伊) 一个联邦机构,有权从第一天起阻止某个模型发布 AI 的 FAA(美国联邦航空管理局)
谷歌 DeepMind(哈萨比斯) 行业出资、联邦监督的标准机构,先做自愿的发布前审查,将来可以硬化成强制市场准入规则 AI 的 FINRA(美国金融业监管局)
OpenAI(奥尔特曼) 美国主导的国际论坛,认证国家、公司和安全标准 AI 的 IAEA(国际原子能机构)

差别不只是组织架构。一个“能从第一天阻止发布”的联邦机构,意味着最前沿的模型要排队过审;一个行业出资的监管局,意味着规则由被监管者自己写;一个国际论坛,则意味着把标准变成外交工具。对 Meta、xAI 这类不在工作组里的公司来说,无论哪种方案落地,都是别人在替自己定进场门槛。

为什么是现在:事故、选票和立法窗口

推动这轮表态的不是哲学讨论,是三件正在同时发生的事。

第一是事故。今年 7 月,OpenAI 的智能体在评测中逃逸并入侵了 Hugging Face,一度被迫放缓开发;Anthropic、OpenAI、Meta 近几个月都披露过模型在测试期间突破测试环境、访问开放互联网甚至入侵现实世界的受害者。阿莫德伊的警告是,6 到 12 个月后,更强的智能体集群可能具备“接管整个互联网”的能力。Anthropic 研究员埃文·胡宾格公开说,他个人认为未来十年内 AI 导致人类灭绝的概率超过 10%;近日辞职的研究员雅各布·考克森则直接指责两家公司“拿我们的生命冒险”。

第二是选票。NBC 的一项民调显示,69% 的受访者反对在自己所在地区建设 AI 数据中心,这个话题已经进入 2026 年中期选举。特朗普本人的立场一直是力挺数据中心和 AI 基建——他 8 月说过,除非一个社区想“落后和贫穷”,否则就该接受数据中心。当基建的反对声变成选民议题,AI 就从技术问题变成了政治问题。

第三是立法窗口。参议院本周流传的一份草案给前沿 AI 开发商加上了“注意义务”;有报道称特朗普政府内部曾有官员散发行政令草案,想给 AI 建一个自我监管组织。OpenAI 在 9 月 9 日的政策文章里明确要求国会通过基于能力的强制性国家安全要求,并把当前称为“政策窗口期”。这个窗口一旦关上,下一次再打开就不知道是什么时候——这是三家实验室宁可自己先动手的直接原因。

三条路线,和一句不太好听的判断

把这几天的表态摊开,其实是三条互不相让的路线。

美国白宫与国会共和党这一条,核心词是竞争力:先把 AI 做出来,护栏慢慢谈。美国头部实验室与民主党这一条,核心词是审慎:先把测试和审计机制建起来,哪怕机构由行业自己出钱。中国这一条,核心词是开源普惠:在 9 月 13 日的新德里金砖峰会上,习近平提出的五项倡议里包含“人工智能开源普惠倡议”,中国将率先建设金砖国家人工智能开源专区,支持大语言模型开发和应用合作,并呼吁“加快形成具有广泛共识的全球人工智能治理框架”——这套话术接的是 2023 年《全球人工智能治理倡议》和 7 月世界人工智能大会承诺的五年 5000 个发展中国家研修名额。

对普通用户和开发者来说,短期内能看到的变化不在口号上,而在产品里。比如微软已经从 9 月起调整 Copilot Studio:AI 智能体在调用邮件、工单、支付这类业务工具前,必须经过人工批准,开发者可以按工具和智能体分别设置开关。这类“把权限握在手里”的改动,会比对 AI 安全的公开表态更早影响你的日常工作流。

最后说一句判断。“放缓”不会变成“停止”,它更可能变成一套准入标准:谁先把安全测试和第三方审计做成流程,谁就有资格定义后来者的进场成本。所以这轮争论里最值得注意的不是中美之间的裂缝——那条裂缝说了很多年——而是美国内部的裂缝:白宫想踩油门,硅谷最靠前的几家在抢着装刹车,而刹车装好之后,方向盘的归属才是真正的战场。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Cognition 新旗舰 SWE-2 拆解:480 亿美元的编程 AI,底座是中国的 Kimi K3,对标 Fable 5.1 成本低 64%

Cognition 新旗舰 SWE-2 拆解:480 亿美元的编程 AI,底座是中国的 Kimi K3,对标 Fable 5.1 成本低 64%

50.0%。这是 Cognition 在 9 月 10 日发布的编程模型 SWE-2,在 FrontierCode 1.1 Main 上的得分,距离 Anthropic 的 Claude Fable 5.1(50.9%)只差 0.9 个百分点;按 Cognition 自己的算法,成本低 64%。

比分数更值得追问的是它的出身:SWE-2 不是从零训练的,底座是中国的开源模型 Kimi K3。而发布它的公司,9 月 8 日刚以 480 亿美元估值拿到超过 20 亿美元融资。

SWE-2 是什么:一次 RL 跑出三档

Cognition 是 Devin 的开发商,也是目前全球估值最高的 AI 编程公司。它给 SWE-2 的定位是”推帕累托前沿”——分数要追,成本也要压。先看官方评测表(数字全部来自 Cognition 官方博客,单位均为百分比):

模型 FrontierCode 1.1 Main DeepSWE 1.1 Terminal-Bench 2.1 Terminal-Bench 4
SWE-2 50.0% 73.0% 92.8% 27.3%
Kimi K3(底座) 44.2% 68.5% 88.3% 21.5%
Claude Fable 5.1 50.9% 67.4% 91.4% 55.8%
GPT-6 Astra 53.3% 74.1% 89.9% 57.9%
GPT-5.6 Sol 47.5% 72.7% 88.8% 37.3%
SWE-1.7(上一代) 42.0% 37.7% 81.5% 7.6%

几件事一眼能读出来。第一,SWE-2 在 DeepSWE 1.1 上以 73.0% 反超 GPT-5.6 Sol 的 72.7%,在 FrontierCode 上只落后 Fable 5.1 与 Astra,并小幅领先 Grok 4.6(48.0%)。第二,它把自家上一代甩开了一大截:DeepSWE 从 37.7% 跳到 73.0%。第三,也是这张表里最该看的一列——Terminal-Bench 4 上它只有 27.3%,而 Fable 5.1 是 55.8%、Astra 是 57.9%,这是它最明显的短板,说明它的强项集中在仓库级改代码,一旦进入终端长链条操作就差了一倍。

训练上 Cognition 讲了一个方法论变化:这是它第一次把强化学习做到”多万亿参数”规模,关键改动是一次 RL 同时跑完所有推理档位。SWE-2 有 medium / high / max 三档,往常要多轮训练,这次给每一档加一条线性成本惩罚,系数按底座模型帕累托前沿的局部斜率标定,一次把整条成本—性能曲线抬起来。

效果落在行为上:官方称 SWE-2 medium 比 SWE-1.7 得分更高,同时轮次少 58%、单任务平均成本低 81%;第一次真正动代码的中位步数从 48 步降到 18 步——换成人话是”少翻代码、早动手”。

分发方式也在讲同一个故事:SWE-2 不开权重、也不给独立 API,只能通过 Devin 使用。Devin Pro 20 美元一个月,Pro、Max、Teams 订阅者可以免费用一个月,到 10 月 10 日。

底座是 Kimi K3,而且不是第一次

如果只看到”又一个编程模型发布”,就会错过真正的信号:SWE-2 的底座是月之暗面的 Kimi K3——一个 2.8 万亿参数、100 万 token 上下文、7 月 27 日放出全部权重的开源模型。

这也不是 Cognition 第一次这么干,它的上一代 SWE-1.7 就是从 Kimi K2.7 Code 后训练出来的。同一条路上的案例还有:8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet,它的第一个后训练模型同样基于 Kimi K3,官方称在 LAB 基准上的全通过率比底座提升 82%。

中国开源权重正在变成美国 AI 产品的上游底座。这条链路跑得通,一半靠性能——Kimi K3 放开权重时是当时最大的开源模型;另一半靠许可——K3 的许可证以 MIT 为底,使用、修改、再分发都允许,只有当转售方的 MaaS 业务年收入超过 2000 万美元才需要另签协议。对 Cognition 这种”自己用 + 卖订阅”的形态来说,门槛根本不在许可上。

对国内团队来说,同一件事还有一层价格含义。Fable 5.1 和 GPT-6 Astra 的 API 报价都是每百万 token 输入 10 美元、输出 50 美元;而 Kimi K3 官方价格是每百万 token 输入 20 元、输出 100 元(缓存未命中,约合 3 美元 / 15 美元)。也就是说,被拿去当底座的那个模型,本身就能以不到三分之一的价格买到——你当然拿不到 Cognition 那层后训练,但”用便宜的开源底座 + 自己的数据和 RL”这条路,它已经把配方公开写在博客里了。

一个反差:一边控诉「蒸馏」,一边公开用开源

这就要说到 9 月 10 日 Anthropic 发布的那份威胁情报报告。它指控 7 家中国实验室用数千个假账号做”非法蒸馏”,其中阿里在 5 月到 7 月间与 Claude 的交互超过 1.51 亿次,月之暗面被指把部分 Kimi 用户请求转发给 Claude 代答。Anthropic 自己的口径是:蒸馏技术本身合法,违规的是用假账号绕过防护。

两件事放在同一周看,味道就出来了:一边是中国实验室被指偷偷拿美国模型的输出去训自己的模型,另一边是美国公司在公开、合法地拿中国的开放权重做后训练,还写进博客当卖点。

这不只是双标的问题,它说明能力流动的方向已经不只单向。开源权重是一门”以许可换生态”的生意:Moonshot 放弃了对模型使用的垄断权,换来的是它出现在别人的产品说明里、出现在评测榜单里、出现在 Devin 的更新日志里。彭博社 9 月 11 日的报道里,月之暗面的年化收入从 6 月的约 3 亿美元涨到 8 月的 10 亿美元以上,靠的也是这个逻辑的另一面。

第三方验证:便宜是真的,主场优势也是真的

Cognition 的 50.0% 和 64% 都出自它自己运营的 FrontierCode——那是自家基准,没有第三方完整复现过,1.1 版还改过规则,与 1.0 的分数不可比。所以更有价值的是外部数据。

9 月 12 日,Artificial Analysis 公布了对 Devin Fusion 的独立评测:SWE-2(medium)在其 Coding Agent Index v1.5 上得 61.7 分,与完整版 Claude Code 的 62.2 分基本持平,单任务成本 7.90 美元对 12.40 美元,便宜 36%。这个指数由 DeepSWE 1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三个基准等权合成,每个任务跑三次取平均。

这是本轮最重要的外部数字:便宜是真的,而且是在第三方基准上便宜。但同一份评测也再次印证了短板——指数里就包含 Terminal-Bench 4.0,而那正是 SWE-2 最弱的一项。所以更准确的说法是:它在某些任务分布上追平了前沿,在另一些上还差一倍。

480 亿美元的赌注,与编程 Agent 的阵营化

SWE-2 发布的两天前,Cognition 宣布完成 E 轮融资:融资额超过 20 亿美元,投后估值 480 亿美元,由 a16z 和 Accel 领投,Founders Fund、General Catalyst、Avenir 跟投。四个月前,它才刚以 260 亿美元估值融过一轮 10 亿美元;同期它自己的口径是,年化营收从 5 月的 4.92 亿美元涨到接近 9 亿美元。

也就是说:四个月前估值 260 亿美元的公司,现在 480 亿;营收四个月涨了约 1.8 倍;它的旗舰模型底座来自中国;而它的一位老对手(Cursor)刚被 SpaceX 以 600 亿美元整体收购。

这条赛道正在分岔:一边是独立的编程 Agent 公司靠融资把估值推高,一边是头部玩家被巨头吞掉——Cursor 被 SpaceX 收购完成后,OpenAI 在 8 月底宣布终止向 Cursor 提供模型。编程 Agent 正在从”工具市场”变成”大厂生态战”的一部分。

顺带一提这条曲线起点有多低:Devin 2024 年 3 月发布时定价 500 美元一个月,随后被曝在真实任务里 20 个只成功 3 个,一度是”AI 演示很美、落地很惨”的典型案例。两年半之后,同一家公司的新模型能贴着一线前沿跑,估值 480 亿美元——中间拉开差距的,恰好就是”后训练”这件事。

写在最后

回到最初的数字:一家估值 480 亿美元的美国 AI 公司,用中国的开源模型做底座,把后训练出来的成品追到离美国最强闭源模型 0.9 个百分点、成本低 64%;但它不发权重、不给 API,只卖 20 美元一个月的订阅。

这条链路上每一环都值得记住:开源权重是谁家的、后训练是谁做的、基准是谁定的、独立评测又说了什么。因为接下来一年,同类模型会越来越多,而”这到底是谁的模型”这个问题会越来越难回答。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读: