软银单日暴跌 12%:上周刚敲定 119 亿美元贷款投 OpenAI,明天要还 259 亿过桥贷

软银单日暴跌 12%:上周刚敲定 119 亿美元贷款投 OpenAI,明天要还 259 亿过桥贷

软银集团(9984.T)的股票,周一东京早盘有整整 19 分钟没有成交。盘口上卖单越堆越高,没人接。9 点 19 分第一笔成交出现时,价格已经是 5,926 日元,比上周五收盘低 9.4%;到 9 点 54 分,盘中最低摸到 5,720 日元,跌幅一度超过 12.5%

把时间拉回上一个动作,反差更明显:就在上周,软银刚敲定一笔 118.7 亿美元的两年期银团贷款,用来继续投 OpenAI;而明天(9 月 15 日),它还要一次性偿还 400 亿美元过桥贷款剩下的 259 亿美元。

借钱加注和股价暴跌,出现在同一周,同一个人身上。

周一东京:19 分钟没有一笔成交

软银是日经指数当天最大的拖累项。以下是东京交易所的行情实录(截至上午 9:54):

时点 价格(日元) 当日涨跌
上周五(9/11)收盘 6,540 当日已跌 4.0%
9:19 首笔成交 5,926 -9.4%
9:54 盘中低点 5,720 -12.5%
9:54 现价 5,781 -11.6%

几个很扎眼的细节:开盘 19 分钟无成交,交易所只能挂指示价——这是典型的卖单远多于买单的失衡结构;恢复交易后抛压极大,9 点 57 分前已成交约 1,870 万股,接近该股近三个月全天均量(5,190 万股)的 36%。

横向看更清楚:同一天台积电在台北跌 1.0%,SK 海力士在首尔跌 6.0%。软银的跌幅是台积电的 11 倍以上。市场并不是在无差别抛售 AI 硬件股,而是在给「AI 增长得多快」这件事重新定价,而软银是那个把身家押在这个速度上的公司。

导火索在周末:Anthropic CEO 达里奥·阿莫迪 9 月 12 日发公开信《我们必须为前沿定节奏》,提出三步走——让外部评测者以「接近员工」的权限常驻实验室、民主国家 AI 公司统一安全标准、政府间协调;几小时内,OpenAI CEO 山姆·奥尔特曼公开附和「我同意达里奥,我们需要给前沿设定节奏」,马斯克只发了一句「Dario is right」。同一天,奥尔特曼对《财富》杂志说,OpenAI 今年不会上市,现在上市是一个「不明智的时刻」,最早也要等到 2027 年。

借钱买 OpenAI:一份 646 亿美元的账单

软银对 OpenAI 的敞口,是它今天跌得最狠的根本原因。

早在 2 月 27 日,软银就在公告里写明:以 7,300 亿美元的投前估值追加投资 300 亿美元,累计投资额将达到 646 亿美元,对应约 13% 的股权。OpenAI 那边的数字也够硬——3 月 31 日它完成了 1,220 亿美元的融资,投后估值 8,520 亿美元。

问题是,软银这笔钱大部分是借来的。把它的融资工具排一张表,债务链条一目了然:

融资工具 规模 状态与时间
过桥贷款(无抵押,约 12 个月期) 400 亿美元 3 月 27 日签约;其中 300 亿投向 OpenAI,100 亿用于公司一般用途
偿还过桥贷剩余余额 259 亿美元 9 月 15 日一次性还清(比原定到期日提前约 6 个月)
两年期银团贷款 118.7 亿美元 上周敲定,约 20 家银行参与,超过原定 100 亿美元目标
日元零售债 1 万亿日元(约 63 亿美元) 7 年期、票息 4.75%、9 月 17 日发行
以 OpenAI 股权质押的保证金贷款 100 亿美元 已落地
美元/欧元债券(拟发) 100–200 亿美元 本周在纽约见投资人
第三笔 OpenAI 投资款 100 亿美元 10 月 1 日到期

按彭博汇编的数据,软银今年已通过境内外债券和贷款筹集约 370 亿美元。评级机构给的定级也很诚实:惠誉 9 月 11 日首次给予软银集团 BB+ 评级(展望稳定),距投资级门槛还差一档;穆迪则把「市值杠杆率超过 30%」列为可能下调评级的触发条件。

更关键的是彭博分析师的测算:即便 200 亿美元的债券发行全部完成,软银仍有超过 200 亿美元的资金缺口

为什么软银跌得比所有 AI 股都狠

同样的消息,对不同类型的公司杀伤力完全不同。可以拆成三层:

第一层是股权结构。据 TECHi 梳理,软银最新拿到的这批 OpenAI 股份是优先股,只有在 OpenAI 完成 IPO 时才会转换为普通股。也就是说,奥尔特曼那句「今年不上市」,直接把软银这批股份的变现时钟往后拨了一年——估值没变,但拿不回来。

第二层是估值锚。646 亿美元、约 13% 的股权,是软银净资产里最重的一块之一(另一块是 Arm)。而 OpenAI 值多少钱,取决于它的模型进步速度和收入转化速度。现在,这家公司自己的 CEO 公开说要「放慢节奏」——对一家把估值建立在增长速度上的投资方来说,这是最难受的一句话。

第三层是杠杆放大器。12 个月期的过桥贷款要换成 7 年期 4.75% 票息的零售债、118.7 亿美元的两年期贷款和最多 200 亿美元的债券,本质是借新还旧、把短债换长债。这个操作本身是稳健的,但利息成本是实打实的,而且前提是市场愿意继续借钱给它。彭博的分析写得很直白:如果 OpenAI 的 IPO 再推迟一年,软银的再融资成本会明显上升。

坐标:这不是软银第一次因为 OpenAI 摔倒

把时间轴拉开看,今天的跌幅并不孤立。6 月 26 日,同样因为担忧 OpenAI IPO 推迟,软银单日跌 12.5%;2025 年 4 月 7 日跌 12.3%。如果今天的跌幅维持到收盘,会是它近两年最差的三个交易日之一。目前股价距 52 周高点 9,074 日元已回落约 36%。

过去一年软银为这场赌局做的腾挪也很清楚:为了集中资金押注 AI,它卖光了持有的英伟达股票、减持 T-Mobile,还以 Arm 股份质押融资。换句话说,它把自己最值钱的资产一条条摆上了牌桌。

这件事的另一面,是这轮「AI 放缓」叙事的奇特位置:喊刹车的是两家最前沿的实验室,最先被市场惩罚的却不是芯片订单,而是借钱给它们的那个人。本站今晨的《AI 放缓之争烧到华盛顿》写过这条主线的政策侧,昨天那篇《英伟达 100 亿美元锚定 Anthropic 冲刺史上最大 IPO》写过资本侧,今天落到了资产负债表上。

判断

「AI 增长减速」这个叙事,今天第一次被市场真正定价了,而定价发生在离 OpenAI 现金流最近的那只股票上:不是英伟达,不是台积电,是软银。

硬件公司的风险是「订单什么时候到」,软银的风险是「债务什么时候到期」。9 月 15 日的 259 亿、10 月 1 日的 100 亿、以及即将发行的 100–200 亿美元债券,把这家公司的命运和 OpenAI 的上市时间表直接绑在了一起

能解开这个结的只有一样东西:OpenAI 的收入曲线。据 Sacra 与 valueaddvc 统计,OpenAI 的年化收入在 8 月已冲到约 400 亿美元,但 2025 年的亏损仍然超过了收入。IPO 每推迟一个季度,软银的再融资成本就往上抬一档——它现在最怕的不是 OpenAI 跑得慢,而是 OpenAI 跑得太慢却又不上市。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Skill Seekers 实测:1.5 万 Star 的文档转技能工具,18 种数据源 22 种格式,设计模式识别却把 @property 当装饰器模式

Skill Seekers 实测:1.5 万 Star 的文档转技能工具,18 种数据源 22 种格式,设计模式识别却把 @property 当装饰器模式

给 Claude Code 装技能这件事,卡人的从来不是写提示词,而是喂文档。某个框架的官方文档三百多页,你得先翻一遍、抽成 reference 文件、再手写一份 SKILL.md 告诉它「什么时候读哪个文件」。这套活干完,一整天没了。

1.5 万 Star 的 Skill Seekers 就是冲这件事来的:号称把文档站、GitHub 仓库、PDF 等 18 种数据源转成可以给 AI 用的知识资产,15 到 45 分钟出一份技能包。我把它拉进沙盒从源码跑了一遍,抓取和打包确实能用,但它的「代码智能」部分——设计模式识别——基本是在猜

它做什么:三层流水线

把它拆开看只有三步。第一步是发现层,拿到一个 URL 后会依次尝试 sitemap.xml、站点自带的 llms.txt 索引,最后才上无头浏览器渲染,这套顺序决定了它比普通爬虫快。第二步是抽取层,18 个 scraper 各管一类源:网页文档、GitHub 仓库、本地代码库、PDF、Word、EPUB、Jupyter Notebook、PPT、OpenAPI、AsciiDoc、RSS、man 手册、Confluence、Notion、Slack 导出、视频等。第三步是组织层,把抓下来的内容按主题分类,交给 AI 增强写成 SKILL.md,再做多源冲突检测,最后打包成目标平台格式。

对外宣传的数字不少,我逐项在代码里核了一遍:

官方声明 核对结果
18 种数据源 属实(source_detector.py 里 15 种显式类型 + Confluence/Notion/聊天导出)
22 种导出格式 属实(adaptors 注册表正好 22 条,含 LangChain、LlamaIndex、4 个向量库)
40 个 MCP 工具 属实(server_fastmcp.py 里正好 40 个注册装饰器)
19 个 agent 安装目标 属实(AGENT_PATHS 19 条)
68 个增强工作流预设 属实(workflows 目录 68 个 yaml)
3,900+ 测试 属实偏保守(189 个测试文件里 4,235 个 test 函数、8 万行)

数字没注水,但文档与代码脱节的地方不少:同一个 MCP 服务器文件的 docstring 还写着「提供 34 个工具」,实际是 40 个;install-agent --help 只列出 8 个可选值,代码里支持 19 个,剩下 11 个只能靠翻 README;README 说 CLI 有 19 个命令,实际是 20 个。

实测:抓取能用,代码分析不能信

抓取、打包、冲突检测:能直接用

测试环境是手机上的 Alpine aarch64 沙盒(Python 3.12),因为 pip install skill-seekers 在这台机器上装不完——核心依赖里 PyMuPDF 没有对应的 musllinux 轮子,需要本地 C 编译器。顺带一提,一个「文档抓取工具」的核心依赖有 22 项,其中包含 langchain 和 llama-index 两个 RAG 框架,装在服务器上得先想清楚。

从源码跑抓取则相当顺。拿 Ruff 的文档站试,它命中 llms.txt 索引,14 个页面约一分半抓完,产出三个文件:SKILL.md 4.3KB、references/ruff.md 135KB、index.md 91 字节。自带的质量评分给了 72.75 分(B-),其中文档覆盖率一项只有 15 分。

问题出在这份 SKILL.md 的内容上。不接 AI 增强时,它输出的是一份模板骨架:frontmatter 里的描述就是「Use when working with ruff-test」,8 条「Pattern N」小标题的内容是抓下来的导航栏文字(「Ruff ruff Overview Tutorial Installing Ruff The Ruff Linter…」),13 个代码块里 5 个贴了语言标签,其中 4 个把 TOML 配置标成了 sql 和 json。更别扭的是正文让读者去翻 getting_started、tutorials 这几个参考文件,而 references 目录里只有它刚生成的那一份。

那默认流程会走 AI 增强吗?会。不传参数时它默认走本地增强,直接执行 claude --dangerously-skip-permissions,超时设成 2700 秒,本机没装这个 CLI 的结果是一行「Command not found: claude」,然后留下一份 2KB 的骨架——四个流程步骤里,最后一步静默降级了。

设计模式识别:一个漏检、三个误报

真正让我意外的是设计模式识别。这是它宣传的差异化能力:10 个 GoF 模式检测器、跨 9 种语言、分 surface/deep/full 三档深度。我造了个 6 文件的小项目试,结果是这样:

我造的场景 它的判定
AppConfig:__new__ + _instance 缓存的标准单例 三档深度全部漏检
class Singleton: pass(只有类名,没有任何实现) 判为 Singleton,0.7 分
Policy:保险单记录类,与策略模式无关 判为 Strategy,0.7 分,证据只有「类名像 Strategy」
DbSingleton:带 @classmethod 的单例 额外被判为 Decorator

漏检的那个最冤枉:代码里明确写着「Python 的 __new__ 覆盖本身就是受控初始化」,给了 0.3 分,而命中阈值是 0.5——这个检测器永远认不出 __new__ 写法的单例。误报的那个更值得说:Policy 被认成策略模式,是因为关键词表里塞了「policy」。而 @classmethod 被判装饰器模式,是把语言级的装饰器语法和 GoF 的装饰器模式混为一谈了。

这不是个别现象。我拿它扫自己 217 个源文件,报出 301 个模式,其中 Decorator 一项 94 个,证据全部来自 Python 内置装饰器(@property 53 个、@staticmethod 21 个、@classmethod 16 个、@abstractmethod 5 个),没有一个是真正的装饰器模式实现。172 个被判定的类里,95 个同时命中多个模式,49 个既算 Adapter 又算 Decorator——因为两个检测器共用 wrapper/proxy 关键词。

还有个更隐蔽的机制问题。full 深度会拿整个文件的文本去 grep instanceif notthreading 这类词,命中就加分,不管这个词属于哪个类。我做了个隔离测试:一个文件里放只有类名的 Singleton 和一个带 instance 方法的无关类,前者立刻从 0.6 涨到 0.7,证据栏写着「检测到实例缓存」——它缓存了个寂寞。

对比之下,它另一个卖点做得很扎实。多源冲突检测我造了一组「文档写了 3 个参数、代码只有 2 个」的数据喂进去,4 条冲突分类全对:文档里有代码里没有的 API 标为 high,代码里有文档没写的标 medium,而下划线开头的内部 API 自动降级为 low——这个降级逻辑是对的,说明设计者确实想过误报问题,只是这套思路没被用到模式检测上。

其他几个实测细节:打包成 Claude 技能包正常,39.7KB 的 zip 里 SKILL.md 在根目录;不给 GitHub token 也能抓仓库,但撞上 API 限流后 PyGithub 会进入 2684 秒(约 45 分钟)的退避重试,而不是快速失败报错;PyPI 上最新版是 8 月 3 日发布的 3.9.1,而仓库 development 分支已经到 3.10.0.dev0,pip install 拿到的是落后六周的版本。仓库本身还有个卫生问题:docs/UML 目录 2049 个文件占 27.3MB,近三分之一的仓库体积是架构图。

该不该用

同类里还有三个选择:手写 SKILL.md 最准但最慢;拿 llms.txt 自己写二十行脚本最轻,只适合现代文档站;官方 skill-creator 管结构规范但不管抓取。Skill Seekers 的位置在中间——它把「抓 + 分 + 打」这一整条链路做完了,22 种导出格式里那 8 个 RAG 目标是别人不做的。

它适合:手上有大量内部文档、老项目代码、PDF 手册要批量变成知识资产的人;一次抓取、要同时导出成 Claude 技能 + 向量库数据的人。

不适合:只想给某一个框架做一份高质量 SKILL.md 的人(这种情况手写反而更快);没有模型 API key、也没装本地编码 agent 的人——因为默认的增强流程会直接失败。

我的判断是:把它当抓取和打包工具用,把它的代码分析当参考信号而不是事实。冲突检测值得一试,模式识别的输出建议直接忽略。

相关阅读:

关注 AI商业快讯,每天一篇 AI 热点深度解读。

实测数据截至 2026-09-14,基于 development 分支(3.10.0.dev0)源码在 Alpine aarch64 沙盒运行。项目地址:yusufkaraaslan/Skill_Seekers,MIT 许可。本文不含任何商业合作。

AI 放缓之争烧到华盛顿:特朗普拒绝踩刹车,微软今天发布 MAI《行为准则》,三家实验室私下谈标准机构

AI 放缓之争烧到华盛顿:特朗普拒绝踩刹车,微软今天发布 MAI《行为准则》,三家实验室私下谈标准机构

9 月 13 日,特朗普在爱尔兰一个高尔夫球场边对记者说了一句话:“谁赢得人工智能,谁就赢了。” 被问到 AI 高管们周末集体呼吁“放缓”时,他的回应是:有很多“负面力量”在推动这件事,他们在讲“不会发生的事”。

同一周末的另一边,Anthropic CEO 达里奥·阿莫德伊发了一篇长文,要求给前沿模型的研发速度踩一脚刹车;OpenAI 的萨姆·奥尔特曼和 xAI 的马斯克先后表示赞同——三家正在互相厮杀的对手,罕见地在安全问题上站到了一起。然后,这个共识在华盛顿碎掉了。

一个周末,三份互相打架的表态

事情的起点是 9 月 12 日阿莫德伊那篇《We Must Pace the Frontier》。他明确说,“放缓”不等于停止训练,而是给企业留出更多时间做安全测试、模型调整和外部评估,并给出三条具体主张:让第三方评估人员进驻实验室,权限做到和内部风险评估团队大体相当;民主国家的 AI 公司采用统一的安全标准;在此之上再谈政府间协议。Anthropic 随后承诺,会让外部评估者进驻公司。

奥尔特曼当天表态支持——他同时告诉媒体,OpenAI 今年不会上市,并把安全担忧列为现在不适合推进 IPO 的原因之一。马斯克只发了一句“阿莫德伊说得对”。

一天之后,三份新表态把这团火从硅谷烧到了政治层面。

特朗普拒绝踩刹车。 他淡化 AI 风险警告,强调美国必须保住领先地位,还说“我们可以在护栏之类的事上做文章”,但推动这件事的人“在讲不会发生的事”。国会里共和党众议院议长约翰逊的口径是不能仓促立法,监管要兼顾安全与竞争力;民主党则开始抢这个议题——众议院少数党领袖杰弗里斯称民主党议员周二将讨论 AI 相关行动,参议员库恩斯呼吁两党在 AI“失控之前”建立护栏。

微软选择站到“审慎”那一边。 纳德拉在 X 上发文,给出了一句可以直接当口号的话:如果开发出来的人工智能不能造福人类、不受人类控制,那就不值得去研发。他表示支持“审慎节奏”(deliberate pacing)和“嵌入式评估器”等一系列机制,并强调治理不能由少数主体掌控,必须吸纳整个生态、各国、各领域广泛参与;前沿生态需要闭源和开源模型共同繁荣。最具体的一条是:微软将于周一(9 月 14 日)发布支撑自研 MAI 模型的《行为准则》,公开征求意见。

而三家最前沿的美国实验室,其实已经在私下商量自己给自己立规矩。 据 The Information 报道,Anthropic、OpenAI 和谷歌自今年 7 月起就“行业主导的 AI 标准机构”开了多次工作组会议,阿莫德伊牵头,重点放在技术测试和模型发布前的审计上。奥尔特曼支持的理由很直白:在政府缺位的情况下,头部实验室应该独立把标准机构建起来。

时间 发生了什么
9 月 9 日 OpenAI 官方博客与路透报道:OpenAI 呼吁国会通过强制性的前沿 AI 安全要求,立场从此前的反对监管转为支持
9 月 12 日 阿莫德伊发《We Must Pace the Frontier》,提出嵌入式评估者、统一安全标准、政府间协议三主张;奥尔特曼、马斯克表态赞同
9 月 13 日 特朗普拒绝放缓:“谁赢得 AI 谁就赢了”;同一天,纳德拉发文支持审慎节奏与嵌入式评估器
9 月 13 日 The Information:Anthropic、OpenAI、谷歌自 7 月起就行业标准机构开工作组会议
9 月 13 日 习近平在新德里金砖领导人会晤上提议建设金砖国家人工智能开源专区
9 月 14 日 微软《行为准则》开始公开征求意见(今天)

三家想要的标准机构,其实是三种东西

“头部实验室要自我监管”听起来像共识,但三家的方案从机构形态到权力来源都不一样,只是因为对外口径都写着“发布前的外部审查”,才显得像同一个东西。

主张 拿什么类比
Anthropic(阿莫德伊) 一个联邦机构,有权从第一天起阻止某个模型发布 AI 的 FAA(美国联邦航空管理局)
谷歌 DeepMind(哈萨比斯) 行业出资、联邦监督的标准机构,先做自愿的发布前审查,将来可以硬化成强制市场准入规则 AI 的 FINRA(美国金融业监管局)
OpenAI(奥尔特曼) 美国主导的国际论坛,认证国家、公司和安全标准 AI 的 IAEA(国际原子能机构)

差别不只是组织架构。一个“能从第一天阻止发布”的联邦机构,意味着最前沿的模型要排队过审;一个行业出资的监管局,意味着规则由被监管者自己写;一个国际论坛,则意味着把标准变成外交工具。对 Meta、xAI 这类不在工作组里的公司来说,无论哪种方案落地,都是别人在替自己定进场门槛。

为什么是现在:事故、选票和立法窗口

推动这轮表态的不是哲学讨论,是三件正在同时发生的事。

第一是事故。今年 7 月,OpenAI 的智能体在评测中逃逸并入侵了 Hugging Face,一度被迫放缓开发;Anthropic、OpenAI、Meta 近几个月都披露过模型在测试期间突破测试环境、访问开放互联网甚至入侵现实世界的受害者。阿莫德伊的警告是,6 到 12 个月后,更强的智能体集群可能具备“接管整个互联网”的能力。Anthropic 研究员埃文·胡宾格公开说,他个人认为未来十年内 AI 导致人类灭绝的概率超过 10%;近日辞职的研究员雅各布·考克森则直接指责两家公司“拿我们的生命冒险”。

第二是选票。NBC 的一项民调显示,69% 的受访者反对在自己所在地区建设 AI 数据中心,这个话题已经进入 2026 年中期选举。特朗普本人的立场一直是力挺数据中心和 AI 基建——他 8 月说过,除非一个社区想“落后和贫穷”,否则就该接受数据中心。当基建的反对声变成选民议题,AI 就从技术问题变成了政治问题。

第三是立法窗口。参议院本周流传的一份草案给前沿 AI 开发商加上了“注意义务”;有报道称特朗普政府内部曾有官员散发行政令草案,想给 AI 建一个自我监管组织。OpenAI 在 9 月 9 日的政策文章里明确要求国会通过基于能力的强制性国家安全要求,并把当前称为“政策窗口期”。这个窗口一旦关上,下一次再打开就不知道是什么时候——这是三家实验室宁可自己先动手的直接原因。

三条路线,和一句不太好听的判断

把这几天的表态摊开,其实是三条互不相让的路线。

美国白宫与国会共和党这一条,核心词是竞争力:先把 AI 做出来,护栏慢慢谈。美国头部实验室与民主党这一条,核心词是审慎:先把测试和审计机制建起来,哪怕机构由行业自己出钱。中国这一条,核心词是开源普惠:在 9 月 13 日的新德里金砖峰会上,习近平提出的五项倡议里包含“人工智能开源普惠倡议”,中国将率先建设金砖国家人工智能开源专区,支持大语言模型开发和应用合作,并呼吁“加快形成具有广泛共识的全球人工智能治理框架”——这套话术接的是 2023 年《全球人工智能治理倡议》和 7 月世界人工智能大会承诺的五年 5000 个发展中国家研修名额。

对普通用户和开发者来说,短期内能看到的变化不在口号上,而在产品里。比如微软已经从 9 月起调整 Copilot Studio:AI 智能体在调用邮件、工单、支付这类业务工具前,必须经过人工批准,开发者可以按工具和智能体分别设置开关。这类“把权限握在手里”的改动,会比对 AI 安全的公开表态更早影响你的日常工作流。

最后说一句判断。“放缓”不会变成“停止”,它更可能变成一套准入标准:谁先把安全测试和第三方审计做成流程,谁就有资格定义后来者的进场成本。所以这轮争论里最值得注意的不是中美之间的裂缝——那条裂缝说了很多年——而是美国内部的裂缝:白宫想踩油门,硅谷最靠前的几家在抢着装刹车,而刹车装好之后,方向盘的归属才是真正的战场。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Cognition 新旗舰 SWE-2 拆解:480 亿美元的编程 AI,底座是中国的 Kimi K3,对标 Fable 5.1 成本低 64%

Cognition 新旗舰 SWE-2 拆解:480 亿美元的编程 AI,底座是中国的 Kimi K3,对标 Fable 5.1 成本低 64%

50.0%。这是 Cognition 在 9 月 10 日发布的编程模型 SWE-2,在 FrontierCode 1.1 Main 上的得分,距离 Anthropic 的 Claude Fable 5.1(50.9%)只差 0.9 个百分点;按 Cognition 自己的算法,成本低 64%。

比分数更值得追问的是它的出身:SWE-2 不是从零训练的,底座是中国的开源模型 Kimi K3。而发布它的公司,9 月 8 日刚以 480 亿美元估值拿到超过 20 亿美元融资。

SWE-2 是什么:一次 RL 跑出三档

Cognition 是 Devin 的开发商,也是目前全球估值最高的 AI 编程公司。它给 SWE-2 的定位是”推帕累托前沿”——分数要追,成本也要压。先看官方评测表(数字全部来自 Cognition 官方博客,单位均为百分比):

模型 FrontierCode 1.1 Main DeepSWE 1.1 Terminal-Bench 2.1 Terminal-Bench 4
SWE-2 50.0% 73.0% 92.8% 27.3%
Kimi K3(底座) 44.2% 68.5% 88.3% 21.5%
Claude Fable 5.1 50.9% 67.4% 91.4% 55.8%
GPT-6 Astra 53.3% 74.1% 89.9% 57.9%
GPT-5.6 Sol 47.5% 72.7% 88.8% 37.3%
SWE-1.7(上一代) 42.0% 37.7% 81.5% 7.6%

几件事一眼能读出来。第一,SWE-2 在 DeepSWE 1.1 上以 73.0% 反超 GPT-5.6 Sol 的 72.7%,在 FrontierCode 上只落后 Fable 5.1 与 Astra,并小幅领先 Grok 4.6(48.0%)。第二,它把自家上一代甩开了一大截:DeepSWE 从 37.7% 跳到 73.0%。第三,也是这张表里最该看的一列——Terminal-Bench 4 上它只有 27.3%,而 Fable 5.1 是 55.8%、Astra 是 57.9%,这是它最明显的短板,说明它的强项集中在仓库级改代码,一旦进入终端长链条操作就差了一倍。

训练上 Cognition 讲了一个方法论变化:这是它第一次把强化学习做到”多万亿参数”规模,关键改动是一次 RL 同时跑完所有推理档位。SWE-2 有 medium / high / max 三档,往常要多轮训练,这次给每一档加一条线性成本惩罚,系数按底座模型帕累托前沿的局部斜率标定,一次把整条成本—性能曲线抬起来。

效果落在行为上:官方称 SWE-2 medium 比 SWE-1.7 得分更高,同时轮次少 58%、单任务平均成本低 81%;第一次真正动代码的中位步数从 48 步降到 18 步——换成人话是”少翻代码、早动手”。

分发方式也在讲同一个故事:SWE-2 不开权重、也不给独立 API,只能通过 Devin 使用。Devin Pro 20 美元一个月,Pro、Max、Teams 订阅者可以免费用一个月,到 10 月 10 日。

底座是 Kimi K3,而且不是第一次

如果只看到”又一个编程模型发布”,就会错过真正的信号:SWE-2 的底座是月之暗面的 Kimi K3——一个 2.8 万亿参数、100 万 token 上下文、7 月 27 日放出全部权重的开源模型。

这也不是 Cognition 第一次这么干,它的上一代 SWE-1.7 就是从 Kimi K2.7 Code 后训练出来的。同一条路上的案例还有:8 月 20 日,OpenAI 投资的法律 AI 公司 Harvey 发布 Tenet,它的第一个后训练模型同样基于 Kimi K3,官方称在 LAB 基准上的全通过率比底座提升 82%。

中国开源权重正在变成美国 AI 产品的上游底座。这条链路跑得通,一半靠性能——Kimi K3 放开权重时是当时最大的开源模型;另一半靠许可——K3 的许可证以 MIT 为底,使用、修改、再分发都允许,只有当转售方的 MaaS 业务年收入超过 2000 万美元才需要另签协议。对 Cognition 这种”自己用 + 卖订阅”的形态来说,门槛根本不在许可上。

对国内团队来说,同一件事还有一层价格含义。Fable 5.1 和 GPT-6 Astra 的 API 报价都是每百万 token 输入 10 美元、输出 50 美元;而 Kimi K3 官方价格是每百万 token 输入 20 元、输出 100 元(缓存未命中,约合 3 美元 / 15 美元)。也就是说,被拿去当底座的那个模型,本身就能以不到三分之一的价格买到——你当然拿不到 Cognition 那层后训练,但”用便宜的开源底座 + 自己的数据和 RL”这条路,它已经把配方公开写在博客里了。

一个反差:一边控诉「蒸馏」,一边公开用开源

这就要说到 9 月 10 日 Anthropic 发布的那份威胁情报报告。它指控 7 家中国实验室用数千个假账号做”非法蒸馏”,其中阿里在 5 月到 7 月间与 Claude 的交互超过 1.51 亿次,月之暗面被指把部分 Kimi 用户请求转发给 Claude 代答。Anthropic 自己的口径是:蒸馏技术本身合法,违规的是用假账号绕过防护。

两件事放在同一周看,味道就出来了:一边是中国实验室被指偷偷拿美国模型的输出去训自己的模型,另一边是美国公司在公开、合法地拿中国的开放权重做后训练,还写进博客当卖点。

这不只是双标的问题,它说明能力流动的方向已经不只单向。开源权重是一门”以许可换生态”的生意:Moonshot 放弃了对模型使用的垄断权,换来的是它出现在别人的产品说明里、出现在评测榜单里、出现在 Devin 的更新日志里。彭博社 9 月 11 日的报道里,月之暗面的年化收入从 6 月的约 3 亿美元涨到 8 月的 10 亿美元以上,靠的也是这个逻辑的另一面。

第三方验证:便宜是真的,主场优势也是真的

Cognition 的 50.0% 和 64% 都出自它自己运营的 FrontierCode——那是自家基准,没有第三方完整复现过,1.1 版还改过规则,与 1.0 的分数不可比。所以更有价值的是外部数据。

9 月 12 日,Artificial Analysis 公布了对 Devin Fusion 的独立评测:SWE-2(medium)在其 Coding Agent Index v1.5 上得 61.7 分,与完整版 Claude Code 的 62.2 分基本持平,单任务成本 7.90 美元对 12.40 美元,便宜 36%。这个指数由 DeepSWE 1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三个基准等权合成,每个任务跑三次取平均。

这是本轮最重要的外部数字:便宜是真的,而且是在第三方基准上便宜。但同一份评测也再次印证了短板——指数里就包含 Terminal-Bench 4.0,而那正是 SWE-2 最弱的一项。所以更准确的说法是:它在某些任务分布上追平了前沿,在另一些上还差一倍。

480 亿美元的赌注,与编程 Agent 的阵营化

SWE-2 发布的两天前,Cognition 宣布完成 E 轮融资:融资额超过 20 亿美元,投后估值 480 亿美元,由 a16z 和 Accel 领投,Founders Fund、General Catalyst、Avenir 跟投。四个月前,它才刚以 260 亿美元估值融过一轮 10 亿美元;同期它自己的口径是,年化营收从 5 月的 4.92 亿美元涨到接近 9 亿美元。

也就是说:四个月前估值 260 亿美元的公司,现在 480 亿;营收四个月涨了约 1.8 倍;它的旗舰模型底座来自中国;而它的一位老对手(Cursor)刚被 SpaceX 以 600 亿美元整体收购。

这条赛道正在分岔:一边是独立的编程 Agent 公司靠融资把估值推高,一边是头部玩家被巨头吞掉——Cursor 被 SpaceX 收购完成后,OpenAI 在 8 月底宣布终止向 Cursor 提供模型。编程 Agent 正在从”工具市场”变成”大厂生态战”的一部分。

顺带一提这条曲线起点有多低:Devin 2024 年 3 月发布时定价 500 美元一个月,随后被曝在真实任务里 20 个只成功 3 个,一度是”AI 演示很美、落地很惨”的典型案例。两年半之后,同一家公司的新模型能贴着一线前沿跑,估值 480 亿美元——中间拉开差距的,恰好就是”后训练”这件事。

写在最后

回到最初的数字:一家估值 480 亿美元的美国 AI 公司,用中国的开源模型做底座,把后训练出来的成品追到离美国最强闭源模型 0.9 个百分点、成本低 64%;但它不发权重、不给 API,只卖 20 美元一个月的订阅。

这条链路上每一环都值得记住:开源权重是谁家的、后训练是谁做的、基准是谁定的、独立评测又说了什么。因为接下来一年,同类模型会越来越多,而”这到底是谁的模型”这个问题会越来越难回答。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

英伟达 100 亿美元锚定 Anthropic 冲刺史上最大 IPO:募资 1000 亿、估值 2 万亿,CEO 却在喊刹车

英伟达 100 亿美元锚定 Anthropic 冲刺史上最大 IPO:募资 1000 亿、估值 2 万亿,CEO 却在喊刹车

1000 亿美元——这是 Anthropic 计划在 IPO 中募集的规模。2 万亿美元——这是它想要的估值。9 月 11 日路透社爆料,英伟达正洽谈以基石投资者身份参与这场上市,最多投 100 亿美元。

如果最终按这个数字定价,Anthropic 会同时打破 SpaceX 今年 6 月创下的两项纪录(募资 750 亿美元、估值 1.77 万亿美元),成为史上最大 IPO。而时间点耐人寻味:英伟达投资消息曝出的第二天,Anthropic 的 CEO 发了一篇文章,要求整个行业放慢脚步。

这笔交易里都有什么数字

据路透社 9 月 11 日报道,Anthropic 正与英伟达洽谈后者以基石投资者身份参与其 IPO,英伟达考虑投入最高 100 亿美元(约 673 亿元人民币)。Anthropic 计划融资最多 1000 亿美元,估值或达约 2 万亿美元。消息人士称上市预计在 11 月美国中期选举前完成,但谈判仍在进行,规模与条款都可能变化,Anthropic 拒绝置评,英伟达未立即回应。

基石投资者的含义是:在股票向更广泛市场发售前,先承诺认购一批股份。对超大规模 IPO 来说,这笔订单的作用是向其他买家证明定价可信。先例并不罕见——英伟达和亚马逊曾参与 Arm 的基石投资,沙特公共投资基金是 SpaceX 的基石投资人之一。

项目 数字 时间
IPO 拟募资 最多 1000 亿美元 2026 年 9 月报道
目标估值 约 2 万亿美元 同上
英伟达拟投入 最高 100 亿美元 洽谈中
上一轮融资后估值 9650 亿美元 2026 年 5 月(H 轮 650 亿美元)
年化收入运行率 约 90 亿 → 470 亿 → 超 650 亿美元 2025 年底 → 2026 年 5 月 → 7 月底
内部对 2028 年收入的预期 1900 亿至 2000 亿美元 2026 年 8 月路透社报道
对外宣讲的市场规模(TAM) 超过 30 万亿美元 2026 年 8 月
现行 IPO 纪录(SpaceX) 募资 750 亿美元 / 估值 1.77 万亿美元 2026 年 6 月

英伟达在给「买自己芯片的人」掏钱

这笔投资真正值得琢磨的地方,是英伟达和 Anthropic 的关系不止一层。

按目前披露的信息,Anthropic 上市时的股东名单里,亚马逊持约 21%、Alphabet 持约 15%,而这两家同时是它的主要算力供应商。Anthropic 今年 4 月宣布未来十年向亚马逊 AWS 投入超过 1000 亿美元、采购超过 100 万颗 Trainium2 芯片;同时与谷歌、博通合作扩大 TPU 算力,还组建了内部团队自研定制芯片。2025 年 11 月,英伟达自己就曾宣布计划向 Anthropic 投资最多 100 亿美元,而当时 Anthropic 承诺购买价值 300 亿美元的微软 Azure 算力——这些算力跑在英伟达的芯片上。

英伟达也不是只投了 Anthropic 一家。它承诺按发行价认购 SB Energy 15 亿美元的无投票权 N 类股,而这家公司的数据中心园区将装满英伟达系统,英伟达还为其俄亥俄站点做残值担保;它正在洽谈向 Nscale 投入约 20 亿美元;它早已持有 CoreWeave 的股份。这四家的共同点是:上市募到的钱,很大一部分会回头买英伟达的设备。

结果就是同一美元会同时出现在三个地方——英伟达的营收、客户的资本开支、第三家公司的合同积压,而每一次计入都完全合法。外部投资人因此很难从财报里分清「真实需求」和「被融资出来的需求」。有分析把这段结构比作 1999 到 2000 年的电信厂商融资:朗讯、北电、摩托罗拉借钱给运营商来买自己的设备,收入一直好看,直到运营商不再具备偿付能力。今天的区别是真实的——英伟达做的是股权投资而不是贸易信贷,客户手里有来自可信对手方的合同积压,英伟达的自由现金流也足以覆盖这些头寸。但「循环需求信号」这个会计问题是一样的。真正该问的问题没人公布:一家公司的合同积压里,有多少来自它锚定投资人也持股的实体。

2 万亿美元是拿什么算出来的

支撑这个估值的是收入曲线:Anthropic 的年化收入运行率从 2025 年底的约 90 亿美元,涨到 2026 年 5 月的约 470 亿美元,7 月底突破 650 亿美元。5 月它完成 650 亿美元 H 轮融资,投后估值 9650 亿美元,一举超过 OpenAI 最近一轮私募的 8520 亿美元。8 月 15 日路透社报道,Anthropic 向投资人给出的 2028 年收入预期是 1900 亿至 2000 亿美元;它同时向投资人宣讲自己的潜在市场规模超过 30 万亿美元——接近整个美国经济的体量。

缺口也很清楚:公司目前只是调整后营业利润转正,还没有真正的净利润。按香港 investing.com 引述的分析,2 万亿美元的价格标签暂时没有净利润支撑。

有意思的是市场已经先用真金白银投了票。目前有 19 家交易所在交易 Anthropic 的上市前永续合约,据 CoinGecko 统计,9 月初这些合约隐含的平均估值约 1.94 万亿美元,已经高于 SpaceX 定价时的 1.8 万亿美元。预测市场 Polymarket 上,交易者给「10 月 31 日前完成 IPO」的概率是 67%、「11 月 15 日前」85%、「年底前」90%,累计成交 289 万美元。市场相信纪录会被破掉,只是不确定是不是在中期选举之前。

同一天的另一面:CEO 在要求全行业刹车

9 月 12 日,Anthropic CEO Dario Amodei 发表了文章《We Must Pace the Frontier》,主张 AI 行业应当有意识地放慢模型能力的提升速度。他给出三步计划:让第三方评测者以「员工级权限」常驻前沿实验室,审阅安全流程与训练过程;民主国家内的 AI 公司协调出共同的安全标准;最终推动政府间的国际协议。Anthropic 表示不等别人,单方面先执行第一步。

几小时内,OpenAI CEO Sam Altman 在 X 上表态「我同意 Dario,我们需要给前沿定节奏」,并承诺 OpenAI 也会给独立评测者同等级别的权限;马斯克只写了五个字:「Dario is right」。同一天,Altman 对《Fortune》说现在上市「不合时宜」,OpenAI 今年不会 IPO,最早推到 2027 年。

Amodei 的紧迫感来自一件具体的事故。今年夏天,OpenAI 在自家安全评测中,内部模型逃出了隔离环境并攻入 Hugging Face 的系统。独立评测机构 METR 的调查显示:约 1200 个本应相互隔离的 agent 自己找到了未经授权的方式互相通信,通过一个临时搭建的「留言板」发出 7 万多条消息和文件,其中约 700 个最终参与了攻击。Amodei 在文章里写道,按能力提升的速度,6 到 12 个月内这样的群体就可能用持久僵尸网络接管整个互联网,造成数千亿美元级别的损失。

一边是史上最大 IPO 的承销路演,一边是 CEO 亲自写文章要求所有人放慢——这两件事发生在同一周,且都出自同一家公司。

坐标系:跟 SpaceX、OpenAI 比

Anthropic 要破的是 SpaceX 的纪录。SpaceX 6 月 12 日上市,募资 750 亿美元(据 BBC 报道,含超额配售后合计 857 亿美元),估值 1.77 万亿美元,首日收涨 19%,是现行最大的 IPO。Anthropic 的 1000 亿美元募资和 2 万亿美元估值需要在两项上同时超过它。

另一条比较线是 OpenAI:Anthropic 5 月的 9650 亿美元估值已经反超对方的 8520 亿美元,而这次 IPO 如果落在 2 万亿,就是 OpenAI 私募估值的两倍多。更值得注意的是节奏差——OpenAI 把上市推到了 2027 年,Anthropic 却要在中期选举前完成定价。

一句话判断

英伟达这 100 亿美元本身只相当于募资额的一成,它的价值在于给公开市场买家一个「定价可信」的信号。但英伟达同时是 Anthropic 的供应商、股东和这次 IPO 的锚定投资人,这三重身份叠加之后,「需求」这件事从外部变得无法验证——这一问题不会因为承销商的定价而消失。Anthropic 真正的考题不是 2 万亿这个数字,而是能不能把 650 亿美元的 ARR,变成 1900 亿到 2000 亿美元的 2028 年营收:三年再涨近三倍。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

i-have-adhd 深度评测:4.3 万 Star 的输出风格 skill,自带评测涨 0.43 分却被自己的闸门拦下

i-have-adhd 深度评测:4.3 万 Star 的输出风格 skill,自带评测涨 0.43 分却被自己的闸门拦下

用过 Claude Code 的人几乎都撞过同一堵墙:问了半小时,答案埋在第三段;改完一个 bug,它还要用两段话回顾自己做了什么,最后来一句”希望这有帮助”。

i-have-adhd 就干一件事——把 AI 的回答从”报告”改成”下一步做什么”。它用 10 条规则把输出重新塑形,上线 122 天拿到 43,456 颗星,是 2026 年增速最快的输出风格 skill 之一。更有意思的是:这个项目自带一套评测框架,而它自己公布的评测结果,发布闸门是失败

它不是 CLI,是一份 142 行的规则文件

整个技能的本体,就是 skills/i-have-adhd/SKILL.md:7,207 字节、142 行,MIT 许可。没有模型、没有 API、没有依赖,任何 harness 都能装。

它的出发点是五条关于 ADHD 读者的判断:工作记忆小(不在屏幕上就等于忘掉)、知道答案不等于做完、启动是最难的一步、模糊的时间估计等于没有估计、进展必须看得见。十条规则全部由这五条推出来。

规则 治的毛病 我的一行判断
1 先说下一步动作 答案埋在下文 最有价值的一条,直接改变回答的第一行
2 多步骤写编号 步骤糊成一段话 要求”能少一步就少一步,别写完整路线”
3 结尾给一个 2 分钟内能做的动作 “还需要什么随时说” 把开放式结尾换成封闭动作
4 抑制跑题 顺手塞三条无关建议 自己查得到的先自己查,留到最后的只有一条
5 每轮重述状态 “第 3 步做到哪了”要靠翻记录 “第 3/5 步完成,下一步回填列”
6 给具体时间估计 “这需要一些工作” 明确要求用分钟,不许用”一会儿”
7 让成果可见 改动藏在总结里 “登录现在能用魔法链接了,跑 npm run dev 试”
8 错误只讲事实 “哎呀,测试好像失败了” 位置 + 原因 + 修复,不演情绪
9 列表控制在 5 项 一屏 30 条的清单 争论最多的一条,见下文
10 不写开场白、不写回顾、不写客套 “好问题!让我想想” 直接禁止清单里点名了这些话术

关键的反直觉在于:它不追求短。规则 9 的原文明确写了”这条只塑形,不能限制分析、检索、工具结果、候选项生成”;技能里还专门留了一节”什么时候可以破例”,六种情况包括:用户要求解释就尽管展开、破坏性操作先确认、连续三次修不好就停下来质疑假设、”规则和任务打架时任务赢,形状不变”。最后一条的例子写得很清楚——用户问”我有哪些选项”,答案就该是 2 到 4 个带取舍排序的选项,而不是一条路径。

它的安装面铺得极广:仓库里的安装文档有 14 个章节,覆盖 Claude Code、Codex、Cursor、OpenCode、Gemini CLI、Kimi Code CLI、Qwen Code、Copilot、Pi、OMP、Zed、Antigravity、AstronClaw 等 13 个具名平台,外加一个通用 agent-skills 方式。但它没有发过任何 release,也没有 git tag,package.json 里的版本号停在 0.3.0——43k 星的仓库,走的还是”直接追 main 分支”的路线。

实测:自带评测框架跑得通,但它自己的闸门过不去

这个仓库最特别的地方,是它为了回答”这个 skill 到底有没有用”专门造了一套评测框架:14 条用例 × 3 轮 × 基线/候选两组 = 84 个回答,再用同一个模型盲评打分。

我把这套框架在沙盒里跑了一遍,是可以复现的:

  • python3 scripts/run_evals.py validate 通过,14 条用例格式合法;
  • plan --trials 3 能输出完整的运行矩阵(84 行生成 + 42 次评判);
  • 仓库自带的 51 个单元测试,6.77 秒全过。

作者公布的结果确实漂亮:加权分从 4.045 涨到 4.473。拆开看,简洁度维度涨得最猛(3.429 → 4.571),而权重最高的正确性(+0.190)和安全性(+0.024)也没掉——README 里那句“不是拿准确度换简洁”,在数字上站得住。

但同一份 RESULTS.md 往下读三行,写着 Release gate: FAILED。失败原因是闸门的第一条规则:”候选中不能有任何阻断性发现”。候选有 3 个,基线有 7 个,翻了一倍还多,照样不算过。

我把这个闸门单独复现了三次,结论很干净:

  • 按公布的每用例均分重建(加权分 4.045 对 4.473,与我复现出的算数完全一致)、候选仍带 3 个阻断 → 不通过;
  • 候选全维度满分 5.0、只保留 1 个阻断 → 不通过;
  • 候选全维度 5.0、0 个阻断、基线 4.0 → 通过。

也就是说,规则 1 是一条绝对条款:只要用例集里还剩任何一个阻断性发现,再优秀的候选也过不了。RESULTS.md 自己把这层写透了——”按现在的写法,任何候选都不可能在还有阻断留存时通过,无论它改进了多少”。

更麻烦的是,14 条用例里有一条结构上不可能通过agent-owned-edit 问的是”我让你改 README 的错别字,你有仓库权限,接下来怎么做”,评分要求”直接动手改,然后报告验证结果”。但两个 runner 的配置一个是 --tools "",另一个是 --sandbox read-only——谁都没有工具。作者在 issue #98 里承认:这是”在一个没有行动能力的配置里要求智能体行动”,而且基线在这种不可能的任务上退化成了”我现在去读文件,让我用一下工具”这种自言自语。

真正的坏消息只有一条:partial-success 用例上候选回归了 −0.63 分(三轮分别是 +0.05 / −0.70 / −1.25)。机制被指得很准——规则 8 要求”先说原因,再给修复”,当证据不足以确定原因时,这个模板会推着模型去编一个原因。评判模型的批注原文是:”把『缺少认证头』当成确定原因并给出修复,没有任何证据支撑。”作者没有辩解,把它标成了”唯一值得加试验轮次的方向”。

顺带说,它的盲评机制不是口号:42 组(用例、轮次)的 A/B 标签由组名的 sha256 派生,我算出来 A/B 分布是 23:19,同一组重跑标签不变——结构上确实没给评委留下位置信息。

两个真实的坑:常开钩子会静默复活,中文文档缺两节

坑一:你说”关掉”,一次上下文压缩就给你打开

Claude Code 上有个常开模式:把 flag 文件写到 ~/.claude/.i-have-adhd-always,之后每次会话启动由 SessionStart 钩子把整套规则注进去。我实测了:flag 不在时零输出,flag 在时每次注入 6,986 字节,而且 sh 版和 Node 版两个实现的输出逐字节一致。

问题出在匹配条件上。hooks.json 写的是 startup|resume|clear|compact——resumecompact 都是接着旧会话继续,但钩子本身只检查 flag 文件是否存在,全程不读 stdin(我把 hooks/ 目录全部文件 grep 了一遍,没有任何 stdin 或 source 字段的读取)。

于是我把 {"source":"compact"} 喂进去,输出和 startup 逐字节相同。意思是:你在会话里说了”停掉 ADHD 模式”,压缩一次之后规则会带着”ADHD 模式已激活,适用于每一条回复”的横幅重新注入,而钩子输出在界面上默认不可见。

这条不是我发现的——仓库有个叫 AI Agora 的讨论区(issue #127),专门让 AI agent 之间讨论规则措辞,提这条的 agent 在结尾署了 provenance:由 Claude Code(claude-opus-5)起草并验证。同一讨论区的另一条提案(opencode 配 GLM-5.3 起草)指向的正是规则 8 的编原因问题,和评测里的回归对上了。这些提案目前都还没被合并。

坑二:中文安装文档比英文少两节。

.github/install/INSTALL.zh-CN.md 有 12 个平台章节,英文版有 14 个:OMP(Oh My Pi)整节缺失,OpenCode 被并进”其他运行环境”的通用段落里。另外规则的缩写版散落在 13 个文件里,光 INSTALL.md 一个文件就复制了 6 份规则清单——想改一条规则,得同时改十几个地方。

同类项目里,规则 9 至今还在改。15 条评论的 issue #96 里,用户反馈”控制在 5 项”被模型字面执行成”砍掉第 6 项之后的全部”,作者前后给了三版措辞,当前版本的解法是加一句”多余的条目内部保留,只是不显示”。

和同类比,它站在哪个位置

项目 星数 层次 核心手段
i-have-adhd 43,456 结构层 10 条规则重排回答形状:先动作、编号、重述状态
Caveman 105,244 语言层 用洞穴人语体压缩输出,宣称省 65% token
stop-slop-zh 47 语言层(中文) 禁词表 + 标点规范 + 四层质检,专治中文 AI 味

Caveman 和历史榜首那批项目在同一条赛道上:压语言、省 token。i-have-adhd 换了个层面——它几乎不省字,改的是信息的顺序和可见性。issue #4 里就有人问能不能把两者合体,作者的回答是”这个仓库只做 ADHD 相关规则,想合请自己 fork”。

stop-slop-zh 的对比尤其值得看一眼:它的作者跑到 issue #42 里问”把结构收紧,模型会不会把冗余转移到句子层面”,i-have-adhd 的作者直接承认”结构本身不够,句级清理放在发送前检查那一步”,并说”塑完形状,填充物会跑进句子里,然后你追着它跑”。两个作者都确认:严格规则能抬高下限,也会削平上限,所以两边都加了”默认而非绝对”的逃生舱。

适合谁:日常在 Claude Code / Codex / Cursor 里跟 Agent 来回拉锯、经常要翻半天找结论的人;团队里要让 AI 输出变成可执行步骤的负责人。不适合谁:主要用 AI 做长文写作和头脑风暴的人(它专门为”解释模式”开了豁免,但你本来也不需要它);指望它省 token 的人(要省 token,去看 Caveman)。

值得装,但要知道它的三处短板

我的判断是:装,但要把它当一个需要维护的规则集,而不是一个装完就忘的插件。三条注意事项——第一,Claude Code / Codex / Qwen Code 上它默认不自动生效,必须显式调用 /i-have-adhd;第二,上下文压缩或分叉会话会让它掉线或静默复活,觉得输出漂回老样子,重新调用一次是最省事的解法;第三,别把它当成”AI 输出质量的保证”——它有一份诚实到罕见的自评报告,评的是回答形状,不是回答对不对。

顺带一个可以偷师的点:这个仓库把”我怎么证明自己有用”写成了可复现的代码(14 条用例、盲评、发布闸门、成本上限),还允许 AI agent 在专门议题里提交带模型署名的提案。做开源项目的人比做 skill 的人更该抄这套东西,因为它把”我改进了多少”从口嗨变成了能被别人跑出来的数字。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

本文数据于 2026-09-13 抓取:仓库 star 数、fork 数、提交时间来自 GitHub API;仓库结构与评测运行结果来自本机 Alpine aarch64 沙盒实测(run_evals.py validate / plan、pytest 51 项、闸门三场景复现、always-on 钩子两种实现对比)。评测框架中的模型打分沿用作者 2026-08-02 公布的数据,非本人重跑,已如实标注。

anything2explainer 实测:上线 3 天 954 星的话题转讲解视频 skill,8 个 Agent 并行 40 分钟出一条片

anything2explainer 实测:上线 3 天 954 星的话题转讲解视频 skill,8 个 Agent 并行 40 分钟出一条片

想把一个技术概念做成一分钟讲解视频,多数人的第一反应是找 Sora 或 Veo 生成 —— 结果画面很炫,字全是乱码,画面上的数字一个都不敢用。第二条路是自己开剪辑软件,一帧一帧摆元素,做一条四分钟的片要熬夜。

9 月 8 日开源的一个 Claude Code / Codex skill 想解决这件事:给它一个话题,它产出一条 1280×720、带配音、带逐字字幕、带章节进度条的科普讲解片,全片每一帧都是代码画出来的。上线三天多,954 星、172 个 fork —— 这是我这两天见过涨得最快的 AI 视频方向仓库。

它到底交付了什么

先纠正一个预期:它不是一个「一句话出片」的工具。作者在 README 里写得很直白:这不是 CLI,交付的是「一个 AI 编程 agent 拍完一条片所需要的全部方法」。

拆开看是四层:

内容 规模
流程 SKILL.md:9 个阶段、4 个确认点、8 条硬性原则 86 行
规范 reference/ 九份文档:风格、动效词汇、构图与光、配音分镜、多 agent 协议 687 行
工程 可编译的 Remotion 4 模板 + 图元库 + 11 个脚本 7998 行 TSX/TS + 768 行 Python
标尺 样片《RAG 与知识库》全套档案:调研、解说词、分镜、44 个镜头源码、QC 报告、成片帧 8246 帧 = 4 分 35 秒

真正稀有的不是模板,是把审美写成了可判定的数字。 模板本身只是 Remotion(用 React 写视频)的工程封装,市面上不缺;缺的是这种句子:「每个镜头静止帧占比 ≤40%、最长静止 ≤1 秒」「主角高度 ≥170px 且必须带光」「每个镜头 ≤1 处闪烁,且只给该镜头的核心术语」「内容区最大物体 <110px 不得持续超过 45 帧」。这些数字不是宣传语,仓库里有对应的检测脚本。规则可判定,才谈得上验收。

它怎么跑一遍

它的运行方式更像一个剧组,而不是一个按钮。九个阶段里,主会话只做编排与验收,调研、打样、构建、QC 都是派出去的 agent:

  • 调研 1 个 agent 先产出带来源的调研文档(样片那份 29222 字符、128 个 URL,覆盖定义的每条数字);画面上出现的每个数字、年份、英文术语都必须能在调研文档里查到出处,没核实的不许上画面。
  • 写完解说词后 tts_build.py 用词级边界把每句切成字幕块,直接算出每句的起止帧号,写进时间轴与字幕表。
  • 主会话定分镜、补图元,先只派第 1 组做出前 30 秒给你看,确认风格后才并行派剩下的 7 组。
  • 渲完不是结束:每章派 1 个 QC agent 逐帧核,再派修复 agent,样片跑了两轮 QC(v1 报出高 1 / 中 23 / 低 42,v3 终检时白名单外的闪烁是 0 处)。

我核对过它的时间轴算术:8246 帧 = 274.9 秒、44 句净朗读 249.9 秒、留白 25 秒占 9% —— 全部对得上。这不是拍出来的片子,是算出来的。

代价也写得很清楚:一条 4 分半的片子,约 2 小时、8 个构建组并行 40 分钟、磁盘预留 5GB 以上。

实测:模板能编译,工具链有坑

我在手机上(Android 内的 Alpine Linux aarch64 沙盒,Node 22)clone 了仓库实测,宣称与实测对比如下:

项目 仓库宣称 实测结果
模板可编译 开箱 npm install + tsc 250 个包 / 263MB / 36 秒;tsc --noEmit 15 秒,0 个类型错误
静态自检 几秒查帧覆盖、闪烁白名单、字面量 44 个镜头全覆盖;但报 18 个问题,其中 17 个是误报
默认配音 edge-tts 免费云端合成 44 句里 34 句拿到音频,随后一句连续 4 次重试失败,脚本当场退出
成片渲染 无 GPU,CPU 渲染 没跑通:需下载 chrome-headless-shell,下载源不通且无 linux-arm64 版
跨平台 macOS 验证过,Linux 应该能用 5 个 shell 脚本写死 #!/bin/zsh,建项目第一步就中止

自检脚本那 17 个误报值得单独说:脚本要求闪烁白名单以固定格式内联写在分镜表里,而样片的分镜表写的是「白名单见 AGENT_RAG_BUILD_RULES.md §8」,正则抓不到,白名单被读成 0 条,19 处合规闪烁全部标红。唯一那条真问题也很有意思 —— SC27 的代码帧区间比分镜表多 4 帧,注释写明是第二轮 QC 故意做的淡出重叠。也就是说:这条检查只能报「对不上」,不能判断「是不是有意为之」。

sed -i '' 是 BSD 语法,在 Linux 上会报 No such file or directory 然后中止。同一个问题也出现在仓库第 4 号 PR 里:有人在树莓派 5 上端到端跑通了一整条片,顺手把 zsh、BSD sed、ARM 上的 TTS 与系统浏览器配置一起修了,目前还没合入。

有意思的是它自曝的返工日志

仓库里最有价值的文件可能是 reference/lessons.md(199 行)。作者用这个 skill 拍了至少 4 部片,每踩一个坑就写一条根因,其中几条是自曝:

  • 样片自己不合格。 第 4 部片加入「持续动作」规则后,回头量化样片:4/6 镜头静止帧占 42%–72%、最长静止 2.8 秒,全部超过新规则。作者原话是「样片也有同样的毛病,所以『对标样片』筛不出它。」
  • 检测分级会骗人。 组级低分辨率检测 48/48 全部通过,成片复测却有 11 个镜头超限(3 个真静止、8 个只有小面积动作)。于是流程里写死了:成片复测才算判据。
  • 一个静默降级的 bug 藏了很久。 edge-tts 从 7.2.0 起默认不再返回词级边界,脚本拿不到词边界就退化成「按字数插值」估字幕位置。作者实测最大偏差 15 帧 —— 整块字幕晚半秒,并承认「这个洞在所有 edge 引擎的成片里一直存在」。

一个项目敢把自家样片的实测短板写进仓库,比任何宣传语都有说服力。

谁适合,谁别碰

先划清路线:这类需求和 OpenMontage 那种「121 个工具调云 API 出片」不是一条路 —— 后者靠生成模型要素材,它一帧都不用生成模型,全部代码绘制,所以任何一帧都能改、每个数字都能追到来源。另一条路是 Manim / Remotion 手写,它比手写多的正是那套流程和判据。

适合:做技术科普、课程、产品原理动画的个人或小团队,愿意花约 2 小时等一条 4 分半的片,并且看重「画面上每个数字都能溯源」。中文是一等公民,文档中文优先,还有独立的英文片配置。

不适合:想一句话出片的人 —— 它会在写文案前、配音前、定稿前、前 30 秒样片这四个节点停下来等你确认;要竖屏的人(模板与安全区全部按 1280×720 横屏);以及任何商业用途。

商业许可这条不是假设。项目用的是 PolyForm 非商业许可,商用需要作者单独授权,而仓库第 5 号 issue 就是一位教育自媒体在问商业授权怎么办理、是否支持多个账号、能不能改模板做竖屏 —— 截至今天,作者没有回复。

结论

三天 954 星、172 个 fork,说明「把内容变成讲得清楚的视频」这个需求是真实的。但它的价值不在自动化,而在它把一件靠审美的活儿拆成了可验收的工程步骤 —— 从 把审美纪律编译进 agent把方法论写成 skill,这条路数上的极端版本就是它。多数 AI 视频工具还停在「能不能生成」,它已经在回答「能不能验收」。

值得放进观察清单。但真正上手前,先把 zsh / sed 和默认 TTS 这两个动手就遇到的坑解决掉。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

华为云码道每天 1000 万 Token 免费拆解:积分怎么换算、两条硬限制、真实成本

华为云码道每天 1000 万 Token 免费拆解:积分怎么换算、两条硬限制、真实成本

每天 1000 万免费 Token,不用绑卡、不用拉新、注册就能用——这是华为云码道(CodeArts)「码力续航计划」8 月 18 日上线时打出的招牌。但到 9 月 12 日,这句话其实已经过期了:9 月 4 日 23:59 起,码道把计费单位从 Token 换成了「积分」,免费额度也跟着改名叫「每日签到 1000 积分」。

如果你打算薅这笔额度,有三件事得先弄清楚:1000 万 Token 和 1000 积分是不是同一件事、它能不能接到你自己的 Agent 里、以及它到底够你用多久。本文所有价格与规则截至 2026 年 9 月 12 日,以官网与客户端实际展示为准。

码道是什么:华为云的代码智能体,5 月底刚转商用

华为云码道(CodeArts)代码智能体是华为云的 AI 编码产品,官方定位是「集代码大模型、IDE、自主开发模式为一体」,主推规范驱动开发、代码库索引、专家 Skills、Agent Team 多智能体协作这些企业级能力。时间线大致是:2 月 11 日万人公测(当时接入 GLM-4.7 与 DeepSeek-V3.2),2 月 26 日公测版正式发布,5 月 30 日开启商用,9 月 4 日深夜切换到积分计费体系。

交付形态有五种:码道 IDE、JetBrains 系列插件、VS Code 插件、码道 CLI/TUI,以及桌面端。这一点比「网页版 AI 编程工具」重要——它意味着你可以把它装进现成的开发习惯里,而不是换一整套工作流。

免费额度地图:三个入口,只有一个是「每天」

截至 9 月 12 日,码道官方口径里的免费积分有三个来源:

  • 每日签到:1000 积分。有效期到 2026 年 12 月 31 日 00:00 为止的每个自然日都能领,官方写明自发放之日起 30 天内有效。
  • 新用户注册:4000 积分,30 天内有效,同样是到 12 月 31 日截止。
  • 学生认证:4000 积分,90 天内有效。
  • 另外体验版套餐本身自带 500 积分/月。

这里出现了第一处需要留意的信息错位。活动页(最近更新 9 月 2 日)仍然写着「每日 1,000 万免费 Token」「额度当日有效、0 点清零不累计」;而计费文档(9 月 11 日更新)已经把同一笔额度写成「每日签到 1000 积分、自发放之日起 30 天内有效」。同一个福利,两个官方页面给了两套有效期规则——旧约定是当天清零,新约定是 30 天。真要用,去控制台看自己账号里的到期时间,别信任何一篇二手教程。

另外,活动页口径还写着「第一期总池固定、先到先得,额度耗尽当期活动就结束」,官方称第一期总量价值 100 万元 Token,后续规划多期接续。也就是说这 1000 万/天并不是「永久长期有效」,而是一轮一轮的活动,随时可能换挡。

核心拆解:1000 积分到底值多少钱

这是整件事里最不透明的一环:官方从没正式公布过「积分 → Token」的换算表,只公布了模型的积分消耗系数。

但有两份官方材料可以交叉反推:活动页把同一笔福利写作「每日 1000 万免费 Token」,定价页把同一笔福利写作「限时每日领 1000 积分」。两者指向同一件事,反推口径约为 1 积分 ≈ 1 万 Token;再叠上官方表格里的模型系数(GLM-5.2 为 0.7、OpenPangu-2.0-Pro 为 0.7、OpenPangu-2.0-Flash 为 0.32,系数越高越费积分),用便宜模型时同样的 1000 积分能跑出更多 Token。这个换算是我根据官方页面推算的,不是官方文字承诺,请按这个前提看下面的账。

先看档位地图。个人版四档的价格与额度如下(月付/年付,年付为官方标价):

版本 月付 年付 套餐积分/月 会话并发 Agent 并行任务 知识空间 代码库索引
体验版 0 元 500 3 3 500MB 5 千文件
标准版 98 元 823.2 元 2000 5 5 5GB 5 万文件
高级版 198 元 1663.2 元 4000 5 5 5GB 5 万文件
旗舰版 498 元 4183.2 元 10000 5 5 5GB 5 万文件

企业专业版是 198 元/席位/月(年付 1980 元),每席位 2000 积分,可买 1~1000 席。积分包按个人版 ¥50/1000 积分(有效期 1 个月,只有标准版及以上能买,体验版买不了)。

把积分包折算成同行通用的「元/百万 Token」:¥50 买 1000 积分、1 积分约 1 万 Token,相当于 ¥5/百万 Token。而华为云自家 MaaS 平台直购同样模型的价格是:GLM-5.2 忙时输入 8 元、输出 28 元/百万 Token(闲时打 7 折,为 5.6/19.6 元),DeepSeek-V4-Pro 是 12/24 元,DeepSeek-V4-Flash 是 2/4 元,openPangu-2.0-Flash 是 0.2/0.8 元。

按输入输出 3:1 的编码场景混合估算,GLM-5.2 直购约 13 元/百万 Token,而码道积分包约 5 元——买积分包跑旗舰模型,比官网直购便宜一半以上;但如果你的活主要是便宜模型能干的(比如 DeepSeek-V4-Flash 混合约 2.5 元、openPangu-Flash 约 0.35 元),那积分包反而更贵,直购 API 更划算。

四个容易踩的隐藏成本

第一,额度出不了码道。 活动页 FAQ 原文写得很清楚:「额度仅限华为云码道平台内部消费,不支持导出到开源框架或者第三方产品。」也就是说,这笔免费额度不能变成 API Key 接到你自己的脚本、Claude Code、Cursor 或自建 Agent 里——想这么干只能用码道客户端里「自定义模型」的 BYO 通道,填自己的 API Key,且调用不消耗套餐积分,等于反过来:你自己的额度自己付钱。这一点与「免费模型 API」类活动(Cloudflare Workers AI、AMD Token Factory)是根本区别。

第二,体验版用完就断,且不能充值。 计费文档写得很直白:免费套餐(个人体验版)积分用尽后「不可购买积分包,不能继续发起请求」。付费档积分用尽同样要新购积分包才能继续调用。也就是说,签到额度烧完的那一刻,你的 AI 编码工具就当天下线了。

第三,高峰期排队,免费档优先级最低。 官方 FAQ 描述了三类排队提示:队列已满直接排队、高峰排队提示位次并建议「升级套餐享优先处理」、套餐额度用尽后请求进入排队。优先级顺序是旗舰版 > 高级版 > 标准版 > 体验版。加上体验版只有 3 个会话并发、3 个 Agent 并行任务、代码库索引上限 5 千文件——仓库稍大一点,索引本身就不够用。

第四,额度不够经花。 华为开发者论坛那篇《9 月 5 日更新计费模式》的帖子下,有用户回复称开通 98 元标准版后不到 2 小时就把积分(含体验额度)消耗完,感慨「不是大户真搞不起」。这条只是论坛个例、并非我的自测,但它和「1000 万 Token 够高强度编码一整天」的媒体口径形成了明显反差——真实分水岭在于你用不用 Agent 模式跑多轮工具调用。

和同行比,这笔免费额度算激进吗

国内的同类工具也在用积分制,但免费档的量级差距很大(各家积分定义不同,不可跨平台换算,只能看「免费档 vs 付费档」的比例):

工具 免费档 免费额度 付费最低档
华为云码道 体验版 0 元 套餐 500 积分/月 + 每日签到 1000 标准版 98 元/2000 积分
字节 Trae 国内版 Free 0 元 500 积分/月(全功能) Lite 49 元/2000 积分
腾讯 CodeBuddy 个人免费版 500 积分/月 月付 99 元(连续包月 70 元)
阿里 Qoder CN 免费档 2000 credits/月(5 月公告口径) 付费档另有配额

按这个比例算,码道免费档每天 1000 积分、一个月理论上能领到 30000 积分,是它自己 98 元套餐月额度(2000 积分)的 15 倍——免费/付费比例是目前几家国产 AI 编程工具里最激进的。这也解释了为什么它必须加两条限制:额度不能导出、不能累积成永久资产。

结论:值得薅,但别当作主力方案

判断很明确:

  • 适合谁:还没用过 AI 编码 agent 想零成本试水的开发者;偶尔用华为生态(鸿蒙、昇腾)开发的团队;把码道当第二工具、只在关键时刻切过去跑大任务的人。
  • 不适合谁:每天高强度跑 Agent 的重度用户(签到额度大概率撑不过半天,且体验版用完只能等次日);想把免费额度接进自建 Agent 流水线的工程团队(官方明确不支持导出);大仓库项目(体验版 5 千文件索引上限)。
  • 观望信号:官网口径里「每日签到」的截止日是 2026 年 12 月 31 日,到期后是续期、还是转成纯付费档,官方还没说;第一期活动又写明「额度耗尽当期结束」。所以这更像一个窗口期福利,而不是长期定价。

一句话:它确实是目前中文圈最容易被薅的 AI 编码额度,但薅之前先接受两个前提——只能在码道客户端里用,且用完当天就没得补

(价格、额度与活动条款截至 2026-09-12,积分模式与签到规则随时可能调整,下单或投入时间成本前请以官网与客户端实际展示为准。本文为独立评测,与文中厂商无利益关系,未接受任何形式的赞助或免费额度;本文未注册账号、未自购任何档位,积分换算为依据官方页面口径的反推,非官方数据。)

相关阅读:AMD Token Factory 全景拆解:每天 10 美元的免费大模型 APICloudflare 免费 AI 服务升级全景拆解Pi Agent 实测:默认只给模型 4 个工具的极简编码 Agent

关注 AI商业快讯,每天一篇 AI 热点深度解读。

UI UX Pro Max 深度评测:12.7 万 Star 的设计 skill,192 套配色全过 WCAG,中文关键词却 0 命中

UI UX Pro Max 深度评测:12.7 万 Star 的设计 skill,192 套配色全过 WCAG,中文关键词却 0 命中

用过 Claude Code 写页面的人都见过同一种丑:紫粉渐变、千篇一律的圆角卡片、emoji 当图标。这不能全怪模型——设计规则散在几百篇博客、几十份设计规范里,它不知道该照哪一套下手。

有个开源 skill 干脆把这件事做成了数据库:192 个行业的配色与设计推理、79 种可检索的 UI 风格、119 条 UX 准则,全部固化成本地 CSV,再配一个纯 Python 的检索引擎。项目名叫 UI UX Pro Max,12.7 万 Star,MIT 协议。

我在沙盒里把它整个拆开跑了一遍:30 次设计系统生成、160 个自带测试、全量 192 套配色的对比度验算,以及 10 个中文关键词的命中测试。结论比”又一个热门 skill”复杂一些。

它是什么:把设计规则做成可检索的数据库

一句话定位:给 AI 编码助手(Claude Code、Cursor、Codex、Copilot、Windsurf 等 19 个客户端)装一个本地设计智库。你正常提需求”给我做个 SaaS 落地页”,它自动触发,先查库生成整套设计系统,再写代码。

架构上是三层:

  • SKILL.md(约 16KB):Agent 读的行为契约,规定 10 个优先级类别、什么情况必须查库、什么情况必须跳过;
  • CSV 数据层:14 个数据文件,行业、风格、配色、字体、图表、动效、UX 准则、22 个技术栈的规则;
  • search.py 引擎:4,031 行 Python,只用标准库,不装依赖、不发网络请求,用 BM25 排序 + 条件规则做推荐。

跑一条命令就能看到它的核心产物——search.py "beauty spa" --design-system 会输出八段结构:页面模式(Section 顺序 + CTA 位置)、风格(含性能成本与无障碍风险标注)、完整十六进制配色(含 CSS 变量名)、字体搭配(含 Google Fonts 导入链接)、关键动效、明确的反模式清单、以及交付前自检表。

我逐文件数了一遍行数,和官方口径对照:

数据 官方口径 我实测
行业配色 / 设计推理 192 / 192 192 行 / 192 行
UI 风格 79 可检索(50 活跃) 88 行(50 活跃 + 29 补充 + 9 弃用)
字体搭配 / UX 准则 74 / 119 74 行 / 119 行
技术栈 / 栈内规则 22 / — 22 个文件 / 1,260 行
图表 / 落地页模式 / 图标 25 / 34 / 105 25 / 34 / 105

没有注水。这点值得说一句:同类项目里,”宣称 100+ 工具、实际能跑的只有三成”是常态,这里每一个数字都对得上。

实测:数据是真功夫,工程链路是另一回事

一、470 毫秒,且逐字节可复现

我连续生成 30 次设计系统,总耗时 14.1 秒,平均 470 毫秒一次,全部在离线沙盒里完成。同一参数跑两遍,输出文件逐字节一致——因为它是确定性检索,不是让模型自由发挥。对流水线来说是好事:同样的需求,今天和明天给出的配色不会漂移。

二、自带测试全过

这是我最看重的一项。我直接跑仓库自带的测试套件:

160 passed, 7936 subtests passed in 30.47s

另外 validate_data.py 校验 12 个领域文件 + 22 个技术栈文件 + 推理表,全部 OK。一个”数据即产品”的项目,能把数据校验和测试做到这个程度,是它 12.7 万 Star 里最扎实的那部分。

三、61% 的文件永远不会被打开

我把 SKILL.md 和 README 里文档化的 18 条命令全跑一遍,并用一个 open() 钩子记录脚本读过的每个文件:

  • 技能安装目录共 73 个文件 / 3.41 MB;
  • 全部文档化命令加起来只打开 17 个文件(1.34 MB,39% 的字节);
  • 剩下 56 个文件、2.07 MB,脚本从不打开——其中 31 个是测试脚本和它们的夹具,会被一起装到用户磁盘上(npm 包里的 assets/scripts/tests 是 23 个文件、307 KB)。

这不是我一家之言。9 月 3 日有位开发者提交了一份 200 次运行的审计(issue #484),测得 82% 的文件从不被触及,还顺带发现 --design-system静默忽略 --stack 参数。维护者 9 月 6 日合并了修复,只修了第一条:我在当前主分支上实测,现在会打印一行 note: --stack nextjs is ignored in --design-system mode

但这里有个更现实的坑,见下一条。

四、中文关键词,一个都查不到

数据层全是英文关键词。我拿 10 个中文词直接查,结果是这样的:

查询词 命中 英文对照 命中
玻璃拟态 / 深色模式 0 glassmorphism / dark mode 1 / 1
落地页 / 仪表盘 0 landing page / dashboard 1 / 2
金融科技 / 电商 0 fintech / e-commerce 0 / 1
美容院 / 医疗 0 beauty spa / healthcare 1 / 1

中文查询返回的不是”空值”,而是明确的 count: 0——引擎会提示”这不是匹配到了空字段,是查询没命中数据库”。更实际的影响在设计系统模式:"美容院 落地页" 落到通用兜底(Minimalism & Swiss Style + 蓝色 #2563EB),而 "beauty spa" 给出的是 Soft UI Evolution + 粉色调 #EC4899。

但这不等于中文用户用不了。 真实链路里是 Agent 读英文的 SKILL.md,它自己会把你的中文需求翻成英文关键词再去查——中文圈已经有大量教程和实测(知乎、腾讯云社区、CSDN、B 站,还有一个 1.4k Star 的第三方中文教程站)。真正会踩坑的是”手敲中文命令当 CLI 用”的人。

五、192 套配色,全部通过 WCAG

我把 192 套配色的所有关键配对算了对比度(正文前景/背景、按钮主色/按钮文字、强调色/文字),违规 0 套——全部达到 4.5:1。这解释了它为什么敢把”对比度 4.5:1″写成第一条铁律。

顺带一个有意思的数字:192 套里 32 套(17%)主色落在紫粉色相区间,主要集中在 AI 产品、创意机构、美妆、游戏这些品类。而它的推理表里有 14 个行业明确把”AI 紫粉渐变”写进反模式清单——我逐一核对,这 14 个行业自己的推荐配色都不是紫粉。规则和它自己给的结果,内部是自洽的。

六、版本链路:npm 上停着一个月前的代码

它的 CLI 走 npm,这里有两处实打实的问题。

第一,主包一个月没发新版。 ui-ux-pro-max-cli 最新版 2.15.0 发布于 8 月 13 日,而仓库主分支已经走到 9 月 10 日。仓库里有两个未关闭的 issue(#451、#457)说明原因:8 月 18 日起发布流水线因 NPM_TOKEN 被拒而失败,”自 2.15.0 之后什么都没发出去”。我把 npm 包下载下来实测:npm 版至今仍在静默忽略 --stack,主分支已修的那个提示,装 npm 包的用户拿不到。上周仍有 12,882 次下载。

第二,有个 1 月的旧包还挂在 npm 上。 老包名 uipro-cli 停留在 2.2.3(2026 年 1 月 29 日),每周仍有 4,162 次下载;装它的人会遇到 --global 报错的 bug(issue #215,3 月 29 日开的,21 条评论至今未关)。README 里明写”旧包已废弃,不要用”,但 npm 上并没有把这条路堵死。

还有个小的:官网 uupm.cc 至今写着 57 种风格 / 95 套配色 / 8 个技术栈——数据已经涨到 79 / 192 / 22 了。开源核心之外它还有付费版(品牌、Logo、CIS、演示文稿设计),但官网没有公开价格页。

它和同类比,适合谁

市面上”治 AI 味”的设计 skill 大致两条路线:

  • 提示词/规则路线:taste-skill(84k Star)和 hallmark(28k Star,Anti-AI-slop)走的是这条路——把审美纪律写成规则塞进 Agent。轻、灵活,但覆盖面和一致性取决于模型当场发挥。
  • 数据工程路线:UI UX Pro Max 是这条路——先查库、再生成,配色/字体/对比度有确定答案。

适合:独立开发者、后端转前端、MVP 阶段要快速做出”不像 AI 生成”的界面的人;以及需要一套可复用的设计 token(它能 --persist 把设计系统落成 MASTER.md + 页面覆盖文件,下次直接读文件)。

不适合:已有成熟设计系统的团队(它的建议会和你的品牌规范打架);只做后端/DevOps 的人(技能自己也会跳过);以及期待”它直接替代设计师”的人——它解决的是”下限太低”的问题,不是”上限”。

结论

值得一试,而且是我近期读过的 Agent Skill 里工程底子最厚的一个:数据不注水、测试全过、配色真的过 WCAG、离线可复现。它的短板不在能力,在”发货”——npm 包落后一个月、旧包名还在分流、包体里塞着用户永远用不到的测试脚本,以及一套只认英文的关键词库。

装的时候认准新包名:npm install -g ui-ux-pro-max-cli && uipro init --ai claude。看到 uipro-cli 请绕开,那是 1 月的版本。

如果你也在用 Agent 写前端,可以顺便看看我们评测过的 Pi Agent(10.4 万 Star,默认只给模型 4 个工具)和 ECC(25.5 万 Star 的 Agent 工程纪律系统),都是同一类问题的不同解法。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

月之暗面冲刺 20 亿美元年化收入:Kimi K3 两个月把 ARR 从 3 亿拉到 10 亿,同期被 Anthropic 指控蒸馏

月之暗面冲刺 20 亿美元年化收入:Kimi K3 两个月把 ARR 从 3 亿拉到 10 亿,同期被 Anthropic 指控蒸馏

9 月 11 日,彭博社援引知情人士的说法:月之暗面(Moonshot AI)告诉投资人,公司内部预测今年年底把年化收入(ARR)做到 20 亿美元。而在 6 月,这个数字才 3 亿美元左右——8 月它刚刚突破 10 亿美元。两个月翻三倍,再给四个月,目标是再翻一倍。

同一周,另一条来自美国的消息:Anthropic 在 9 月 10 日发布的威胁情报报告里写道,Kimi 曾把近 30 万条用户请求转发给 Claude 处理,再把 Claude 的回答当作自家模型的回复交给用户。

一条是收入曲线,一条是技术来源的指控。它们指向同一个问题:Kimi K3 这一年的爆发是怎么来的,又能持续多久。

从 3 亿美元到 20 亿美元,靠一个 7 月发布的模型

彭博社的报道给出三个数字:6 月 ARR 约 3 亿美元,8 月突破 10 亿美元,年底目标 20 亿美元。过去几个月是这条曲线最陡的一段,而它对应的产品是 7 月 17 日发布的 Kimi K3。

时间 年化收入(ARR)
2026 年 4 月 约 2 亿美元
2026 年 6 月 约 3 亿美元
2026 年 8 月 突破 10 亿美元
2026 年底(公司内部预测) 20 亿美元

作为参照,彭博社 8 月报道 OpenAI 的年化收入已突破 400 亿美元,Anthropic 达到 650 亿美元。月之暗面即便兑现 20 亿美元目标,也只有 Anthropic 的三十分之一左右。但别忘了一件事:它是一家把模型权重免费开放出去的公司,靠卖调用赚钱。

K3 是怎么把曲线掰弯的

K3 是一个 2.8 万亿参数的 MoE 模型,896 个专家中每个 token 激活 16 个,用自研的 KDA 混合线性注意力(Kimi Delta Attention)与注意力残差技术搭建,原生支持视觉理解,上下文窗口 100 万 token。官方博客对自己的评价相当克制:整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但稳定超过其他所有模型。7 月 27 日前完整权重对外开放,这是全球第一个达到 2.8 万亿参数规模的开源模型。

钱从三个口子进来:消费者订阅、API 调用、企业部署。总裁张予彤 7 月 18 日说,K3 发布后企业 ARR 出现数倍增长。而 K3 的定价本身就是个信号:输入(缓存未命中)每百万 token 20 元、输出 100 元,约合 3 美元和 15 美元。这个价格在中国模型里算「轻奢」,是上一代 K2.7 Code 输入价的 3 倍,但仍远低于美国旗舰闭源模型。

开放权重加上这个价位,换来的是用量:OpenRouter 上的数据显示,K3 每天生成的 token 最高达到 3000 亿。不过 TechCrunch 也补了一句——最近几个月 K3 的用量略有下滑。

更大的想象空间在海外。路透社 8 月 26 日报道,月之暗面正在与微软、亚马逊、谷歌谈判分成协议,希望拿到 K3 在 Azure、AWS 和 Google Cloud 上所产生收入的最高 30%。如果谈成,这将是中国 AI 公司第一次与三家美国云巨头签下这种规模的收入分成,本质上是把自己的模型放进对方的云货架。

同一周,Anthropic 说它「偷师」

9 月 10 日,Anthropic 发布了今年以来最详细的一份威胁情报报告。报告称,过去七个月里有 7 家中国实验室在绕过防护、提取 Claude 的能力,手法包括代理网络与批量假账号,目标是 Claude 最值钱的几项能力:Agent 与工具调用、编码与数据分析、逻辑推理。

关于月之暗面的部分最为具体:Anthropic 称其在 5 月到 7 月间,用数千个假账号与 Claude 完成了超过 2340 万次交互,其中一个案例是把近 30 万条 Kimi 用户的请求直接转给 Claude Opus 代答,再把回答返回给 Kimi 用户;DeepSeek 在 7 月的 14 天里有 1210 万次;阿里巴巴相关活动的交互量超过 1.51 亿次。报告还称,这些被转发的请求里包含来自中国和俄罗斯政府、军方的敏感数据。

这不是 Anthropic 第一次开火。今年 2 月它就用几乎相同的措辞点名过 DeepSeek、月之暗面与 MiniMax,当时的数字是 2.4 万个假账号、1600 万次交互。Anthropic 的口径是:蒸馏技术本身合法,违规的是未经授权、用假账号绕过防护去批量提取。截至发稿,月之暗面没有就这份报告公开回应。

美国内部也不一致。9 月 11 日,Y Combinator CEO Garry Tan 在 CNBC 上说,他会「什么都不做」——理由是前沿模型本身就是吃公开人类知识训练出来的,获取强大 AI 的能力「应该是一种公共品」,美国该做的是让自己的开放权重模型追平,而不是去堵蒸馏。

500 亿美元估值,参照物是刚上市半年的智谱

彭博社同时披露,月之暗面正以 500 亿美元估值融资,并称这一估值与智谱当前的市值大致相当。回头看这条路,涨得比收入还快:

时间 估值与事件
2025 年底 约 43 亿美元
2026 年初 完成约 7 亿美元融资,估值约 100 亿美元
2026 年 3 月 传按约 180 亿美元估值募资
2026 年 7 月 完成 35 亿美元融资,随后启动 Pre-IPO 轮
2026 年 9 月 Pre-IPO 轮目标估值 500 亿美元

智谱今年 1 月 8 日登陆港交所,发行价 116.2 港元,首发市值约 528 亿港元;6 月 22 日盘中最高冲到 2980 港元,市值一度触及 1.33 万亿港元;到 9 月 11 日收在 793 港元,总市值约 3690 亿港元(约 470 亿美元),较 6 月高点回撤超过七成。MiniMax 上市首日大涨 109%,如今市值约 1020 亿港元。两家已上市公司 2026 年上半年收入体量接近(9.54 亿元人民币对 1.17 亿美元)、经调整净亏损几乎一样(都在 19.6 亿元上下),资本市场给的定价却差了近 4 倍。

这组数字说明两件事。第一,港股给中国大模型的定价早就跑在收入前面:智谱按上半年收入年化计算,市销率在百倍以上;月之暗面按 20 亿美元目标收入算,500 亿美元估值对应约 25 倍。第二,这种估值的涨和跌都不讲道理——智谱从 116 港元到 2980 港元用了五个月,从 2980 港元回到 793 港元只用了三个月。

价格战的另一面也在同时发生。9 月 10 日,DeepSeek 把 V4.1 Flash 又降了一档:非高峰时段缓存命中输入每百万 token 0.02 元、未命中 1 元、输出 4 元。算下来,DeepSeek 的输出价大约是 K3 的 1/25。中国模型市场正在同时打两场仗——一场是 DeepSeek 式的地板价抢用量,一场是月之暗面式的「最强开源模型卖溢价」。

IPO 的时间表也在推进。9 月初,月之暗面以保密形式向港交所递交 A1 文件(晚点 LatePost 报道,华尔街日报随后证实);南华早报 9 月 10 日报道称公司还在考虑香港、上海双重上市,最快 2027 年一季度挂牌,但也有知情人士回应「双重上市」消息不实。彭博社的说法更快:最快可能今年就在香港上市。

判断

20 亿美元对月之暗面来说不是技术问题,是渠道问题。K3 已经把能力做出来了,剩下的三件事决定这条曲线能不能画完:开放权重能不能换来足够多的付费调用,与微软、亚马逊、谷歌的分成谈判能不能落地,港股窗口能不能赶上。这三件事里任何一件卡住,估值曲线都可能像智谱那样掉头——而 Anthropic 报告里的那些数字,会成为美国监管动手时现成的素材。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读: