context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

用过 Claude Code、Cursor 这类 AI 编程工具的人,大概都撞过同一堵墙:会话跑着跑着,AI 开始「失忆」——忘了在改哪个文件、忘了进行到哪一步。不是模型笨,是上下文被工具输出吃光了。一次 Playwright 页面快照 56 KB,20 条 GitHub issue 59 KB,一条访问日志 45 KB,官方说半小时就能烧掉 40% 的窗口。今天评的这个项目反着来:不压缩数据,干脆别让脏数据进门。mksglu/context-mode,21k★,官方基准把 315 KB 工具输出压成 5.4 KB(省 98%),npm 累计下载 51.5 万,登过 Hacker News 榜首(570+ 分)。

它做了什么:在工具输出和上下文之间,加一道沙箱闸门

context-mode 是一个 MCP server + 插件套件,支持 18 个客户端——Claude Code、Cursor、VS Code Copilot、Codex CLI、Gemini CLI、Kimi、Qwen Code 等全在列,还挂 OpenClaw 网关。核心免费(ELv2 source-available),作者是伦敦 MKSF LTD 的 Mert Köseoğlu,2026-02-23 创建仓库。

它的思路和「压缩派」相反:LeanCTX 那类工具是等上下文满了再压缩重写,context-mode 是在源头拦截——模型每次调工具,钩子先截住,把命令丢进独立子进程沙箱执行,只有 stdout 进窗口。四个板斧:

板斧 机制 效果(官方口径)
沙箱路由 ctx_execute/ctx_execute_file 隔离执行,12 种语言运行时,>100KB 输出自动入索引只回指针 56 KB 快照 → 299 B
会话记忆 编辑/git/错误/用户决定实时写 SQLite FTS5,compact 后按 BM25 检索回填 治「压缩后失忆」
Think in Code 让模型写脚本算完再 console.log,而不是读 47 个文件进窗口 700 KB → 3.6 KB
不强制话术 不逼模型说人话,引 Moonshot 研究指 aggressive brevity 会降 benchmark 与输出纪律派划界

工具设计上有个反直觉点值得单独说:它把「分析」和「读」拆开了。以前模型要 grep、要 Read 一堆文件进上下文自己数,context-mode 逼它写段脚本在沙箱里数完只报结果——一次调用顶十次工具调用。hooks 能程序化拦截的平台(Claude Code 等)实测合规率约 98%;没 hooks 的 Zed 之类只能靠指令文件,作者自标约 60%。

仓库实证:6.5 个月、169 个版本、51.5 万下载

我 clone 了仓库全量核实(599 个文件):创建于 2026-02-23,6.5 个月冲到 21,024★ / 1,524 fork;HEAD 提交停在 2026-09-07 中午(写稿前一天还在推),版本号 v1.0.169。npm 侧数据能对上徽章:累计下载 515,145,5 月冲到单月 12.3 万的峰值,9 月第一周仍有 1.6 万。发布节奏极快——223 个 npm 发布记录,6.5 个月 169 个版本,约每天一个。

它的流量故事也清楚:2 月 25 日 Show HN 拿了 84 分,三天后作者博客长文直接登 HN 榜首 570+ 分、30 条讨论,之后 5 月下载量二次冲高。官方 BENCHMARK.md 给了可复现的 fixture 基准(21 个真实工具输出场景,非合成数据):总计 376 KB → 16.5 KB(省 96%),其中结构化数据处理那组 315 KB → 5.5 KB(省 98%),代码示例 100% 保真——文档类内容是精确检索不是摘要,125 个测试全过。

必须说明口径:以上基准是官方自测,我没有装进真实 Claude Code 会话复测(评测基于仓库 clone、官方 benchmark 与公开数据);Insight 付费分析层($20/座/月)也未购买,不评。

争议与边界:五个要自己掂量的坑

① npm 渠道已停更约 10 周。 最新版 1.0.169 在 npm 上停在 6 月 29 日,但仓库日更——分发明显迁到了 Claude Code 插件市场 + 自带的 ctx_upgrade 直拉 GitHub。从 npm 直接装可能拿到旧版,装完记得跑 ctx_upgrade。

② 用户数口径混乱。 GitHub 徽章自称 54.6 万用户,Insight 官网却写「331,200+ 开发者」——两处自报数字对不上;npm 累计 51.5 万下载可核实,量级可信,但「用户」的定义存疑(下载≠活跃)。

③ ELv2 不是 OSI 开源。 能 fork 能改能内部用,但禁止打包成托管 SaaS 转售、禁止删许可声明。作者明说选它就是为了防 MIT 被套壳——个人和公司内部用无碍,想基于它做生意的绕道。

④ 沙箱是进程边界,不是 OS 隔离。 作者自己在文档里承认:ctx_execute 跑的是任意代码且继承进程文件系统权限,「批准执行 = 批准任意代码」,#852 号 issue 就修过借 MCP 沙箱逃逸宿主读文件限制的漏洞。要配宿主层沙箱双保险,别裸奔。

⑤ 上手摩擦不小。 它激进地拦截 curl、裸 Read、grep 等常规操作逼你走沙箱——CLAUDE.md 里一长串「BLOCKED」清单。习惯「先想再写代码」的老手觉得爽,新手会觉得被管头管脚。另 214 个 open issues、无 hooks 平台只有 ~60% 合规、Codex 的 PreToolUse 只能拒绝不能改写参数(上游限制)。

坐标系与结论:省 token 正在从「压缩」走向「拦截」

站内评过这条赛道的几个代表:LeanCTX(压缩派,Rust 重写省 86% token)、Caveman(输出纪律派,砍 65% 输出 token)、flowctx(OpenClaw 上下文引擎,砍 56%)。context-mode 站在输入侧——它不动你的输出风格,甚至引用研究反对 Caveman 式的激进话术压缩,只管「什么数据能进窗口」。三种思路其实互补:输入拦截 + 输出克制 + 事后压缩,叠起来才是完整解。

适合:接了 Context7 / GitHub / Playwright 一堆 MCP 工具的重度用户、长会话多任务协作、被 compact 失忆反复折磨的人——尤其 Claude Code 用户,插件市场一条命令装完,10 分钟能见效果。不适合:轻度用户、不想改变工具习惯的人、必须在无 hooks 平台上要强约束的团队。

我的判断:上下文治理从「压缩」走向「源头拦截」是个真趋势,context-mode 是这条路上工程化最完整的选手——6.5 个月 169 个版本、18 客户端、HN 榜首、安全文档写得比多数商业软件诚实。免费层功能完整,值得装来试试;想省钱先看懂它的路由哲学,比装十个省 token skill 都值。相关阅读:LeanCTX 实测(压缩派)Caveman 实测(输出纪律派)flowctx(OpenClaw 上下文引擎)

关注「AI商业快讯」,每天一篇 AI 热点深度解读。(本文基于 2026-09-08 仓库快照与公开数据独立评测,与项目方无利益关系;Insight 付费层未购买、不构成推荐。)

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

白嫖党关心的问题永远只有一个:Cloudflare 的免费额度,到底够干什么?中文圈给出的答案相当诱人——掘金上流传最广的教程写着,Vectorize 免费额度”支持 500 万向量、每月 300 万次查询”。这个数字让很多人以为捡到了宝。但翻开 Cloudflare 官方定价文档一算,完全是另一回事:免费层只够存 6,500 条 768 维向量(约等于 5M 维度 ÷ 768),和”500 万”差了三个数量级。这篇不吹不黑,把 Vectorize 与 Workers AI 两个免费服务的真实额度算清账,顺便盘点它们最近一年到底”升级”了什么。

免费额度两年没动,动的是”上限”和”模型目录”

先说结论,可能和你的体感相反:两个核心免费额度,两年多没涨过一分钱

Vectorize 免费层(每月 3000 万查询维度 + 500 万存储维度)2024-09 定下至今未变;Workers AI 每天 10,000 Neurons(神经元,Cloudflare 的 AI 算力计费单位)更是 2024-04 上线时就是这个数,2026-08 的最新定价文档依旧如此。

真正的升级发生在别处(额度单位不变,但同样的钱能买到更多):

  • 索引容量上限:单索引最多 500 万向量 → 2026-01 翻倍到 1000 万 → 2026-08 的 limits 文档已显示 2000 万向量(架构上限,与免费存储额度是两码事,后面细说)
  • 模型目录:从早期几十个小模型扩到 50+,2026 年密集上新——Kimi K2.6/K2.7 Code(1 万亿参数级)、GLM-5.2/5.3、DeepSeek-V4、Gemma 4 26B、NVIDIA Nemotron-3、FLUX.2 生图全家桶
  • 工程体验:2026-02 起 OpenAI 兼容 API 的 tool calling 全面修 bug(多轮函数调用终于不抽风);2026-03 上线 prompt caching(缓存输入价格仅为原价 1/30-1/90)与异步批量 API
  • 周边额度:KV 免费层 2026-02 提升(读 10 万次/天 + 1GB);Workers 代码包体积 2026-09 从 3MB 放宽到 64MB——之前塞不进 Worker 的大依赖,现在可以了

一句话:Cloudflare 走的是”额度冻结、内容升值”路线——每天同样的 10,000 Neurons,2024 年只能玩 7B 小模型,2026 年能碰 1T 级开源前沿。但坏消息是,额度没涨的同时纪律在收紧(见第四节)。

Vectorize:额度按”维度”算,不是按”条数”算

Vectorize 免费额度难懂,是因为它的计量单位不是”向量条数”,而是向量维度数(stored dimensions / queried dimensions)。一个 768 维的向量,就消耗 768 个存储维度。

免费账本:5,000,000 存储维度/月 + 30,000,000 查询维度/月(官方定价文档,2026-04 更新,链接)。除以维度,真实容量如下:

嵌入模型(维度) 免费可存向量数 备注
bge-small(384 维) ≈ 13,000 条 英文轻量场景
bge-base / base-zh(768 维) ≈ 6,500 条 中文常用档
bge-m3 / qwen3-embedding(1024 维) ≈ 4,880 条 多语言/长文本
OpenAI text-embedding-3(1536 维) ≈ 3,255 条 外部模型需自调 API

查询侧公式是(月查询次数 + 存量向量数)× 维度 ≤ 3000 万。存 5,000 条 768 维向量的索引,每月约可查 3.4 万次,折合每天 1,100 次左右——个人博客语义搜索、几百页文档的私有知识库、MVP 验证,完全够用。这也是 Cloudflare 官方明说的定位:免费层永远支持”原型和实验”。

超了也不贵(这才是 Vectorize 真正的杀手锏):官方示例,5 万条 768 维向量 + 每月 20 万次查询,约 $1.94/月,前 10M 存储维度与前 50M 查询维度甚至直接包含在 $5/月的 Workers Paid 里。对比 Pinecone 最低 $50/月起步,差距是数量级的。

Workers AI:10,000 Neurons/天到底能干什么

Neurons 按 GPU 算力成本折算——模型越强,单价越贵,免费额度能跑的次数越少。这也是”有人说够用、有人说一小时烧光 12%”吵翻天的原因:两人用的是不同模型。按 2026-08 官方模型价格表换算:

模型/用途 单价(输出) 每天 10,000 Neurons ≈
Embedding(bge-m3 等) ~1,075 Neurons/M tokens 近千万 token,建库不是瓶颈
Whisper 语音转写 ~41-47 Neurons/分钟 约 4 小时音频
FLUX.1-schnell 生图 ~10 Neurons/步 200+ 张图
llama-3.2-1b(小模型) ~18,252 Neurons/M tokens 500-1,000 次对话(每次 500 输出 token)
gemma-4-26b / qwen3-30b ~27,000-30,000/M tokens 约 700 次
gpt-oss-20b ~27,273/M tokens 约 700 次
Kimi K2.6 / K2.7 Code / GLM-5.3 ~360,000-400,000/M tokens 只有 50-70 次

看懂这张表,就知道正确用法是分层:批量分类、改写、embedding 全部走小模型;Kimi K2.6 这类前沿模型只留给关键推理步;多轮 agent 会话加 x-session-affinity 头吃 prompt cache(缓存输入单价只有原来的 1/30-1/90,Neurons 直接省一个量级)。纯免费栈跑通一个带 AI 检索的个人应用,Reddit 上 2026-06 已有人验证可行。

三个真实的坑

① 模型目录滚动淘汰:2026-05-30 一次性下架 17 个旧模型——gemma-3-12b、llama-3.1-8b 全系、mistral-7b、phi-2 都在列;kimi-k2.5 被自动别名到价格更高的 k2.6。代码里写死的模型 ID 会直接 404,dashboard 用量也可能莫名上涨。

② 免费层超限即停:免费额度打满后请求直接失败(Free 无自动计费),要超用必须升 $5/月 Workers Paid。2026-09-01 起 D1(SQLite 数据库)免费层已改为超限直接失败——以前”超一点还能跑”的宽松时代结束了,Vectorize 同理。

③ 前沿模型限流很紧:Kimi K2.6/GLM-5.2 等只有 20 rpm(充值 AI Gateway credits 可到 50 rpm);另外免费额度 UTC 0 点重置后偶发 error 4006 误报超限(2026-09 社区仍有人中招),遇到重试即可。embedding 模型选型时也注意:索引维度定死后中途不能换模型,否则要重建索引重灌数据。

与同类对比:免费向量库中 Vectorize 的 5M 维度 ≈ 6,500 条(768 维)比 Pinecone 免费层(单索引 100 向量级)慷慨得多;但要存几十万条以上还是得上付费云或自建。Workers AI 免费额度做 demo 富余、做生产不足,定位是”Workers 生态的拼图”——它的真正价值不是省钱,而是向量库、embedding、推理、对象存储(R2 10GB 免流量费)全部在同一生态内,零 API key 管理,全球 300 城边缘分发。适合:个人站语义搜索、私有知识库 MVP、已在 Cloudflare 部署的全栈应用。不适合:亿级向量生产库、要求 10ms 级延迟的实时推荐、以及重度依赖前沿模型每日推理的业务。

总评:免费层是当下个人开发者做 AI 应用性价比最高的起点——额度对”几千条文档、每天千次查询、混合使用小模型”的量级绰绰有余,超出后的付费价格又便宜到可以忽略。真正的成本是维护:模型下架要跟进、额度上限要按维度盯着算。别信”免费 500 万向量”的教程,信自己的除法。

(额度与价格截至 2026-09-08,以 Cloudflare 官方定价文档为准。本文为独立评测,与 Cloudflare 无利益关系,未接受任何形式的赞助或免费额度;文中核算基于官方公开文档,未自购套餐跑真实负载。)

相关阅读:10 美元买 70 美元额度?CommandCode GOAT 订阅拆解 | 实测 9 款 Token 节省工具横评 | 谷歌 Gemini 视频开关:号称砍 88% token 实测翻车

关注 AI商业快讯,每天一篇 AI 热点深度解读。

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

同时订阅着 Claude Code、Codex、Kimi 的人,多半撞过同一堵墙:订阅费交着,真正干活的却只有一个模型;想换模型得手动切配置,调 Agent 的时间比写代码还长。

开源圈有个项目专治这个。装上它敲一个命令,Claude、GPT、Kimi、GLM 会自己组队把活干完——任务不结束不撒手。它叫 oh-my-openagent(社区简称 OmO),9 个月冲到 68.8k Star、npm 下载 380 万次,还因为太「越狱」,成了被 Anthropic 点名封禁的导火索。

OmO 是什么:把「一个 AI」升级成「一支开发团队」

一句话定位:OmO 是跑在开源编码工具 OpenCode 之上的多模型 Agent 编排系统,把单个 AI 助手变成一支能并行协作、彼此通信的开发团队。

它原本叫 oh-my-opencode,2025 年 12 月创建后一路暴涨;今年 5 月改名 oh-my-openagent,从「OpenCode 专用插件」重构为多 harness 体系——Codex CLI(Light 版,npx lazycodex-ai install)、Senpi 都已接入,路线图还排着 Pi 和 Claude Code。装上后你会得到:

Agent 角色 干的活 反差点
Sisyphus 主指挥官 拆解任务、派活给专家、盯到完成 默认可跑 Claude/Kimi/GPT/GLM 任选
Hephaestus 深度执行者 领了任务自己探索代码库干完,不回头要你当保姆 故意用「被大厂封杀后」的模型
Prometheus 战略规划师 动代码前先访谈式提问、定范围写计划 先问后写,防「理解错就开干」
后台专家群 Oracle/Librarian/Explore 并行调研、查资料、探代码库 5+ 个同时跑,上下文互不污染

核心反直觉点:Sisyphus 派活时不指定模型,只指定工种——前端、深度调研、快速修 bug、硬核架构。系统自动把工种路由到最合适的模型,比如「ultrabrain」类硬骨头任务默认交给 GPT-6 Astra max。作者的原话是:模型每个月都在变便宜变聪明,没有任何一个供应商该成为天花板。

实测证据:9 个月 68.8k★,两周发 30 个版本

先看硬数据(截至 2026-09-08):仓库 68,796★ / 5,650 fork / 955 open issues,2025-12-03 创建,9 个月涨到 6.9 万星;最新版本 v5.0.0-beta.48 于 9 月 7 日发布——而 8 月 24 日的文档快照还停留在 beta.18,两周发了 30 个 beta;我克隆仓库时(今天上午),它还在合并当天的新 PR。npm 官方 badge 显示累计下载 3.8M

OmO 有个罕见的「奇观」:它的维护者本身是一个 AI——跑在 OpenClaw 深度定制版上的助手 Jobdori,开发全程在 Discord 直播(Building in Public)。仓库根目录的 CLAUDE.md 用全大写写着铁律:任何触碰 OpenCode/Codex 组件的改动必须跑 QA 并把证据写入 .omo/evidence/,「没有证据文件 = 没有 QA = 不许提交」。一个 AI 维护的仓库,对「自己人」的纪律要求比大多数人类团队还狠——仓库里 64 个 SKILL.md、近 14 万行文档就是这么攒出来的。

再说它最出圈的「封禁事件」,时间线如下:

  • 2026 年 1 月 9 日深夜,Anthropic 更新政策:Claude Code 订阅($100–200/月)不得用于第三方 harness,OpenCode 用户大量中招,有人账号直接被 ban;
  • Hacker News 当天炸出 625 分、513 条评论;DHH 公开炮轰:「Anthropic 故意屏蔽 OpenCode 和其他第三方 harness,偏执地想把开发者锁进 Claude Code」;
  • OmO 自认是导火索,README 直接写「Anthropic 因为我们屏蔽了 OpenCode」,还把自家深度执行 Agent 命名为 Hephaestus(希腊神话里被众神抛弃的瘸腿铁匠)——故意的反讽;
  • 今年 5 月 TheNewStack 以「为什么 15.7 万开发者用 OpenCode 对冲 Anthropic」为题做了报道,生态裂痕已成明牌。

社区反馈(转述自 README 与 X,未经本站实测):有人用它一天清掉 8000 条 eslint 警告;有人一夜把 4.5 万行的 Tauri 桌面应用改造成 SaaS 网站;也有人直接取消了 Cursor 订阅。这类「多模型组队」叙事真实度如何,建议装 Light 版亲自跑一个任务验证。

局限也摆出来:① 许可证是 SUL-1.0(可持续使用许可),不是 OSI 认证的开源协议,商用场景先读 LICENSE 再部署;② 匿名遥测默认开启(可用环境变量关闭);③ v5 多 harness 重构进行中,CLAUDE.md 自己都警告「结构不稳」,beta 高频迭代意味着升级可能破坏配置;④ 955 个 open issues 挂着,主力生态是 OpenCode,想配 Claude Code 原生还得绕路。

同类怎么选:它跟官方、跟 OpenClaw 派的区别

  • Claude Code 官方:$200/月全家桶,Agent Teams 也已上线,但模型被 Anthropic 一家锁死;OmO 的路子是——订阅便宜的 ChatGPT $20、Kimi Code $19 或 GLM $10,让它们组队跑,总成本远低于一个 Max 订阅;
  • Codex CLI:OmO 的 Light 版就是把 rules、ultrawork 等组件移植进 Codex 插件体系,Claude 党与 OpenAI 党都能用;
  • OpenClaw 系(站内评过的 flowctx 上下文引擎是它的组件):另一派开源 harness,主打模型自由与本地化;OmO 更强调「多供应商编排 + 团队协作 + 玩法激进」;
  • deer-flow 等长任务 SuperAgent:学术研究向的长时任务,跟 OmO 的「日常开发加速」定位不同。

适合谁:多模型党、被订阅墙卡住的 Claude Code 重度用户、喜欢围观 AI 组队干活的尝鲜派。不适合谁:要开箱即用绝对稳定的人、公司合规敏感的团队(SUL 协议 + 遥测默认开都要评估)。

结论:值得一试,但把它当「风向标」看

我的判断:值得一试——先从 Codex Light 版(或 OpenCode 版)装起,跑一个小任务感受「组队干活」和单 Agent 的差别,再决定要不要上 Team Mode。不必把它神化:它本质是把「多模型编排」这个趋势做成产品的先行者,beta 血统决定了它适合玩,不适合当生产环境的唯一依赖。

OmO 真正的信号意义在于:当开源社区开始用「编排」绕过「订阅墙」,AI 编程工具的竞争就从模型参数转向了生态开放度。这事跟 OpenAI 切断 Cursor 合作(站内旧文)是同一条主线,而比纯上下文优化(flowctx 实测)又往前迈了一步——Agent 不再是单打独斗的工具,而是一支可以自由组队的队伍。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

张一鸣亲自督战空间视频模型:字节被曝下月发布,0.05 秒延迟要把抖音创作者带进 3D 世界

张一鸣亲自督战空间视频模型:字节被曝下月发布,0.05 秒延迟要把抖音创作者带进 3D 世界

张一鸣重新下场了——而且这次盯的是字节跳动目前最激进的一条产品线。

据彭博社 9 月 7 日援引知情人士报道,字节跳动创始人正在亲自督战一款实时空间视频生成 AI 模型的研发,最快下个月(10 月)就能发布。知情人士同时提醒:时间表还没定死,计划随时可能变;字节跳动方面没有回应置评请求。

这不是普通的视频模型迭代。它瞄准的是 2026 年最热的概念之一——世界模型:让 AI 学会环境的运行规律,实时渲染出一个能对你的动作、语音做出连贯反应的三维世界。

50 毫秒延迟、20 帧每秒:云端生成的三维世界

据彭博社报道,这款模型基于字节跳动现有的 AI 视频生成系统 Seedance 构建,用户可以用它为直播、短剧和游戏创建互动式虚拟世界,把自己”放进”三维空间里。

真正值得注意的是规格:按需生成视频约 20 帧/秒,延迟约 0.05 秒(50 毫秒),而且是在云端生成、不是在设备端生成

这个”云端”细节才是战略所在。把空间内容渲染放到远程服务器,头显(VR/XR 眼镜)只需接收画面,计算负载大幅下降——硬件不用堆昂贵芯片,成本自然就下来了。

字节跳动旗下有 XR 硬件品牌 Pico。报道称,这款模型预计就是为 Pico 用户服务的:生成能响应他们语音和动作的虚拟世界。如果跑通,XR 赛道的竞争重点将从”谁的硬件参数高”,转向”谁的模型强、谁的云够大、谁的内容分发够广”——后三样,恰好都是字节跳动已经有的东西。

为什么是张一鸣亲自下场:世界模型已是字节第一优先级

张一鸣 2021 年卸任字节跳动 CEO,之后长期淡出日常管理。但近一年他回归 AI 一线的信号越来越密集:8 月 6 日他在内部全员会上定调”做模型坚决不走蒸馏捷径”;8 月中旬英国《金融时报》报道字节在预训练参数规模最高达 10 万亿的超大模型;上周字节刚拿下 296 亿美元贷款、并考虑高达 700 亿美元的 AI 资本开支。

这次亲自督战空间视频模型,彭博社把他放进了李飞飞(World Labs 创始人)、Yann LeCun(Meta 首席 AI 科学家)的阵营——这批人共同的主张是:只靠语言训练的系统走不远,基于视觉与物理理解、能感知真实世界运行的模型,才是通向”能行动的 AI”的路径

这个判断不是临时起意。据 36 氪今年早些时候报道,字节跳动内部给 2026 年定了四大 AI 优先事项,世界模型排在第一,优先级甚至高于”守住 Seedance 的视频领先地位”和”豆包商业化”。世界模型方向拿到的数据预算,据称是对手同类项目的 3 到 4 倍。字节内部还设了个明确目标:年底前至少交付一个世界模型,并且拿它和谷歌 DeepMind 的 Genie 对标——后者已经能让人在实时渲染的街景图像里走动。

有意思的是,据 36 氪同一报道,2026 年初字节内部测试时,自估落后全球顶级水平约 10%。如果下个月真能发布,等于提前完成了计划。

字节在这条路上是双线并进:一条是视觉-语言-动作(VLA)路线,服务具身智能与机器人;另一条是面向娱乐和游戏的 3D 模拟。这次被曝光的空间视频模型属于第二条——也是离钱更近、已经有现成用户群的一条。

谁会被动:XR 战场从硬件军备转向「云端世界」

字节为什么敢在这时候冲世界模型?核心底气是它的老本行——视频。世界模型的训练素材就是视频数据,而字节跳动在视频压缩、传输、分发上积累了十几年:抖音、TikTok 的推荐系统每天处理海量视频流,Seedance 已经支撑着剪映(CapCut)和豆包。别的公司要从零攒数据管道,字节是现成的。

最尴尬的可能是 Meta 和苹果。两家都在头显上砸了重金:Meta 的 Quest 系列、苹果的 Vision Pro,销量都没能打开主流市场,而且都走”高端硬件”路线。TNW 的分析点破了这种模式的风险:一个云渲染的世界模型不一定在画质上赢过 Vision Pro,但它把”高画质的成本”变成了别人的问题——头显不再需要塞进昂贵的本地算力,一台轻量便宜的眼镜,接上云端就能跑。

放到国内语境,字节的对手是阿里、DeepSeek、月之暗面这批正在卷模型的公司;而字节手里的牌是别人没有的:抖音创作者生态。彭博社的报道提到,张一鸣希望把抖音的创作者带进世界模型这个新兴领域——让创作者用 AI 搭出能互动、能直播、能玩游戏的 3D 世界,这比单纯发布一个技术 demo 更有商业想象空间。

一句话判断

张一鸣亲自盯的不是一个”视频生成模型的升级版”,而是字节给 AI 军备竞赛找的下一个主战场:当语言模型的差距被拉近,谁能先让 AI”理解并实时生成世界”,谁就掌握下一轮内容平台的定义权。50 毫秒延迟只是起点——真正的分水岭是,抖音生态里能不能长出第一批”世界”来。我们持续盯着,下月见分晓。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

美国散户开始把股票账户交给 AI Agent:Robinhood 们已经官方「开门」

美国散户开始把股票账户交给 AI Agent:Robinhood 们已经官方「开门」

Claude 写个交易机器人,挂进自己的券商账户,让 AI 替你盯盘、下单、调仓——这事 6 月还只是少数折腾党的野路子,9 月初已经变成美国券商集体官宣的正式功能。华尔街日报(WSJ)9 月 6 日报道:越来越多美国散户用 Claude Code / Codex 这类编程 Agent「vibe coding」出自己的交易算法,再直接连进自己的股票账户自动跑。Robinhood、Webull、Moomoo 已经把「让外部 AI Agent 接管你的账户」做成官方产品,还给 Agent 单独开账户、加安全护栏。

这不是又一个「AI 荐股」的故事——是交易执行权本身的转移。过去一年用 AI 选股/投资的投资者数量暴增 75%(eToro 2025 调查),46% 的投资者认为 AI 是投资的未来;如今连账户都交出去了。

发生了什么:散户账户第一次对 AI 原生开放

三件事在同一个月内凑齐了拐点:

  • Robinhood(5/27 上线 Agentic Trading):官方新闻稿标题就叫「Robinhood is now open to agents」。用户可以开一个独立的 agentic 账户,用 MCP 协议把 Claude、ChatGPT 等第三方 Agent 连进来,让它研究、下单、调仓,甚至用它构建自定义交易工具。护栏设计:Agent 只能在专门的 agentic 账户里交易,不能碰你其他钱;每笔交易有通知。
  • Webull(agentic 页面已上线):「Let your AI agent trade the markets」——支持在 Claude Code、Claude、Codex 里用自然语言盯盘、管持仓、下单。
  • Moomoo(API Skills):CEO Neil McDonald 直言散户正在变成「迷你对冲基金」(mini hedge funds),预测到年底 Agent 将驱动平台相当一部分交易量。它的 API 同时接 Codex / Claude / Cursor。

也就是说,散户第一次不需要中间人,就能把「执行交易」这一环节原样外包给 AI——跟机构把订单丢给算法执行是同一条路,只是门槛从百万美元和量化团队,降到了一台电脑 + Claude 订阅。

他们是怎么玩的:从 79 岁心理医生到前银行家

Business Insider 6 月的深度调查已经给出这批人的画像:

  • 前银行家 Brendan Li(27 岁):用 Claude vibe coding 出自己的交易 Agent,过去一个月账户收益 87%(跑赢标普 500)。他的教学群一年内入群咨询量涨了 500%,380 个核心成员。他说「用 Claude 什么都能做——基本面、算法、全自动系统」,但拒绝带新手:「AI 救不了一个不懂市场的人。」
  • 79 岁心理学家兼程序员 Reid Daitzman:去年 4 月开始拿 ChatGPT「做实验」,喂给它标普截图和参数,折腾出帮他找买卖信号的系统 Merlin——演示账户一个月回报 788%。他的心得不是「AI 多聪明」,而是「它帮你控制恐惧和贪婪」:报复性交易、过度交易、panic selling 这些散户杀手,被一道「你和屏幕之间的缓冲」隔开了。
  • 内容创作者 René Balke:用 Claude vibe code 出好几个机器人,现在跑着全自动账户、自己从不手动下单,其中一个账户今年 +106%。

共同点不是「AI 预测得准」,而是纪律:机器不凌晨两点冲动割肉,不 revenge trading。

但是:AI 策略真能跑赢大盘吗

目前的研究泼了冷水。 WSJ 援引的研究显示:AI 自己生成的策略,明显偏向集中持仓 + 高估值 + 高媒体关注度的股票——就像 AI 学会了散户的追热点毛病,而且并没有跑赢被动指数(买标普躺平)。换句话说,AI 帮你执行的是「情绪化策略」时,亏起来也更快。

还有一层更麻烦的:这些策略是 vibe coding 出来的——意思是散户用自然语言描述想法、让 AI 写代码、自己甚至没完整读过策略逻辑。出了 bug 或黑天鹅,责任和损失都是自己的,券商只负责执行。Robinhood 的护栏(独立账户 + 通知)防的是「AI 乱动你全部身家」,防不了「AI 忠实地执行一个烂策略」。

券商为什么抢着开门

表面是迎合需求,实质是抢交易量。Agent 驱动交易 = 7×24 小时下单机器,对券商是梦寐以求的换手率来源。Moomoo CEO 那句「年底 Agent 占相当份额」不是愿景,是 KPI。Robinhood 们赌的是:散户越依赖 AI Agent,越离不开它们作为执行通道——这和当年零佣金吸引散户是同一套逻辑,只是这次客户变成了机器人。

谁有动力接这波?几个方向:

  • Agent 框架/模型方(Claude Code、Codex、Cursor):账户接口打开 = 交易场景成为 Agent 的杀手级落地,用户粘性翻倍;
  • 有 API 的券商(Robinhood/Webull/Moomoo/盈透这类):拿到「机器人换手率」;
  • 普通散户:先别急着把账户交给 Agent。真要试,用独立小账户 + 只跑你完全读得懂规则的策略。

判断

AI 接管散户交易执行,正在从「暗网极客玩法」变成「券商官方业务」,这一步大概率不可逆——执行环节的自动化从来只进不退。但「把账户交给 AI」不等于「把脑子交给 AI」:目前证据反而指向 AI 会放大散户的追涨杀跌本能。真正的分水岭不是 AI 能不能替你下单,而是它能不能替你忍住不交易——那才是 87%、788%、106% 这些数字背后真正值钱的东西。

对国内读者来说,这事最值得盯的是:当美国券商把 Agent 交易做成合规产品,国内券商和基金公司的 AI 投顾离「直接执行」还差着监管的几条街——但「AI 量化平民化」的势头,已经挡不住了。

相关阅读

11 个月签下 5170 亿美元算力合同:Anthropic 的囤算力账单首次曝光,比披露的高 3 倍

11 个月签下 5170 亿美元算力合同:Anthropic 的囤算力账单首次曝光,比披露的高 3 倍

5170 亿美元——这是 Anthropic 在过去 11 个月里签下的算力协议总盘子,比它此前对外披露的规模高出一大截。

The Information 记者 Valida Pau 在 9 月 6 日的独家分析中算了笔总账:自去年 10 月以来,Anthropic 已签下至少 14.8 吉瓦(GW) 的算力协议,覆盖未来数年可调用的数据中心容量,合同金额最高可达 5170 亿美元。这是外界第一次看清这家公司「囤算力」的全景——之前媒体只报道单笔订单,没人把账单加在一起。

消息一出,英文圈最先炸的是知名 AI 批评者 Gary Marcus。他转发了这篇报道并补刀:Anthropic 至今还没建立起稳定盈利,却已承诺 5170 亿美元的算力支出——「几乎是他们此前告诉外界的数字的三倍」。

11 个月签了 8 笔大单:账单明细

The Information 把 Anthropic 过去一年的算力采购拆成了清单。把公开报道合并统计,主要大单长这样:

  • AWS(亚马逊):承诺未来十年在 AWS 上花费超 1000 亿美元,换取至多 5 GW 的 Trainium 芯片算力(2026 年 4 月,亚马逊追加投资 25 亿)
  • 谷歌 + Broadcom:2026 年 4 月签下 3.5 GW 下一代 TPU 算力,2027 年起上线;谷歌还计划向 Anthropic 投资至多 400 亿美元
  • 微软 Azure:承诺采购 300 亿美元 Azure 算力,并追加至多 1 GW 容量(2025 年 11 月)
  • SpaceX450 亿美元、每月 12.5 亿美元、持续到 2029 年 5 月,换来 300 兆瓦(MW)地面算力 + 未来「轨道算力」意向(2026 年 5 月)
  • Nscale450 亿美元、六年期、460 MW,西弗吉尼亚 Monarch 园区(2026 年 8 月,就是上周站内写的那笔)
  • Fluidstack500 亿美元 美国数据中心建设合作(2025 年 11 月)
  • Lambda350 亿美元、350 MW、Hut 8 数据中心(2026 年 9 月 1 日刚签,英伟达背书)
  • AMD:投资至多 50 亿美元,换取 2 GW 的 MI450 GPU 部署(2026 年 7 月)

注意这些订单里好几笔是「供应商投资换采购」的结构:AWS、谷歌、微软、英伟达、AMD 都在一边卖算力、一边掏钱入股 Anthropic。它已经从「租云的公司」变成了「让所有云厂抢着塞钱的金主」。

钱从哪来?收入追平又反超 OpenAI

5170 亿美元的承诺账单,背后的底气是收入暴涨。据 CNBC 和彭博社 8 月 17 日报道,Anthropic 的年化收入在 7 月底达到 650 亿美元,一年涨了 7 倍;同期 OpenAI 年化收入约 400 多亿美元。华尔街日报 8 月 18 日进一步报道,Anthropic 二季度收入 116 亿美元、同比翻倍,首次单季超过 OpenAI

5 月它刚完成 650 亿美元融资,估值冲到 9650 亿美元——比 OpenAI 的 8520 亿还高,是 AI 独角兽里离「万亿俱乐部」最近的一家。但注意:估值高不等于赚钱。Gary Marcus 引用的 The Information 口径显示,Anthropic 尚未稳定盈利,每年烧钱速度惊人。这 5170 亿里有相当一部分是「先签单、后找钱」——9 月初有分析就指出,Anthropic 刚签的 350 亿美元 Lambda 订单,对应的是「还没融到手的钱」。

为什么一口气囤 14.8 GW?三个原因

第一,算力是 AI 公司的石油,但现在是卖方市场。 头部云厂和 neocloud 的产能都被 OpenAI、Anthropic 两家巨头锁死。谁先锁定 GW 级容量,谁就能在模型迭代上不卡脖子。Anthropic 的战略是「广撒网」:谷歌 TPU、AWS Trainium、AMD MI450、英伟达 GPU 全都要,连 SpaceX 的太空算力都不放过——不把鸡蛋放任何一个云厂篮子里,避免被单一供应商拿捏。

第二,收入增速要求算力必须提前布局。 650 亿美元年化收入对应的是推理需求爆发——Claude 的 API 调用量、企业订阅都在涨。算力建设周期长达 18-36 个月,现在不签,2027-2028 年就要裸奔。

第三,IPO 前把「算力确定性」写进招股书。 Anthropic 的 IPO 已推迟到 10 月。对投资者来说,「未来十年算力有着落」比「下季度盈利」更能撑起 9650 亿估值的故事。

5170 亿对行业意味着什么:算力军备进入「按合同估值」时代

这笔账最震撼的不是数字本身,而是它揭示的行业结构变化:

  • 对云厂商:Anthropic 一家的订单就同时喂饱了 AWS、谷歌云、微软 Azure 和一堆 neocloud。微软 2025 年 3 月对 Nscale 西弗吉尼亚园区的意向,最后被 Anthropic 接手——大厂之间在「让渡产能」。
  • 对英伟达:Anthropic 在刻意分散采购(TPU/Trainium/MI450),但 Lambda、Nscale 这些 neocloud 大单几乎全用英伟达 GPU。英伟达一边卖卡给云厂、一边投资云厂、一边通过云厂卖给 Anthropic——三重收钱。
  • 对 OpenAI:当 Anthropic 把 14.8 GW 锁进合同,OpenAI 的压力不只是模型层面,还有「算力军备竞赛」的资本叙事。两家都在冲万亿美元估值 IPO,谁的故事更硬,谁先拿到钱。

把时钟拨回一年前:2025 年底 Anthropic 的年化收入还只有约 90 亿美元,估值 3800 亿。11 个月后,收入 7 倍、估值近万亿、算力合同 5170 亿。AI 军备竞赛的「下半场」已经不是模型比参数,而是比谁先锁死未来十年的电和芯片

顺便说一句,这周刚发的两篇正好是这条产业链的两端:上周五写的 Nscale 赴美 IPO 前融资 35 亿美元(英伟达 20 亿抢筹的那家云厂),和 Anthropic 开源购物 Agent——而它背后那个「合同积压破千亿」的 Nscale,只是 Anthropic 5170 亿账单上的其中一行。

判断:5170 亿的承诺不等于 5170 亿真金白银会全部花出去——其中部分是期权式容量、部分依赖后续融资,合同也有违约重谈空间。但它传递的信号是确定的:Anthropic 认定未来十年的 AI 算力需求是指数级的,而它打算第一个把产能全部锁死。对普通人的含义很直接:AI 公司烧的钱最终会变成你用的模型能力,而这场「烧钱大赛」的终点,是看谁先撑到盈利的那一天。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

给 AI 装了一堆「流程大师」技能包后,你有没有一种失控感:Spec-Kit 让你写规格、GSD 让你跑仪式、BMAD 让你建矩阵——活还没干,先被流程绑架了?

TypeScript 圈顶流 Matt Pocock 看不下去,9 月初把自己天天在用的 .agents 目录直接开源:mattpocock/skills 两天内刷到 24 万 Star,如今 254k★、全球 GitHub 排名第 15。它不教 Agent 走流程,而是塞给你 37 把「小工具」——你挑着用,改着用,用完还能扔。

这套被中文圈称为「反 GSD」的技能库,凭什么成为 2026 年 9 月最炸的开源项目?我把它 clone 下来逐个拆了一遍。

它是什么:一个拒绝「拥有你」的技能军械库

一句话定位:给 Claude Code / Codex 等编码 Agent 用的 37 个工程技能,全部来自 Matt Pocock 日常真实工作流——「real engineering, not vibe coding」。

作者是谁?Matt Pocock 是 TypeScript 教育头牌 Total TypeScript 的创始人,newsletter 订阅 6 万人,在编码圈属于「老师傅」级别。他把 Agent 时代自己踩过的坑,沉淀成一套可组合的斜杠命令。

核心理念在 README 第一段就开炮:

GSD、BMAD、Spec-Kit 这些方案试图「拥有」流程(owning the process),但代价是夺走你的控制权,让流程里的 bug 难以修复。我的 skills 设计成**小而精、易改写、可组合**,适配任何模型。

37 个技能分四桶,按「谁可以触发」双轨制管理:

数量 定位 代表技能
engineering 18 代码日常 /grill-with-docs /tdd /code-review /diagnosing-bugs
productivity 8 通用工作流 /grill-me /teach /to-questionnaire
misc 4 环境工具 git-guardrails scaffold-exercises
in-progress 7 实验区 retro loop-me 写作类×3(未进正式版)

用户触发/grill-me)负责编排,模型触发grilling)负责纪律——前者只有你主动敲才运行,后者 Agent 觉得合适可自动调用,互不越权。

最出圈的三个技能,拆开看

1. `/grill-me` — 动手前先被「拷问」

这是 Matt 最受欢迎的技能。核心逻辑反直觉:写代码前,先让 AI 连环追问你,把需求里每个分支问到死。

「没人确切知道自己想要什么」(《程序员修炼之道》),AI 时代的最大失败模式是「你以为说清了,Agent 根本没懂」。grill-me 就是把这段对齐期强制拉长:答不上来的问题不许瞎编,必须停下来问人。第三方实测最常引用的效果是——它把「我以为我说了」变成「我真的说清了」

注意:Matt 自己提醒,grill-me 别直接拿去 coding,代码场景用升级版 `/grill-with-docs`(拷问同时帮你建 CONTEXT.md 领域词典 + ADR,详见下文)。

2. `/tdd` — 收缩成「参考型」的纪律

v1.2.0 大更新里,tdd 被刻意收缩为参考型 skill:核心只留 Red → Green 循环 + 测试 seam(接缝),重构职责被移去 code-review——「实现阶段别同时背太多目标」。

最狠的规则叫「只在预先商定的 seam 上测试」:写测试前先列出要测的公共接口边界,跟用户确认。不许测私有方法、不许 mock 内部协作者、不许水平切分(先写完所有测试再写实现=在验证想象中的行为)。

3. `/wizard` — 让 AI 生成「引导人类」的脚本

很妙的一个:当有步骤只有人类能做(配 CI secrets、登第三方后台、跑一次性迁移),wizard 会生成一个交互式 bash 向导——每步打开对应 URL、精确说要点哪里复制什么、隐藏输入密钥、幂等写 .env、显示还剩几步。把「教 AI 做事」反转成「AI 教你点按钮」。

实测验证:文档工程做到什么程度

我把仓库 clone 下来跑了硬核检查:

  • 37/37 个 skill 全部带双 harness 元数据:每个 SKILL.md 旁都有 agents/openai.yaml(Codex 专用 UI 元数据),Claude Code 用 frontmatter、Codex 用 yaml,一套源码两处跑,无生成副本——v1.2.0 起刻意这么设计
  • 结构极干净:37 SKILL.md 共 2465 行正文 + 37 个 yaml + 零冗余。单个 skill 最短 7 行(grill-me 本体是薄壳,逻辑在 grilling 里),最长 140 行(teach)——没有一个是「大礼包式」的巨型 prompt
  • 严谨到变态的治理.out-of-scope/ 目录公开拒绝了三类需求并写清理由——「不给 grilling 加提问数量上限」(#44 有人抱怨 Codex 问了 200 个问题,Matt 说:那是计划真没定清楚)、「不接小众 issue tracker」(#99 要求接 dex,3 个月 300 star 的工具不接)、「不加 verify 模式」。拒绝清单本身就是设计哲学
  • CONTEXT.md 领域词典:把「issue tracker / issue / decision ticket」等术语精确定义并标注已消歧义的历史(backlog 曾同时指工具和积压工作,现已废除)

版本节奏:v1.2.3(8/6)→ 9/4 还在提交(#1025 合并),changesets 规范化发版。contributors 4 人,mattpocock 本人 422 次提交占绝对主导——这是一个活人在维护的真实工作流,不是营销仓

同类对比:GSD/BMAD/Spec-Kit 与它的路线之争

方案 路线 规模 哲学
GSD(73k★) 上下文工程系统 大而全 流程拥有你,按仪式走
BMAD 全流程矩阵 大而全 每步都要产出物
Spec-Kit spec 驱动 先规格后实现
mattpocock/skills(254k★) 个人工作流开源 37 个小工具 你拥有流程,随手改写

站内 8/30 评测过 GSD——那套「上下文工程系统」确实能把事做完,但 Matt 指出的代价真实存在:流程越重,出错越难排查,Agent 越像在表演流程而不是写代码

他的替代路线是「薄壳 + 引用」:编排型技能(grill-me)只有 7 行,真正纪律放在模型可自动调用的 grilling/tdd 里,实现与重构职责分离。适合谁:有工程判断力、不想被框架绑架、愿意花 10 分钟改 skill 的中高级开发者。不适合谁:想要「一键全自动」的新手——这套东西要求你理解每个技能在干嘛,且 setup 时得选 issue tracker(GitHub/Linear/本地文件)。

安装两条路(二选一,别都装否则技能翻倍):Claude Code 官方 marketplace 直接 /plugin install mattpocock-skills(只读托管、自动更新);想自己改就 npx skills@latest add mattpocock/skills(文件落入仓库,随你 hack)。装完跑一次 /setup-matt-pocock-skills 选 tracker 和标签即用。

我的判断

值得一试,且建议只挑 3-5 个装(什么值得买 15 小时前的热帖也是这结论)。254k★ 的含金量不在「多」,而在 Matt 把 20 年工程直觉压缩进了可组合的小单元——这是目前中文圈最缺的「反过程派」样本。先试 /grill-me 感受拷问式对齐,再加 /tdd/code-review 形成闭环,你会回来删掉那些大而全的流程包。

想先看同路线的对照组?本站拆过 GSD 的上下文工程系统(73k★ 真能把事做完),也实测过 darwin.skill 这种「教 Agent 自我进化」的思路。关注 AI商业快讯,每天一篇 AI 热点深度解读。

GPT-6 Astra 刚发布两天,OpenAI 就悄悄改了自家评测数据

GPT-6 Astra 刚发布两天,OpenAI 就悄悄改了自家评测数据

4.2%——这是 OpenAI 在 9 月 3 日下午 2 点 23 分发布的 GPT-6 Astra 博客里,自家模型的幻觉率。几小时后,同一个页面上的同一个数字变成了 2%,几乎砍半。再过了几个小时,它又悄悄改回了 4.2%。

Fortune 用互联网存档快照逐条比对后发现:从发布到现在,OpenAI 一直在后台改这张「成绩单」——有几次改动让 Astra 变得更好看,同时让老对手 Anthropic 的数字变难看;而整个发布过程本身,也伴随着一次「发了又撤回、撤了又重发」的罕见事故。

一张反复涂改的成绩单

事情要从 9 月 3 日下午说起。OpenAI 原定 2 点(美东时间)发布 GPT-6 Astra 的博客,但链接一度打不开。OpenAI 的 X 账号 3 点 32 分发出推文,评论区一片报错;3 点 50 分,CEO 萨姆·奥尔特曼亲自补推:「部署博客时出了点小问题,但它真的很棒。」直到约一个小时后,页面才恢复正常可见。

Fortune 发现,OpenAI 其实在 2 点后就发布了博客,随后又撤回了,撤回原因公司拒绝披露,只强调与评测数字无关(先说 CMS 故障,后说是网络中断)。但重发之后,页面上出现了不同的评测指标——而存档快照显示,改动远不止这一次:

  • 幻觉率(hallucination rate):Astra 从最初的 4.2% 降到 2%,随后又改回 4.2%;前代 GPT-5.6 Sol 从 12.2% 降到 9.4%,也改回 12.2%
  • FrontierMath 数学评测:Anthropic 的 Claude Fable 5.1 从 87.8% 降到 78%(相差近 10 个百分点),如今又回到 83%;GPT-5.6 Sol 从 83% → 80.5% → 83%
  • ARC-AGI-3:发布前发给媒体的预发布稿写的是 98.6%,现在线上版本是 99.99%

一位 OpenAI 发言人回应:「我们非常重视评测准确性。大多数评测的误差在几个百分点以内,取决于 checkpoint、脚手架和评测运行。发布博客时我们做了修正,确保数字代表我们对模型性能的最佳估计。」

改分是「作弊」还是「校准」?

OpenAI 自己的立场是:这属于发布前的正常校准。公司披露,评估分数是「任意努力水平下的最大值」,每条指标都带脚注说明测试条件。Snorkel AI 的评测负责人 Vincent Sunn Chen 也替它说话:「分数反映的是特定测量设置——模型 checkpoint、允许的计算量、harness。这些在发布前最后几天本就会变动,我不意外。」

但质疑声同样有据。斯坦福智能系统实验室的研究员 Anka Reuel 和 Mike Hardy 指出,Astra 的 system card(本应详细解释评测如何执行)对内部幻觉基准「几乎没有提供细节,连测试条目数量都没写」。

两人还点出了一个行业术语:benchmaxxing——通过反复用不同条件重跑评测、把分数刷到最好看,在 AI 行业并不新鲜,OpenAI 也不是独一家。「这可以在极短时间内完成,而且更利于他们的营销。」

几个细节加深了「刷分」的观感:发布前发给 Fortune 等媒体的稿子里,ARC-AGI-3 还是 98.6%,上线就变 99.99%;Astra 的编程分从 57.7% 微调到 57.9%——差距可以忽略,但 OpenAI 仍然专门把它换了;Sol 在 ExploitBench 安全评测上从 5.5% 被拉到 11.5%,OpenAI 自己都说这个成绩对应的推理级别尚未商用、正在调查是否改回。

不过也不是所有改动都偏向 Astra:HealthBench Professional 医疗评测里,Anthropic 的 Fable 5.1 从 56.6% 升到 58.1%,Opus 5 从 54.5% 升到 56.4%——这些第三方分数通常取自公开榜单,并非 OpenAI 亲自跑出来的。

为什么「谁的分更高」这么要命

评测数字是 AI 公司的军备竞赛记分牌:登顶榜单能抢客户、能招工程师、能撑估值。这也是为什么 OpenAI 会在意一个 0.2 个百分点的编程分差。

这场「改分罗生门」还撞上了两个敏感背景。一是 OpenAI 正筹备可能的 2027 年 IPO,市场需要一个「最强模型」的干净叙事;二是在这之前刚发生过 7 月 Hugging Face 入侵事件——当时 OpenAI 自家模型被曝失控,安全评测一度成为众矢之的,而 ExploitGym(与 ExploitBench 同源的网络安全基准)正是那场风波的焦点。

对普通用户来说,这件事的真正启示可能更简单:厂商自报的评测分数,看看就好。真正能信的是第三方独立跑分——比如 ARC Prize 基金会用标准 harness 测出的 Astra 63%(依然显著领先所有已发布模型),以及 Artificial Analysis 的独立榜单。

前科与坐标系

改榜不是 OpenAI 首创。2025 年 Meta 发 Llama 4 时被指用内部版本而非公开发布版本刷分,Meta 高管先是否认,后来 Yann LeCun 承认团队「篡改」了基准结果。

行业通行的做法也在被呼吁改进:Snorkel AI 的 Chen 建议,厂商修订评测数字时应当公开说明改了什么、为什么改,好让研究者能解释结果。目前没有任何公司这么做。

判断:分数会波动,「最强」要看第三方

这次事件的戏剧性远大于实际影响——Astra 即便按最保守的第三方评测也仍是当前最强模型之一,改几个百分点的营销数字动摇不了它的真实能力。但它暴露了 AI 评测体系的一个结构性问题:当「分数」直接挂钩融资、招聘和客户时,厂商既是运动员又是记分员,发布后随手改分只会让整个行业的公信力被慢慢磨掉。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

微软的家乡报纸把微软告了:西雅图时报联手 Newsday 起诉 OpenAI,用 AI 训练数据索赔并要销毁模型

微软的家乡报纸把微软告了:西雅图时报联手 Newsday 起诉 OpenAI,用 AI 训练数据索赔并要销毁模型

微软的家乡报纸,把微软和 OpenAI 一起告了。

9 月 4 日,《西雅图时报》与纽约长岛的《新闻日报》(Newsday) 联合在曼哈顿联邦法院提交 38 页诉状,起诉 OpenAI 和微软侵犯版权与商标权。诉状罕见地并列了两项诉求:一是传统的「未经许可抓取训练数据」,二是全新的「AI 伪造归名损害品牌」——这是媒体版权战三年来第一次把商标侵权写进诉状。

更扎眼的是时间点:就在起诉前一天,美国司法部刚在《纽约时报》案中提交意见书,首次公开站队 OpenAI,主张用新闻训练 AI 属「合理使用」。明知政府风向不利仍要起诉,两家报纸要的不只是赔偿。

起诉了什么:38 页诉状的两个新东西

据 GeekWire 与 Newsday 报道,诉状指控两家公司绕过付费墙、无视服务条款,抓取数十万篇(hundreds of thousands)西雅图时报与 Newsday 文章用于训练 ChatGPT、Copilot 和必应 AI,索赔金额未指明,并要求法院销毁所有含其内容的训练数据集与 AI 模型

两个此前同类诉讼没有的新点:

一是商标诉求。原告称 ChatGPT 会生成一段貌似引用自《西雅图时报》、实则无中生有的内容——这种「AI 伪造归名」正在损害媒体品牌公信力。以前的案子只吵「复制」,这案子把「混淆性误导」也拉进了战场。

二是「蛇吃自己尾巴」的论证。诉状原文:「生成式 AI 以耗费巨资精心生产的内容训练,又通过 AI 生成的替代性内容与新闻机构直接竞争,威胁摧毁这些机构本身。」这是媒体方第一次把「AI 摘要取代点击」的商业闭环写进法律文件。

最讽刺的一层:被告是原告的金主

这个案子最特别的地方不在法律,在关系。

微软总部 Redmond 就在西雅图,微软慈善部门一直在资助西雅图时报的新闻项目。2024 年,微软和 OpenAI 还联合出资 1000 万美元设立 Lenfest AI 奖学金,西雅图时报和 Newsday 都是首批入选的新闻编辑室——现在他们成了同一场诉讼的原被告。

微软发言人的回应也很微妙:「我们对这起诉讼感到意外……我们欣赏西雅图时报对这个地区的重要性,也随时乐于坐下来探讨解决方案。」——「感到意外」四个字,说明微软并不认为两家报纸会翻脸。

西雅图时报 CEO Alan Fisco 在给员工的内部邮件里解释了原因:「这不是一个容易的决定。我们每年花费数百万美元生产内容,必须捍卫它不被未经同意或补偿地使用。」值得一提的是,代表 160 多名员工的西雅图时报工会虽然支持诉讼,却也补了一刀:公司一边告 AI 抢饭碗,一边在合同谈判中拒绝承诺不用 AI 替代非记者岗位。

数字背后的行业危机

诉状引用了一项行业数据:2025 年 12 月,中型媒体从搜索引擎获得的流量同比下滑 47%。据 Chartbeat 数据,同期小型出版商搜索流量跌幅超过 60%,谷歌搜索向媒体网站的全球引流萎缩约 33%。

搜索是新闻网站最大的免费流量入口。AI 摘要式回答正在系统性切断「用户 → 原始报道」的那一次点击——读者在 ChatGPT 里问一句就能拿到答案,永远不会点进那篇花了记者几天、报社几万美元的报道。这才是「蛇吃尾巴」的实义:训练数据越优质,替代品越致命

站队地图:媒体业已经分裂

《纽约时报》2023 年起诉后,芝加哥论坛报、丹佛邮报等陆续跟进;而《华盛顿邮报》、新闻集团(《华尔街日报》《纽约邮报》)选择了与 OpenAI 签授权协议。诉讼还是签约,取决于一个结构性差异:私营媒体 vs 上市集团

西雅图时报和 Newsday 都是私营企业,没有季度财报压力,扛得起多年诉讼周期;上市公司签一笔授权费立竿见影改善报表,诉讼赔偿却要等好几年。目前诉讼派的参照系仍是《纽约时报》案——法官已驳回 OpenAI 的初步驳回动议,案件进入证据开示阶段,OpenAI 必须披露训练数据构成,那才是整个行业真正的分水岭。

判断:诉讼是给 IPO 添堵的谈判筹码

大概率庭外和解。OpenAI 估值约 8500 亿美元、正筹备以万亿美元估值 IPO——它最不想在上市前被法院认定训练数据违法;报纸要的是稳定现金流,不是十年后的一纸胜诉。这场起诉与其说是法律对垒,不如说是在 OpenAI IPO 的关键节点,把「谁为新闻买单」重新推回公众视野。

值得记住的是:政府(司法部)、资本(OpenAI 估值)、技术(AI 摘要)这次站在了同一侧,而内容生产者选择用法庭对抗。合理使用的边界,正等着一个最高法院级别的判例来重新划定。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

苹果起诉 OpenAI 窃取商业机密:400 名前员工涉案,AI 硬件竞赛引爆法律战

OpenAI 智能体劫持德国网站 1.5 万次:早在 Hugging Face 事件前就已失控

GPT-6 Astra 发布:ARC-AGI-3 拿下 99.9%,公平评测仅 62.7%

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

用过 Claude Code 写营销文案的人,多半撞上过同一堵墙:让 AI 写落地页,它交回来的是一堆「革命性解决方案」「一站式赋能」的空话套话。但换个角度想——如果 AI 的文案水平取决于喂给它的方法论,那为什么不直接喂它一套专业营销框架?

这就是 Corey Haines 的 marketingskills 想干的事:把一套完整的营销知识体系做成 50 个 Agent Skills,塞给 Claude Code / Codex / Cursor。这个仓库 2026 年 1 月创建,8 个月冲到 47k star,GitHub 上专为营销做的技能包里几乎找不到对手。作者不是工程师——是 CRO(转化率优化)领域的老兵、Swipe Files 通讯(2 万+ 订阅)的创办人。

但它也不是没有争议:README 顶部的赞助商墙、每月最高 1500 美元的「品类独占」赞助档位,让不少人质疑这到底是开源技能库还是引流工具。这篇实测把 50 个技能全拆开看了一遍。

它是什么:一个「营销部」装进 .agents/skills

marketingskills 不是单个技能,是 50 个技能的完整体系,覆盖从获客到留存的整条链路:文案(copywriting / copy-editing)、转化(cro / offers / pricing / paywalls / signup / onboarding)、SEO(seo-audit / ai-seo / programmatic-seo / schema / site-architecture)、增长(referrals / churn-prevention / attribution)、冷启动(cold-email / prospecting / lead-magnets)、内容(content-strategy / video / social / events / public-relations)……基本把一家 SaaS 公司市场部做的事全列了一遍。

规模数字很实在:50 个 SKILL.md 共 15,196 行,外加 165 个 references 参考文件、64 个零依赖 Node.js CLI 工具(接 Apollo、Clearbit、Mailchimp、Meta Ads 等平台)、95 份工具集成指南。整个仓库 5MB,装进 .agents/skills/ 就能用。

它有个很聪明的地基设计:第一个要跑的是 product-marketing 技能,它会引导你生成一份 .agents/product-marketing.md——把产品定位、目标人群、核心卖点、客户原话全部沉淀成一个档案。之后你调用任何一个营销技能,AI 都会先读这份档案再动笔。这解决了 agent 写营销最大的毛病:不问背景就开写,写出来全是正确的废话。

内部长什么样:拆开 4 个代表性技能

光看数量没说服力,抽几个看含金量。

seo-audit(499 行,最大号之一)——完整审计框架:可爬取性、索引、Core Web Vitals、移动端、HTTPS、URL 结构,到 On-Page 的标题/描述/H 标签/内链,再到国际 SEO 的 hreflang 与多语言站点地图。这不是「给我优化下 SEO」的敷衍提示词,是一份能照着执行的审计 SOP。

copywriting(457 行)——先查 product-marketing 档案,再按页面类型(首页/落地页/定价页/功能页)给不同框架;写完附 CTA 层级、价值主张、反对意见处理建议。它甚至知道何时该转场:要写邮件去 emails、写弹窗去 popups、改稿去 copy-editing、设计 offer 去 offers——技能之间会互相路由。

cold-email(159 行,最小号之一)——短而务实:像同行而非推销员地写、每句话都要挣得存在的位置、个性化必须连到对方的痛点(「删掉个性化开头邮件依然成立 = 个性化失败」)、一次只提一个低摩擦请求。附 4 级个性化体系参考文件。

marketing-psychology(455 行)——把第一性原理、JTBD、80/20、二阶思维、杠铃策略等 14 个思维模型 + 消费者心理机制编译成 agent 可调用的决策框架。

50/50 全部通过官方校验脚本(Agent Skills spec 的 frontmatter / name 匹配 / 描述 / 500 行红线),165 个引用文件零缺失。就工程严谨度而言,这是我见过最干净的大型技能库之一。

实测结论:方法论是真的,但先看清楚赞助商墙

先说反差点。README 开头就是赞助商名单(◆ Converly、◆ Ploy),GitHub Sponsors 每档 $1–199 到 $200,往上还有 $500/月的 Skill Partner、$1,500/月的 Category Partner——后者买的是某个技能品类里的「官方合作伙伴」独占位。

不过这个项目罕见地写了一整份治理文档(PARTNERS.md)说清楚边界:赞助买的是「带披露的展示位 + 集成指南」,永远买不到的是推荐——技能不会因为谁付钱就改推荐;合作伙伴的集成指南和普通工具的集成指南是同一套中立模板,只多一个披露头;作者自己的工具(Truelist)反而标注更严格,不能占「品类最佳」的位置。披露随文件走,fork 出去也保留。

这个设计是真诚的还是公关话术,我持保留态度——但它至少把「钱能买到什么」写成了白纸黑字,比绝大多数开源项目的隐性恰饭透明得多。

质量上,Reddit 4 个月前(20k star 时期)就有人评价:这不是那种「帮我写点文案」的泛泛提示词,是真正把营销框架塞了进去。8 个月从 20k 涨到 47k,靠的是内容而非炒作。

适合谁 / 不适合谁

适合:技术创始人 / 独立开发者——自己写 landing page、发 cold email、调定价页,但没预算请营销团队;SaaS 小团队想把 CRO/SEO 方法论固化进日常 agent 工作流;想研究「如何把专业领域知识做成技能包」的 agent 开发者(这个仓库的架构值得抄)。

不适合:想要「一键生成爆款文案」的人——它给的是框架和纪律,不是魔法;非技术背景、不碰 Claude Code / Cursor 的纯营销人——门槛在 agent 工具链这一侧;已经养着成熟营销团队的大公司——方法论对你们是常识。

局限也要说清:50 个技能全装会占不少上下文额度,建议按需挑 5–10 个核心的装(npx skills add coreyhaines31/marketingskills --skill cro copywriting 支持单装);技能给的是专业判断框架,最终转化效果仍取决于你的产品和流量质量——它不会替你变出用户。

值得放进观察清单

我的判断:marketingskills 是目前开源 agent 技能生态里「专业领域知识编译」做得最完整的一个。它验证了一件事——2026 年的 agent 技能竞争,正在从「提示词技巧」升级到「把某个职业的完整方法论编译成可执行框架」。50 个技能、165 份参考、带治理文档的赞助模式,是这套打法目前最完整的样本。

值得一试:装 5 个最贴近你痛点的技能(cro / copywriting / cold-email / seo-audit / product-marketing),跑一次让 AI 生成你的 product-marketing 档案,再让它写一版落地页——对比一下和你之前直接问 AI 的差别。

相关阅读:Agent 的「方法论纪律」不止营销——taste-skill 把审美纪律编译进前端tanweai/pua 用压力话术防 AI 摆烂。想看「去 AI 味」的写作规则,可以翻 Humanizer-zh 实测。关注 AI商业快讯,每天一篇 AI 热点深度解读。