Pi Agent 实测:10.4 万 Star 的极简编码 Agent,默认只给模型 4 个工具

Pi Agent 实测:10.4 万 Star 的极简编码 Agent,默认只给模型 4 个工具

用过终端 AI 编码 Agent 的人,大多撞过同一堵墙:功能越加越多,工具列表越拉越长,系统提示词动辄几千 token,模型反而开始选错工具、忘掉目标。Pi Agent 反着做——默认只给模型 4 个工具,系统提示词压到 2.6KB 左右,一年发了 259 个版本,拿到 10.4 万 Star、每周 152 万次 npm 下载。官方文档还明说它「不要」MCP、不要子代理、不要计划模式。这些「不要」到底是省钱的真本事,还是把活甩给社区?我在安卓手机的沙盒里把它装了一遍,跑通了它的 agent 循环,并把每次发给模型的请求原样抓了下来。

一、Pi 是什么:一个「什么都不自带」的编码 Agent

Pi(仓库 earendil-works/pi,命令 pi)是终端里的编码 Agent,也就是常说的 harness。作者 Mario Zechner 是游戏引擎 libGDX 的作者,网名 badlogic。MIT 协议,2025 年 8 月建仓,到发稿时 103,904 Star、12,997 fork、323 订阅者;npm 包 @earendil-works/pi-coding-agent 上周下载 1,526,012 次(9 月 3 日至 9 日,npm 官方统计接口)。

这不是小玩具。主仓库是 11 个包组成的 monorepo,TypeScript 代码合计 318,385 行,其中测试文件 544 个、测试代码 139,487 行;release 累计 259 个,最新版 v0.85.1(9 月 5 日);贡献者里 badlogic 本人 3,701 次提交,第二名 mitsuhiko(Armin Ronacher,Flask/Jinja 作者)668 次。11 个包分别是 coding-agent(CLI 本体)、agent(agent 运行时)、ai(多厂商 LLM API)、tui、protocol、client、server、session-backends、telemetry、chord、evals。

它的官方定位是「minimal agent harness」:让 Pi 适应你的工作流,而不是反过来。落到代码上就是六个明确的「没有」——没有 MCP(官方的理由是「写个带 README 的 CLI 工具就够了」,并专门写了篇博文解释)、没有子代理(要就 tmux 起多个实例)、没有权限弹窗(要更强边界请自己进容器)、没有 plan mode、没有内置待办清单、没有后台 bash。核心保持空,能力全靠四类资源外挂:TypeScript 扩展、SKILL.md 技能包、提示词模板、主题,打包成 Pi Package 用 npm 或 git 分发。运行方式有四种:交互式 TUI、print/JSON(可脚本化,也能被管道喂输入)、RPC(进程集成)、SDK(嵌进自己的应用)。

这和站内此前评测的 ECC(Everything Claude Code) 恰好是两个方向:ECC 把工程纪律整套塞进 Agent,Pi 把核心清空、把选择权交回给使用者。

二、实测:手机 + 零 API key,把它的 Agent 循环抓出来看

测试环境是一台安卓手机里的 Alpine aarch64 沙盒(PRoot,没有任何 GPU 和模型),Node v22.23.2——Pi 要求 Node ≥ 22.19.0,刚好过线。

安装本身没有意外:npm install -g @earendil-works/pi-coding-agent 拉进 132 个依赖包耗时 25 秒,落地体积 154.7MB,pi --version 输出 0.85.1。官方还专门写了 Termux(安卓终端)安装文档,手机跑 Pi 是被支持的场景。

真正要看的是它发给模型什么。我没有 API key,也不想编造数字,于是写了一个假的 OpenAI 兼容服务(本地 HTTP + SSE 流式响应),再用一个十几行的 Pi 扩展注册成自定义 provider,让 pi 把请求打到本地。这样每一次请求的完整 payload——系统提示词、工具定义、消息历史——都会被原样落盘,可以逐字节量。

抓包项 默认配置 显式开启全部内置工具
发给模型的工具数 4 个(read / bash / edit / write) 7 个(+ grep / find / ls)
工具定义 JSON 长度 3,024 字符 5,302 字符
系统提示词长度 2,571 字符 2,673 字符

三个可以复现的结论:

第一,默认真的只有 4 个工具。官方文档写「By default, pi gives the model four tools」,抓包证实:read(读文件)、bash(执行命令)、edit(精确替换改文件)、write(写文件)。grep、find、ls 存在但要靠 --tools 显式打开,一打开工具定义就从 3,024 涨到 5,302 字符,接近翻倍。社区里 Pi 被称作「只用 4 个工具的 Agent」,说的就是这个默认值,不是营销话术。

第二,系统提示词确实小。2,571 字符(英文,约合六七百 token),官方站点的说法是「very token efficient due to its minimal system prompt」,第三方横评也写它「系统提示词不到 1000 token」——实测对得上。这个数字的意义在于:工具定义加系统提示词合计不到 6KB,每一轮对话都要重发一遍,长会话里省下来的就是真金白银。

第三,agent 循环是真的能跑完。假模型按脚本返回工具调用,pi 依次执行了:读文件 → 用 bash 写文件并 cat 回来 → 用 write 落一个新文件,共 4 次 LLM 往返,最后以自然语言收尾。沙盒里真实出现了 out.txtsummary.md。零密钥、零真实模型,但工具调度、结果回填、多轮循环、会话持久化这条链路全部走通。

顺手还测了两件事。一是技能兼容:把一份带 frontmatter 的 SKILL.md 丢进项目的 .pi/skills/,pi 把它注入系统提示词的 区块(系统提示词从 2,571 涨到 3,172 字符),只给模型「名字 + 描述 + 文件路径」,让它需要时再用 read 去读全文——惰性加载,不是全文塞进上下文。也就是说,为别的 Agent 写的技能包,Pi 能直接复用。二是会话与导出:会话存成 JSONL(格式版本 3),每一条带 idparentId,天然支持从任意历史消息分支重开;--export 能把整个会话导出成 273KB 的单文件 HTML 分享出去。

两个坑,也如实记下:

  • 走管道运行时,Pi 默认会读 stdin 并把它合并进 prompt。我的第一次调用没关闭 stdin,进程就一直等着,看起来像卡死;加 < /dev/null 才正常。
  • 项目级安装的包,在项目被标记为「信任」之前对 CLI 不可见:pi install npm:pi-web-access -l 明明装好了 134 个依赖,pi list 却显示「No packages installed」,加 --approve 才列出来。设计上是安全考虑,但第一次遇到很容易以为装失败了。

三、横向对比:一个 fork 拿到 3 万 Star,也提供了反面数据

Pi 的极简是有代价的,代价就是别人替你补。最典型的例子是 can1357/oh-my-pi(命令 omp):安全研究员 Can Bölük 在 2025 年 12 月 31 日直接 fork 了 Pi,塞进 LSP 客户端、调试器、浏览器、Python 内核、子代理,约 8 万行 Rust,命名致敬 Oh My Zsh。今天它有 30,562 Star——相当于 Pi 星数的三成,是判断「极简派 vs 全家桶派」谁更受欢迎的一个参考。

有意思的是,同一个模型下 Pi 反而更快更省。工具平台 Composio 在 9 月 1 日发布过一组同模型(deepseek-v4-flash)30 个真实任务的对比:

指标 Pi oh-my-pi(OMP)
任务通过 20 / 30 17 / 30
每次成功成本 $0.028 $0.103
单任务中位耗时 132.2 秒 272.4 秒
平均 token 消耗 558,885 742,283

数据要打折看:这是第三方单一模型、单一题集的测试,不能当成通用结论。但方向和 Pi 的设计逻辑一致——工具越多、提示词越长,便宜模型被拖慢、被绕晕的概率越高。Composio 的结论是 Pi 在「便宜模型的编辑可靠性」上输给 OMP 的 hash 锚定编辑(OMP 自称把某模型的一次通过率从 6.7% 拉到 68.3%),这也是极简派最实在的软肋:没有花招兜底,全靠模型自己稳。

另外,社区的选择本身就构成反讽:Pi 官方说「不需要 MCP」,而 pi.dev/packages 上安装量最大的扩展恰好是 pi-mcp-adapter(约 86.6 万次/月),第二是子代理扩展 pi-subagents(约 41.2 万次/月)。官方留白 + 社区填空,这条路走得通,但「Pi 什么都不带」的代价最终是使用者自己装回来。

模型接入这块对国内读者更实用:除了常规 API key,Pi 支持订阅登录——ChatGPT Plus/Pro(Codex,OpenAI 官方为开源项目背书)、Claude Pro/Max、GitHub Copilot、xAI、OpenRouter。要提醒一句:官方文档明确写了,用 Claude Pro/Max 登录第三方 harness,消耗走的是 extra usage 按 token 计费,不占用你的订阅额度——别以为登录了就能白嫖月费。国内厂商则以 token plan / coding 套餐形式支持:Kimi for Coding、Qwen Token Plan(含中国版、个人版)、小米 MiMo Token Plan(中国/阿姆斯特丹/新加坡三区)、MiniMax 中国站、智谱 zai-coding-cn。

四、259 个 release 背后:一套很硬的治理规则

Pi 的发布节奏和治理方式是它最容易被忽略、但对团队选型很关键的一面。

259 个 release、45 个 npm 版本、最新版本 9 月 5 日发布,同时 issue 关闭 5,855 个、开放 138 个,PR 累计 3,124 个——高频迭代但积压不严重。更能说明问题的是贡献规则:新贡献者的 issue 和 PR 默认自动关闭,维护者每天人工捞回值得处理的,用回复里的 lgtmi(此后你的 issue 不再自动关)或 lgtm(issue 和 PR 都放行)作为通行证;周五到周日提交的内容不保证被审阅。官方贡献指南里写着一条「唯一规则」:你必须理解你自己的代码——用 AI 写代码没问题,提交自己看不懂的 AI 垃圾不行。

供应链上它的洁癖也很少见:直接外部依赖钉死精确版本、.npmrc 设置 min-release-age=2(不使用当天刚发布的依赖)、package-lock 是唯一真源、发布包内附 npm-shrinkwrap 锁传递依赖、CI 用 npm ci --ignore-scripts 且定时跑 npm audit signatures,新增带生命周期脚本的依赖会直接让检查失败。

代价同样清楚,而且是官方自己写在文档里的:

  • 没有内置权限系统。README 原话是「Pi 不包含限制文件系统、进程、网络或凭证访问的权限系统」,默认以启动者的权限运行。要隔离请自行容器化(它给了三种方案:微虚拟机扩展、Docker、策略沙盒)。
  • 扩展和技能等于完全系统权限。官方在包管理文档里直说:扩展执行任意代码,技能可以指示模型做任何事,安装第三方包前请先读源码。
  • 提示词注入无法防护。SECURITY.md 承认 AGENTS.md 或代码注释里的指令可以轻易操纵 Agent,本地用户账号与 Pi 进程被视为同一个信任边界,报告这类问题不算漏洞。
  • 会话数据可以公开。项目鼓励把开源工作的会话用 pi-share-hf 发到 Hugging Face 供改进模型,作者自己也在公开数据集里发布自己的工作会话。这是自愿行为,但团队用之前最好先明确策略。

五、结论:值得放进你的 Agent 工具箱

我的判断是:Pi 不是给「想一键变强」的人准备的,而是给愿意把 Agent 当基础设施来改的人准备的。10.4 万 Star、152 万周下载、259 个 release、六成代码是测试——这套组合说明它已经跑过了「个人玩具」阶段,进入「有人拿它当底座」的阶段。

适合谁:① 想把 Agent 接进自己流程(CI、脚本、自家产品)的人,print/JSON/RPC/SDK 四种模式足够;② 预算敏感、用便宜模型的人,4 个工具 + 2.6KB 系统提示词对低成本模型更友好;③ 已经有一堆 SKILL.md 技能包的人,实测可直接复用。

不适合谁:① 想要开箱即用的调试器、LSP、子代理的人,直接看 oh-my-pi 或 OmO 这类组队方案;② 需要权限弹窗、审计、隔离的人,得先自己搭容器;③ 完全不想读文档的人——Pi 的「没有」清单,每一条都要你自己补。

中文资料已经不缺入门介绍了(知乎有长文、runoob 有教程,甚至有人写了本 Pi 架构书),所以本文更想留的是三件能复现的事:默认确实只发 4 个工具、系统提示词真的只有 2.6KB、SKILL.md 技能包真的能跨 harness 复用。至于「极简还是全家桶」,站内此前评测的 mattpocock/skillsOpenMontage 的工具注册表实测 已经给过两种答案,Pi 提供了第三种:把核心清空,让使用者自己决定装什么。

OpenMontage 实测:57k Star 的开源视频 Agent,121 个工具零密钥能跑几个?

OpenMontage 实测:57k Star 的开源视频 Agent,121 个工具零密钥能跑几个?

用 AI 做过视频的人都熟这套流程:脚本问 ChatGPT、图给 Midjourney、配音上 ElevenLabs、最后回剪映里一帧帧对时间轴。四个工具、四轮复制粘贴、一次成片半天就没了。

OpenMontage 想干的就是把这一串收进一句话:你在 Claude Code 或 Cursor 里说「做个 60 秒的神经网络讲解视频」,剩下的交给 Agent。

这个项目 3 月底建仓,现在 5.7 万 Star,还挂上了 GitHub Trending 当日第一的徽章。我把它拉进手机里的 Linux 沙盒实测了一遍:一个 ffmpeg、零 API 密钥,121 个注册工具里究竟有几个能真正跑起来——结论比宣传语有意思。

它的核心设计:没有编排器的 Agent 流水线

大多数「AI 做视频」项目本质是一个带 UI 的调用链:Prompt 进、片段出。OpenMontage 反过来——它没有代码编排器,你的 AI 编程助手本身就是编排器。

仓库里被拆成四层,职责很清晰:

  • tools/ —— 121 个 Python 工具,是 Agent 的「手」(生成、配音、剪辑、分析)
  • pipeline_defs/ —— YAML 管线清单,是「剧本」(哪些阶段、用什么工具、什么验收标准)
  • skills/ —— 157 个 Markdown 技能文件,是「怎么做」(每个阶段的导演手册、创作技巧、评审标准)
  • .agents/skills/ —— 90 个技术知识包,是「底层原理」(各家模型 API 怎么用)

每次生产都走同一条流水线:研究 → 提案 → 脚本 → 分镜 → 素材 → 剪辑 → 合成 →(发布)。每个阶段都配一份「导演技能」文件,Agent 读完再动手,做完自查,再停下来等你点头。

比较少见的是它的闸门设计:提案、脚本、分镜、素材生成、发布五个节点默认强制人工确认,官方写明「checkpoint 写入器会拒绝一个没有审批记录的阶段」。素材生成前还会弹一张分镜接触表,把每个镜头的取景、Prompt、预估花费、质量分列出来——钱花在哪儿,先看再批。

配套还有个本地看板 Backlot,管线跑到哪一步、花了多少、哪个 provider 被选中,实时显示在一块板子上,跑完还能按时间戳回放整个生产过程。

内置 12 条管线,覆盖的场景比想象中宽:动画讲解(Animated Explainer)、纯动效(Animation)、数字人播报(Avatar Spokesperson)、电影感预告(Cinematic)、长视频切条(Clip Factory)、纪录片式混剪(Documentary Montage)、实拍+AI 混合(Hybrid)、多语言配音(Localization & Dub)、播客转视频(Podcast Repurpose)、软件录屏(Screen Demo)、口播(Talking Head),以及用 SVG 骨骼做角色动画的 Character Animation。

实测:官方说 100+ 工具,到底几个能跑

实测环境:手机内的 Alpine Linux 沙盒(aarch64,PRoot),Python 3.12,没有配置任何 API 密钥。所有数字来自 sudo 无关的两条命令——工具的注册表发现接口和仓库自带测试套件。

先把官方宣传和实测数字摆一起:

官方说法 实测结果
100+ 生产工具 注册表实际发现 121 个工具
60+ provider 集成 代码里实际 66 个 provider 标识
700+ 技能与知识文件 skills/ 157 个 + .agents/skills/ 577 个 = 734 个
12 条生产管线 pipeline_defs/ 下 13 个 YAML(多出的是冒烟测试管线)
零密钥可做真视频 装完 ffmpeg 后 121 个工具只有 36 个可用

数字对得上,宣传没注水。但最后一行值得展开——因为这决定了你上手第一天的体验。

密钥不是门槛,运行时才是。 装上 ffmpeg 之前,注册表报告 121 个工具全部不可用。装完 ffmpeg(一条 apk add ffmpeg),状态变成:36 个可用、84 个不可用、1 个降级。

拆开看结构更清楚:43 个纯本地工具里 32 个立刻转正,剩下的靠缺失的运行时卡住——Piper 语音要装 piper 二进制、转写要 faster_whisper、语义检索素材要 PyTorch 模型、本地视频生成要 GPU。而 55 个云端 API 工具,零密钥时可用数为 1。

最扎眼的一格是视频生成:27 个视频生成工具,零密钥时可用数量为 0。官方的「零密钥也能出片」指的是另一条路——用 Piper 配音 + 免费素材库/档案馆的现成画面 + Remotion/FFmpeg 做动画合成。这是一条真实存在的路,但它是「拿现成素材剪出视频」,不是「凭空生成画面」。

我挑了几个 ffmpeg 系工具做了实际的端到端调用:

工具 实测任务 结果
auto_reframe 1280×720 横屏转竖屏 4.4 秒输出 1080×1920,帧数一致
frame_sampler 均匀抽 4 帧 1.2 秒,4 张 JPG
video_trimmer 裁 1–3 秒片段 0.3 秒
silence_cutter 静音段处理 0.5 秒
audio_probe 音频流探测 0.3 秒

手机沙盒里跑竖屏重构,4.4 秒——这类活它干得干净。

然后是翻车点,这两个才是真正该看的。

第一个是硬编码的 Windows 字体。showcase_card(给视频加标题卡)的默认字体写死成 segoeuib.ttf——Segoe UI Bold,Windows 专有。在 Linux/macOS 上 ffmpeg 直接退出码 254,报错信息只有一行 FFmpeg failed。有意思的是它的参数说明写着「Uses system font lookup」(使用系统字体查找),但源码里根本没有查找逻辑,三处字体位置全是 segoeui*.ttf 字面量。我显式传入 title_font=/usr/share/fonts/dejavu/DejaVuSerifCondensed-BoldItalic.ttf 后,4.0 秒正常出片。

第二个更值得警惕:注册表的状态字段会撒谎。仓库里一个 9 月 6 日新开的 issue(#637)由踩坑者提出:diagram_gen 在没装 mermaid-cli 的情况下依然报告 AVAILABLE,然后把 mermaid 源码原样渲染成一张文字卡片,还返回 success: True。提问者写道:「一个信任注册表状态和 success 标志的 Agent,会把代码图片当成图表交付出去。」根因是源码里用 or 判定可用性——只要装了 Pillow 就报可用。

我在自己的沙盒里撞上了同一类问题:face_tracker 的工具契约声明依赖只有 cmd:ffmpeg,实际 get_status 检查的却是 mediapipe + opencv。照着契约装 ffmpeg 永远也变不成可用。

最后是仓库自己的测试套件。我没有挑测试,直接跑 pytest tests/contracts tests/tools1730 项通过、18 项失败、7 项跳过,耗时 32 分钟。18 个失败全部集中在 Google 系后端(Vertex、Imagen、Lyria),原因是我沙盒里没装 google-genai 包——属于环境缺依赖,不是代码缺陷。一个视频项目把契约测试做到 1700+ 项,说明工程纪律是真的。

谁该用、谁等等:三条现实约束

第一条是许可证。OpenMontage 用的是 AGPL-3.0,不是 MIT。你自己用、内部用都没问题,但如果你打算把它集成进一个对外提供服务的 SaaS 产品,AGPL 的传染性会咬人——这一点官方在 README 里没有专门提示,选型时必须自己过一遍。

第二条是单人项目的风险。仓库 52 位贡献者,作者 calesthio 一个人贡献了 311 次提交,其余贡献者都在 30 次以下;当前 317 个 issue 挂在那里(历史总量 152 个已关闭)。项目背后有一个官网和云服务「OpenMontage Studio」的等候名单,也就是说这是「开源核心 + 云产品」的商业结构,长期维护有动力,但节奏完全取决于一个人和一家新公司。

第三条是要选对参照物。同类的视频自动化项目里:MoneyPrinterTurbo 12.2 万 Star、MIT 许可、昨天还在提交,胜在简单直接但只覆盖「素材拼接 + 配音字幕」这一条链路;Open-Sora 2.97 万 Star、Apache-2.0,做的是模型本身不是生产管线;ShortGPT 已经一年多没提交,可以划掉了;Remotion 5.9 万 Star,是 OpenMontage 底层实际使用的合成引擎,属于互补而非竞争。

顺带提醒一句:官方在 9 月 4 日专门开了 issue 声明有假冒的「OpenMontage-app」安装包仓库在传播,这个项目本身不发布任何安装程序。搜索时别装错了。

如果你已经有 Claude Code / Cursor 的订阅,想批量化生产讲解类视频又不想按月付视频生成 API 的钱,它值得放进工具箱第一格——装好 ffmpeg 和 Node,第一天就能跑通素材类管线。如果你期待的是「打开网页、输入主题、十分钟出片」,或者你要把它塞进商业 SaaS,那先放观察清单,等云版本和许可证策略明朗再说。

一句实话:这次实测我没有注册账号、没有购买任何 API 密钥,官方云产品的报价(官网演示账单约 $2.09 一条 60 秒视频)来自官方页面而非我的账单;沙盒环境是 Alpine Linux,与官方推荐的 Ubuntu/macOS 有差异,少数工具的表现可能受环境限制。上面每一个数字都可以复现——仓库是公开的。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

OpenAI 暂停 200 美元 Pro 新订阅:Astra 太火算力告急,微软把数据中心规划翻到 38 吉瓦

OpenAI 暂停 200 美元 Pro 新订阅:Astra 太火算力告急,微软把数据中心规划翻到 38 吉瓦

每月 200 美元的 ChatGPT Pro,OpenAI 突然不卖新号了。

9 月 11 日凌晨,OpenAI 核心产品负责人 Thibault「Tibo」Sottiaux 在 X 上确认:为保住现有用户的 GPT-6 Astra 体验,暂停接受每月 200 美元的 ChatGPT Pro 新订阅。这不是涨价,也不是产品下架——是产能到顶了。

一家一个月前还在被分析师追问「AI 收入什么时候能覆盖成本」的公司,此刻的问题变成了:想付钱的人太多,机器不够用。

从预警到关门,只隔了一天

事情的时间线很短,短到能看出压力有多急:

时间(北京时间) 发生了什么
9 月 3 日 GPT-6 Astra 开始分批推送,官方称之为「AGI 时代」的开端
9 月 9 日 Tibo 公开预警:Astra 需求「前所未有」,若持续下去可能暂停新 Pro 订阅
9 月 10 日 奥尔特曼回应称暂停「会很糟」,但会优先保证现有付费用户
9 月 10 日 《纽约时报》披露:OpenAI 把 2030 年算力支出预期从 6000 亿上调到 7500 亿美元
9 月 11 日 新 Pro 订阅正式暂停

Tibo 的原话很克制:「我们想做尽可能小的一步调整,好让更多人还能用上 Astra。」他给出的理由是,200 美元档是目前对 OpenAI 系统压力最大的订阅层级。

边界划得很清楚:现有 200 美元 Pro 用户不受影响,Plus、Go 和 API 照常售卖。OpenAI 也没说什么时候恢复,更没公布每天有多少新订阅——需求量级至今是个黑箱。

值得一提的是,Pro 其实有两个档:100 美元档约等于 Plus 的 5 倍额度,200 美元档约 20 倍。这次被关掉的是后者,也正是个人用户里使用量最高的那一档。

不是不想卖,是真没算力

把这几天的消息拼在一起,缺口的位置就很清楚了。

第一层缺口在芯片。黄仁勋最近的说法是,供应链正处于紧张状态,当前供给大概只能满足约 70% 的需求。英伟达自己承认,即使按产能算,明年营收能同比涨 70%,仍然填不满客户的胃口。

第二层缺口在数据中心。OpenAI 已经把长期算力合同铺得很开:与甲骨文的容量合同总计 6 吉瓦、与 AWS 的多年协议扩大到八年 1380 亿美元(含 2 吉瓦 Trainium 算力)、对 Azure 的云支出承诺 2500 亿美元。可甲骨文的剩余履约义务已经堆到 6380 亿美元、同比涨 363%,其中 750 亿美元还跟客户预付 GPU 有关——订单转成真实可用算力,需要时间和电。

第三层缺口在。7500 亿美元这个数字比三个月前的预测又高了 25%。甲骨文上季度自由现金流是负 236.9 亿美元,资本支出 556.6 亿美元;CoreWeave 二季度自由现金流负 57.4 亿美元、合同积压约 1040 亿美元。算力链条上每一环都在用负债换产能。

对普通用户来说,这次的直接影响有限——Astra 的额度紧张主要落在重度使用者和 Codex 用户身上。过去两周里,OpenAI 一边给 Codex 用户重置额度、砍掉部分限制,一边被用户抱怨新模型的额度消耗速度快得异常。这一次干脆把最贵的那扇门先关上一半。

同一周,微软把数据中心规划翻了三倍

算力荒不是 OpenAI 一家的难题,另一条几乎是同时出现的消息更能说明问题。

彭博社 9 月 10 日报道,微软计划到 2032 年把全球数据中心容量从现在的约 12 吉瓦提升到超过 38 吉瓦,翻了三倍还多。38 吉瓦这个数字有多大?超过了纽约州用电高峰期的电力需求。

真正刺眼的是结构:现在这 12 吉瓦里,只有约 2 吉瓦是给 AI 专用芯片的;到 2032 年,AI 专用算力预计也只占总容量的三分之一左右。微软云基础设施高管 Alistair Speirs 的解释是,新一代 AI 工具除了 GPU 同样吃 CPU,光靠 GPU 堆不出好基础设施——正在亚特兰大建设的 East US 3 数据中心,主要就是装 CPU 的通用计算集群,总开发成本数百亿美元。

微软之所以这么急,是因为它已经在掉业务了:由于容量不足,微软此前限制过美国和欧洲部分关键区域的新云服务订阅,一些潜在客户因此流向竞争对手。更讽刺的是,2025 年初它曾主动暂停部分数据中心开发项目,当时的 CFO 担心过度建设,如今公司内部不少高管对那次决定后悔。

算一笔总账:微软、谷歌、亚马逊、Meta 四家承诺的未来投入合计接近 2.4 万亿美元,绝大部分砸在数据中心设备和租赁上。而阻力也在变大——美国多地居民反对在本地区建大型数据中心,得州、纽约州等地的州长已要求暂停新的服务器园区项目。

钱能印,地皮和电网不能。

同一天的反面:DeepSeek 在降价

就在 OpenAI 关掉订阅入口的同一周,国内厂商走的是完全相反的方向。

9 月 10 日中午 12 点,DeepSeek 正式发布 V4.1 Flash 并执行新定价:空闲时段输入缓存命中 0.02 元、缓存未命中 1 元、输出 4 元(每百万 token),高峰时段翻倍。官方同时宣布,9 月 14 日 12 点下线 V4 Pro 服务,届时 V4 Pro 的请求会全部路由到 V4.1 Flash,并按 Flash 的单价计费——也就是说,旧旗舰用户被「平移」到了更便宜的新模型上。

官方口径是,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro;上下文窗口 1M、最长输出 384K,长文本场景下的缓存硬盘占用还降了 88%。

把两边放在一起看,反差很直白:一边是每月 200 美元的高端订阅暂停收钱,一边是 API 价格再降一档。这不是谁技术强的问题,而是算力在两边市场的稀缺程度完全不同——美国头部实验室的产能被自己的爆款模型吃穿,中国厂商则在用效率换价格空间。

判断

这轮算力荒最值得记住的不是 200 美元这个数字,而是它暴露的商业模式矛盾:订阅制卖的是「随便用」,可算力是按量买的。2025 年初奥尔特曼就曾公开表示 200 美元档在亏钱,因为用户用得比他预想的多。一年半过去,模型更强了,单次请求更贵了,这个矛盾只会更尖锐。

短期内,OpenAI 的恢复时点取决于产能上线速度,而不是需求回落——毕竟它刚把 2030 年的算力预算又调高了 25%。中期看,头部厂商大概率会往「分层配额 + 用量计费」的方向继续挪,纯「无限用」的高端订阅会越来越难维持。想上车 Astra 又卡在门外的人,API 是目前唯一还能买到的入口,按量付费反而是当下最不会断供的选择。

至于国内市场,反方向的降价还在继续。谁先把成本曲线压下来,谁就能在下一轮抢到用户——算力不够的年代,效率本身就是产品力

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

信息来源:TechCrunch(9 月 10 日)、彭博社经华尔街见闻(9 月 11 日)、《纽约时报》DealBook(9 月 10 日)、DeepSeek 官方 API 通知与 IT 之家(9 月 10 日)。文中金额与时间均以原始报道为准,OpenAI 未公布 Pro 订阅恢复时间。

AMD Token Factory 全景拆解:每天 10 美元的免费大模型 API,DeepSeek 与 Qwen 双协议真能白拿?

AMD Token Factory 全景拆解:每天 10 美元的免费大模型 API,DeepSeek 与 Qwen 双协议真能白拿?

如果你每个月在 AI 模型 API 上花钱,AMD 最近这个东西值得看一眼:不用买显卡,不用先开云实例,登录网页复制一个 Key,就能调用跑在 AMD 自己服务器上的大模型,官方标注「免费」。

它叫 Token Factory,挂在 AMD Radeon Cloud 上,目前标着 BETA。里面并列摆着 DeepSeek 和 Qwen 的模型,都支持 OpenAI 接口格式——也就是说,Cherry Studio、openCode、Cline 这类工具改个 Base URL 就能用;它同时还提供 Anthropic 格式接口,Claude Code 也能直接指过去。

但「免费」两个字后面藏着两个数字:一个算不平的额度,和一条没人细看的条款。这篇把官方文档翻了一遍,把该说的都摆出来。

它是什么:AMD 把免费 API 挂在自己的云上

AMD Radeon Cloud 是 AMD 官方的云端算力平台,分两层:

免费共享端点(Public Free Model APIs) —— 常开、不消耗任何东西、不用开实例。模型由 AMD 挑,你只管调用。Base URL 是 https://developer.amd.com.cn/radeon/api/v1

专属端点(Dedicated Model APIs) —— 你自己开一个 GPU 实例、用 vLLM 或 SGLang 部署想跑的模型,这部分要烧 credits,不算免费。

免费层提供四个接口:OpenAI 的 /v1/chat/completions/v1/models,Anthropic 的 /v1/messages/v1/messages/count_tokens。注意它不提供 embeddings、rerank、音频、图像生成和 /v1/responses,打到这些路径一律 404——想做 RAG 的人得另找向量化服务。

拿 Key 的路径极短:打开 Token Factory 页面首次登录,Key 会自动签发,格式是 rc- 加 48 位十六进制;同一个 Key 通吃所有免费模型,换模型只改请求里的 model 字段,不用重新申请。Key 可通过 POST /api/profile/api-token 轮换,旧 Key 立刻失效。

登录方式对中国用户比较友好:手机号、邮箱、以及 GitHub / CSDN / 魔搭社区快捷登录都行。但站点有区域限制——中国站是 developer.amd.com.cn,国际站是 radeon-global.anruicloud.com,两边账号不互通,而且我实测打开国际站只有一个启动实例的控制台,没有 Token Factory 入口。所以现阶段,这基本是一份中国站限定福利。

现在免费能拿到什么

这是今天的实际目录(模型会变,官方明说可以随时增减):

模型 上下文 图片输入 思考模式
DeepSeek-V4-Flash-0731 1,048,576 不支持 默认关闭,可手动开
DeepSeek-V4-Flash-Vision-Exp 1,048,576 支持 默认关闭
Qwen3.8-Flash-Next 262,144 支持 默认开启
MiniCPM5-2B 131,072 不支持 不思考

两个值得说的点。一是 Qwen3.8-Flash-Next 是 Qwen4 架构的开放权重预览版,125B 总参数、每 token 只激活 6B,官方宣称在编程与 Agent 任务上超过 Qwen3.7-Plus;二是 百万 token 上下文和图片理解都在免费层里,这个组合在免费 API 里很少见。

但模型页里那几行「使用限制」才是真正的坑,而且官方文档写得很细:

  • Qwen3.8-Flash-Next 只接受一条 system 消息,且必须排在数组第一位,角色必须拼 system 这不是网关规则,是它权重自带的 Jinja 模板强制的。新版 OpenAI SDK 会把 system 发成 developer,直接违反它自己的模板——用官方 SDK 反而报错。DeepSeek 两个模型没这毛病,system 消息位置随意、可多条。
  • 有一批参数会被静默丢弃,不报错、不提示。 stopseedlogit_biaslogprobstop_kmin_prepetition_penalty 全在丢弃名单里。你以为设了停止词,其实是没设。
  • 思考模式的默认状态两个模型相反。 DeepSeek 不发 reasoning_effort 就不思考;Qwen3.8-Flash-Next 不发也在思考,而且默认档是它最长的 xhigh。要写一套跨模型代码,档位取 lowmedium 才通用——顶层档位的名字不统一,Qwen 叫 xhigh,DeepSeek 还额外接受 max,两者不通用。

额度算不平:两个官方口径差了 74 倍

社区口径一致:每天约 10 美元的等值额度,每日重置、不过夜。这个 $10 在官方文档里能对上——GET /api/profile/model-usage 的示例响应里写着 daily_cost_limit_usd: 10

问题在于,这 $10 到底能换多少 token,官方给了两套互相打架的口径。

口径一:模型卡上的积分换算。 展示价是输入 0.14 pts / 百万 token、输出 0.28 pts / 百万 token、缓存命中 0.0028 pts / 百万 token。这三个数字恰好等于 DeepSeek V4-Flash 涨价前的官方美元价。按这个算,$10 能换约 3570 万个输出 token。

口径二:官方 usage 接口的示例。 同一份文档里,示例响应写着「今天 142 次请求、88,214 token、花费 $1.8412」,last_30_days 是「2840 次请求、1,904,221 token、$39.77」。两条数据折算下来都是 每百万 token 约 20.9 美元。按这个算,$10 只能换约 48 万个 token。

两个口径差 74 倍。同一天花同样的钱,一个能跑三十多万字,一个只能跑几千字。

官方对这个问题的回答是:「上面的数字只是示例,你的真实限额以接口返回的为准——账号之间不一样,而且会变。」换句话说,注册完第一件事应该是调一次 GET /api/profile/model-usage,看自己账号到底记的是什么价,再决定要不要把它当主力通道。

作为参照系:DeepSeek 官方 API 现在的价格是 V4-Flash 输出 4.5 元/百万 token(空闲时段)到 9 元(高峰),折合 0.63 到 1.27 美元。如果 AMD 走的是口径一,那确实白拿;如果走口径二,那它按的是「原价」,只是不向你收钱。

额外提一句,AMD 的免费共享 API 和 Radeon Cloud 的 credits 是两套完全独立的账:免费模型不吃 credits,credits 只在跑 GPU 实例时消耗,而且实例闲置照样烧,一个账号同时只能开一个实例。别把「领了 100 美元云信用额」和「每天 10 美元模型额度」当成一回事。

限流和条款:真正卡住你的是这两样

额度之外还有两道独立的闸门,任一道都能把你拦下来:

  • 平台准入层:每个 Key 30 请求/分钟、每 IP 120 请求/分钟、每 Key 8 个并发,另有按模型、按服务进程、按平台全局三档并发限制。
  • 网关计量层:每个账号 20 请求/分钟(60 秒滑动窗口),外加每日消费上限。

账号级 20 RPM 比 Key 级 30 RPM 更严,这点很容易被忽略——只盯着 30 配限流的人会莫名撞 429。好在限流状态不用猜,每个成功响应都带余量头:X-RateLimit-Remaining-User-RPM 看分钟余量,X-RateLimit-Remaining-User-Daily-USD 看当天还剩多少额度。被限时返回 429 加 Retry-After(分钟限制给 60 秒,并发限制给 1 秒)。

需要提醒的是,文档里对「每日额度什么时候重置」有两处矛盾表述:一处说是「从你第一个计费请求起算的滚动周期,不是固定午夜边界」,另一处说是「按 Asia/Shanghai 每日重置」,示例又给了零点。以自己账号返回的 daily_reset_at 为准——这直接影响你的批处理任务会不会跑一半断在半夜。

真正需要逐字读的是服务条款,官方这次写得很直白,几条红线:

  • 一人一个 Key。 同一个人开多个账号持 Key,包括用邮箱加点、+tag 别名绕过,会导致 Key 被停用;共用、转让、出售 Key 同样停用。
  • 禁止任何形式的转售,包括藏在代理、网关、聚合器后面。 官方原话是:任何人都可以自己注册免费使用,没有任何第三方被授权转卖这项服务;把服务或模型包装成自己的产品、指示模型谎报自己是哪家的、池化账号提升团队容量,都在禁止之列。市面上那些「AMD 免费 API 中转站」,接入即违规。
  • 它记录你的 prompt 和模型输出。 官方明说会记录 API 请求内容,对话内容保留约 2 天滚动窗口后删除,元数据保留更久;不用于训练、不出售、不共享第三方。文档里那句写得很实在:「我们告诉你这件事是因为它属实,不是因为舒服——如果某段 prompt 你不希望被存下来,就别发。」
  • 禁止处理个人、健康、金融等敏感数据。 这是试用服务,机密内容一律不要发。
  • 它不是生产服务。 无 SLA、无可用性承诺、无支持义务;模型可随时增删,端点和 Key 可因运维原因重启或吊销。

和 NVIDIA、商汤、魔搭放在一起比

同量级的免费 API 通道不多,横向摆一下:

服务 免费形式 主要短板
AMD Token Factory 每日额度上限,OpenAI + Anthropic 双协议 中国站限定,账号级 20 RPM,记录 prompt
NVIDIA NIM 40 RPM,无每日上限,模型 100+ 全站共享 40 RPM,社区反馈经常超时
商汤 SenseNova 公测免费,滚动 5 小时 60k 积分 限时公测,付费档已在路上
魔搭 ModelScope 约 200 次/日 需阿里云实名,仅限个人非商用
火山方舟 每日 200 万 token 需注册实名

AMD 的差异点很清楚:唯一同时提供 OpenAI 和 Anthropic 两种接口格式的免费通道,意味着 Claude Code 这类只认 Anthropic 协议的客户端不用装任何转换中间件就能直连;再加上百万上下文和图片理解都在免费层,这个组合目前独一份。

输的地方也清楚:模型只有四个、目录随时变、账号级 20 RPM 比 NVIDIA 的 40 RPM 更紧、中国站限定。

适合谁:想免费跑 DeepSeek-V4-Flash 或 Qwen3.8-Flash-Next 写代码、搭 Agent、做长文档实验的个人开发者;手上有 Claude Code 想换个便宜后端的人。

不适合谁:要上生产的(无 SLA)、要发敏感数据的(记录 prompt)、要分享给团队或对外转发的(条款直接封)、要依赖 embeddings 做 RAG 的(免费层不提供)。

我的判断

值得注册,但别当主力。

它免费、官方托管、协议标准、接入成本几乎为零——对中国开发者来说,这是当前最容易白拿到 DeepSeek 旗舰和 Qwen4 预览版模型的途径之一,光这一点就值得花十分钟把 Key 拿到手。

但三个前提必须摆清楚:额度口径没算平(两个官方数字差 74 倍,注册后第一件事是查自己的实际计价);它记录 prompt(约 2 天滚动窗口,方便调试,但任何机密内容别发);它明说不是生产服务(模型今天有明天可能没,别硬编码模型名,用 GET /v1/models 现查)。

观望信号也很明确:等官方把计价口径写清楚,或者等它走出中国站。

顺便说一句,AMD 这几年在「开发者免费额度」上给得比硬件大方——AI 开发者计划里还有 100 美元 AMD Developer Cloud 信用额(约合单卡 MI300X 跑 50 小时)、50 美元 Fireworks AI 额度,不过云信用额激活后 30 天过期,领了不用的记得别放过期。

价格与额度截至 2026-09-10,以官网为准(官方文档多处标注 Last updated: 2026-09-10)。本文为独立评测,与 AMD 无利益关系,未接受任何形式的赞助或免费额度;本次未注册账号、未自购任何档位,以上为官方文档(含官方端点实测记录)与公开社区信息解析,非本人实测体验。

延伸阅读:

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

美国司法部调查英伟达 200 亿美元 Groq 交易:不买公司只买人和授权,能绕开反垄断审查吗

美国司法部调查英伟达 200 亿美元 Groq 交易:不买公司只买人和授权,能绕开反垄断审查吗

200 亿美元,这是英伟达历史上最大的一笔”交易”。但从去年 12 月到现在,公司官方口径始终是同一句话:我们没有收购 Groq。

9 月 9 日,《纽约时报》报道称,美国司法部正在调查这笔交易是否被刻意设计成”技术授权 + 挖人”的结构,以绕开反垄断审查。报道援引两名知情人士的说法:调查在去年 12 月交易公布后不久就已启动,司法部已经向英伟达发出正式的资料索取函。如果最终认定英伟达在这笔交易上处理失当,司法部可以开出罚单,但不太可能要求把交易拆回原样。

英伟达发言人的回应也很有意思:”Groq 这件事,是美国制度按其设计运转的典范——鼓励创新、回报创业者、让消费者受益。”

交易长什么样:一份非独家授权协议,加一群人

2025 年 12 月 24 日,英伟达与 AI 推理芯片公司 Groq 宣布达成协议。按当时的公开报道(CNBC 口径),英伟达将支付约 200 亿美元,获得 Groq 推理芯片设计技术的非独家授权;作为协议的一部分,Groq 创始人兼 CEO 乔纳森·罗斯(Jonathan Ross)、总裁桑尼·马德拉(Sunny Madra)及核心员工加入英伟达;Groq 则继续作为独立公司运营。(路透社本周的报道把金额写作 170 亿美元,两家口径存在出入。)

Groq 的技术路线和英伟达不完全一样:它主攻推理——也就是模型上线之后跑任务的那一段——芯片能效更高,此前被视作英伟达在推理市场上的潜在挑战者。

为什么美国监管要查:这笔交易绕过了自动审查

关键在于美国的并购审查机制。按《哈特-斯科特-罗迪诺法》(HSR),只有达到申报门槛的交易才需要事先申报,2026 年的门槛是 1.339 亿美元。一笔 200 亿美元的收购,正常情况下必然要过这道关口;但如果拆成”技术授权 + 雇佣核心团队”,公司主体没被买走,这笔交易就不在自动审查的范围内。

这套玩法在硅谷已经流行了好几年:

  • 2024 年 3 月,微软支付 6.5 亿美元,从 Inflection AI 挖走两位联合创始人及绝大部分团队,公司留在原地;
  • 2024 年 8 月,谷歌以约 27 亿美元从 Character.AI 挖回 Noam Shazeer 等约 30 名核心人员。

英伟达自己更是熟手。2025 年 9 月,它以超过 9 亿美元授权芯片互联公司 Enfabrica 的技术,同时收下其 CEO 与团队;Groq 之后,2026 年 8 月又来了第三次——60 亿美元买下 AI 编程公司 Poolside 的”模型工厂”授权,向 109 名参与核心模型研发的工程师发出聘书,另外再投 10 亿美元,Poolside 估值 120 亿美元。

监管并不是没看见:

时间 事件
2025-12-24 英伟达与 Groq 宣布约 200 亿美元授权协议,核心团队加入英伟达
2026-02-04 参议员沃伦、怀登、布卢门撒尔呼吁 FTC 与司法部审查 AI”反向挖角”交易
2026-03-18 司法部反垄断部门负责人公开称这类交易是”危险信号”
2026-03-23 沃伦与布卢门撒尔致信黄仁勋,要求 4 月 3 日前解释交易结构
2026-09-09 《纽约时报》报道:司法部正在调查这笔交易是否规避反垄断审查

那封信里有一句话被广泛引用:”通过授权技术并雇走最重要的员工,英伟达实际上已经在名字之外收购了 Groq。”

这笔交易到底伤到了谁

最直接的证据来自 OpenAI。今年 2 月路透社报道,OpenAI 曾考虑采用 Groq 芯片,作为某些推理任务上比英伟达更省电的替代方案;但在英伟达的授权交易公布后,双方的谈判被”叫停”,OpenAI 转而承诺采购更多英伟达芯片。

这正是反垄断关注的核心:技术许可是非独家的,理论上别人还能用;但设计芯片的人被挖走之后,这项技术对第三方的实际价值会大幅缩水。英伟达目前控制着约 90% 的 GPU 市场,3 月 16 日又发布了集成 Groq 技术的新推理处理器,官方称最高可把 AI 处理速度提升 35 倍。

Groq 自己的处境也很耐人寻味。卖掉技术授权和最核心的团队之后,这家公司转向 neocloud(推理云)业务:2026 年 6 月融资 6.5 亿美元,8 月再融 3.5 亿美元、估值 35 亿美元——而它云上跑的算力,正是英伟达的卡。

罚单不是重点,下一次才是

对英伟达来说,最坏的情况大概率是罚款加整改承诺,而不是拆分——《纽约时报》的报道也提到,司法部不太可能寻求撤销这笔交易。真正被改变的是”下一次”:Poolside 那笔 60 亿美元的授权交易已经在同样的审视之下,而任何还想复制”授权 + 挖人”结构的公司,都得先算一笔合规成本。

对 AI 创业者来说,影响可能更现实:过去两年,卖团队是最快的退出方式,”巨头买人不买壳”撑起了一批公司的估值;如今这条路被监管盯上,通道只会更窄、更慢、更贵。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

你的 AI 编码工具很强,但它不像一个团队:每次新任务都要你重新叮嘱上下文、流程和规矩,写代码行,可「先想清楚再动手、写完自己测、改完自己审」这套工程纪律它不记得。于是有人把整个「工程操作系统」打包成了技能库——8 个月拿下 25.5 万星。

ECC 是什么:给 Agent 装的「操作系统」,不是又一个工具

ECC(Everything Claude Code)是 affaan-m(Affaan Mustafa,纽约,AI 算力交易平台 Itô Markets 创始人)自 2026-01-18 起单人维护的开源项目,MIT 协议。它的自我定位是「agent harness operating system」——不写一行模型代码,而是给 Claude Code、Codex、Cursor、OpenCode、Gemini、Zed 等 10 个 AI 编码工具套上一层工程方法论:技能(Skills)、专职 Agent、钩子门禁(Hooks)、记忆与安全扫描。

核心循环一句话:plan → test → implement → review → verify → remember → improve(规划→测试→实现→评审→验证→记忆→改进),口号是「优化上下文窗口,其余全部持久化」。装一次,agent 从此自带团队纪律,不用每次把流程写进 prompt。

仓库当前规模(2026-09-10 实测 clone 全量核实):68 个专职 Agent、286 个技能、94 个命令、22 种语言规则集、4 组钩子,外加实验性的 ecc2/——Rust 写的「跨 harness 统一控制面」(终端面板 + SQLite 会话库 + 守护进程,仍为 alpha)。

暴涨曲线:21 天 4 万星,8 个月 25.5 万

时间 星数 事件
2026-01-18 1 仓库创建
01-21(第 4 天) 6,400 病毒式传播启动
01-26(第 9 天) 28,800
02-07(第 21 天) 40,000 官方 star-history 曲线(仓库内嵌数据)
03-23 100,000 augmentcode.com 报道破 10 万
05 月底 ~200,000 多个第三方评测时点
2026-09-10 255,150 GitHub API 实测;fork 38,224

星数已达 GitHub 全站头部级别,且今日仍在合 PR(编号 #2907+)。增速从单日数千星回落到月均约 3 万——非刷量式瞬时爆发,是持续近 8 个月的稳定增长。npm 侧:ecc-universal 月下载约 1.9 万次、ecc-agentshield 约 2.9 万次,最新 2.2.1(2026-08-25 发 v2.2.0,单次迭代 108 commits / 530 文件 / 4 万行增改)。

拆解:68 个 Agent 和 286 个技能,质量如何?

Agent(68 个,每个约 5KB 角色文档):architect(架构师)等角色在 frontmatter 里直接指定 model: opus 和工具白名单,正文开头是完整的「Prompt Defense Baseline」反提示注入基线——unicode 同形字、零宽字符、上下文窗口溢出攻击、第三方抓取内容一律按不可信处理。把安全基线写进每个 Agent 的,在开源技能库里不多见。

技能(286 个,实测 0 空壳):90%(258 个)是约 12KB 的扎实单文件 SKILL.md,10% 带 scripts/examples/references 五件套(如 agent-self-evaluation 含评分脚本 + 高低分对照例)。内容质量抽样很高:article-writing 技能直接内置禁语清单——game-changercutting-edge、「In today’s rapidly evolving landscape」这类 AI 套话全部拉黑,要求「用证据不用形容词」;benchmark 技能给出 LCP/CLS/INP 等 Core Web Vitals 可执行测量流程。覆盖从 accessibility、android-clean-architecture 到 kubernetes-patterns、agent-payment-x402 的广度。

钩子与治理:Bash 前置钩子在每次命令执行前跑质量/tmux/推送/GateGuard 检查,可阻断(exit 2);SessionStart 自动恢复上次会话上下文。2026 年 6 月做过一次 MCP 审计:默认连接器从 6 个砍到 1 个(github/context7/exa/memory 等全部退役,改由技能包 CLI 直连)——与「MCP 收紧」行业趋势同步。

数字之外:三处必须泼的冷水

①星多、装少:25.5 万星 vs 双 npm 包合计月下载不足 5 万。配置型仓库本就 clone 即用、无需反复安装,比例合理,但「收藏 > 实际部署」的现实要认清——155MB 全家桶装进日常 workflow 是另一回事。

②「免费」的分层:README 功能表把 AgentShield 标为 Included,但完整扫描(私仓、PR 触发审计、AgentShield 扫描服务)实际在 ECC Pro,$19/席/月;免费层 = OSS 本体 + GitHub App 公开仓每月 10 次分析。核心方法论免费,深度自动化要订阅——与同类「开源引流、SaaS 收费」模式一致,但宣传口径值得留意。

③单点风险:25.5 万星项目由单人维护(赞助商列表含其自家公司 Itô Markets,利益需自行判断);中文社区流传的「Anthropic 黑客松一等奖」头衔在官方 README/CHANGELOG 中未见佐证;HN 等圈外社区几乎没有高热度讨论——热度高度集中在 GitHub 生态内部。

安装、适合谁、值不值

# Claude Code 内两行装(二选一,勿叠加)
/plugin marketplace add https://github.com/affaan-m/ECC
/plugin install ecc@ecc
# 或终端引导安装
npx ecc-universal setup

适合:重度 Claude Code/Codex 用户,尤其想给多个 Agent 会话统一纪律、要安全基线和审计的企业开发者——68 个专职 Agent + 反注入基线 + 记忆系统是实打实的工程资产。不适合:轻度用户——286 个技能默认全装进上下文管理面,对「偶尔用一次 AI 写代码」的人是负担。

坐标系里看:若说 context-mode 深度评测(21k★ MCP 沙箱) 管的是「上下文输入」、Caveman 实测(99k★ 输出纪律) 管的是「输出纪律」,ECC 管的是整条工程流水线——它是目前这个品类里体量最大、方法论最完整的一个。结论:值得一试,但先想清楚你是要「收藏一套方法论」还是「真的把工程队纪律装进日常」——后者需要投入,不是 npx 一下就能白得。

本文基于 2026-09-10 全量 clone(3,538 文件)静态实证 + GitHub API/npm 官方数据交叉核验;沙盒环境无 Claude Code,未做安装后运行态实测。ECC 含 $19/席/月的 Pro 商业层,评测立场独立。

苹果发布首款折叠 iPhone Duo:1999 美元起,Siri AI 下周推送但中文还要等

苹果发布首款折叠 iPhone Duo:1999 美元起,Siri AI 下周推送但中文还要等

1999 美元——苹果等了近十年的首款折叠 iPhone,今天凌晨终于登场。但整场发布会看下来,真正的重头戏不是那块能对折的屏幕,而是一个叫 Siri AI 的东西:它 9 月 15 日就要随 iOS 27 推送,却首发只支持英语——中文用户,还得等。

折叠 iPhone 来了:1999 美元,配史上最强端侧 AI

北京时间 9 月 10 日凌晨 1 点,苹果在 Apple Park 举行秋季发布会(主题「亮新篇,来耀眼」),这是接替 Tim Cook 出任 CEO 的 John Ternus 首场发布会。新品清单里最炸的是 iPhone Duo——苹果首款折叠 iPhone:展开是 7.6 英寸内屏,合上是 5.4 英寸外屏,起售价 1,999 美元(国内 15,999 元起),10 月 16 日预购、10 月 23 日开售,中国在首批 70 多个国家名单内。

型号 亮点 起售价
iPhone Duo(折叠) 7.6″ 内屏 + 5.4″ 外屏,A20 Pro,双电池 $1,999 / 15,999 元
iPhone 18 Pro / Pro Max 可变光圈相机升级,「智能个人中枢」 $1,199 起
Apple Watch Series 12 / Ultra 4 Siri AI 摘要 + 对话回顾 待公布

iPhone Duo 搭载的 A20 Pro 是 2 纳米制程:6 核 CPU 快 20%、7 核 GPU 快 40%,最值得注意的是双 16 核神经网络引擎,AI 算力翻倍,统一内存带宽提升 50%——苹果把「复杂 AI 工作负载」和散热(定制均热板)直接写进了芯片宣传页。折叠屏铰链由 100 多个组件构成,外壳 3D 打印,苹果透露制造环节用上了 AI。

真正的大招是 Siri AI:语音助手 15 年来最大改版

如果只看硬件,iPhone Duo 是「折叠迟到者」;但苹果真正的 AI 宣言藏在软件里。Siri AI 是 Siri 诞生 15 年来最大一次重做,随 iOS 27 以 beta 形式推送(北京时间 9 月 15 日),底层由苹果与 Google 合作的定制 Gemini 模型驱动:

  • 不再是弹窗语音助手:Siri 变成独立 App,界面类似 ChatGPT,可以打字、可以连续多轮对话,历史会话经 iCloud 私密同步
  • 个人上下文理解:能跨信息、邮件、照片找你「当下需要的东西」;屏幕感知——看到什么就能针对内容回答、操作
  • Siri Camera 模式:打开相机问 Siri,让它「看你所看」再回答或执行
  • 随处写作:在任意输入框描述需求,Siri 帮你写、帮你改
  • 端侧优先 + Private Cloud Compute:隐私架构不变,能本地跑的不上云

配套的 Apple Intelligence 也升级:照片支持 Spatial Reframing / Extend / 更强的 Clean Up,Image Playground 可生成写实图像并支持 SynthID 水印(AI 生成/编辑图可被识别),Safari 新增 Notify Me 盯页面变化。

但中文用户要等。 官方口径:Siri AI 首批仅英语;10 月扩法语、日语、韩语、葡萄牙语、西班牙语五种;简体中文在 16 种计划语言内,却没有任何时间表——IT之家等媒体直接用了「国行遥遥无期」。基础 Apple Intelligence 的简体中文支持会随 iOS 27 同步到来,但可用性因地区而异。

为什么是「折叠 + 2nm + 端侧 AI」:苹果的算力赌注

把 Siri AI、iPhone Duo、A20 Pro 放在一起看,苹果的棋局很清楚:端侧 AI 才是它的主场

生成式 AI 这三年,OpenAI、Google 的答案是「模型更大、云更强」;苹果能打的牌从来只有一张——算力就在你口袋里。A20 Pro 的神经网络引擎算力翻倍、带宽提升 50%,为的就是让「个人上下文 + 屏幕感知」这类重活能在本机跑完,再配合 Private Cloud Compute 处理更重请求。折叠大屏 + 端侧 AI 的组合,本质是给「AI 助理看得更多、上下文更大」找一块更大的画布:分屏左边看内容、右边跟 Siri AI 对话,是这场发布会最直白的演示。

同场发布的 Apple Watch Series 12 / Ultra 4 也补了 AI 功能:Siri Recap 自动整理一天对话要点,Live Rewind 能回放刚才 15 秒没听清的话,还能用环境聆听记录团队会议、家长会内容——隐私设计上,苹果强调转录是 opt-in、原始音频不可访问、处理后即删除。这条「录音权限」线,苹果踩得比谁都谨慎。

迟到的追赶者:Siri AI vs ChatGPT vs Gemini

坐标系拉远一点:折叠屏赛道三星、华为已经卖了两三年,iPhone Duo 拼的是「苹果生态 + AI 整合」而非首发;AI 助理赛道,ChatGPT 2022 年就火了,苹果直到 2026 年 WWDC 才正式端出 Siri AI,还选择了与 Google 合作、用定制 Gemini 当底座——在模型层认输,在端侧和生态层决战,是苹果这一轮最务实的姿态。

代价也很明显:Siri AI 首发只有英语、功能偏基础(拼写纠正、拍照问 Siri、照片消除等先上),中文用户看到完整形态的时间表未知。这台折叠 iPhone 卖的不只是硬件,是「AI 助理时代的第一张船票」——而国内用户拿到票的时间,还没有人知道。苹果与 OpenAI 的恩怨(此前起诉其窃取商业机密、涉 400 名前员工)与 AI 硬件的全面竞赛,我们此前已拆过;而「AI 助理到底能多能干」,也可以对照我们实测的通用 Agent 方案。

判断:苹果打的是慢棋,但底牌没掀完

一句话:苹果用一场发布会宣告 AI 助理战正式开打——端侧算力翻倍是筹码,Siri AI 是号角,折叠屏只是载体。它迟到两年,却握着一张别人没有的牌:10 亿级设备生态 + 隐私叙事 + 自研芯片。Siri AI 首版越保守,越说明苹果把这场仗当长跑:9 月 15 日英语用户先上车,中文版、完整功能、更多语言会在后面几个版本分批到。对普通用户,建议只有一个:先别急着为 AI 换机,等 Siri AI 中文版落地、看真实口碑再决定——苹果的 AI,从来是「慢但稳」,这一次也不会例外。

关注 AI商业快讯,每天一篇 AI 热点深度解读。相关阅读:苹果起诉 OpenAI 窃取商业机密:400 名前员工涉案,AI 硬件竞赛引爆法律战 · Open Minis 实测:手机里的 Linux 沙盒 + AI Agent,比 Siri 能干 100 倍

Anthropic 双线承压:Claude Max 订阅被指 5x/20x 虚标遭前 FTC 律师集体诉讼,黑客偷会话烧光用户 $200 月费

Anthropic 双线承压:Claude Max 订阅被指 5x/20x 虚标遭前 FTC 律师集体诉讼,黑客偷会话烧光用户 $200 月费

8 月的一天,英国独立 AI 顾问 Grant De Swardt 没碰电脑,他 200 美元/月的 Claude Max 20x 账号用量却在悄悄上涨。他禁用全部挂接、暂停定时任务、关掉云端执行,做了一次干净的对照实验——用量仍然从 45% 爬到了 55%。找 Anthropic 要用量明细,得到的答复是:明细没有,但确实异常——随后封停账号、作废所有会话、退了 44.49 英镑了事。

几乎同一时间,另一场针对 Anthropic 的攻势也在升级:Claude 订阅用户的集体诉讼被「扩大重递」,接手的是两位曾在 FTC 反垄断旗手 Lina Khan 麾下任职的律师。一边是用户告它「额度虚标」,一边是黑客偷会话烧它的订阅额度——Anthropic 引以为傲的重度用户生意,正在两头失火。

前 FTC 律师接手,集体诉讼扩大重递

9 月 9 日,The Verge 报道:一批 Claude 订阅用户向法院提交了扩大版集体诉讼,指控 Anthropic 对其 Max 订阅层级的额度上限做了欺骗性宣传。带队律师是 Monica Vaca 和 Kati Daffan——两人都曾在前 FTC 主席 Lina Khan 任内工作。报道称,这是「罕见的、试图用法律惩罚 AI 公司日益明显的金钱挤压(money squeeze)」的动作。

这起案件 6 月 15 日首次提起:华盛顿特区用户 Karl Kahn 为高强度编码升级到 Max 20x(200 美元/月),在加州北区联邦法院起诉,称 Max 5x(100 美元/月)与 20x 的实际可用额度远低于宣传。今天的新版本扩大了原告群体,并换上监管经验更丰富的律师阵容。

「5x」「20x」的水分藏在两次点击之后

诉讼核心指控很具体:Anthropic 营销图里醒目的「5x」「20x」,指的是相对 Pro 订阅(20 美元/月)的额度倍数。但实际条款里,这个倍数只在 5 小时的会话窗口内成立,且整个账号还受每周上限约束——加总起来,用户实际获得的总量提升远小于「5 倍」「20 倍」的心理暗示。

想搞清这层意思有多难?按原告律师的说法:要点两次不同的超链接才能看到「session」这个词,而要看懂「session」的定义,还得再去 Pro 订阅页面单独翻找。用户在社区里的算账更扎心:7 月 14 日一名 20x 新订阅用户称自己 2.5 小时就撞上了周上限;Mashable 5 小时前的跟进报道算了一笔账——把每周上限摊进去,20x 用户为每小时实际用量付的钱可能比 5x 甚至 Pro 还高。Reddit 上 8 月 31 日的高赞帖标题直言:「Anthropic 正在光速耗尽用户的信任。」

另一条战线:会话被偷,额度被烧

比「说不清买了多少」更糟的是「没干活也被扣量」。TechCrunch 9 月 8 日披露:Anthropic 已向部分用户发出警告邮件,确认有恶意行为者正用常见的 infostealer(信息窃取木马)偷走人们电脑上的 Claude 登录会话,再借此访问账号、消耗订阅额度。

De Swardt 的经历是典型样本:Anthropic 调查后告诉他,一个被攻破的 Claude session key 被用来铸造了未授权的 Claude Code OAuth 令牌,账号「可能被某个看起来未经授权的第三方服务用于处理他人活动」,但官方也无法确定入侵途径。他的账号两周后才恢复,期间业务停摆,最终他取消订阅转投 Cursor——「其他模型没那么大差别,也没好到哪去」。

更让用户后背发凉的是结构性缺陷:账号支持只追踪总用量、不提供分项明细,即便用户主动要求也不给。这意味着此类盗刷可能持续数月无人察觉。Reddit 上 80 多条评论里,有人称账号被自动升级扣款、用量从 0 冲到 100%;有人说只用了几条 prompt 加一次网页搜索,12 分钟里用量从 0 涨到 49%;还有人连续三天每天烧光全部额度,而自己根本没打开过 Claude。Anthropic 对被盗用户做了登出、作废授权和部分退款,并提醒他们可能中了木马——但对「用户如何主动识别盗刷」这一问题,官方拒绝评论。

订阅价值保卫战的反噬

两条战线其实同源。Anthropic 反复强调重度用户是核心业务——The Verge 直言,公司为保护订阅价值,甚至不惜切断 OpenClaw 等热门第三方应用(更早的 2026 年 1 月,它曾封禁绕过 Claude Code 订阅墙的开源编排工具 OmO,引发大规模用户抗议)。逻辑没错:订阅额度是它的收入根基。但当用户发现——第三方被切了、价格不便宜、额度说不清、被盗了也不知道——「保护订阅价值」就变成了「挤压订阅用户」,诉讼与退订潮(9 月 1 日曾冲上 X 热议趋势)随之而来。

往大了看,这是整个订阅制 AI 的共性问题:用量被做成黑箱,定价复杂度堪比电信套餐。前 FTC 律师的入场,是监管风向的一个信号——消费者保护视角正从「AI 安全」延伸到「AI 计费公平」。

对普通用户的实用建议:别把 Claude 等 AI 账号长期挂在浏览器或终端不登出;警惕来路不明的软件与广告(infostealer 的主要传播渠道);定期检查账号活跃会话与用量;发现异常立即作废全部会话并联系官方。额度是你的钱,黑箱不是挡箭牌。

相关阅读:

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

一、Agent 正在大规模进企业,但「敢不敢让它碰系统」成了刹车

产业数据已经不再抽象:微软披露数以万计的企业在管理数千万个 AI Agent,法国 IT 服务商 Atos 一家就在管 1.9 万个;Salesforce 的 Agentforce 累计完成了 24 亿个「agentic work units」——AI 真正替企业完成一件工作的次数。

但与此同时,安全案例也在刷新认知。36氪 2026 年 9 月 8 日转载的一篇文章讲了几个实验:骗子把指令藏在网页屏幕外 -9999 像素的位置,人类看不见、Agent 读得到;研究人员拿 26 个模型测一个假网站,GPT-5.4、Claude Sonnet 4.5 在只看到假站时都把它当成了可信入口;还有人伪造 Python 库诱导 Agent 付 3 美元买「软件许可证」,Llama、Gemini 共 4 个模型真的执行了付款。安全公司披露的 EchoLeak 漏洞更直接:员工不用点击任何链接,Copilot 处理邮件时,藏在邮件里的指令就能诱导它把内部信息带出去——「有了 Agent 帮忙,钓鱼邮件都不用你点击了」。

安全圈与产业界正在形成一个共识:Agent 越接近真实业务,治理越要前置。网易智企 6 月给 CEO 们发了一份检查清单,把内容边界、权限边界、数据边界、操作边界、审计记录和责任归属列为上线前必须回答的问题(出处:网易智企《安全合规治理不应等问题发生后再补》2026-06-17)。落到自己公司,问题会浓缩成一句很具体的话:让 AI Agent 操作业务系统之前,你怎么保证它不会乱建乱改数据?出了事,查得到是哪次操作、哪个账号干的吗?

二、为什么多数系统接不住 Agent

想让 Agent 干活,先得有接口。但大部分企业系统天生不是给 AI 用的:

  • 契约靠人写人读的文档:接口文档由人维护,版本一升级就漂移,Agent 按旧文档调新接口必然出错。有厂商吐槽过这个现状:「AI 不知道有什么内部系统、如何接入」(出处:火山引擎开发者社区 2025-06-12)。
  • 开放裸 API 却没有校验:Agent 的幻觉会直接变成脏数据——字段名拼错一个字母,一张坏表单就进了库。AI 接入的协议层(如 MCP)解决了「怎么连」,但正如一篇治理文章提醒的:它同时扩大了攻击面,企业必须配套认证机制和治理可见性,否则「连得上」不等于「敢让它操作」(出处:知乎《当MCP成为AI Agent的”企业接口”》2026-07-22)。
  • 审计缺失:AI 做了什么只能靠猜。行业对 AI 审计的要求是能回答四个问题:什么数据进来了、输出了什么、系统做了什么、谁批准的(出处:Collibra 2026-06-24)——多数系统一条都答不上。

三、GTS 的做法:把 AI native 做成机制,而不是口号

GTS 是一个多租户、元数据驱动的「表单+审批流」平台,走的是另一条路:既然 AI Agent 要进业务流程,那就从系统层面回答好三个问题——看得懂、改不坏、赖不掉

① 看得懂:机器可读契约,Agent 自己拉取,永不漂移

GTS 提供两个公开只读端点,无需登录,任何 Agent 启动时都能自己拉取:

  • /discovery/routes:当前全部 58 个 API 端点自动导出。后端每加一个路由,列表自动多一条——写作当天实测已是 58 条,任何静态文档都追不上这个更新速度。
  • /discovery/contract:配置域契约——认证方式、响应信封、多租户纪律、12 种字段类型及其附加属性、流程节点属性、单据状态机、审批动作枚举、字典用法。

因为契约从系统实现自动导出、与代码同源,它不会像人手维护的文档那样过时。AI 学的是系统自己的配置语言,不是一份翻译稿。(浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 当场可验。)

② 改不坏:服务端强校验,幻觉写不进数据库

表单 schema、流程 nodes 在落库前全部经服务端校验:字段类型必须在白名单内、字段 key 唯一且合法、select 必须有选项、流程节点名唯一、审批人规则必须合法。非法配置直接返回 400,并带精确到位置的报错——比如把 required 拼成 requred,会收到 schema_json[0] has unknown key(s): requred。Agent 收到报错可以自己修正重发;非法内容根本不落库。模型幻觉再离谱,也污染不了数据库。这正对应治理清单里那条底线:「系统接口返回异常时,不能反复提交或绕过校验」——GTS 把这条做死在了服务端。

③ 赖不掉:全操作审计,人与 Agent 一视同仁

每一次管理/变更写操作都记入审计日志:租户、操作者账号、动作、对象、IP、User-Agent、摘要,操作者自动从 token 解析。无论是人还是 Agent、用的是哪个账号、做了什么,全部可回看。前面说的四个问题(什么进来了、输出了什么、系统做了什么、谁批准的),在这里逐条有答案。

④ 官方直接把「Agent 上岗说明书」做成了可下载的技能包

GTS 把「AI 怎么操作这套系统」打包成一个官方技能包 gts-operator,下载地址:https://www.geeyo.com/s/gts/dist/skills/gts-operator.zip 。支持 skills 机制的 Agent(Claude Code / Codex 类)装上之后,用自然语言就能完成整套管理操作:帮客户开通租户并配管理员、维护组织架构与人员、配置表单与审批流(字段类型 / 条件分支 / 审批人规则)、发起业务单据、执行审批(同意 / 驳回 / 转办 / 加急)、查询与导出。它采用「动态发现」模式——先拉取 discovery 契约再动手,后端演进时技能无需手改。关键设计:Agent 与人类走的是同一套 API、同一份校验、同一份审计,系统没有给 AI 开任何后门。官方已用它跑通「注册租户→建组织→配表单/流程→发起单据→审批」的全链路验证。

四、三个值得展开的设计取舍

为什么「校验+审计+隔离」三件套缺一不可? GTS 的设计哲学是「安全是前提,不是功能」:校验保证非法内容不落库,审计保证每个操作可追溯,行级多租户保证跨租户访问一律 404。三件事同时存在,才敢把写操作开放给 AI——缺了任何一件,开放 API 给 Agent 都是在裸奔。

为什么契约能精确到字段级? 因为 GTS 本身是元数据驱动的:表单、流程、字典都是数据、都是配置。契约描述的正是系统实际运行的语言——字段类型、校验规则、状态机与实现同源,不存在「说明书和实物是两回事」。这是 AI native 能落地的地基,也是它和「事后补文档」式集成的根本区别。

边界在哪里? GTS 的 AI 能力覆盖表单+审批这类配置化业务域。它不是通用 BPM 重引擎,也不是 Agent 托管平台——它解决的是企业接 Agent 最前面那道坎:接得进、改不坏、赖不掉

五、十分钟自己验证

三步就能验证上面说的每一句:浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 看契约长什么样;下载 gts-operator.zip 装给手边的 Agent,用自然语言让它开一个租户、配一张报销单;再到演示站 https://www.geeyo.com/s/gts/ 注册、走完一张单的审批。AI native 是真机制还是噱头,动手十分钟就有答案。

DeepMind 发布 AlphaGenome Atlas:把人类 DNA 90 亿种单字母变异的后果全部算好,免费图谱先破一例罕见病

DeepMind 发布 AlphaGenome Atlas:把人类 DNA 90 亿种单字母变异的后果全部算好,免费图谱先破一例罕见病

90 亿——这是你我的 DNA 里可能出现的单字母突变总数。昨天(9 月 8 日),谷歌 DeepMind 宣布了一件听起来像科幻的事:把每一种突变的分子后果,都用 AI 预先算好了。这套名为 AlphaGenome Atlas 的图谱正式免费开放,数据量 1 PB,比获诺贝尔奖的 AlphaFold 数据库还大 30 多倍,而且已经帮科学家破了一例罕见病。

一张把所有 DNA 错误都标好的地图

人类基因组由约 30 亿个碱基对组成,但科学界对它的理解长期只停留在 2%——那部分负责编码蛋白质的「说明书」。剩下 98% 曾一度被误称为『垃圾 DNA』,实际上是调控基因活性的「总控台」,绝大多数与疾病相关的变异都藏在这里。

问题在于:人类基因组里共有约 90 亿种可能的单字母变异(专业叫单核苷酸变异 SNV),在实验室里逐一测试每一种,几乎不可能。DeepMind 的做法是让 AI 先跑:用去年 6 月发布的 AlphaGenome 模型,把 90 亿种变异的调控影响全部预计算成 1 PB 的数据集,再包上一层查询门户——零编码、免费,任何研究者打开网页就能查。

为了让科学家快速找到「哪个变异最要紧」,图谱还配了一个 AVI 评分:把 AlphaGenome(看基因调控)和 AlphaMissense(看蛋白质影响)两个模型的预测浓缩成一个数字,编码区和非编码区通吃,相当于给每个变异贴了个「危险指数」。测试显示它在多项致病性基准上达到一流水平。

罕见病破案现场:一个被忽略的变异

最能说明价值的,是图谱上线前就已经发生的实战。

美国博德研究所(Broad Institute)的团队在研究一批多年未确诊的罕见病病例。患儿基因里藏着一个 DNM1 基因变异——这个基因与癫痫性脑病密切相关,但此前的分析方法把它漏掉了。用 AVI 评分重新排序后,变异被高亮:AI 预测它制造了一个错误的剪接位点,导致蛋白质异常延长。后续实验筛选验证了预测,还顺藤摸瓜找到了附近一批同类变异。一个「大海捞针」的病例,就这样被 AI 图谱捞了出来。

埃克塞特大学的 Gareth Hawkes 则把图谱用在大人群上:他对 5.4 万余名英国生物样本库参与者的全基因组数据重新分析,按预测的分子效应给变异分组,结果多找回了 22% 的非编码基因关联——这些信号原本淹没在统计噪音里。他还锁定了调控 PLA2G7(与衰老相关)和 EGLN1(细胞氧传感器)的关键变异;聚焦图谱预测影响最大的前 1% 变异后,识别出 19 个与 BMI(身体质量指数)相关的遗传区域。

为什么说这是 AlphaFold 之后的又一步

把时间线拉长,DeepMind 的「AI 破解生命」路线图很清晰:2021 年 AlphaFold 2 解决蛋白质 3D 结构预测,拿下 2024 年诺贝尔化学奖;2022 年 AlphaFold 数据库把已知结构从 19 万实验样本扩展到 2 亿个预测,覆盖「蛋白质宇宙」;2025 年 AlphaGenome 模型登场,从看结构转向看基因调控。

今天的 Atlas 是第三步的规模化落地:如果说 AlphaFold 数据库是「蛋白质的谷歌地图」,AlphaGenome Atlas 就是「人类 DNA 的逐字注疏」——每个字母改写的后果都已标注。人类基因组计划 2003 年完成「读出」全部序列用了 13 年,如今 AI 正把「读懂」每一个变异变成可查询的服务。

边界与判断

冷静的一面要说清楚:这是预测图谱,不是诊断工具。DeepMind 在发布说明里明确标注,AlphaGenome「未经临床验证、不获准用于任何临床用途」;基因与疾病的关系也远比单点突变复杂,图谱的价值是帮研究者缩小范围、加速验证,而不是直接给普通人出「基因体检报告」。商业授权将在后续通过谷歌云开放。

但方向已经明确:AI for Science 正在从「预测单个结构」走向「穷举式解释整个基因组」。DeepMind 自己也把 Atlas 定位为「基线而非终点」——模型每升级一次,这张 90 亿变异的地图就会更精细一层。对全球约 3 亿罕见病患者和无数遗传病研究者来说,这是一份刚打开的礼物。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读: