美国司法部调查英伟达 200 亿美元 Groq 交易:不买公司只买人和授权,能绕开反垄断审查吗

美国司法部调查英伟达 200 亿美元 Groq 交易:不买公司只买人和授权,能绕开反垄断审查吗

200 亿美元,这是英伟达历史上最大的一笔”交易”。但从去年 12 月到现在,公司官方口径始终是同一句话:我们没有收购 Groq。

9 月 9 日,《纽约时报》报道称,美国司法部正在调查这笔交易是否被刻意设计成”技术授权 + 挖人”的结构,以绕开反垄断审查。报道援引两名知情人士的说法:调查在去年 12 月交易公布后不久就已启动,司法部已经向英伟达发出正式的资料索取函。如果最终认定英伟达在这笔交易上处理失当,司法部可以开出罚单,但不太可能要求把交易拆回原样。

英伟达发言人的回应也很有意思:”Groq 这件事,是美国制度按其设计运转的典范——鼓励创新、回报创业者、让消费者受益。”

交易长什么样:一份非独家授权协议,加一群人

2025 年 12 月 24 日,英伟达与 AI 推理芯片公司 Groq 宣布达成协议。按当时的公开报道(CNBC 口径),英伟达将支付约 200 亿美元,获得 Groq 推理芯片设计技术的非独家授权;作为协议的一部分,Groq 创始人兼 CEO 乔纳森·罗斯(Jonathan Ross)、总裁桑尼·马德拉(Sunny Madra)及核心员工加入英伟达;Groq 则继续作为独立公司运营。(路透社本周的报道把金额写作 170 亿美元,两家口径存在出入。)

Groq 的技术路线和英伟达不完全一样:它主攻推理——也就是模型上线之后跑任务的那一段——芯片能效更高,此前被视作英伟达在推理市场上的潜在挑战者。

为什么美国监管要查:这笔交易绕过了自动审查

关键在于美国的并购审查机制。按《哈特-斯科特-罗迪诺法》(HSR),只有达到申报门槛的交易才需要事先申报,2026 年的门槛是 1.339 亿美元。一笔 200 亿美元的收购,正常情况下必然要过这道关口;但如果拆成”技术授权 + 雇佣核心团队”,公司主体没被买走,这笔交易就不在自动审查的范围内。

这套玩法在硅谷已经流行了好几年:

  • 2024 年 3 月,微软支付 6.5 亿美元,从 Inflection AI 挖走两位联合创始人及绝大部分团队,公司留在原地;
  • 2024 年 8 月,谷歌以约 27 亿美元从 Character.AI 挖回 Noam Shazeer 等约 30 名核心人员。

英伟达自己更是熟手。2025 年 9 月,它以超过 9 亿美元授权芯片互联公司 Enfabrica 的技术,同时收下其 CEO 与团队;Groq 之后,2026 年 8 月又来了第三次——60 亿美元买下 AI 编程公司 Poolside 的”模型工厂”授权,向 109 名参与核心模型研发的工程师发出聘书,另外再投 10 亿美元,Poolside 估值 120 亿美元。

监管并不是没看见:

时间 事件
2025-12-24 英伟达与 Groq 宣布约 200 亿美元授权协议,核心团队加入英伟达
2026-02-04 参议员沃伦、怀登、布卢门撒尔呼吁 FTC 与司法部审查 AI”反向挖角”交易
2026-03-18 司法部反垄断部门负责人公开称这类交易是”危险信号”
2026-03-23 沃伦与布卢门撒尔致信黄仁勋,要求 4 月 3 日前解释交易结构
2026-09-09 《纽约时报》报道:司法部正在调查这笔交易是否规避反垄断审查

那封信里有一句话被广泛引用:”通过授权技术并雇走最重要的员工,英伟达实际上已经在名字之外收购了 Groq。”

这笔交易到底伤到了谁

最直接的证据来自 OpenAI。今年 2 月路透社报道,OpenAI 曾考虑采用 Groq 芯片,作为某些推理任务上比英伟达更省电的替代方案;但在英伟达的授权交易公布后,双方的谈判被”叫停”,OpenAI 转而承诺采购更多英伟达芯片。

这正是反垄断关注的核心:技术许可是非独家的,理论上别人还能用;但设计芯片的人被挖走之后,这项技术对第三方的实际价值会大幅缩水。英伟达目前控制着约 90% 的 GPU 市场,3 月 16 日又发布了集成 Groq 技术的新推理处理器,官方称最高可把 AI 处理速度提升 35 倍。

Groq 自己的处境也很耐人寻味。卖掉技术授权和最核心的团队之后,这家公司转向 neocloud(推理云)业务:2026 年 6 月融资 6.5 亿美元,8 月再融 3.5 亿美元、估值 35 亿美元——而它云上跑的算力,正是英伟达的卡。

罚单不是重点,下一次才是

对英伟达来说,最坏的情况大概率是罚款加整改承诺,而不是拆分——《纽约时报》的报道也提到,司法部不太可能寻求撤销这笔交易。真正被改变的是”下一次”:Poolside 那笔 60 亿美元的授权交易已经在同样的审视之下,而任何还想复制”授权 + 挖人”结构的公司,都得先算一笔合规成本。

对 AI 创业者来说,影响可能更现实:过去两年,卖团队是最快的退出方式,”巨头买人不买壳”撑起了一批公司的估值;如今这条路被监管盯上,通道只会更窄、更慢、更贵。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

你的 AI 编码工具很强,但它不像一个团队:每次新任务都要你重新叮嘱上下文、流程和规矩,写代码行,可「先想清楚再动手、写完自己测、改完自己审」这套工程纪律它不记得。于是有人把整个「工程操作系统」打包成了技能库——8 个月拿下 25.5 万星。

ECC 是什么:给 Agent 装的「操作系统」,不是又一个工具

ECC(Everything Claude Code)是 affaan-m(Affaan Mustafa,纽约,AI 算力交易平台 Itô Markets 创始人)自 2026-01-18 起单人维护的开源项目,MIT 协议。它的自我定位是「agent harness operating system」——不写一行模型代码,而是给 Claude Code、Codex、Cursor、OpenCode、Gemini、Zed 等 10 个 AI 编码工具套上一层工程方法论:技能(Skills)、专职 Agent、钩子门禁(Hooks)、记忆与安全扫描。

核心循环一句话:plan → test → implement → review → verify → remember → improve(规划→测试→实现→评审→验证→记忆→改进),口号是「优化上下文窗口,其余全部持久化」。装一次,agent 从此自带团队纪律,不用每次把流程写进 prompt。

仓库当前规模(2026-09-10 实测 clone 全量核实):68 个专职 Agent、286 个技能、94 个命令、22 种语言规则集、4 组钩子,外加实验性的 ecc2/——Rust 写的「跨 harness 统一控制面」(终端面板 + SQLite 会话库 + 守护进程,仍为 alpha)。

暴涨曲线:21 天 4 万星,8 个月 25.5 万

时间 星数 事件
2026-01-18 1 仓库创建
01-21(第 4 天) 6,400 病毒式传播启动
01-26(第 9 天) 28,800
02-07(第 21 天) 40,000 官方 star-history 曲线(仓库内嵌数据)
03-23 100,000 augmentcode.com 报道破 10 万
05 月底 ~200,000 多个第三方评测时点
2026-09-10 255,150 GitHub API 实测;fork 38,224

星数已达 GitHub 全站头部级别,且今日仍在合 PR(编号 #2907+)。增速从单日数千星回落到月均约 3 万——非刷量式瞬时爆发,是持续近 8 个月的稳定增长。npm 侧:ecc-universal 月下载约 1.9 万次、ecc-agentshield 约 2.9 万次,最新 2.2.1(2026-08-25 发 v2.2.0,单次迭代 108 commits / 530 文件 / 4 万行增改)。

拆解:68 个 Agent 和 286 个技能,质量如何?

Agent(68 个,每个约 5KB 角色文档):architect(架构师)等角色在 frontmatter 里直接指定 model: opus 和工具白名单,正文开头是完整的「Prompt Defense Baseline」反提示注入基线——unicode 同形字、零宽字符、上下文窗口溢出攻击、第三方抓取内容一律按不可信处理。把安全基线写进每个 Agent 的,在开源技能库里不多见。

技能(286 个,实测 0 空壳):90%(258 个)是约 12KB 的扎实单文件 SKILL.md,10% 带 scripts/examples/references 五件套(如 agent-self-evaluation 含评分脚本 + 高低分对照例)。内容质量抽样很高:article-writing 技能直接内置禁语清单——game-changercutting-edge、「In today’s rapidly evolving landscape」这类 AI 套话全部拉黑,要求「用证据不用形容词」;benchmark 技能给出 LCP/CLS/INP 等 Core Web Vitals 可执行测量流程。覆盖从 accessibility、android-clean-architecture 到 kubernetes-patterns、agent-payment-x402 的广度。

钩子与治理:Bash 前置钩子在每次命令执行前跑质量/tmux/推送/GateGuard 检查,可阻断(exit 2);SessionStart 自动恢复上次会话上下文。2026 年 6 月做过一次 MCP 审计:默认连接器从 6 个砍到 1 个(github/context7/exa/memory 等全部退役,改由技能包 CLI 直连)——与「MCP 收紧」行业趋势同步。

数字之外:三处必须泼的冷水

①星多、装少:25.5 万星 vs 双 npm 包合计月下载不足 5 万。配置型仓库本就 clone 即用、无需反复安装,比例合理,但「收藏 > 实际部署」的现实要认清——155MB 全家桶装进日常 workflow 是另一回事。

②「免费」的分层:README 功能表把 AgentShield 标为 Included,但完整扫描(私仓、PR 触发审计、AgentShield 扫描服务)实际在 ECC Pro,$19/席/月;免费层 = OSS 本体 + GitHub App 公开仓每月 10 次分析。核心方法论免费,深度自动化要订阅——与同类「开源引流、SaaS 收费」模式一致,但宣传口径值得留意。

③单点风险:25.5 万星项目由单人维护(赞助商列表含其自家公司 Itô Markets,利益需自行判断);中文社区流传的「Anthropic 黑客松一等奖」头衔在官方 README/CHANGELOG 中未见佐证;HN 等圈外社区几乎没有高热度讨论——热度高度集中在 GitHub 生态内部。

安装、适合谁、值不值

# Claude Code 内两行装(二选一,勿叠加)
/plugin marketplace add https://github.com/affaan-m/ECC
/plugin install ecc@ecc
# 或终端引导安装
npx ecc-universal setup

适合:重度 Claude Code/Codex 用户,尤其想给多个 Agent 会话统一纪律、要安全基线和审计的企业开发者——68 个专职 Agent + 反注入基线 + 记忆系统是实打实的工程资产。不适合:轻度用户——286 个技能默认全装进上下文管理面,对「偶尔用一次 AI 写代码」的人是负担。

坐标系里看:若说 context-mode 深度评测(21k★ MCP 沙箱) 管的是「上下文输入」、Caveman 实测(99k★ 输出纪律) 管的是「输出纪律」,ECC 管的是整条工程流水线——它是目前这个品类里体量最大、方法论最完整的一个。结论:值得一试,但先想清楚你是要「收藏一套方法论」还是「真的把工程队纪律装进日常」——后者需要投入,不是 npx 一下就能白得。

本文基于 2026-09-10 全量 clone(3,538 文件)静态实证 + GitHub API/npm 官方数据交叉核验;沙盒环境无 Claude Code,未做安装后运行态实测。ECC 含 $19/席/月的 Pro 商业层,评测立场独立。

苹果发布首款折叠 iPhone Duo:1999 美元起,Siri AI 下周推送但中文还要等

苹果发布首款折叠 iPhone Duo:1999 美元起,Siri AI 下周推送但中文还要等

1999 美元——苹果等了近十年的首款折叠 iPhone,今天凌晨终于登场。但整场发布会看下来,真正的重头戏不是那块能对折的屏幕,而是一个叫 Siri AI 的东西:它 9 月 15 日就要随 iOS 27 推送,却首发只支持英语——中文用户,还得等。

折叠 iPhone 来了:1999 美元,配史上最强端侧 AI

北京时间 9 月 10 日凌晨 1 点,苹果在 Apple Park 举行秋季发布会(主题「亮新篇,来耀眼」),这是接替 Tim Cook 出任 CEO 的 John Ternus 首场发布会。新品清单里最炸的是 iPhone Duo——苹果首款折叠 iPhone:展开是 7.6 英寸内屏,合上是 5.4 英寸外屏,起售价 1,999 美元(国内 15,999 元起),10 月 16 日预购、10 月 23 日开售,中国在首批 70 多个国家名单内。

型号 亮点 起售价
iPhone Duo(折叠) 7.6″ 内屏 + 5.4″ 外屏,A20 Pro,双电池 $1,999 / 15,999 元
iPhone 18 Pro / Pro Max 可变光圈相机升级,「智能个人中枢」 $1,199 起
Apple Watch Series 12 / Ultra 4 Siri AI 摘要 + 对话回顾 待公布

iPhone Duo 搭载的 A20 Pro 是 2 纳米制程:6 核 CPU 快 20%、7 核 GPU 快 40%,最值得注意的是双 16 核神经网络引擎,AI 算力翻倍,统一内存带宽提升 50%——苹果把「复杂 AI 工作负载」和散热(定制均热板)直接写进了芯片宣传页。折叠屏铰链由 100 多个组件构成,外壳 3D 打印,苹果透露制造环节用上了 AI。

真正的大招是 Siri AI:语音助手 15 年来最大改版

如果只看硬件,iPhone Duo 是「折叠迟到者」;但苹果真正的 AI 宣言藏在软件里。Siri AI 是 Siri 诞生 15 年来最大一次重做,随 iOS 27 以 beta 形式推送(北京时间 9 月 15 日),底层由苹果与 Google 合作的定制 Gemini 模型驱动:

  • 不再是弹窗语音助手:Siri 变成独立 App,界面类似 ChatGPT,可以打字、可以连续多轮对话,历史会话经 iCloud 私密同步
  • 个人上下文理解:能跨信息、邮件、照片找你「当下需要的东西」;屏幕感知——看到什么就能针对内容回答、操作
  • Siri Camera 模式:打开相机问 Siri,让它「看你所看」再回答或执行
  • 随处写作:在任意输入框描述需求,Siri 帮你写、帮你改
  • 端侧优先 + Private Cloud Compute:隐私架构不变,能本地跑的不上云

配套的 Apple Intelligence 也升级:照片支持 Spatial Reframing / Extend / 更强的 Clean Up,Image Playground 可生成写实图像并支持 SynthID 水印(AI 生成/编辑图可被识别),Safari 新增 Notify Me 盯页面变化。

但中文用户要等。 官方口径:Siri AI 首批仅英语;10 月扩法语、日语、韩语、葡萄牙语、西班牙语五种;简体中文在 16 种计划语言内,却没有任何时间表——IT之家等媒体直接用了「国行遥遥无期」。基础 Apple Intelligence 的简体中文支持会随 iOS 27 同步到来,但可用性因地区而异。

为什么是「折叠 + 2nm + 端侧 AI」:苹果的算力赌注

把 Siri AI、iPhone Duo、A20 Pro 放在一起看,苹果的棋局很清楚:端侧 AI 才是它的主场

生成式 AI 这三年,OpenAI、Google 的答案是「模型更大、云更强」;苹果能打的牌从来只有一张——算力就在你口袋里。A20 Pro 的神经网络引擎算力翻倍、带宽提升 50%,为的就是让「个人上下文 + 屏幕感知」这类重活能在本机跑完,再配合 Private Cloud Compute 处理更重请求。折叠大屏 + 端侧 AI 的组合,本质是给「AI 助理看得更多、上下文更大」找一块更大的画布:分屏左边看内容、右边跟 Siri AI 对话,是这场发布会最直白的演示。

同场发布的 Apple Watch Series 12 / Ultra 4 也补了 AI 功能:Siri Recap 自动整理一天对话要点,Live Rewind 能回放刚才 15 秒没听清的话,还能用环境聆听记录团队会议、家长会内容——隐私设计上,苹果强调转录是 opt-in、原始音频不可访问、处理后即删除。这条「录音权限」线,苹果踩得比谁都谨慎。

迟到的追赶者:Siri AI vs ChatGPT vs Gemini

坐标系拉远一点:折叠屏赛道三星、华为已经卖了两三年,iPhone Duo 拼的是「苹果生态 + AI 整合」而非首发;AI 助理赛道,ChatGPT 2022 年就火了,苹果直到 2026 年 WWDC 才正式端出 Siri AI,还选择了与 Google 合作、用定制 Gemini 当底座——在模型层认输,在端侧和生态层决战,是苹果这一轮最务实的姿态。

代价也很明显:Siri AI 首发只有英语、功能偏基础(拼写纠正、拍照问 Siri、照片消除等先上),中文用户看到完整形态的时间表未知。这台折叠 iPhone 卖的不只是硬件,是「AI 助理时代的第一张船票」——而国内用户拿到票的时间,还没有人知道。苹果与 OpenAI 的恩怨(此前起诉其窃取商业机密、涉 400 名前员工)与 AI 硬件的全面竞赛,我们此前已拆过;而「AI 助理到底能多能干」,也可以对照我们实测的通用 Agent 方案。

判断:苹果打的是慢棋,但底牌没掀完

一句话:苹果用一场发布会宣告 AI 助理战正式开打——端侧算力翻倍是筹码,Siri AI 是号角,折叠屏只是载体。它迟到两年,却握着一张别人没有的牌:10 亿级设备生态 + 隐私叙事 + 自研芯片。Siri AI 首版越保守,越说明苹果把这场仗当长跑:9 月 15 日英语用户先上车,中文版、完整功能、更多语言会在后面几个版本分批到。对普通用户,建议只有一个:先别急着为 AI 换机,等 Siri AI 中文版落地、看真实口碑再决定——苹果的 AI,从来是「慢但稳」,这一次也不会例外。

关注 AI商业快讯,每天一篇 AI 热点深度解读。相关阅读:苹果起诉 OpenAI 窃取商业机密:400 名前员工涉案,AI 硬件竞赛引爆法律战 · Open Minis 实测:手机里的 Linux 沙盒 + AI Agent,比 Siri 能干 100 倍

Anthropic 双线承压:Claude Max 订阅被指 5x/20x 虚标遭前 FTC 律师集体诉讼,黑客偷会话烧光用户 $200 月费

Anthropic 双线承压:Claude Max 订阅被指 5x/20x 虚标遭前 FTC 律师集体诉讼,黑客偷会话烧光用户 $200 月费

8 月的一天,英国独立 AI 顾问 Grant De Swardt 没碰电脑,他 200 美元/月的 Claude Max 20x 账号用量却在悄悄上涨。他禁用全部挂接、暂停定时任务、关掉云端执行,做了一次干净的对照实验——用量仍然从 45% 爬到了 55%。找 Anthropic 要用量明细,得到的答复是:明细没有,但确实异常——随后封停账号、作废所有会话、退了 44.49 英镑了事。

几乎同一时间,另一场针对 Anthropic 的攻势也在升级:Claude 订阅用户的集体诉讼被「扩大重递」,接手的是两位曾在 FTC 反垄断旗手 Lina Khan 麾下任职的律师。一边是用户告它「额度虚标」,一边是黑客偷会话烧它的订阅额度——Anthropic 引以为傲的重度用户生意,正在两头失火。

前 FTC 律师接手,集体诉讼扩大重递

9 月 9 日,The Verge 报道:一批 Claude 订阅用户向法院提交了扩大版集体诉讼,指控 Anthropic 对其 Max 订阅层级的额度上限做了欺骗性宣传。带队律师是 Monica Vaca 和 Kati Daffan——两人都曾在前 FTC 主席 Lina Khan 任内工作。报道称,这是「罕见的、试图用法律惩罚 AI 公司日益明显的金钱挤压(money squeeze)」的动作。

这起案件 6 月 15 日首次提起:华盛顿特区用户 Karl Kahn 为高强度编码升级到 Max 20x(200 美元/月),在加州北区联邦法院起诉,称 Max 5x(100 美元/月)与 20x 的实际可用额度远低于宣传。今天的新版本扩大了原告群体,并换上监管经验更丰富的律师阵容。

「5x」「20x」的水分藏在两次点击之后

诉讼核心指控很具体:Anthropic 营销图里醒目的「5x」「20x」,指的是相对 Pro 订阅(20 美元/月)的额度倍数。但实际条款里,这个倍数只在 5 小时的会话窗口内成立,且整个账号还受每周上限约束——加总起来,用户实际获得的总量提升远小于「5 倍」「20 倍」的心理暗示。

想搞清这层意思有多难?按原告律师的说法:要点两次不同的超链接才能看到「session」这个词,而要看懂「session」的定义,还得再去 Pro 订阅页面单独翻找。用户在社区里的算账更扎心:7 月 14 日一名 20x 新订阅用户称自己 2.5 小时就撞上了周上限;Mashable 5 小时前的跟进报道算了一笔账——把每周上限摊进去,20x 用户为每小时实际用量付的钱可能比 5x 甚至 Pro 还高。Reddit 上 8 月 31 日的高赞帖标题直言:「Anthropic 正在光速耗尽用户的信任。」

另一条战线:会话被偷,额度被烧

比「说不清买了多少」更糟的是「没干活也被扣量」。TechCrunch 9 月 8 日披露:Anthropic 已向部分用户发出警告邮件,确认有恶意行为者正用常见的 infostealer(信息窃取木马)偷走人们电脑上的 Claude 登录会话,再借此访问账号、消耗订阅额度。

De Swardt 的经历是典型样本:Anthropic 调查后告诉他,一个被攻破的 Claude session key 被用来铸造了未授权的 Claude Code OAuth 令牌,账号「可能被某个看起来未经授权的第三方服务用于处理他人活动」,但官方也无法确定入侵途径。他的账号两周后才恢复,期间业务停摆,最终他取消订阅转投 Cursor——「其他模型没那么大差别,也没好到哪去」。

更让用户后背发凉的是结构性缺陷:账号支持只追踪总用量、不提供分项明细,即便用户主动要求也不给。这意味着此类盗刷可能持续数月无人察觉。Reddit 上 80 多条评论里,有人称账号被自动升级扣款、用量从 0 冲到 100%;有人说只用了几条 prompt 加一次网页搜索,12 分钟里用量从 0 涨到 49%;还有人连续三天每天烧光全部额度,而自己根本没打开过 Claude。Anthropic 对被盗用户做了登出、作废授权和部分退款,并提醒他们可能中了木马——但对「用户如何主动识别盗刷」这一问题,官方拒绝评论。

订阅价值保卫战的反噬

两条战线其实同源。Anthropic 反复强调重度用户是核心业务——The Verge 直言,公司为保护订阅价值,甚至不惜切断 OpenClaw 等热门第三方应用(更早的 2026 年 1 月,它曾封禁绕过 Claude Code 订阅墙的开源编排工具 OmO,引发大规模用户抗议)。逻辑没错:订阅额度是它的收入根基。但当用户发现——第三方被切了、价格不便宜、额度说不清、被盗了也不知道——「保护订阅价值」就变成了「挤压订阅用户」,诉讼与退订潮(9 月 1 日曾冲上 X 热议趋势)随之而来。

往大了看,这是整个订阅制 AI 的共性问题:用量被做成黑箱,定价复杂度堪比电信套餐。前 FTC 律师的入场,是监管风向的一个信号——消费者保护视角正从「AI 安全」延伸到「AI 计费公平」。

对普通用户的实用建议:别把 Claude 等 AI 账号长期挂在浏览器或终端不登出;警惕来路不明的软件与广告(infostealer 的主要传播渠道);定期检查账号活跃会话与用量;发现异常立即作废全部会话并联系官方。额度是你的钱,黑箱不是挡箭牌。

相关阅读:

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

一、Agent 正在大规模进企业,但「敢不敢让它碰系统」成了刹车

产业数据已经不再抽象:微软披露数以万计的企业在管理数千万个 AI Agent,法国 IT 服务商 Atos 一家就在管 1.9 万个;Salesforce 的 Agentforce 累计完成了 24 亿个「agentic work units」——AI 真正替企业完成一件工作的次数。

但与此同时,安全案例也在刷新认知。36氪 2026 年 9 月 8 日转载的一篇文章讲了几个实验:骗子把指令藏在网页屏幕外 -9999 像素的位置,人类看不见、Agent 读得到;研究人员拿 26 个模型测一个假网站,GPT-5.4、Claude Sonnet 4.5 在只看到假站时都把它当成了可信入口;还有人伪造 Python 库诱导 Agent 付 3 美元买「软件许可证」,Llama、Gemini 共 4 个模型真的执行了付款。安全公司披露的 EchoLeak 漏洞更直接:员工不用点击任何链接,Copilot 处理邮件时,藏在邮件里的指令就能诱导它把内部信息带出去——「有了 Agent 帮忙,钓鱼邮件都不用你点击了」。

安全圈与产业界正在形成一个共识:Agent 越接近真实业务,治理越要前置。网易智企 6 月给 CEO 们发了一份检查清单,把内容边界、权限边界、数据边界、操作边界、审计记录和责任归属列为上线前必须回答的问题(出处:网易智企《安全合规治理不应等问题发生后再补》2026-06-17)。落到自己公司,问题会浓缩成一句很具体的话:让 AI Agent 操作业务系统之前,你怎么保证它不会乱建乱改数据?出了事,查得到是哪次操作、哪个账号干的吗?

二、为什么多数系统接不住 Agent

想让 Agent 干活,先得有接口。但大部分企业系统天生不是给 AI 用的:

  • 契约靠人写人读的文档:接口文档由人维护,版本一升级就漂移,Agent 按旧文档调新接口必然出错。有厂商吐槽过这个现状:「AI 不知道有什么内部系统、如何接入」(出处:火山引擎开发者社区 2025-06-12)。
  • 开放裸 API 却没有校验:Agent 的幻觉会直接变成脏数据——字段名拼错一个字母,一张坏表单就进了库。AI 接入的协议层(如 MCP)解决了「怎么连」,但正如一篇治理文章提醒的:它同时扩大了攻击面,企业必须配套认证机制和治理可见性,否则「连得上」不等于「敢让它操作」(出处:知乎《当MCP成为AI Agent的”企业接口”》2026-07-22)。
  • 审计缺失:AI 做了什么只能靠猜。行业对 AI 审计的要求是能回答四个问题:什么数据进来了、输出了什么、系统做了什么、谁批准的(出处:Collibra 2026-06-24)——多数系统一条都答不上。

三、GTS 的做法:把 AI native 做成机制,而不是口号

GTS 是一个多租户、元数据驱动的「表单+审批流」平台,走的是另一条路:既然 AI Agent 要进业务流程,那就从系统层面回答好三个问题——看得懂、改不坏、赖不掉

① 看得懂:机器可读契约,Agent 自己拉取,永不漂移

GTS 提供两个公开只读端点,无需登录,任何 Agent 启动时都能自己拉取:

  • /discovery/routes:当前全部 58 个 API 端点自动导出。后端每加一个路由,列表自动多一条——写作当天实测已是 58 条,任何静态文档都追不上这个更新速度。
  • /discovery/contract:配置域契约——认证方式、响应信封、多租户纪律、12 种字段类型及其附加属性、流程节点属性、单据状态机、审批动作枚举、字典用法。

因为契约从系统实现自动导出、与代码同源,它不会像人手维护的文档那样过时。AI 学的是系统自己的配置语言,不是一份翻译稿。(浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 当场可验。)

② 改不坏:服务端强校验,幻觉写不进数据库

表单 schema、流程 nodes 在落库前全部经服务端校验:字段类型必须在白名单内、字段 key 唯一且合法、select 必须有选项、流程节点名唯一、审批人规则必须合法。非法配置直接返回 400,并带精确到位置的报错——比如把 required 拼成 requred,会收到 schema_json[0] has unknown key(s): requred。Agent 收到报错可以自己修正重发;非法内容根本不落库。模型幻觉再离谱,也污染不了数据库。这正对应治理清单里那条底线:「系统接口返回异常时,不能反复提交或绕过校验」——GTS 把这条做死在了服务端。

③ 赖不掉:全操作审计,人与 Agent 一视同仁

每一次管理/变更写操作都记入审计日志:租户、操作者账号、动作、对象、IP、User-Agent、摘要,操作者自动从 token 解析。无论是人还是 Agent、用的是哪个账号、做了什么,全部可回看。前面说的四个问题(什么进来了、输出了什么、系统做了什么、谁批准的),在这里逐条有答案。

④ 官方直接把「Agent 上岗说明书」做成了可下载的技能包

GTS 把「AI 怎么操作这套系统」打包成一个官方技能包 gts-operator,下载地址:https://www.geeyo.com/s/gts/dist/skills/gts-operator.zip 。支持 skills 机制的 Agent(Claude Code / Codex 类)装上之后,用自然语言就能完成整套管理操作:帮客户开通租户并配管理员、维护组织架构与人员、配置表单与审批流(字段类型 / 条件分支 / 审批人规则)、发起业务单据、执行审批(同意 / 驳回 / 转办 / 加急)、查询与导出。它采用「动态发现」模式——先拉取 discovery 契约再动手,后端演进时技能无需手改。关键设计:Agent 与人类走的是同一套 API、同一份校验、同一份审计,系统没有给 AI 开任何后门。官方已用它跑通「注册租户→建组织→配表单/流程→发起单据→审批」的全链路验证。

四、三个值得展开的设计取舍

为什么「校验+审计+隔离」三件套缺一不可? GTS 的设计哲学是「安全是前提,不是功能」:校验保证非法内容不落库,审计保证每个操作可追溯,行级多租户保证跨租户访问一律 404。三件事同时存在,才敢把写操作开放给 AI——缺了任何一件,开放 API 给 Agent 都是在裸奔。

为什么契约能精确到字段级? 因为 GTS 本身是元数据驱动的:表单、流程、字典都是数据、都是配置。契约描述的正是系统实际运行的语言——字段类型、校验规则、状态机与实现同源,不存在「说明书和实物是两回事」。这是 AI native 能落地的地基,也是它和「事后补文档」式集成的根本区别。

边界在哪里? GTS 的 AI 能力覆盖表单+审批这类配置化业务域。它不是通用 BPM 重引擎,也不是 Agent 托管平台——它解决的是企业接 Agent 最前面那道坎:接得进、改不坏、赖不掉

五、十分钟自己验证

三步就能验证上面说的每一句:浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 看契约长什么样;下载 gts-operator.zip 装给手边的 Agent,用自然语言让它开一个租户、配一张报销单;再到演示站 https://www.geeyo.com/s/gts/ 注册、走完一张单的审批。AI native 是真机制还是噱头,动手十分钟就有答案。

DeepMind 发布 AlphaGenome Atlas:把人类 DNA 90 亿种单字母变异的后果全部算好,免费图谱先破一例罕见病

DeepMind 发布 AlphaGenome Atlas:把人类 DNA 90 亿种单字母变异的后果全部算好,免费图谱先破一例罕见病

90 亿——这是你我的 DNA 里可能出现的单字母突变总数。昨天(9 月 8 日),谷歌 DeepMind 宣布了一件听起来像科幻的事:把每一种突变的分子后果,都用 AI 预先算好了。这套名为 AlphaGenome Atlas 的图谱正式免费开放,数据量 1 PB,比获诺贝尔奖的 AlphaFold 数据库还大 30 多倍,而且已经帮科学家破了一例罕见病。

一张把所有 DNA 错误都标好的地图

人类基因组由约 30 亿个碱基对组成,但科学界对它的理解长期只停留在 2%——那部分负责编码蛋白质的「说明书」。剩下 98% 曾一度被误称为『垃圾 DNA』,实际上是调控基因活性的「总控台」,绝大多数与疾病相关的变异都藏在这里。

问题在于:人类基因组里共有约 90 亿种可能的单字母变异(专业叫单核苷酸变异 SNV),在实验室里逐一测试每一种,几乎不可能。DeepMind 的做法是让 AI 先跑:用去年 6 月发布的 AlphaGenome 模型,把 90 亿种变异的调控影响全部预计算成 1 PB 的数据集,再包上一层查询门户——零编码、免费,任何研究者打开网页就能查。

为了让科学家快速找到「哪个变异最要紧」,图谱还配了一个 AVI 评分:把 AlphaGenome(看基因调控)和 AlphaMissense(看蛋白质影响)两个模型的预测浓缩成一个数字,编码区和非编码区通吃,相当于给每个变异贴了个「危险指数」。测试显示它在多项致病性基准上达到一流水平。

罕见病破案现场:一个被忽略的变异

最能说明价值的,是图谱上线前就已经发生的实战。

美国博德研究所(Broad Institute)的团队在研究一批多年未确诊的罕见病病例。患儿基因里藏着一个 DNM1 基因变异——这个基因与癫痫性脑病密切相关,但此前的分析方法把它漏掉了。用 AVI 评分重新排序后,变异被高亮:AI 预测它制造了一个错误的剪接位点,导致蛋白质异常延长。后续实验筛选验证了预测,还顺藤摸瓜找到了附近一批同类变异。一个「大海捞针」的病例,就这样被 AI 图谱捞了出来。

埃克塞特大学的 Gareth Hawkes 则把图谱用在大人群上:他对 5.4 万余名英国生物样本库参与者的全基因组数据重新分析,按预测的分子效应给变异分组,结果多找回了 22% 的非编码基因关联——这些信号原本淹没在统计噪音里。他还锁定了调控 PLA2G7(与衰老相关)和 EGLN1(细胞氧传感器)的关键变异;聚焦图谱预测影响最大的前 1% 变异后,识别出 19 个与 BMI(身体质量指数)相关的遗传区域。

为什么说这是 AlphaFold 之后的又一步

把时间线拉长,DeepMind 的「AI 破解生命」路线图很清晰:2021 年 AlphaFold 2 解决蛋白质 3D 结构预测,拿下 2024 年诺贝尔化学奖;2022 年 AlphaFold 数据库把已知结构从 19 万实验样本扩展到 2 亿个预测,覆盖「蛋白质宇宙」;2025 年 AlphaGenome 模型登场,从看结构转向看基因调控。

今天的 Atlas 是第三步的规模化落地:如果说 AlphaFold 数据库是「蛋白质的谷歌地图」,AlphaGenome Atlas 就是「人类 DNA 的逐字注疏」——每个字母改写的后果都已标注。人类基因组计划 2003 年完成「读出」全部序列用了 13 年,如今 AI 正把「读懂」每一个变异变成可查询的服务。

边界与判断

冷静的一面要说清楚:这是预测图谱,不是诊断工具。DeepMind 在发布说明里明确标注,AlphaGenome「未经临床验证、不获准用于任何临床用途」;基因与疾病的关系也远比单点突变复杂,图谱的价值是帮研究者缩小范围、加速验证,而不是直接给普通人出「基因体检报告」。商业授权将在后续通过谷歌云开放。

但方向已经明确:AI for Science 正在从「预测单个结构」走向「穷举式解释整个基因组」。DeepMind 自己也把 Atlas 定位为「基线而非终点」——模型每升级一次,这张 90 亿变异的地图就会更精细一层。对全球约 3 亿罕见病患者和无数遗传病研究者来说,这是一份刚打开的礼物。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

用过 Claude Code、Cursor 这类 AI 编程工具的人,大概都撞过同一堵墙:会话跑着跑着,AI 开始「失忆」——忘了在改哪个文件、忘了进行到哪一步。不是模型笨,是上下文被工具输出吃光了。一次 Playwright 页面快照 56 KB,20 条 GitHub issue 59 KB,一条访问日志 45 KB,官方说半小时就能烧掉 40% 的窗口。今天评的这个项目反着来:不压缩数据,干脆别让脏数据进门。mksglu/context-mode,21k★,官方基准把 315 KB 工具输出压成 5.4 KB(省 98%),npm 累计下载 51.5 万,登过 Hacker News 榜首(570+ 分)。

它做了什么:在工具输出和上下文之间,加一道沙箱闸门

context-mode 是一个 MCP server + 插件套件,支持 18 个客户端——Claude Code、Cursor、VS Code Copilot、Codex CLI、Gemini CLI、Kimi、Qwen Code 等全在列,还挂 OpenClaw 网关。核心免费(ELv2 source-available),作者是伦敦 MKSF LTD 的 Mert Köseoğlu,2026-02-23 创建仓库。

它的思路和「压缩派」相反:LeanCTX 那类工具是等上下文满了再压缩重写,context-mode 是在源头拦截——模型每次调工具,钩子先截住,把命令丢进独立子进程沙箱执行,只有 stdout 进窗口。四个板斧:

板斧 机制 效果(官方口径)
沙箱路由 ctx_execute/ctx_execute_file 隔离执行,12 种语言运行时,>100KB 输出自动入索引只回指针 56 KB 快照 → 299 B
会话记忆 编辑/git/错误/用户决定实时写 SQLite FTS5,compact 后按 BM25 检索回填 治「压缩后失忆」
Think in Code 让模型写脚本算完再 console.log,而不是读 47 个文件进窗口 700 KB → 3.6 KB
不强制话术 不逼模型说人话,引 Moonshot 研究指 aggressive brevity 会降 benchmark 与输出纪律派划界

工具设计上有个反直觉点值得单独说:它把「分析」和「读」拆开了。以前模型要 grep、要 Read 一堆文件进上下文自己数,context-mode 逼它写段脚本在沙箱里数完只报结果——一次调用顶十次工具调用。hooks 能程序化拦截的平台(Claude Code 等)实测合规率约 98%;没 hooks 的 Zed 之类只能靠指令文件,作者自标约 60%。

仓库实证:6.5 个月、169 个版本、51.5 万下载

我 clone 了仓库全量核实(599 个文件):创建于 2026-02-23,6.5 个月冲到 21,024★ / 1,524 fork;HEAD 提交停在 2026-09-07 中午(写稿前一天还在推),版本号 v1.0.169。npm 侧数据能对上徽章:累计下载 515,145,5 月冲到单月 12.3 万的峰值,9 月第一周仍有 1.6 万。发布节奏极快——223 个 npm 发布记录,6.5 个月 169 个版本,约每天一个。

它的流量故事也清楚:2 月 25 日 Show HN 拿了 84 分,三天后作者博客长文直接登 HN 榜首 570+ 分、30 条讨论,之后 5 月下载量二次冲高。官方 BENCHMARK.md 给了可复现的 fixture 基准(21 个真实工具输出场景,非合成数据):总计 376 KB → 16.5 KB(省 96%),其中结构化数据处理那组 315 KB → 5.5 KB(省 98%),代码示例 100% 保真——文档类内容是精确检索不是摘要,125 个测试全过。

必须说明口径:以上基准是官方自测,我没有装进真实 Claude Code 会话复测(评测基于仓库 clone、官方 benchmark 与公开数据);Insight 付费分析层($20/座/月)也未购买,不评。

争议与边界:五个要自己掂量的坑

① npm 渠道已停更约 10 周。 最新版 1.0.169 在 npm 上停在 6 月 29 日,但仓库日更——分发明显迁到了 Claude Code 插件市场 + 自带的 ctx_upgrade 直拉 GitHub。从 npm 直接装可能拿到旧版,装完记得跑 ctx_upgrade。

② 用户数口径混乱。 GitHub 徽章自称 54.6 万用户,Insight 官网却写「331,200+ 开发者」——两处自报数字对不上;npm 累计 51.5 万下载可核实,量级可信,但「用户」的定义存疑(下载≠活跃)。

③ ELv2 不是 OSI 开源。 能 fork 能改能内部用,但禁止打包成托管 SaaS 转售、禁止删许可声明。作者明说选它就是为了防 MIT 被套壳——个人和公司内部用无碍,想基于它做生意的绕道。

④ 沙箱是进程边界,不是 OS 隔离。 作者自己在文档里承认:ctx_execute 跑的是任意代码且继承进程文件系统权限,「批准执行 = 批准任意代码」,#852 号 issue 就修过借 MCP 沙箱逃逸宿主读文件限制的漏洞。要配宿主层沙箱双保险,别裸奔。

⑤ 上手摩擦不小。 它激进地拦截 curl、裸 Read、grep 等常规操作逼你走沙箱——CLAUDE.md 里一长串「BLOCKED」清单。习惯「先想再写代码」的老手觉得爽,新手会觉得被管头管脚。另 214 个 open issues、无 hooks 平台只有 ~60% 合规、Codex 的 PreToolUse 只能拒绝不能改写参数(上游限制)。

坐标系与结论:省 token 正在从「压缩」走向「拦截」

站内评过这条赛道的几个代表:LeanCTX(压缩派,Rust 重写省 86% token)、Caveman(输出纪律派,砍 65% 输出 token)、flowctx(OpenClaw 上下文引擎,砍 56%)。context-mode 站在输入侧——它不动你的输出风格,甚至引用研究反对 Caveman 式的激进话术压缩,只管「什么数据能进窗口」。三种思路其实互补:输入拦截 + 输出克制 + 事后压缩,叠起来才是完整解。

适合:接了 Context7 / GitHub / Playwright 一堆 MCP 工具的重度用户、长会话多任务协作、被 compact 失忆反复折磨的人——尤其 Claude Code 用户,插件市场一条命令装完,10 分钟能见效果。不适合:轻度用户、不想改变工具习惯的人、必须在无 hooks 平台上要强约束的团队。

我的判断:上下文治理从「压缩」走向「源头拦截」是个真趋势,context-mode 是这条路上工程化最完整的选手——6.5 个月 169 个版本、18 客户端、HN 榜首、安全文档写得比多数商业软件诚实。免费层功能完整,值得装来试试;想省钱先看懂它的路由哲学,比装十个省 token skill 都值。相关阅读:LeanCTX 实测(压缩派)Caveman 实测(输出纪律派)flowctx(OpenClaw 上下文引擎)

关注「AI商业快讯」,每天一篇 AI 热点深度解读。(本文基于 2026-09-08 仓库快照与公开数据独立评测,与项目方无利益关系;Insight 付费层未购买、不构成推荐。)

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

白嫖党关心的问题永远只有一个:Cloudflare 的免费额度,到底够干什么?中文圈给出的答案相当诱人——掘金上流传最广的教程写着,Vectorize 免费额度”支持 500 万向量、每月 300 万次查询”。这个数字让很多人以为捡到了宝。但翻开 Cloudflare 官方定价文档一算,完全是另一回事:免费层只够存 6,500 条 768 维向量(约等于 5M 维度 ÷ 768),和”500 万”差了三个数量级。这篇不吹不黑,把 Vectorize 与 Workers AI 两个免费服务的真实额度算清账,顺便盘点它们最近一年到底”升级”了什么。

免费额度两年没动,动的是”上限”和”模型目录”

先说结论,可能和你的体感相反:两个核心免费额度,两年多没涨过一分钱

Vectorize 免费层(每月 3000 万查询维度 + 500 万存储维度)2024-09 定下至今未变;Workers AI 每天 10,000 Neurons(神经元,Cloudflare 的 AI 算力计费单位)更是 2024-04 上线时就是这个数,2026-08 的最新定价文档依旧如此。

真正的升级发生在别处(额度单位不变,但同样的钱能买到更多):

  • 索引容量上限:单索引最多 500 万向量 → 2026-01 翻倍到 1000 万 → 2026-08 的 limits 文档已显示 2000 万向量(架构上限,与免费存储额度是两码事,后面细说)
  • 模型目录:从早期几十个小模型扩到 50+,2026 年密集上新——Kimi K2.6/K2.7 Code(1 万亿参数级)、GLM-5.2/5.3、DeepSeek-V4、Gemma 4 26B、NVIDIA Nemotron-3、FLUX.2 生图全家桶
  • 工程体验:2026-02 起 OpenAI 兼容 API 的 tool calling 全面修 bug(多轮函数调用终于不抽风);2026-03 上线 prompt caching(缓存输入价格仅为原价 1/30-1/90)与异步批量 API
  • 周边额度:KV 免费层 2026-02 提升(读 10 万次/天 + 1GB);Workers 代码包体积 2026-09 从 3MB 放宽到 64MB——之前塞不进 Worker 的大依赖,现在可以了

一句话:Cloudflare 走的是”额度冻结、内容升值”路线——每天同样的 10,000 Neurons,2024 年只能玩 7B 小模型,2026 年能碰 1T 级开源前沿。但坏消息是,额度没涨的同时纪律在收紧(见第四节)。

Vectorize:额度按”维度”算,不是按”条数”算

Vectorize 免费额度难懂,是因为它的计量单位不是”向量条数”,而是向量维度数(stored dimensions / queried dimensions)。一个 768 维的向量,就消耗 768 个存储维度。

免费账本:5,000,000 存储维度/月 + 30,000,000 查询维度/月(官方定价文档,2026-04 更新,链接)。除以维度,真实容量如下:

嵌入模型(维度) 免费可存向量数 备注
bge-small(384 维) ≈ 13,000 条 英文轻量场景
bge-base / base-zh(768 维) ≈ 6,500 条 中文常用档
bge-m3 / qwen3-embedding(1024 维) ≈ 4,880 条 多语言/长文本
OpenAI text-embedding-3(1536 维) ≈ 3,255 条 外部模型需自调 API

查询侧公式是(月查询次数 + 存量向量数)× 维度 ≤ 3000 万。存 5,000 条 768 维向量的索引,每月约可查 3.4 万次,折合每天 1,100 次左右——个人博客语义搜索、几百页文档的私有知识库、MVP 验证,完全够用。这也是 Cloudflare 官方明说的定位:免费层永远支持”原型和实验”。

超了也不贵(这才是 Vectorize 真正的杀手锏):官方示例,5 万条 768 维向量 + 每月 20 万次查询,约 $1.94/月,前 10M 存储维度与前 50M 查询维度甚至直接包含在 $5/月的 Workers Paid 里。对比 Pinecone 最低 $50/月起步,差距是数量级的。

Workers AI:10,000 Neurons/天到底能干什么

Neurons 按 GPU 算力成本折算——模型越强,单价越贵,免费额度能跑的次数越少。这也是”有人说够用、有人说一小时烧光 12%”吵翻天的原因:两人用的是不同模型。按 2026-08 官方模型价格表换算:

模型/用途 单价(输出) 每天 10,000 Neurons ≈
Embedding(bge-m3 等) ~1,075 Neurons/M tokens 近千万 token,建库不是瓶颈
Whisper 语音转写 ~41-47 Neurons/分钟 约 4 小时音频
FLUX.1-schnell 生图 ~10 Neurons/步 200+ 张图
llama-3.2-1b(小模型) ~18,252 Neurons/M tokens 500-1,000 次对话(每次 500 输出 token)
gemma-4-26b / qwen3-30b ~27,000-30,000/M tokens 约 700 次
gpt-oss-20b ~27,273/M tokens 约 700 次
Kimi K2.6 / K2.7 Code / GLM-5.3 ~360,000-400,000/M tokens 只有 50-70 次

看懂这张表,就知道正确用法是分层:批量分类、改写、embedding 全部走小模型;Kimi K2.6 这类前沿模型只留给关键推理步;多轮 agent 会话加 x-session-affinity 头吃 prompt cache(缓存输入单价只有原来的 1/30-1/90,Neurons 直接省一个量级)。纯免费栈跑通一个带 AI 检索的个人应用,Reddit 上 2026-06 已有人验证可行。

三个真实的坑

① 模型目录滚动淘汰:2026-05-30 一次性下架 17 个旧模型——gemma-3-12b、llama-3.1-8b 全系、mistral-7b、phi-2 都在列;kimi-k2.5 被自动别名到价格更高的 k2.6。代码里写死的模型 ID 会直接 404,dashboard 用量也可能莫名上涨。

② 免费层超限即停:免费额度打满后请求直接失败(Free 无自动计费),要超用必须升 $5/月 Workers Paid。2026-09-01 起 D1(SQLite 数据库)免费层已改为超限直接失败——以前”超一点还能跑”的宽松时代结束了,Vectorize 同理。

③ 前沿模型限流很紧:Kimi K2.6/GLM-5.2 等只有 20 rpm(充值 AI Gateway credits 可到 50 rpm);另外免费额度 UTC 0 点重置后偶发 error 4006 误报超限(2026-09 社区仍有人中招),遇到重试即可。embedding 模型选型时也注意:索引维度定死后中途不能换模型,否则要重建索引重灌数据。

与同类对比:免费向量库中 Vectorize 的 5M 维度 ≈ 6,500 条(768 维)比 Pinecone 免费层(单索引 100 向量级)慷慨得多;但要存几十万条以上还是得上付费云或自建。Workers AI 免费额度做 demo 富余、做生产不足,定位是”Workers 生态的拼图”——它的真正价值不是省钱,而是向量库、embedding、推理、对象存储(R2 10GB 免流量费)全部在同一生态内,零 API key 管理,全球 300 城边缘分发。适合:个人站语义搜索、私有知识库 MVP、已在 Cloudflare 部署的全栈应用。不适合:亿级向量生产库、要求 10ms 级延迟的实时推荐、以及重度依赖前沿模型每日推理的业务。

总评:免费层是当下个人开发者做 AI 应用性价比最高的起点——额度对”几千条文档、每天千次查询、混合使用小模型”的量级绰绰有余,超出后的付费价格又便宜到可以忽略。真正的成本是维护:模型下架要跟进、额度上限要按维度盯着算。别信”免费 500 万向量”的教程,信自己的除法。

(额度与价格截至 2026-09-08,以 Cloudflare 官方定价文档为准。本文为独立评测,与 Cloudflare 无利益关系,未接受任何形式的赞助或免费额度;文中核算基于官方公开文档,未自购套餐跑真实负载。)

相关阅读:10 美元买 70 美元额度?CommandCode GOAT 订阅拆解 | 实测 9 款 Token 节省工具横评 | 谷歌 Gemini 视频开关:号称砍 88% token 实测翻车

关注 AI商业快讯,每天一篇 AI 热点深度解读。

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

同时订阅着 Claude Code、Codex、Kimi 的人,多半撞过同一堵墙:订阅费交着,真正干活的却只有一个模型;想换模型得手动切配置,调 Agent 的时间比写代码还长。

开源圈有个项目专治这个。装上它敲一个命令,Claude、GPT、Kimi、GLM 会自己组队把活干完——任务不结束不撒手。它叫 oh-my-openagent(社区简称 OmO),9 个月冲到 68.8k Star、npm 下载 380 万次,还因为太「越狱」,成了被 Anthropic 点名封禁的导火索。

OmO 是什么:把「一个 AI」升级成「一支开发团队」

一句话定位:OmO 是跑在开源编码工具 OpenCode 之上的多模型 Agent 编排系统,把单个 AI 助手变成一支能并行协作、彼此通信的开发团队。

它原本叫 oh-my-opencode,2025 年 12 月创建后一路暴涨;今年 5 月改名 oh-my-openagent,从「OpenCode 专用插件」重构为多 harness 体系——Codex CLI(Light 版,npx lazycodex-ai install)、Senpi 都已接入,路线图还排着 Pi 和 Claude Code。装上后你会得到:

Agent 角色 干的活 反差点
Sisyphus 主指挥官 拆解任务、派活给专家、盯到完成 默认可跑 Claude/Kimi/GPT/GLM 任选
Hephaestus 深度执行者 领了任务自己探索代码库干完,不回头要你当保姆 故意用「被大厂封杀后」的模型
Prometheus 战略规划师 动代码前先访谈式提问、定范围写计划 先问后写,防「理解错就开干」
后台专家群 Oracle/Librarian/Explore 并行调研、查资料、探代码库 5+ 个同时跑,上下文互不污染

核心反直觉点:Sisyphus 派活时不指定模型,只指定工种——前端、深度调研、快速修 bug、硬核架构。系统自动把工种路由到最合适的模型,比如「ultrabrain」类硬骨头任务默认交给 GPT-6 Astra max。作者的原话是:模型每个月都在变便宜变聪明,没有任何一个供应商该成为天花板。

实测证据:9 个月 68.8k★,两周发 30 个版本

先看硬数据(截至 2026-09-08):仓库 68,796★ / 5,650 fork / 955 open issues,2025-12-03 创建,9 个月涨到 6.9 万星;最新版本 v5.0.0-beta.48 于 9 月 7 日发布——而 8 月 24 日的文档快照还停留在 beta.18,两周发了 30 个 beta;我克隆仓库时(今天上午),它还在合并当天的新 PR。npm 官方 badge 显示累计下载 3.8M

OmO 有个罕见的「奇观」:它的维护者本身是一个 AI——跑在 OpenClaw 深度定制版上的助手 Jobdori,开发全程在 Discord 直播(Building in Public)。仓库根目录的 CLAUDE.md 用全大写写着铁律:任何触碰 OpenCode/Codex 组件的改动必须跑 QA 并把证据写入 .omo/evidence/,「没有证据文件 = 没有 QA = 不许提交」。一个 AI 维护的仓库,对「自己人」的纪律要求比大多数人类团队还狠——仓库里 64 个 SKILL.md、近 14 万行文档就是这么攒出来的。

再说它最出圈的「封禁事件」,时间线如下:

  • 2026 年 1 月 9 日深夜,Anthropic 更新政策:Claude Code 订阅($100–200/月)不得用于第三方 harness,OpenCode 用户大量中招,有人账号直接被 ban;
  • Hacker News 当天炸出 625 分、513 条评论;DHH 公开炮轰:「Anthropic 故意屏蔽 OpenCode 和其他第三方 harness,偏执地想把开发者锁进 Claude Code」;
  • OmO 自认是导火索,README 直接写「Anthropic 因为我们屏蔽了 OpenCode」,还把自家深度执行 Agent 命名为 Hephaestus(希腊神话里被众神抛弃的瘸腿铁匠)——故意的反讽;
  • 今年 5 月 TheNewStack 以「为什么 15.7 万开发者用 OpenCode 对冲 Anthropic」为题做了报道,生态裂痕已成明牌。

社区反馈(转述自 README 与 X,未经本站实测):有人用它一天清掉 8000 条 eslint 警告;有人一夜把 4.5 万行的 Tauri 桌面应用改造成 SaaS 网站;也有人直接取消了 Cursor 订阅。这类「多模型组队」叙事真实度如何,建议装 Light 版亲自跑一个任务验证。

局限也摆出来:① 许可证是 SUL-1.0(可持续使用许可),不是 OSI 认证的开源协议,商用场景先读 LICENSE 再部署;② 匿名遥测默认开启(可用环境变量关闭);③ v5 多 harness 重构进行中,CLAUDE.md 自己都警告「结构不稳」,beta 高频迭代意味着升级可能破坏配置;④ 955 个 open issues 挂着,主力生态是 OpenCode,想配 Claude Code 原生还得绕路。

同类怎么选:它跟官方、跟 OpenClaw 派的区别

  • Claude Code 官方:$200/月全家桶,Agent Teams 也已上线,但模型被 Anthropic 一家锁死;OmO 的路子是——订阅便宜的 ChatGPT $20、Kimi Code $19 或 GLM $10,让它们组队跑,总成本远低于一个 Max 订阅;
  • Codex CLI:OmO 的 Light 版就是把 rules、ultrawork 等组件移植进 Codex 插件体系,Claude 党与 OpenAI 党都能用;
  • OpenClaw 系(站内评过的 flowctx 上下文引擎是它的组件):另一派开源 harness,主打模型自由与本地化;OmO 更强调「多供应商编排 + 团队协作 + 玩法激进」;
  • deer-flow 等长任务 SuperAgent:学术研究向的长时任务,跟 OmO 的「日常开发加速」定位不同。

适合谁:多模型党、被订阅墙卡住的 Claude Code 重度用户、喜欢围观 AI 组队干活的尝鲜派。不适合谁:要开箱即用绝对稳定的人、公司合规敏感的团队(SUL 协议 + 遥测默认开都要评估)。

结论:值得一试,但把它当「风向标」看

我的判断:值得一试——先从 Codex Light 版(或 OpenCode 版)装起,跑一个小任务感受「组队干活」和单 Agent 的差别,再决定要不要上 Team Mode。不必把它神化:它本质是把「多模型编排」这个趋势做成产品的先行者,beta 血统决定了它适合玩,不适合当生产环境的唯一依赖。

OmO 真正的信号意义在于:当开源社区开始用「编排」绕过「订阅墙」,AI 编程工具的竞争就从模型参数转向了生态开放度。这事跟 OpenAI 切断 Cursor 合作(站内旧文)是同一条主线,而比纯上下文优化(flowctx 实测)又往前迈了一步——Agent 不再是单打独斗的工具,而是一支可以自由组队的队伍。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

张一鸣亲自督战空间视频模型:字节被曝下月发布,0.05 秒延迟要把抖音创作者带进 3D 世界

张一鸣亲自督战空间视频模型:字节被曝下月发布,0.05 秒延迟要把抖音创作者带进 3D 世界

张一鸣重新下场了——而且这次盯的是字节跳动目前最激进的一条产品线。

据彭博社 9 月 7 日援引知情人士报道,字节跳动创始人正在亲自督战一款实时空间视频生成 AI 模型的研发,最快下个月(10 月)就能发布。知情人士同时提醒:时间表还没定死,计划随时可能变;字节跳动方面没有回应置评请求。

这不是普通的视频模型迭代。它瞄准的是 2026 年最热的概念之一——世界模型:让 AI 学会环境的运行规律,实时渲染出一个能对你的动作、语音做出连贯反应的三维世界。

50 毫秒延迟、20 帧每秒:云端生成的三维世界

据彭博社报道,这款模型基于字节跳动现有的 AI 视频生成系统 Seedance 构建,用户可以用它为直播、短剧和游戏创建互动式虚拟世界,把自己”放进”三维空间里。

真正值得注意的是规格:按需生成视频约 20 帧/秒,延迟约 0.05 秒(50 毫秒),而且是在云端生成、不是在设备端生成

这个”云端”细节才是战略所在。把空间内容渲染放到远程服务器,头显(VR/XR 眼镜)只需接收画面,计算负载大幅下降——硬件不用堆昂贵芯片,成本自然就下来了。

字节跳动旗下有 XR 硬件品牌 Pico。报道称,这款模型预计就是为 Pico 用户服务的:生成能响应他们语音和动作的虚拟世界。如果跑通,XR 赛道的竞争重点将从”谁的硬件参数高”,转向”谁的模型强、谁的云够大、谁的内容分发够广”——后三样,恰好都是字节跳动已经有的东西。

为什么是张一鸣亲自下场:世界模型已是字节第一优先级

张一鸣 2021 年卸任字节跳动 CEO,之后长期淡出日常管理。但近一年他回归 AI 一线的信号越来越密集:8 月 6 日他在内部全员会上定调”做模型坚决不走蒸馏捷径”;8 月中旬英国《金融时报》报道字节在预训练参数规模最高达 10 万亿的超大模型;上周字节刚拿下 296 亿美元贷款、并考虑高达 700 亿美元的 AI 资本开支。

这次亲自督战空间视频模型,彭博社把他放进了李飞飞(World Labs 创始人)、Yann LeCun(Meta 首席 AI 科学家)的阵营——这批人共同的主张是:只靠语言训练的系统走不远,基于视觉与物理理解、能感知真实世界运行的模型,才是通向”能行动的 AI”的路径

这个判断不是临时起意。据 36 氪今年早些时候报道,字节跳动内部给 2026 年定了四大 AI 优先事项,世界模型排在第一,优先级甚至高于”守住 Seedance 的视频领先地位”和”豆包商业化”。世界模型方向拿到的数据预算,据称是对手同类项目的 3 到 4 倍。字节内部还设了个明确目标:年底前至少交付一个世界模型,并且拿它和谷歌 DeepMind 的 Genie 对标——后者已经能让人在实时渲染的街景图像里走动。

有意思的是,据 36 氪同一报道,2026 年初字节内部测试时,自估落后全球顶级水平约 10%。如果下个月真能发布,等于提前完成了计划。

字节在这条路上是双线并进:一条是视觉-语言-动作(VLA)路线,服务具身智能与机器人;另一条是面向娱乐和游戏的 3D 模拟。这次被曝光的空间视频模型属于第二条——也是离钱更近、已经有现成用户群的一条。

谁会被动:XR 战场从硬件军备转向「云端世界」

字节为什么敢在这时候冲世界模型?核心底气是它的老本行——视频。世界模型的训练素材就是视频数据,而字节跳动在视频压缩、传输、分发上积累了十几年:抖音、TikTok 的推荐系统每天处理海量视频流,Seedance 已经支撑着剪映(CapCut)和豆包。别的公司要从零攒数据管道,字节是现成的。

最尴尬的可能是 Meta 和苹果。两家都在头显上砸了重金:Meta 的 Quest 系列、苹果的 Vision Pro,销量都没能打开主流市场,而且都走”高端硬件”路线。TNW 的分析点破了这种模式的风险:一个云渲染的世界模型不一定在画质上赢过 Vision Pro,但它把”高画质的成本”变成了别人的问题——头显不再需要塞进昂贵的本地算力,一台轻量便宜的眼镜,接上云端就能跑。

放到国内语境,字节的对手是阿里、DeepSeek、月之暗面这批正在卷模型的公司;而字节手里的牌是别人没有的:抖音创作者生态。彭博社的报道提到,张一鸣希望把抖音的创作者带进世界模型这个新兴领域——让创作者用 AI 搭出能互动、能直播、能玩游戏的 3D 世界,这比单纯发布一个技术 demo 更有商业想象空间。

一句话判断

张一鸣亲自盯的不是一个”视频生成模型的升级版”,而是字节给 AI 军备竞赛找的下一个主战场:当语言模型的差距被拉近,谁能先让 AI”理解并实时生成世界”,谁就掌握下一轮内容平台的定义权。50 毫秒延迟只是起点——真正的分水岭是,抖音生态里能不能长出第一批”世界”来。我们持续盯着,下月见分晓。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读: