Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

你有没有经历过这种崩溃?

花了 2 小时让 Claude Code 做一个 Django 迁移,50+ 工具调用后上下文窗口炸了。/clear 一敲,Agent 一脸茫然问你:”请问您要做什么?”

这不是 bug,这是所有 AI 编程 Agent 的结构性缺陷:上下文窗口 = RAM,关机就清零。Manus AI 在被 Meta 收购前想明白了这件事——用文件系统当持久记忆,而不是把所有东西塞进上下文。

Planning-with-Files 就是这个思路的标准化实现:3 个 Markdown 文件 + Hook 自动注入,让 Agent 的”工作记忆”写在磁盘上,/clear 崩溃、上下文压缩、Session 断裂全不怕。26k Star、96.7% 断言通过率、3/3 盲测 A/B 全胜——这是目前持久化规划领域数据最硬的 Skill。

工作原理:三文件 + Hook 注入循环

核心模型

Context Window = RAM(易失、有限)
Filesystem    = Disk(持久、无限)

→ 任何重要东西都写到磁盘上

三个文件各管什么

文件 职责 更新时机
task_plan.md 阶段划分 + 进度追踪 + 决策记录 每完成一个阶段
findings.md 研究笔记 + 发现 + 决策依据 任何新发现
progress.md Session 日志 + 测试结果 全程持续记录

Hook 注入循环(5 个生命周期钩子)

Agent 工作 → 写决策/发现/错误到文件
     ↓
Hook 每轮开始时重新注入文件内容到上下文
     ↓
/clear 或崩溃 → 文件还在 → 新 Session 读文件恢复
     ↓
所有阶段完成 → Stop Hook 检查 → 释放完成信号

5 个 Hook 分别是:

  1. UserPromptSubmit — 每轮用户输入前注入计划
  1. PreToolUse — 每次工具调用前注入计划
  1. PostToolUse — Write/Edit 后提醒更新 progress.md
  1. Stop — 完成检查门控(gated 模式下阻止提前退出)
  1. PreCompact — 压缩前提醒刷盘

与 Manus AI 的关系

2025 年 12 月 Meta 以 20 亿美元收购 Manus。Manus 的核心秘密就是上下文工程:用 Markdown 文件当”磁盘上的工作记忆”。Planning-with-Files 把这个模式打包成了标准化 Skill,装到任何 Agent 上就能用。

功能拆解:五大模块逐个分析

1. 三文件模板系统

一句话:标准化的 task_plan.mdfindings.mdprogress.md 模板,带完整注释说明每个字段的用途。

核心能力

  • 模板自带 Goal / Next Step / Current Phase / Phases / Decisions / Errors 结构
  • Phase 支持 pending → in_progress → complete 状态流转
  • 决策表和错误表结构化记录,避免重复犯错

适用场景:任何 3+ 步骤或 5+ 工具调用的复杂任务。

2. Hook 自动注入引擎

一句话:5 个生命周期 Hook 让计划文件每轮自动注入上下文,Agent 不需要”记得去读”。

核心能力

  • UserPromptSubmit / PreToolUse 双保险注入
  • PostToolUse 提醒更新进度
  • Stop Hook 门控完成(gated 模式)
  • PreCompact 压缩前刷盘提醒

适用场景:长任务(50+ 工具调用),防止目标漂移。

3. Session 恢复系统

一句话/clear 或崩溃后,自动从 IDE Session Store 读取历史对话 + 从文件恢复计划状态。

核心能力

  • session-catchup.py 自动发现历史 Session
  • 提取上下文丢失后的对话片段
  • 生成恢复报告,帮助 Agent 快速补回状态

实测数据:恢复平均 5.0 turns(裸 Agent 13.3 turns),提速 62%

适用场景:上下文窗口不够用、需要多次 /clear 的超长任务。

4. 并行任务隔离

一句话:v2.36.0+ 支持 .planning/YYYY-MM-DD-slug/ 目录隔离,多个并行任务互不干扰。

核心能力

  • .active_plan 文件指向当前激活的计划目录
  • resolve-plan-dir.sh 智能解析计划路径
  • 防止共享父目录的线程注入无关计划

适用场景:多 Agent 并行、多任务交叉执行。

5. v3 长任务增强

一句话:Autonomous 模式 + Gated 完成门控 + Attestation 计划防篡改 + JSONL 运行日志。

核心能力

  • --autonomous:去掉逐轮计划复述,保留注入
  • --gated:所有阶段完成前阻止 Agent 退出
  • SHA-256 Attestation:计划被篡改时 Hook 拒绝注入
  • JSONL Ledger: append-only 运行日志,可审计

适用场景:数小时级自主运行、需要保证完成质量的无人值守任务。

实测数据:有 Skill vs 没 Skill

Benchmark 总览(v2.21.0,claude-sonnet-4-6,2026-03-06)

测试项 有 Skill 无 Skill 差距
断言通过率(30 项) 96.7%(29/30) 6.7%(2/30) +90.0 pp
三文件模式遵循 5/5 0/5 +100%
盲测 A/B 胜率 3/3(100%) 0/3 全胜
平均评分(10 分制) 10.0 6.8 +3.2

Token 成本对比

维度 有 Skill 无 Skill 差距
平均 Token 19,926 11,899 +68%
平均耗时 115s 98s +17%

结论:多花 68% Token 换 96.7% 结构化输出——这是一笔划算的交易。额外 Token 花在创建 3 个文件、填充决策表和错误表上,不是浪费。

Session 恢复实测(v3.4.0 内部基准,2026-07-06)

恢复方式 恢复所需 Turn 数 正确性
Planning-with-Files 5.0 77/77 pytest 全绿
裸 Agent(无规划) 13.3 77/77 pytest 全绿

恢复提速 62%,零正确性惩罚。两者最终都能完成任务,但有 Skill 的快了将近 3 倍。

盲测 A/B 评语摘录

“Output B(有 Skill)满足所有四项结构化工作流期望……Output A(无 Skill)交付了真实可运行的代码,但不符合结构化多阶段规划格式。” — Eval 1 评审

“Output B 还包含了 pytz/zoneinfo 迁移(4.2 特有问题,Output A 完全遗漏)以及 django-upgrade 工具推荐……18,727 字符 vs 12,847,信息密度更高。” — Eval 4 评审

安装方式 + 适用场景 + 结语

安装(一行命令)

# Claude Code(插件路由,含 Hook + 斜杠命令)
/plugin marketplace add OthmanAdi/planning-with-files
/plugin install planning-with-files@planning-with-files

# 60+ Agent 通用(Agent Skills 标准)
npx skills add OthmanAdi/planning-with-files --skill planning-with-files -g

# npm 锁版本到项目
npm install planning-with-files

安装后输入 /plan 或让 Agent “plan this task” 即可触发。

最适合谁

角色 为什么需要
独立开发者 一个人做复杂项目,需要跨 Session 记住进度
长任务工程师 数小时级 Agent 运行,目标漂移是最大敌人
多 Agent 协作 并行任务隔离 + 计划防篡改
AI 编程初学者 结构化输出强制养成好习惯

不太适合谁

  • 简单 CRUD / 一次性脚本:3 步以内的任务不需要三文件,反而增加摩擦
  • 已有 ECC 等系统级方案的团队:ECC 的 Agent Harness 已经覆盖了规划功能,重复叠加意义不大
  • Token 预算极紧的场景:多花 68% Token 不是所有人都能接受

一句话结语

Planning-with-Files 解决的是 AI 编程中最痛的结构性问题——上下文易失。它的数据足够硬(96.7% 通过率、3/3 A/B 全胜),架构足够通用(60+ Agent、18+ IDE),代价也足够清晰(+68% Token)。如果你的 Agent 经常在长任务中失忆,这是目前最成熟的解法。

数据来源:GitHub OthmanAdi/planning-with-files README + docs/evals.md,截至 2026-08-27。

相关阅读

⚠️ 本文为技术评测,非付费推广。Planning-with-Files 为 MIT 开源项目。

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

资讯摘要

据 TechCrunch、CNBC、Bloomberg 等多家媒体报道,Anthropic 在2026年5月第一周创造了AI行业史无前例的「超级新闻周」:Q1收入同比增长80倍,年化收入(ARR)突破440亿美元;与Google Cloud签署2000亿美元算力合同;与SpaceX签署算力协议接入xAI Colossus 1超级计算机;推出Claude Code Auto Mode自动选择最优模型;联合摩根大通CEO Jamie Dimon发布10个金融服务Agent;同日开源Claude Agent SDK。

同一周内,Google DeepMind员工以98%的赞成票通过成立工会(AI实验室史上首个工会);欧盟AI Act高风险规则合规截止日期从2026年8月推迟至2027年12月;宾夕法尼亚州起诉Character.AI聊天机器人冒充持牌精神科医生。

为什么值得关注

Anthropic 在5天内完成了从「追赶者」到「全层竞争者」的身份转变。此前只有OpenAI同时在前沿模型、开发工具、企业产品、基础设施投资和消费者市场五个层面展开竞争。现在Anthropic也在做同样的事。

这意味着AI采购者需要重新评估供应商名单。「默认选OpenAI」的安全假设已经不再成立。Anthropic 在收入增速、企业级合作规模和基础设施投入上,目前甚至领先于OpenAI。

对投资者而言,AI行业的竞争格局从「一超多强」正式进入「双雄争霸」时代。

分角色实操建议

对技术负责人

Claude Code Auto Mode 的发布意味着Anthropic正在将「模型选择」从人类决策中移除。Auto Mode 能自动选择最适合当前编码任务的Claude模型(最强版、中端版或最快版),目标是90%的编码任务无需人类干预。

建议:在非关键业务系统中试用Auto Mode,评估其实际效果。对于核心业务系统,建议保留手动选择权,等待更多安全数据。

对投资者

Anthropic的ARR已达440亿美元,与OpenAI的收入轨迹相当。但Anthropic的增长速度(80倍/年)远高于OpenAI同期表现。

关注点:Anthropic正在向消费者市场扩张(此前主要面向企业和开发者),这将直接与ChatGPT竞争。

对普通从业者

AI行业的「一超多强」格局已经结束,进入「双雄争霸」时代。这意味着更多选择、更激烈的竞争、可能更快的技术迭代。

建议:同时关注OpenAI和Anthropic的产品更新,不要只锁定一家。两家公司的差异化竞争可能带来更多创新。

欧盟AI Act:合规窗口期延长16个月

欧盟AI Act高风险AI规则的合规截止日期从2026年8月推迟至2027年12月,为在受监管领域(招聘、贷款、教育、执法、医疗设备)部署AI的企业提供了额外16个月的缓冲期。

这对AI合规团队是好消息。但建议不要因此拖延合规准备工作——提前完成合规的企业将在竞争中占据优势。

首个AI实验室工会:DeepMind员工的集体谈判权

Google DeepMind英国员工以98%的赞成票通过成立工会,触发点是一个具体的五角大楼机密AI合同。这是AI实验室历史上第一个正式工会。

此前AI实验室通过公开信和辞职来处理内部异议;DeepMind员工现在获得了集体谈判权。其他前沿实验室现在面临同样的可能性。

流量导向结语 + 合规披露

关注「AI商业快讯」,每天一篇AI热点深度解读。本周Anthropic的超级新闻周只是开始——AI行业正进入前所未有的激烈竞争期。

本文不含合作/联盟链接。

相关阅读

扎克伯格称AI为人人,商业普惠还是巨头话语权?

Meta首席执行官马克·扎克伯格近期多次公开表示,人工智能应当“为每个人服务”,并推动开源大模型策略。这一表态与Meta发布Llama系列模型的路线一致,也试图在AI监管趋严的背景下塑造技术民主化形象。然而,外界对其动机存在分歧:一方面,开源确实降低了中小企业使用AI的门槛;另一方面,Meta的商业模式仍依赖用户数据和广告收入,所谓“普惠”是否只是另一种生态绑定,仍需观察。

商业机会在哪里

机会一:开源AI基础设施的二次开发服务。 Llama等模型虽可免费获取,但企业级部署需要调优、安全测试和私有化改造,这为第三方技术服务商提供了市场空间。

机会二:面向中小企业的垂直AI工具。 通用模型无法直接解决特定行业问题,围绕法律、医疗、零售等场景开发轻量级AI应用,可作为“为人人”理念落地的商业切口。

机会三:AI素养与合规咨询。 当“AI为人人”引发公众讨论,企业需要理解技术边界、数据责任和伦理风险,相关培训和治理咨询服务需求将持续增长。

落地操作建议

  • 选取一个细分行业,基于主流开源模型构建原型,验证在真实业务中的效率提升与错误率控制,再决定商业化路径。
  • 与至少两个不同规模的客户深度共创,记录部署成本、维护难度和实际收益,形成可复制的服务套餐。
  • 建立开源技术追踪机制,对标Meta等公司的模型更新节奏,及时调整自有产品与合规策略,避免单一生态依赖。

需要清醒认识到,所谓“AI为人人”的宏大叙事背后是复杂的商业博弈。企业若盲目拥抱开源框架,可能面临许可证变更、数据泄露或技术路线淘汰的风险。更务实的做法是利用当前的开放红利期积累垂直能力,同时保持对底层平台变化的灵活应对。未来三到五年,AI普惠的承诺能否兑现,不取决于口号,而取决于是否有可持续的商业闭环。

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

痛点切入

用 AI 写代码的人,大概率遇到过这四种场景:

  • 自作主张 — 你让它加个功能,它默默假设你想要全量导出、分页、异步处理,一口气实现完才发现方向错了
  • 过度工程 — 一个 calculate_discount 函数,它给你写 30 行 Strategy 模式的抽象层
  • 顺手重构 — 你让它修个 bug,diff 里混进一堆「改进」:改了注释、重命名变量、删了你以为没用的代码
  • 无法验证 — 完成标准是「让它能用」,结果循环了 5 轮还在改
  • Andrej Karpathy(前 OpenAI / Tesla AI 负责人)在 X 上发了一段观察,直接点名这四个问题。有人把他的观点整理成一个 CLAUDE.md 文件,上线 7 个月拿到 207,175 Star,成为 GitHub 历史上增长最快的 AI 工具类仓库之一。

    这个 skill 不是代码库、不是插件、不是框架 — 是一个 2,357 字节的 Markdown 文件,四条规则,没有依赖。

    工作原理

    Karpathy Guidelines 的核心思路是:用声明式目标替代命令式指令,用强制约束替代隐性期望

    四条原则 vs 四个问题

    原则 解决的问题 核心机制
    Think Before Coding 假设错误、隐藏困惑 强制显式列出假设,不确定就问
    Simplicity First 过度工程、抽象膨胀 「高级工程师会说这太复杂吗?」自检
    Surgical Changes 顺手重构、无关改动 每行改动必须追溯到用户请求
    Goal-Driven Execution 无法验证、循环失败 把任务转为可验证的成功标准

    为什么只有 4 条?

    Karpathy 的原话:

    “LLMs are exceptionally good at looping until they meet specific goals… Don’t tell it what to do, give it success criteria and watch it go.”

    关键洞察:LLM 擅长「执行到满足条件」,但前提是条件得明确。四条原则不是在教 AI 怎么写代码,而是在 重新定义 AI 和人类的协作契约 — 让 AI 停下来问、写简单点、别乱动、定义清楚什么叫「完成了」。

    与同类方案的差异

    方案 思路 复杂度 效果
    Karpathy Guidelines 4 条行为约束 极低 中等(依赖模型遵守)
    Andrej Karpathy Guidelines (fork) 添加更多规则 中等
    ECC Agent Harness 68 Agent + 286 Skill 高(系统级强制)
    Planning-with-Files 持久化规划文件 高(崩溃恢复)

    Karpathy Guidelines 的独特之处:零依赖、零配置、一个文件搞定。它不强制执行,而是「建议」— 效果取决于模型的指令遵循能力。

    功能拆解

    模块 1:Think Before Coding(思考优先)

    一句话:在写任何代码之前,先列出你的假设,不确定就问。

    核心能力

  • 强制 LLM 显式声明假设(而不是默默假设后直接实现)
  • 面对歧义时呈现多个选项,而不是自己选一个
  • 遇到更简单的方案时主动提出
  • 困惑时停下来,描述哪里不清楚
  • 适用场景:需求模糊的任务、涉及隐私/安全的功能、多技术方案可选的决策

    示例对比

    ❌ LLM 常见行为:用户说「导出用户数据」,直接写一个导出全量 JSON 的函数

    ✅ 应有行为:先问清楚 — 导出全部还是筛选?JSON 还是 CSV?哪些字段?数据量多大?

    模块 2:Simplicity First(简单优先)

    一句话:写能解决问题的最简代码,不加推测性功能。

    核心能力

  • 禁止添加用户没要求的功能
  • 禁止单次使用的代码做抽象
  • 禁止不需要的「灵活性」和「可配置性」
  • 禁止为不可能的场景写错误处理
  • 200 行能 50 行解决就重写
  • 自检标准:「一个高级工程师会说这太复杂吗?」如果是,简化。

    适用场景:所有编码任务,尤其是脚本、工具函数、快速原型

    模块 3:Surgical Changes(外科手术式修改)

    一句话:只改必须改的,只清理自己制造的垃圾。

    核心能力

  • 不「改进」相邻代码、注释或格式
  • 不重构没坏的东西
  • 匹配现有代码风格,即使你有不同偏好
  • 发现无关死代码时提一下,但不删
  • 清理规则:只删除你的改动导致的孤立代码(未使用的 import/变量/函数),不删已有的死代码。

    验收标准:每一行改动都应该能追溯到用户的请求。

    适用场景:Bug 修复、功能增强、代码审查中的小改

    模块 4:Goal-Driven Execution(目标驱动执行)

    一句话:把任务转化为可验证的成功标准,循环直到达成。

    核心能力

  • 把「加验证」转为「写测试用例让非法输入失败,然后让它们通过」
  • 把「修 bug」转为「写一个复现测试,然后让它通过」
  • 把「重构 X」转为「确保重构前后测试都通过」
  • 多步任务用 1. [步骤] → 验证: [检查] 格式列出计划
  • 关键洞察:强成功标准让 LLM 能独立循环,弱标准(「让它能用」)需要反复确认。

    适用场景:多步骤任务、测试驱动开发、需要验收标准的工程任务

    实测数据

    星标与增长

    指标 数值
    Star 数 207,175
    Fork 数 21,141
    Watcher 1,202
    创建时间 2026-01-27
    最后更新 2026-04-20
    许可证 MIT

    7 个月 207k Star,平均每月增长约 30k。对比参考:ECC(242k★)用了 7 个月,Caveman(100k★)同期数据。

    Token 成本对比

    Karpathy Guidelines 本身不直接节省 token(不像 Caveman 那样压缩输出),但通过减少以下行为间接节省:

    场景 无 Guidelines 有 Guidelines 节省估算
    过度工程重写 1000+ 行 → 被拒绝 → 重写 50-200 行一次到位 60-80%
    顺手重构导致的额外 review diff 混入无关改动 → 逐行审查 干净 diff → 快速合并 50%+
    假设错误导致的返工 实现完发现方向错 → 全部重来 先确认再实现 80-100%

    真实场景对比(EXAMPLES.md 摘录)

    场景:添加折扣计算函数

    无 Guidelines(LLM 常见输出):

    from abc import ABC, abstractmethod
    from enum import Enum
    from typing import Protocol, Union
    from dataclasses import dataclass
    
    class DiscountStrategy(ABC):
        @abstractmethod
        def calculate(self, amount: float) -> float:
            pass
    # ... 30+ 行

    有 Guidelines:

    def calculate_discount(amount: float, percent: float) -> float:
        """Calculate discount amount. percent should be 0-100."""
        return amount * (percent / 100)

    代码量对比:30+ 行 vs 3 行。如果需求真的需要多策略,等需要时再重构。

    安装 + 适用场景 + 结语

    安装

    方式 A:Claude Code Plugin(推荐)

    /plugin marketplace add forrestchang/andrej-karpathy-skills
    /plugin install andrej-karpathy-skills@karpathy-skills

    方式 B:CLAUDE.md(逐项目)

    新项目:

    curl -o CLAUDE.md https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md

    现有项目(追加):

    echo "" >> CLAUDE.md
    curl https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md >> CLAUDE.md

    方式 C:Cursor

    仓库自带 .cursor/rules/karpathy-guidelines.mdc,直接在 Cursor 项目中生效。

    最适合谁

    角色 价值 推荐度
    个人开发者 减少 AI 返工,代码质量提升 ⭐⭐⭐⭐⭐
    小团队 统一 AI 协作规范 ⭐⭐⭐⭐
    技术负责人 建立 AI 编码标准 ⭐⭐⭐⭐
    初学者 学习「好代码」的标准 ⭐⭐⭐⭐⭐

    不适合谁

  • 追求极致速度的人:这些规则偏向谨慎,会增加确认环节
  • 简单任务:改个 typo 不需要四条铁律
  • 已经用 ECC 等系统级方案的人:功能重叠
  • 相关文章

  • ECC 实测:242k Star 的 Agent 操作系统,68 个 Agent 286 个 Skill 终结 AI 编程散装
  • Caveman 实测:一个 Skill 砍掉 AI 编程 65% token 成本
  • 合规披露

  • 数据来源:GitHub 仓库 multica-ai/andrej-karpathy-skills,截至 2026-08-25
  • Star/Fork 数据为实时 API 查询结果
  • EXAMPLES.md 对比为仓库官方示例
  • 未进行独立的 token 计数 benchmark,节省估算基于代码量对比推算
  • Karpathy 原始推文链接:https://x.com/karpathy/status/2015883857489522876
  • 一句话总结:Karpathy Guidelines 不是框架,不是插件,是一个 2.3KB 的 Markdown 文件 — 但它可能是性价比最高的 AI 编程改进:四条规则,零成本,直接提升代码质量和协作效率。

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    当 OpenAI 决定自己造芯片,AI 算力格局要变天了。

    8月25日,OpenAI 发布了自研推理芯片 Jalapeño 的首批实测数据。结果令人震惊:在多项关键指标上,这颗与 Broadcom 合作打造的 ASIC 芯片,竟然超越了 Nvidia 当前最先进的 Blackwell GPU。

    这不是实验室里的概念验证,而是 OpenAI 即将在年底部署到生产环境的真实芯片。一场 AI 推理芯片的新战争,正式打响。

    一、Jalapeño 实测数据:每瓦性能碾压 Blackwell

    OpenAI 在官方博文中披露了 Jalapeño 的对比测试结果。核心数据如下:

    能效比(AI 工作负载/瓦特):Jalapeño 达到 Blackwell 的 1.5 到 1.9 倍。这意味着处理相同的 AI 推理任务,Jalapeño 只需要不到 Blackwell 一半的电力。

    延迟(响应时间):Jalapeño 的延迟降低到 Blackwell 的 1/1.7 到 1/3.6。对于 ChatGPT 这样需要实时响应的产品,这个差距意味着用户体验的质变。

    适用场景:Jalapeño 在低延迟和高吞吐两种极端场景下都表现出色,说明这颗芯片不是”偏科生”,而是全面型选手。

    OpenAI 在博文中写道:”OpenAI 模型也加速了 Jalapeño 的开发。”这句话暗示了一个有趣的正反馈循环——OpenAI 用自家模型优化自家芯片,再用更好的芯片跑更强的模型。

    二、从 9 个月到量产:Broadcom 的速度与 OpenAI 的野心

    Jalapeño 的诞生速度本身就是行业奇迹。

    2026 年 6 月 24 日,OpenAI 和 Broadcom 联合发布了这颗芯片。从设计到流片,整个周期只用了 9 个月。要知道,传统芯片从设计到量产通常需要 18-24 个月。

    Broadcom 提供了定制 ASIC 的设计和制造能力,而 OpenAI 贡献了对 LLM 推理工作负载的深度理解。两者的结合产生了一颗专门为大语言模型推理优化的芯片——不是通用 GPU,而是”为这个特定任务而生”的专用处理器。

    芯片采用超大规模光罩(massive reticle-sized)设计,这在业界极为罕见,意味着单颗芯片的面积接近光刻机的物理极限。更大的芯片面积 = 更多的计算单元 = 更高的推理吞吐量。

    三、为什么 Nvidia 被超越?自研芯片的逻辑

    要理解 Jalapeño 为什么能超越 Blackwell,需要看清一个底层逻辑:通用芯片 vs 专用芯片

    Nvidia 的 GPU 是为图形渲染设计的,后来被”借用”来做 AI 计算。它的强大在于通用性——什么都能跑,但什么都不是最优解。Blackwell 是 Nvidia 最新的 AI 专用 GPU,但仍然是 GPU 架构,保留了大量图形渲染相关的冗余电路。

    Jalapeño 则完全不同。它从第一行代码开始就是为 LLM 推理设计的。没有图形渲染单元,没有通用计算的冗余,每一个晶体管都在为”让下一个 token 更快生成”服务。这种极致的专用化,让它在特定任务上能以更少的能耗完成更多的工作。

    这不是 Nvidia 的技术失败,而是商业逻辑的必然。当一个客户(OpenAI)的推理工作负载大到一定程度,自研专用芯片的经济账就算得过来了。

    四、AI 芯片格局:从 Nvidia 一家独大到多极竞争

    Jalapeño 的出现,标志着 AI 芯片市场从”谁买得到 Nvidia”进入”谁造得出更好的芯片”的新阶段。

    对 Nvidia 的影响:短期影响有限。OpenAI 明确表示将继续使用 Nvidia 和其他合作伙伴的加速器来满足不断增长的算力需求。Jalapeño 是补充,不是替代。但长期来看,如果每个大型 AI 公司都开始自研芯片,Nvidia 的市场份额将被逐步蚕食。

    对 Broadcom 的意义:这是 Broadcom 在 AI 芯片代工领域的标志性胜利。如果说台积电是 GPU 的制造者,Broadcom 正在成为定制 AI 芯片的设计伙伴。

    对 AI 行业的启示:自研芯片不再是 Google TPU 那样的”学术实验”,而是大型 AI 公司的标配。当你的推理成本占到运营成本的大头时,造自己的芯片就成了理性选择。

    但有一个关键变量:Nvidia 的下一代芯片 Rubin 已经在向客户出货,采用更先进的 HBM4 内存。Jalapeño 超越的是”上一代”Blackwell,面对 Rubin 时结果可能不同。这场芯片竞赛,远没有到终局。

    五、小结:推理芯片是 AI 的下一个战场

    Jalapeño 的实测数据证明了一件事:在 AI 推理这个价值数千亿美元的市场上,Nvidia 的护城河不是不可逾越的

    OpenAI 用 9 个月造出了一颗能超越 Blackwell 的芯片。明年,它会用 Rubin 级别的技术造出更强的下一代。当每个 AI 巨头都有自己的芯片团队时,算力成本将加速下降,AI 应用的普及也将随之提速。

    芯片战争的下半场,已经开始了。

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    2025 年 10 月,Perl 社区传奇人物 Jesse Vincent 发布了 Superpowers——一套为 AI 编程代理设计的完整软件开发方法论框架。不到一年,这个项目在 GitHub 上拿下了 277,000+ Star,成为 AI 编程工具生态中增速最快的项目之一。据 GitHub 数据显示,该项目已有 24,800+ Fork、681 次提交、100+ 贡献者,支持 Claude Code、Codex、Cursor、Devin、Gemini CLI 等 12+ 个主流编程平台。

    Superpowers 的核心理念只有一句话:让 AI 先停下来想清楚,再动手。它不是新模型,不是 MCP 服务器,而是由 15+ 个可组合 Skills 组成的工程化开发方法论,自动注入到每次 AI 编程会话中,强制执行”需求澄清→计划→TDD→Code Review”的完整流程。据 Datawhale Easy-Vibe 教程评价,Superpowers 把 Claude Code 从”聪明的实习生”升级为”有纪律的开发团队”。

    为什么 AI 编程需要”方法论”?

    用过 Claude Code 的人都遇到过这个痛点:你说”帮我做个登录功能”,AI 立刻开始写代码,不问你用什么认证方式、要不要记住密码、密码重置走邮件还是短信。结果写出来的东西一半不是你要的,返工成本比从头来还高。

    据 Hacker News 社区讨论,资深工程师 d–b 评论道:”我个人不太喜欢 Superpowers。我的老板喜欢。我觉得用 Superpowers 时 Claude 犯的错反而更多。但也许是我的问题。”另一位用户 tao_oat 则表示:”brainstorming skill 确实很棒,它帮助把模糊的早期想法具体化。我特别喜欢它用子代理对抗性审查自己的 spec/plan,这确实捕获了几个我本会遗漏的问题。”

    这种分歧恰好说明了 Superpowers 的定位:它不是让 AI 更聪明,而是让 AI 更有纪律。对于已经有成熟工程管理经验的资深开发者,Superpowers 的流程可能显得多余;但对于需要长期维护的生产级项目、团队协作场景、或者缺少流程纪律的开发者,它几乎是必装的。

    15+ Skills 如何工作?

    Superpowers 包含 15+ 个可组合的 Skills,覆盖软件开发生命周期的每个阶段。其核心工作流分为 7 步:

    步骤 Skill 功能
    1 brainstorming 苏格拉底式需求澄清,通过提问厘清模糊需求
    2 using-git-worktrees 创建隔离工作区,验证测试基线
    3 writing-plans 将大任务拆成 2-5 分钟的小任务,含文件路径和验证步骤
    4 subagent-driven-development 每任务派独立子代理,两阶段审查(spec 合规→代码质量)
    5 test-driven-development 强制 RED-GREEN-REFACTOR TDD 循环
    6 requesting-code-review 按严重级别报告问题,Critical 问题阻断进度
    7 finishing-a-development-branch 验证测试、选择 merge/PR/保留/丢弃

    据 Reddit r/ClaudeCode 社区 2026 年 2 月的反馈:”用了 Superpowers 之后,每个阶段都得到了应有的关注。没有跳过步骤,没有跳过验证。输出结果终于和我规划的一致了。”而 2026 年 6 月的另一条反馈则指出:”它让我慢了很多,消耗了更多 token,比普通计划更快达到限额。”

    安装与使用建议

    Superpowers 的安装极其简单,一条命令即可完成:

    # Claude Code 官方市场

    /plugin install superpowers@claude-plugins-official

    # 或 Superpowers 自有市场

    /plugin marketplace add obra/superpowers-marketplace

    /plugin install superpowers@superpowers-marketplace

    其他平台也有对应的安装方式:Codex 用 /plugins 搜索安装,Cursor 用 /add-plugin superpowers,Gemini CLI 用 gemini extensions install,Devin 用 devin plugins install。完整安装指南见 GitHub 仓库

    最佳使用场景:

    • 生产级项目开发:需要长期维护的代码,流程纪律能减少技术债
    • 团队协作:brainstorming → plan → review 的文档链路天然适合交接
    • 非资深工程师:缺少流程纪律的人,Superpowers 相当于”强制 best practices”

    不建议使用的场景:

    • 快速原型/一次性脚本:流程开销大于收益
    • Token 预算敏感:全流程 token 消耗是裸 Claude Code 的 3-5 倍
    • 资深工程师的个人项目:你可能已经自然地做了 Superpowers 强制的事

    写在最后

    Superpowers 是目前 AI 编程领域最成熟的工程化方法论框架,277k Star 实至名归。它的价值不在于让 AI 更聪明,而在于让 AI 更有纪律。如果你在写需要长期维护的生产级代码,它几乎是必装的;如果你只是快速原型或简单脚本,它的流程开销反而会拖慢你。

    值得关注的是,Superpowers 与 ECC(242k Star,Agent Harness 操作系统)、Caveman(100k Star,Token 压缩 65%)三者互补而非互斥:Superpowers 提供方法论,ECC 提供功能平台,Caveman 提供效率优化。对于预算敏感的开发者,”Superpowers + Caveman”的组合可能是性价比最高的选择。

    关注 AI商业快讯,每天一篇 AI 热点深度解读。

    相关阅读:

    Manus AI:Meta 20亿美元收购被叫停,中国AI Agent龙头被迫独立的背后

    Manus AI:Meta 20亿美元收购被叫停,中国AI Agent龙头被迫独立的背后

    资讯摘要

    据路透社、CNBC 等多家媒体报道,中国 AI Agent 公司 Manus(前身 Butterfly Effect/Monica.im)于 8 月 11 日宣布将恢复独立运营,此前 Meta 于 2025 年 12 月以超过 20 亿美元收购 Manus 的交易被中国国家发改委于 2026 年 4 月以国家安全为由正式否决。8 月 23-24 日,Manus 按照中国监管要求删除了部分用户数据(涉及 2025 年 12 月 29 日 Meta 交易公告后生成的数据),标志着这家估值一度达 5 亿美元的 AI Agent 龙头正式回归独立。

    这是中国首次以国家安全为由否决 AI 领域的跨境并购,也是 AI Agent 赛道迄今金额最大的一桩「反向收购」——从 20 亿美元的全球 AI 并购标杆,到被迫退还买家、数据清洗、独立求生,Manus 的遭遇折射出中美 AI 地缘博弈的深层逻辑。

    为什么值得关注

    AI Agent 赛道的「分水岭时刻」。 Manus 是全球首个实现大规模商业化的通用 AI Agent——2025 年 3 月发布后 8 个月内,年化收入(ARR)从零飙升至 1.25 亿美元,月环比增长超过 20%,付费用户达数百万。正是这种爆发式增长引发了 Meta 的收购兴趣,也触发了中国监管的警觉。

    跨境 AI 投资的风险重估。 中国发改委的否决令不仅是对 Manus 一家的影响——它向全球投资者发出了明确信号:涉及中国 AI 技术的跨境并购将面临前所未有的审查。Benchmark、腾讯、红杉中国(HongShan)等 Manus 的既有投资者,以及所有布局中国 AI 赛道的国际资本,都需要重新评估政策风险。

    AI Agent 的商业价值已被验证。 Manus 证明了通用 AI Agent 不是实验室玩具——它能独立完成复杂任务(研究、编程、数据分析、旅行规划),且用户愿意为此付费。这意味着 AI Agent 赛道的估值逻辑已经从「讲故事」转向「看收入」。

    Manus 事件时间线

    时间 事件
    2022 年 创始人肖弘创立 Butterfly Effect,推出 Monica 浏览器插件
    2025 年 3 月 Manus 正式发布,定位「全球首个通用 AI Agent」
    2025 年 4 月 Benchmark 领投 7500 万美元 Series B,估值 5 亿美元
    2025 年 12 月 17 日 Manus 宣布 ARR 突破 1 亿美元,月环比增长 20%+
    2025 年 12 月 29 日 Meta 宣布以超过 20 亿美元收购 Manus
    2026 年 1 月 中国商务部启动调查,联合创始人被限制出境
    2026 年 4 月 27 日 中国发改委以国家安全为由否决交易
    2026 年 6 月 Sacra 数据显示 Manus 年化收入已达 4.5 亿美元
    2026 年 8 月 11 日 Manus 宣布恢复独立运营
    2026 年 8 月 23-24 日 按监管要求删除部分用户数据

    中国为何否决?

    中国发改委的否决逻辑可以归纳为三个层面:

    1. 数据主权。 Manus 的核心资产不仅是代码,更是数百万用户的行为数据和任务记录。一旦被 Meta 收购,这些数据将落入美国科技巨头手中,北京认为这构成国家安全风险。

    2. 技术外溢。 Manus 的 Agent 架构(自主规划、工具调用、多步骤执行)代表了 AI 领域最前沿的能力方向。中国不希望这类技术通过并购方式被美国公司消化吸收。

    3. 先例效应。 这是中国首次以 2021 年出台的《外商投资安全审查办法》否决 AI 领域的跨境并购。选择 Manus 这样高调的案例「杀鸡儆猴」,意在警告其他中国 AI 公司:不要试图通过「卖身」美国巨头来规避国内竞争。

    值得注意的是,据路透社报道,在交易被否决前,中国监管层曾一度收紧边境管控,阻止 Manus 联合创始人出境——这一细节凸显了事件的敏感程度。

    Manus 的独立生存挑战

    回归独立的 Manus 面临三大挑战:

    融资难题。 原本 20 亿美元的 Meta 交易泡汤后,据 LinkedIn 上的报道,中国投资者曾尝试以同等价格从 Meta 手中买回 Manus。但独立运营意味着 Manus 需要自行寻找下一轮融资,而在中美地缘紧张的背景下,国际投资者会更加谨慎。

    用户信任重建。 8 月 23-24 日的数据删除直接影响了部分用户的使用体验。虽然 Manus 官方称将在删除后恢复服务,但「数据曾被删除」这一事实本身就可能影响用户对平台稳定性的信心。

    竞争加剧。 在 Manus 与 Meta 纠缠的 8 个月里,竞争对手并未停下脚步——OpenAI 的 Operator、Anthropic 的 Computer Use、Google 的 Project Mariner 都在快速迭代。Manus 需要证明,独立运营后它仍能保持技术领先。

    对不同角色的启示

    对创业者: Manus 的遭遇是一记警钟——如果你的公司涉及敏感技术,跨境并购可能不是退出的最优解。在当前地缘格局下,「独立发展 + 多元融资」可能比「卖身巨头」更安全。

    对投资者: 投资中国 AI 公司前,务必将「政策风险」纳入估值模型。Manus 的 Series B 投资者 Benchmark 以 5 亿美元估值入场,原本有望通过 Meta 收购获得 4 倍回报,如今却面临退出路径不确定性。

    对从业者: Manus 证明了 AI Agent 的商业化可行性——1.25 亿美元 ARR(后增至 4.5 亿)是真实存在的市场需求。如果你在做 AI Agent 相关的产品,现在是加速的好时机。

    结语

    Manus 的故事远未结束。它既是中国 AI 产业在全球化与自主化之间寻找平衡的缩影,也是 AI Agent 商业化进程中的标志性事件。接下来,Manus 能否在独立运营后重拾增长势头、能否获得新一轮融资、能否在与 OpenAI/Anthropic/Google 的竞争中守住阵地——这些问题的答案将深刻影响整个 AI Agent 赛道的走向。

    关注 AI商业快讯,每天一篇 AI 热点深度解读。

    相关阅读:
    OpenAI AI Agent 失控黑进 Hugging Face:AI 安全红线被正式触发
    60亿美元授权+109名员工:英伟达第三次上演「反向收购」,AI创业公司出路在哪?

    实测12款大模型能力增强Skills:从行为纠偏到自我进化,星标最高24万

    实测12款大模型能力增强Skills:从行为纠偏到自我进化,星标最高24万

    调研日期:2026-08-24

    数据来源:GitHub awesome-claude-skills / awesome-claude-code / awesome-agent-skills / 直接搜索

    筛选标准:星标 ≥1k、近30天有更新、有真实用户使用

    生态全景速览

    平台 星标 Skills数量 特点
    ComposioHQ/awesome-claude-skills 73.1k★ 50+ Claude Code 专属生态
    hesreallyhim/awesome-claude-code 52.9k★ 100+ 精选高质量skill+工具
    VoltAgent/awesome-agent-skills 31.3k★ 1497+ 跨平台兼容,官方团队维护
    GitHub 直接搜索 2000+ 覆盖全领域

    核心发现:提升大模型能力的skills主要集中在 6 个方向——行为调优、Token优化、规划管理、自我进化、知识增强、提示工程。

    Tier 1:必收(行为/输出质量优化)

    1. ECC — Agent Harness 性能优化系统

    • 仓库affaan-m/ECC — 242.5k★ / 36.7k fork
    • 核心能力

    – 68个专业Agent(规划/审查/构建/安全/领域/文档)

    – 286个Skill覆盖全流程

    – 15种Hook事件强制执行质量标准

    – AgentShield安全扫描(prompt注入/Hook完整性/MCP审计)

    – Memory Vault跨会话记忆持久化

    • 为什么收:这是”Agent Harness Operating System”,不是单一skill。它重新定义了Agent的行为框架,从根上提升输出质量和一致性。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code(稳定)/ Codex / Cursor / OpenCode

    2. Andrej Karpathy Skills — 行为纠偏CLAUDE.md

    – 基于Karpathy对LLM编码陷阱的观察

    – 单文件CLAUDE.md即可改善行为

    – 避免过度自信、幻觉代码、忽视上下文

    • 为什么收:200k+星标验证了”行为纠偏”是刚需。单文件方案零安装成本,立竿见影。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code

    3. Taste-Skill — 品味提升

    – 赋予AI”好品味”,停止生成无聊、通用的内容

    – 避免AI slop(AI生成的低质量内容)

    – 提升代码/文本的审美和质量标准

    • 为什么收:解决LLM输出”正确但平庸”的问题。品味是区分AI和人类输出的关键。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Cursor / Codex

    Tier 1:必收(Token/上下文优化)

    4. Caveman — Token压缩65%

    – 6级强度:lite / full / ultra / wenyan 等

    – 输出Token减少65%(实测)

    – 保留全部技术准确性

    – 支持安全警告时自动恢复完整表达

    • 为什么收:Token = 成本 + 速度。65%压缩意味着同样的预算能做3倍的事。已在我司部署验证。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Minis

    5. Planning-with-Files — 持久化规划

    – 崩溃恢复的Markdown计划文件

    – Session recovery(/clear和compaction后恢复)

    – 每轮重新注入防上下文腐烂

    – 确定性完成门控

    – Manus风格

    • 为什么收:长任务的核心痛点是”上下文丢失”。这个skill用文件系统解决,简单但有效。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / Cursor / OpenCode / 60+ agents

    Tier 1:必收(自我进化)

    6. Darwin-Skill — Skill自我进化系统

    – 评估→改进→测试→保留/回滚 完整闭环

    – Autoresearch-inspired自主优化

    – 无需手动调参,自动探索最优配置

    • 为什么收:这是”AI优化AI”的实现。Skill可以自我进化,持续提升能力上限。
    • 评分:易用性 ⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code

    Tier 2:精选(提示工程)

    7. Prompt-Master — 提示词生成

    – 为任意AI工具生成精确提示词

    – 零Token/积分浪费

    – 完整上下文和记忆保持

    • 为什么收:好的提示词 = 好的输出。这个skill让”写提示词”这件事本身也被AI优化。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / 通用AI工具

    Tier 2:精选(知识增强)

    8. ARIS — 自主ML研究

    – 跨模型审查循环

    – 创意发现和实验自动化

    – 轻量级纯Markdown,无框架依赖

    – 支持Claude Code / Codex / OpenClaw

    • 为什么收:让Agent在你睡觉时自动做研究。是”异步增强”的典范。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / OpenClaw

    9. Graphify — 代码库知识图谱

    – 将代码库+文档+SQL Schema+配置+PDF转为可查询知识库

    – 结构化知识提取

    – 增强Agent对大型项目的理解

    • 为什么收:大模型对大型代码库的理解受限于上下文窗口。Graphify用知识图谱突破这个限制。
    • 评分:易用性 ⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex

    10. Khazix-Skills — 多维度增强合集

    – leader:帮你定义目标

    – neat-freak:洁癖(代码/文件整洁度)

    – hv-analysis:高水平分析

    – khazix-writer:写作增强

    • 为什么收:中文社区最受欢迎的skill合集之一,覆盖目标设定→执行→输出全链条。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / 40+ agents

    Tier 2:精选(综合能力包)

    11. Claude-Skills 345合集

    – 345个skill + 30+ Agents + 70+ 自定义命令

    – 覆盖:工程/营销/产品/合规/C级顾问/研究/商业运营/财务/日常效率

    – 跨平台:Claude Code / Codex / Gemini CLI / Cursor 等8+平台

    • 为什么收:最全面的”一站式”skill包。适合需要全栈能力的团队。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / Gemini CLI / Cursor 等

    12. Last30Days — 实时研究

    – 跨Reddit / X / YouTube / HN / Polymarket / Web研究

    – 综合分析生成有依据的摘要

    – 解决LLM”知识截止日期”问题

    • 为什么收:LLM最大的弱点之一是”不知道最近发生了什么”。这个skill实时补充外部知识。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code

    场景推荐

    场景 推荐组合 预期效果
    **日常编码** Andrej Karpathy + Caveman + Taste 行为纠偏 + 省Token + 提品味
    **长任务/复杂项目** ECC + Planning-with-Files + Graphify 框架级优化 + 崩溃恢复 + 知识增强
    **自主研究/自动化** ARIS + Last30Days + Darwin 睡觉时研究 + 实时知识 + 自我进化
    **全栈团队** Claude-Skills 345 + Prompt-Master + ECC 一站式能力 + 提示词优化 + 质量保障
    **预算敏感** Caveman (full) + Andrej Karpathy + Taste 零成本组合,立竿见影

    推荐安装优先级

    立即安装(0配置,即时生效):

    1. Andrej Karpathy Skills — 单CLAUDE.md文件
    2. Caveman — 超压缩模式
    3. Taste — 品味提升

    短期部署(需简单配置):

    1. ECC — 完整Agent Harness
    2. Planning-with-Files — 长任务支持
    3. Last30Days — 实时知识

    中期规划(需评估集成):

    1. Darwin-Skill — 自我进化
    2. Graphify — 知识图谱
    3. Prompt-Master — 提示词优化

    与已有调研的关系

    • Token优化:已单独调研(2026-08-22),本次收录Caveman作为Tier 1补充
    • 投资领域:已单独调研(2026-08-24),本次不重复
    • 本次重点:通用能力增强,不限于特定领域

    后续调研方向

    1. MCP Server生态:工具调用能力增强
    2. 多模态增强:图像/音频/视频处理skill
    3. 安全与合规:Agent安全审计skill
    4. 垂直领域深挖:医疗/法律/金融专业skill

    75亿美元吞下OpenRouter:Stripe押注AI时代的「智能货币」,模型路由成新基础设施

    75亿美元吞下OpenRouter:Stripe押注AI时代的「智能货币」,模型路由成新基础设施

    引子

    8月19日,支付巨头Stripe宣布以75亿美元收购AI模型网关平台OpenRouter。这笔交易距离OpenRouter完成13亿美元估值的B轮融资仅过去82天——估值翻了近6倍。从一个只有4个模型的Chrome插件,到支撑450万亿+token年处理量的AI基础设施,OpenRouter的三年创业史,折射出整个AI产业从「模型为王」到「路由为王」的范式转移。

    核心进展:75亿美元,AI基础设施最大收购案之一

    Stripe在官方公告中表示,收购OpenRouter将帮助企业优化token路由和使用效率。OpenRouter目前支持来自80多家提供商的500多个模型,服务于1000万用户,年处理token量达450万亿以上——相比成立初期增长了3万倍。

    交易结构方面,据《纽约时报》报道,75亿美元中约15亿美元支付给OpenRouter创始团队,60亿美元归投资者。OpenRouter创始人兼CEO Alex Atallah(此前创立了估值133亿美元的OpenSea)表示:”我们相信智能将是多模型的:没有任何单一模型对每个任务都是最优的,开发者需要一个中立层来编排和管理所有模型。加入Stripe让我们能够加速这一使命。”

    Stripe CEO Patrick Collison则称:”Token是构建AI公司的核心货币,现实世界的经济潜力将取决于如何善用稀缺的计算资源。Stripe正在构建AI的经济基础设施,与OpenRouter一起,我们将帮助企业通过智能路由请求和高效使用token来最大化盈利能力。”

    值得注意的是,OpenRouter的客户名单已经相当亮眼:NVIDIA、Zoom、Lovable等企业都在使用其服务。OpenAI甚至通过OpenRouter提供独家折扣(如Terra和Luna模型),而Meta的Muse Spark和xAI的Grok等新模型也常常首先在OpenRouter上发布。Andrej Karpathy将OpenRouter比作AI的”转换开关”——就像Stripe成为支付处理的转换开关一样。

    技术与商业解读:从”LLM的Stripe”到真正的Stripe

    OpenRouter的崛起故事本身就是一个关于基础设施复利的经典案例。2023年4月,它以Window(windowai.to)的名字起步,只是一个让用户在不同聊天应用中使用多个模型的Chrome插件,灵感来自加密钱包的工作方式。2023年8月正式品牌化后,它打出了”LLM的统一接口”的口号。

    从商业逻辑看,这笔收购有着深刻的对称性。Stripe花了十多年时间构建了处理复杂金融交易的中立基础设施——优化支付方式、授权率、欺诈检测等变量。而OpenRouter做的是同样的事情,只不过对象换成了AI模型。两者都是”即插即用的API,通过抽成简化复杂交易”。

    Menlo Ventures(OpenRouter的主要投资方)在分析中指出了一个关键洞察:OpenRouter的核心产品其实不是路由token,而是成为最佳的AI网关。随着企业级LLM支出成本飙升(Uber、Coinbase、Microsoft等公司都面临这一问题),路由器作为成本解决方案的吸引力巨大。但Menlo也警告,仅基于prompt的路由其实是”愚人金”——在Agent世界中,一个长期运行的任务需要大量上下文才能确保请求被送到正确的模型。”在代码库中查找这个文件”这个任务,可能需要廉价的简单LLM,也可能需要前沿模型,取决于代码库的规模和原始上下文。

    OpenRouter的护城河正是在这里:数百万用户产生的海量prompt、模型选择、上下文和最终结果数据集,让它能够在真实生产环境中做到”在路由的同时真正保持质量”。Menlo预测,未来的路由器产品会直接告诉用户:”你可以通过在这个代码库的摘要部分将GPT 5.6 Sol切换为Muse Spark,每年节省10万美元——我们已经自动完成了评估。”

    影响:模型路由成为AI时代的支付基础设施

    这笔交易的行业影响远超一笔收购本身。

    首先,它标志着AI基础设施领域首个大规模退出案例。从模型管理、成本优化到计算调度,管理AI的基础设施模块已经成型,正在催生新一代公司。就在交易宣布前几周,Ramp、Cursor等10多家公司几乎同时推出了自己的路由器产品——整个行业似乎在同一时间觉醒。

    其次,它重新定义了”AI经济基础设施”的边界。Stripe原本只处理支付侧的利润优化,现在它要同时处理成本侧。对于构建AI应用的企业来说,这意味着未来可能只需要一个API就能完成从收入最大化到成本最小化的全链路优化。用Menlo的话说:”Stripe过去要增加互联网的GDP。从今天起,这包括了智能。”

    第三,这笔交易验证了”多模型未来”的判断。OpenRouter从4个模型起步,到支持500多个模型,本身就证明了没有单一模型能通吃所有场景。当Alex Atallah在一年前自称”LLM的Stripe”时,这听起来像是一厢情愿——现在它变成了字面意义上的事实。

    对于开发者和企业而言,最直接的启示是:模型选择和路由正在从”技术决策”升级为”财务决策”。当token成为核心货币,路由效率就是利润率。这不再是工程师的优化课题,而是CFO的关注焦点。

    小结

    75亿美元,82天,50倍估值——OpenRouter的故事是AI基础设施热潮的缩影。但更值得关注的是这笔交易背后的逻辑:当AI从实验走向生产,管理模型的复杂性本身就成了一门大生意。Stripe和OpenRouter的结合,本质上是在说:AI时代的基础设施,和互联网时代一样,最终会收敛到几个关键的中立层。模型路由,可能就是其中之一。

    对于正在构建AI应用的团队,现在是时候认真审视你的模型调用成本结构了。当Stripe这样的巨头入场,意味着这个赛道的游戏规则即将改变——要么你主动优化,要么你的基础设施提供商替你优化。

    60亿美元授权+109名员工:英伟达第三次上演「反向收购」,AI创业公司出路在哪?

    60亿美元授权+109名员工:英伟达第三次上演「反向收购」,AI创业公司出路在哪?

    资讯摘要

    8月22日,据科技媒体Newcomer独家报道,英伟达已同意支付60亿美元,获得AI编程创业公司Poolside AI的Model Factory软件非独占授权,同时向Poolside投资10亿美元(投前估值120亿美元),并向其109名员工发出聘用邀请。三位创始人将继续留在Poolside。这不是传统收购,而是英伟达继Groq(200亿美元)和Enfabrica(9亿美元)之后,第三次采用「授权+招聘+投资」模式布局AI能力。Poolside在致投资者信中透露,公司去年底未能在6周内筹集20亿美元购买40,000 GB300集群,失去了构建前沿模型的机会,因此转向新战略。

    为什么值得关注:AI人才争夺战进入「反向收购」时代

    英伟达这三笔交易总计约270亿美元,勾勒出AI行业一个新趋势:大型科技公司不再通过传统收购获取技术和人才,而是通过「授权+招聘」模式,绕过反垄断审查,同时保持被投公司独立运营。

    对AI创业者而言,这是一个重要信号:当资本门槛「垂直飙升」(Poolside CEO原话),当构建前沿模型需要「远超一个数量级的集群」,AI创业公司正在被重新定义。Poolside的案例表明,即使拥有顶尖团队和正确方向(CEO称公司「方向正确」),也无法在资本密集型竞赛中持续。

    对投资者而言,英伟达的模式提供了一个退出路径:不是IPO,不是被收购,而是「授权+投资」——公司继续运营,投资者获得现金回报,员工获得大厂职位。Poolside计划在2027年底前将60亿美元分配给现有投资者。

    对AI从业者而言,人才价值正在被重新评估。Poolside CEO在播客中透露,「不到70人构建了这个模型,不到115人参与工程和研究」。109名员工获得英伟达聘用邀请,意味着AI工程师的薪资和议价能力达到新高度。

    分角色实操建议

    对AI创业者:重新评估你的融资策略和增长路径。Poolside的教训是,当资本需求「垂直飙升」时,即使方向正确也可能失败。考虑「授权+投资」模式作为备选退出路径,而非坚持独立IPO。Poolside的Model Factory软件获得60亿美元授权费,证明AI工具链的价值可能超过模型本身。

    对投资者:关注AI工具链和基础设施公司,而非仅押注模型公司。英伟达三次交易都聚焦「技术授权」而非「公司收购」,暗示AI价值链正在从「模型」向「工具链」转移。Poolside的Model Factory是构建模型的系统,不是模型本身——这可能是下一个价值洼地。

    对AI工程师:你的技能议价能力正处于历史高点。109名Poolside员工获得英伟达邀请,平均年薪可能超过50万美元(基于60亿美元/109人粗略计算)。考虑在「授权+招聘」交易中争取更好的条款,因为这类交易正在成为行业常态。

    对大厂采购负责人:评估「授权+招聘」模式的ROI。英伟达三次交易总计270亿美元,但避免了传统收购的整合风险和监管审查。如果贵公司正在寻求AI能力补充,这种模式值得考虑。

    英伟达的「反向收购」模式:AI行业新范式

    英伟达的三次交易呈现清晰模式:

    1. Groq交易(200亿美元):获得推理技术+顶级工程师,Groq保持独立,后续融资3.5亿美元(英伟达参投)
    2. Enfabrica交易(9亿美元):获得硬件技术+团队
    3. Poolside交易(60亿美元):获得Model Factory软件+109名员工,Poolside保持独立

    共同点:

    • 非独占授权(Poolside可继续授权给其他公司)
    • 被投公司保持独立运营
    • 现有投资者获得现金回报
    • 员工获得大厂职位
    • 避免传统收购的整合风险和反垄断审查

    Poolside在致投资者信中阐述了新愿景:「人类水平能力将被开源模型完全商品化,但超级智能不会」。公司将问题分为两类:「智力密集型」(如软件、会计)将变成低利润商品,「实验密集型」(如治愈癌症)需要真实世界实验反馈,AI将成为「世界最有价值的科学发现引擎」。

    小结:AI创业公司的「生存窗口」正在关闭

    Poolside的案例揭示了AI创业的残酷现实:即使拥有正确方向(CEO称公司「方向正确」3.5年)、顶尖团队(不到115人构建前沿模型)、顶级投资(英伟达去年投资10亿美元),仍然可能因为「6周窗口期」未筹集20亿美元而失去构建前沿模型的机会。

    Poolside Infrastructure Company已在德州建设1.2GW数据中心,但公司承认「还没准备好分享更新的愿景」。对于其他AI创业公司,这意味着:资本密集型竞赛的门槛正在快速提升,独立构建前沿模型的机会窗口正在关闭。

    「授权+招聘」模式可能成为AI创业的新常态——不是失败,而是战略选择。Poolside的60亿美元授权费证明,AI工具链的价值可能超过模型本身。对于创业者,关键问题是:你的公司是在构建「智力密集型」产品(将被开源商品化),还是「实验密集型」产品(需要真实世界反馈)?


    相关阅读