Ponytail 深度评测:115k Star 的「懒人高级工程师」,真能省 54% 代码吗?

Ponytail 深度评测:115k Star 的「懒人高级工程师」,真能省 54% 代码吗?

115k Star、3 个月、MIT 协议——Ponytail 是 2026 年增长最快的 AI Coding Skill。它号称能让 AI agent 像「最懒的高级工程师」一样写代码,砍掉 54% 的冗余代码。但独立测试显示,真实效果只有 15%。这个差距从何而来?它到底值不值得装?

它是什么:100 行 Markdown 实现 7 级懒人阶梯

Ponytail 的核心是一个 7 级决策阶梯,在 AI agent 写代码之前强制执行:

  1. 这东西真的需要存在吗?→ 不需要就跳过(YAGNI)
  2. 代码库里已经有了?→ 复用,别重写
  3. 标准库能做?→ 用标准库
  4. 平台原生功能能做?→ 用原生(比如 <input type="date"> 代替日期选择器库)
  5. 已装的依赖能做?→ 用已装的
  6. 一行能搞定?→ 一行搞定
  7. 以上都不行?→ 写能工作的最小代码

关键安全阀:输入验证、错误处理、安全措施、无障碍性永远不能省。用户坚持要完整版本就照做,不再争论。

支持三个强度级别:lite(提建议)、full(强制执行,默认)、ultra(YAGNI 极端主义,删减优先,挑战需求本身)。

Benchmark 真相:官方 -54% vs 独立测试 -15%

官方数据(Haiku 4.5,12 个任务,n=4)

指标 ponytail caveman “YAGNI + one-liners”
代码行数 -54% -20% -33%
Token -22% +7% -14%
成本 -20% +3% -21%
时间 -27% +2% -30%
安全性 100% 100% 95%

JetBrains 独立测试(80 个配对任务,Sonnet 5)

指标 实测值 p 值
代码行数 -15% 0.088
成本 -10.3% 0.004 ✅
时间 -11%
质量 无显著差异

三个关键发现:

1. 自激活率为零。直接复制 SKILL.md 到 skills 目录,agent 10 个 session 一次都没触发。必须用 plugin + SessionStart hook 注入才能生效。

2. 效果集中在过度工程场景。大型构建 -31%,已经精简的任务几乎不动。宣传的 -54% 是 12 个刻意选择的「过度工程陷阱」任务的均值,不是通用场景。

3. 首次出现统计显著的成本节省。在 JetBrains 系列测试(caveman -8.5%、rtk +7.6%)中,ponytail 是第一个 p<0.01 的正向结果。

Scott Logic 的「打脸」测试

Scott Logic CTO Colin Eberhardt 发现,仅用 7 个英文单词:

“Follow YAGNI principles, and one-liner solutions”

在 ponytail 自己的 benchmark 上跑出了比 ponytail 更好的分数(6.9 vs 8.25 LOC)。他的核心批评:

  • ponytail 本质就是 1990 年代 YAGNI 原则的重新包装
  • 原始 benchmark 任务过于简单(5 个约 10 行代码的任务)
  • 基线模型输出多个选项导致 LOC 虚高
  • 100 行 Markdown 配 115k Star,「这是新版 leftpad?」

ponytail 作者接受了批评,扩展了 benchmark(从 5 个任务到 agentic 级别的 12 个任务),修正了污染 bug,发布了诚实的修正版本。这在 AI Skill 生态中相当罕见。

与同类工具对比

维度 ponytail caveman rtk
作用面 输出(代码) 输出(文本) 输入(CLI 输出)
机制 7 级阶梯 压缩文本 压缩终端输出
实测代码 -15% -8.5% N/A
实测成本 -10.3% -8.5% +7.6%
安装复杂度 中(需 plugin)

关键洞察:这些工具作用在不同层面,可以叠加使用。ponytail 管输出(写更少代码),caveman 管表达(说更少话),rtk 管输入(读更少日志)。

优缺点总结

优点

  • 真实有效:独立测试证实 -10% 成本节省,统计显著
  • 安全阀到位:明确不碰验证/安全/无障碍,100% 通过率
  • 生态完善:20+ agent 兼容,5 个子技能(review/audit/debt/gain/help)
  • 方法论诚实:主动修正 benchmark bug,回应批评并扩展测试
  • 与 caveman 互补:一个管代码量,一个管文本量,不冲突

缺点

  • 宣传与实测差距大:-54% vs -15%,约 3 倍缩水
  • 自激活失败:必须用 plugin hook 注入,直接放 skills 目录无效
  • 核心思想不新:YAGNI 是 1990 年代的 XP 原则,7 个单词可以替代
  • 简单任务无效:代码已经精简时效果为零
  • Reddit 反馈:「复杂软件中创建了有 bug 的补丁,假设太多」

适用场景

适合:AI 过度工程严重的团队(agent 动不动装 5 个依赖、写 200 行 wrapper)、前端/全栈项目(原生 HTML/CSS 能替代大量 JS 库)、原型/脚本开发、与 caveman 搭配使用。

不适合:已经写得精简的代码库、复杂系统架构、需要严格类型/接口的项目、硬件/IoT 项目。

结论

Ponytail 是一个设计精良、诚实有效的 AI Skill,但不是魔法。它的真正价值不在于「省 54% 代码」(那需要刻意选择的测试场景),而在于建立一个思维习惯:在写代码之前先问「这真的需要吗?有没有更简单的方法?」这个习惯本身值 10% 的成本节省。

如果你想试:先用 full 模式别上来就 ultra;必须通过 plugin hook 安装别只复制 SKILL.md;搭配 caveman 使用效果叠加;定期跑 /ponytail-audit 检查是否真的减少了不必要的代码。

—— 评测基于 GitHub 仓库、JetBrains 独立测试(80 配对任务)、Scott Logic 批判分析、Reddit 社区反馈。数据截至 2026 年 8 月 ——

相关阅读

Nvidia Q2营收翻倍至962亿美元,129亿吞下Hugging Face:AI算力帝国软硬通吃

Nvidia Q2营收翻倍至962亿美元,129亿吞下Hugging Face:AI算力帝国软硬通吃

据 CNBC、The Information 等多家媒体 8 月 27 日报道,Nvidia 公布 2026 财年 Q2 财报:季度营收 962 亿美元,同比翻倍,远超华尔街 923 亿美元预期;数据中心业务贡献 890 亿美元,同比增长 117%。同日,Nvidia 被曝已同意以 129 亿美元收购开源 AI 模型平台 Hugging Face。消息公布后,Nvidia 股价飙升近 9%,市值单日增加约 4400 亿美元。CEO 黄仁勋在财报电话会上表示,AI「已到达拐点」,需求远超公司 70% 的增长指引。

962 亿背后的三大信号

信号一:AI 需求不是放缓,而是加速。 Nvidia CFO Colette Kress 给出 2028 财年(2027 年 2 月至 2028 年 1 月)70% 的营收增长指引,但黄仁勋直言「需求远大于 70%」,公司受限于供应能力而非市场需求。这是对近期「AI 泡沫论」最有力的回应——当一家年收入近 4000 亿美元的公司说「供不应求」,市场没有理由不信。

信号二:客户结构正在多元化。 过去 Nvidia 的增长高度依赖微软、谷歌、亚马逊等超大规模云厂商。本季度,AI Clouds、工业和企业(ACIE)客户贡献了 403 亿美元收入,同比增长 138%。这意味着 Nvidia 正从「只卖给巨头」转向「卖给所有人」——AI 算力的买家从十几家变成了几百家。

信号三:收购 Hugging Face 是一步「软件定义硬件」的棋。 129 亿美元买下「AI 界的 GitHub」,表面看是跨界,实际逻辑清晰:OpenAI、谷歌、Anthropic、亚马逊都在自研芯片减少对 Nvidia 的依赖,Nvidia 需要一个开源生态锚点来维持硬件需求。Hugging Face 上运行的每一个开源模型,都需要 Nvidia GPU 来推理。更妙的是,Nvidia 承诺帮客户承担数百亿美元云计算成本,如果客户用不完算力,Hugging Face 可以消化剩余产能——这是一套自洽的商业闭环。

对不同角色意味着什么

对 AI 创业者: Nvidia 收购 Hugging Face 意味着开源生态有了一个「超级守护者」。如果你的商业模式依赖开源模型(微调、部署、推理优化),Nvidia 的资金和算力资源会让 Hugging Face 平台更强大。但风险在于:一个由芯片巨头控制的开源平台,是否还能保持中立?

对投资者: Nvidia 股价在连续四个季度「财报日下跌」后终于逆转,说明市场对 AI 投入回报的焦虑正在被实际业绩消化。129 亿收购 Hugging Face 的估值倍数(约 86 倍年收入)虽然惊人,但放在 AI 基础设施赛道并不离谱——Stripe 刚以 70 亿美元收购 OpenRouter(估值 13 亿的 5 倍)。AI 资产正在经历重估。

对云计算厂商: 这是坏消息。Nvidia 通过 Hugging Face 重新进入云服务市场(此前 DGX Cloud 已收缩),而且自带算力成本优势。AWS、Azure、GCP 需要重新评估与 Nvidia 的竞合关系——既是最大客户,又是潜在竞争对手。

对开源社区: Hugging Face 的年收入已从两个月前的 1 亿增长到 1.5 亿美元,接近盈利。被 Nvidia 收购后,短期内资源会更充裕,但长期需要观察:Nvidia 是否会干预平台的模型审核政策、是否会优先推荐自家硬件优化的模型、是否会限制竞对芯片的模型发布。

AI 基础设施进入「平台整合」时代

Nvidia 的这一系列动作,标志着 AI 产业正在从「百花齐放」进入「巨头整合」阶段。芯片(Nvidia GPU)+ 模型平台(Hugging Face)+ 云计算(潜在的 DGX Cloud 回归)+ 软件生态(CUDA + cuDNN),Nvidia 正在构建一个从底层硬件到上层应用的全栈帝国。

与此同时,反垄断风险也在积累。如果这笔交易完成,Nvidia 同时控制了 AI 算力供应和最大的开源模型分发平台,监管机构不太可能视而不见。欧盟 AI Act 已于 8 月 2 日生效,美国白宫也在推动 AI 安全测试——Nvidia 的扩张速度可能跑在监管前面,但不会永远跑在前面。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。Nvidia 的「软硬通吃」策略能否持续?Hugging Face 被收购后开源生态会走向何方?我们将持续跟踪。

相关阅读


本文含合作/联盟链接,不影响你的阅读与体验。详见 联盟营销披露

Understand-Anything 实测:80k Star 的代码知识图谱,让 AI 从「读代码」变成「教代码」

Understand-Anything 实测:80k Star 的代码知识图谱,让 AI 从「读代码」变成「教代码」

20 万行代码的新团队,没有架构文档,最懂系统的工程师刚离职——这是每个开发者都怕遇到的场景。传统方式是逐文件翻代码,平均需要 2-3 周才能建立基本的系统认知。Understand-Anything 用一个多 Agent 流水线扫描整个项目,生成可交互的知识图谱,把「读代码」变成「看地图」。80,770 Star、6,790 Fork、MIT 开源——它可能是目前最火的代码理解工具。

工作原理

Tree-sitter + LLM 混合架构

Understand-Anything 的核心是「确定性结构 + 语义理解」的双层架构:

第一层:Tree-sitter(确定性)

  • 解析源码为具体语法树(CST)
  • 提取结构事实:imports、exports、函数/类定义、调用关系、继承链
  • 预构建 importMap,避免重复推导
  • 基于指纹的变更检测,支持增量更新

第二层:LLM(语义)

  • 读取解析后的结构 + 原始源码
  • 生成纯英文摘要、标签、架构层分类
  • 业务领域映射、导览生成、语言概念标注

这种分离保证了结构图的可复现性(同一代码 → 同一边),同时保留了意图理解(文件是「干什么的」而不仅是「导入了什么」)。

5+2 Agent 流水线

/understand 命令编排 5 个专用 Agent,/understand-domain 加第 6 个,/understand-knowledge 加第 7 个:

Agent 职责 用途
project-scanner 发现文件、检测语言和框架 /understand
file-analyzer 提取函数、类、imports,生成图节点和边 /understand
architecture-analyzer 识别架构层(API/Service/Data/UI/Utility) /understand
tour-builder 生成按依赖排序的导览 /understand
graph-reviewer 验证图完整性和引用完整性 /understand
domain-analyzer 提取业务领域、流程、步骤 /understand-domain
article-analyzer 从 wiki 文章提取实体和隐式关系 /understand-knowledge

File analyzer 并行运行,最多 5 个并发 worker,每批 20-30 个文件。

功能拆解

核心模块

模块 一句话 核心能力 适用场景
结构图探索 代码库变可点击地图 每个文件/函数/类是节点,带纯英文摘要和关系 新人入职、代码审查
领域视图 代码映射业务流程 域/流程/步骤的水平图 向非技术人员解释系统
导览生成 自动创建学习路径 按依赖排序的架构 walkthrough 新人 onboarding
Diff 影响分析 提交前看影响范围 /understand-diff 显示变更波及的模块 PR review、变更管理
模糊/语义搜索 按含义找代码 「哪些部分处理认证?」→ 跨图搜索结果 日常开发、调试
Persona 自适应 UI 根据角色调整详情 初级/PM/高级用户看到不同深度 多角色团队协作
知识库分析 Wiki 变力导向图 从 Karpathy 模式 LLM wiki 提取实体和关系 团队知识管理
Figma 分析 设计稿变知识图谱 页面→屏幕→组件/变体/实例,设计 token 模型 设计-开发协作
增量更新 只分析变更文件 –auto-update post-commit hook 自动维护图 持续集成
多语言输出 6 种语言支持 en/zh/zh-TW/ja/ko/ru 国际化团队

平台兼容性

平台 状态 安装方式
Claude Code ✅ 原生 Plugin marketplace
Cursor ✅ 自动发现 Clone 即用
VS Code + Copilot ✅ 自动发现 Clone 即用
Codex ✅ 支持 install.sh codex
Gemini CLI ✅ 支持 install.sh gemini
OpenCode ✅ 支持 install.sh opencode
Copilot CLI ✅ 支持 copilot plugin install
Kiro ✅ 支持 install.sh kiro
共 15+ 平台 一行脚本

这是它最大的差异化优势——不是绑定某个编辑器的私有功能,而是跨平台的共享产出物。

实测数据

增长数据

指标 数值
GitHub Stars 80,770
Forks 6,790
Contributors 48+(Lum1104 贡献 523 commits)
Open Issues 290
创建时间 2026-03-15
最新版本 v2.9.0(2026-07-10)
许可证 MIT
主要语言 TypeScript 71.3%, JavaScript 15.8%, Python 8.8%

5 个月从 0 到 80k Star,AI 工具类增长最快之一。

Token 成本

据 Augment Code 分析和官方文档:

  • 首次扫描:消耗大量 Token(200k 行代码可能花费数十美元)
  • 增量更新:仅分析变更文件,Token 消耗大幅降低
  • 推荐:大项目用 Token 订阅或本地模型(如 Ollama)

Before vs After 对比

维度 传统方式 Understand-Anything
新人建立系统认知 2-3 周翻代码 1 天跑完流水线 + 看导览
变更影响评估 手动 grep + 阅读 /understand-diff 一键查看
架构文档 不存在或已过期 自动生成 + 增量维护
跨团队共享 口口相传 提交 JSON,所有人共享

已知局限

  1. LLM 成本自担:多 Agent 流水线调用真实 LLM,费用不低
  2. 图质量依赖代码质量:命名混乱、无关注点分离的代码库,图也会混乱
  3. 首次扫描耗时:200k 行代码即使 5 并发也要跑一阵
  4. 可能过期:不启用 –auto-update,图会漂移
  5. 290 个 Open Issues:活跃开发中,部分功能可能不稳定

安装 + 适用场景 + 结语

安装

Claude Code(最简):

/plugin marketplace add Egonex-AI/Understand-Anything
/plugin install understand-anything

其他平台(一行脚本):

curl -fsSL https://raw.githubusercontent.com/Egonex-AI/Understand-Anything/main/install.sh | bash

最适合谁

  • 新入职工程师:1 天建立系统认知,不用翻代码
  • 技术经理/PM:领域视图解释业务逻辑
  • 开源维护者:贡献者快速理解项目结构
  • 多平台团队:不同编辑器,同一份共享图

不适合谁

  • 小项目(<1k 行):杀鸡用牛刀
  • 单人项目:没有共享需求
  • 预算敏感:首次扫描 Token 成本不低
  • 代码质量差的项目:图会反映混乱而非澄清混乱

对不同角色的意义

个人开发者,它是理解陌生代码库的利器——接手遗留项目或研究开源项目时,5 分钟生成全景图。对团队,它是 onboarding 的基础设施——新人第一天就有交互式架构地图。对组织,它把「系统知识」从个人大脑里解放出来,变成可版本控制的团队资产。

相关阅读

本文数据来源:GitHub 仓库公开数据、Augment Code 报告、DEV.to 评测文章。截至 2026 年 8 月 28 日。

智谱「牛来」跑在10万国产卡上:成本1/40 Claude Opus,用量超DeepSeek两倍

智谱「牛来」跑在10万国产卡上:成本1/40 Claude Opus,用量超DeepSeek两倍

8月28日,智谱正式认领了此前在测试期引发广泛关注的神秘模型”牛来”(Ox-Alpha),并披露了一组令人震惊的数据:该模型测试期间每日处理 100 万亿 token,全部运行在超过 10 万张国产 AI 芯片上,成本效率据称与英伟达 GPU 相当,定价仅为 Claude Opus 4.8 的 1/40,使用量超过 DeepSeek 两倍。消息发布后,智谱港股盘中涨超 10%。

这不是又一个”国产替代”的口号。当一个模型能在国产芯片上跑出与英伟达 GPU 相当的成本效率,同时在实际使用量上碾压 DeepSeek,它意味着中国 AI 产业在算力自主这件事上,已经从”PPT 阶段”进入了”跑通阶段”。

10 万张国产卡的日均 100 万亿 token

智谱披露的数字值得拆解。”牛来”模型在测试期的日均 token 处理量达到 100 万亿,这个量级在全球 AI 推理场景中属于头部水平。更关键的是,这些 token 全部由国产芯片承载——没有英伟达 GPU,没有 CUDA 生态,纯国产算力栈。

在成本端,智谱声称”牛来”的成本效率与英伟达 GPU 相当。如果这个说法经得起验证,它意味着国产芯片在大规模推理场景中的性价比已经跨过了”可用”门槛,进入了”有竞争力”区间。定价 1/40 Claude Opus 4.8 更是直接把价格战打到了极致——对于那些对成本敏感的企业客户来说,这是一个无法忽视的选项。

使用量超过 DeepSeek 两倍这个数据同样值得注意。DeepSeek 此前凭借开源策略和低成本定位在开发者社区积累了大量用户,而”牛来”能在测试期就超越 DeepSeek 的使用量,说明市场对低成本、高性能模型的需求依然旺盛。

国产芯片的”ChatGPT 时刻”?

这件事的意义远不止于智谱一家公司的产品发布。从产业角度看,它至少传递了三个信号:

第一,国产芯片的推理能力得到了大规模验证。10 万张卡的日均 100 万亿 token,这不是实验室数据,是真实流量。对于那些担心国产芯片”能造不能用”的质疑,这是一个有力的回应。

第二,AI 模型的成本曲线正在被改写。Claude Opus 4.8 的定价代表了当前闭源模型的高端价位,而”牛来”用 1/40 的价格提供了”相当”的能力,这对整个行业的定价体系都会产生压力。

第三,中国 AI 产业正在形成自己的算力-模型闭环。国产芯片 + 国产模型 + 国产框架,这条链路的打通意味着即使在最极端的供应链中断场景下,中国 AI 产业仍然能够运转。

谁该紧张?

对芯片厂商:英伟达在中国市场的定价权正在被削弱。当国产芯片能跑出相当的成本效率,客户的选择空间就大了。AMD、英特尔同样需要关注——低成本推理市场可能成为国产芯片率先突破的阵地。

对云服务商:阿里云、腾讯云、华为云需要重新评估自己的算力采购策略。如果国产芯片的性价比确实达到这个水平,继续大规模采购英伟达 GPU 的理由就少了一个。

对 AI 创业公司:成本结构变了。如果你的产品依赖昂贵的闭源模型 API,现在有了更便宜的替代方案。但这不意味着可以无脑切换——模型能力、生态兼容性、长期维护都需要评估。

对投资者:智谱港股涨超 10% 是市场对这个信号的即时反应。但更深层的问题是:当中国 AI 产业在算力端实现自主,整个产业链的估值逻辑是否需要重写?

冷静看待

需要指出的是,”成本效率与英伟达 GPU 相当”这个说法目前还缺乏独立第三方的验证。国产芯片在软件生态、开发者工具链、长期稳定性等方面与英伟达 CUDA 生态仍有差距。10 万张卡的规模固然壮观,但这些芯片的采购成本、维护成本、以及实际利用率都是需要考量的因素。

此外,1/40 Claude Opus 4.8 的定价虽然诱人,但模型能力的对比维度很多——代码生成、逻辑推理、多语言处理、长上下文理解等场景下,”牛来”的表现是否真的能与顶级闭源模型抗衡,还需要更多公开 benchmark 的验证。

但无论如何,今天发生的这件事——一个中国 AI 模型在国产芯片上跑出头部级推理量,同时把价格打到竞品的 1/40——标志着中国 AI 产业在算力自主这条路上,迈出了实质性的一步。对于整个行业来说,这既是机遇,也是重新洗牌的开始。

关注 AI商业快讯,每天一篇 AI 热点深度解读


相关阅读:

Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

你有没有经历过这种崩溃?

花了 2 小时让 Claude Code 做一个 Django 迁移,50+ 工具调用后上下文窗口炸了。/clear 一敲,Agent 一脸茫然问你:”请问您要做什么?”

这不是 bug,这是所有 AI 编程 Agent 的结构性缺陷:上下文窗口 = RAM,关机就清零。Manus AI 在被 Meta 收购前想明白了这件事——用文件系统当持久记忆,而不是把所有东西塞进上下文。

Planning-with-Files 就是这个思路的标准化实现:3 个 Markdown 文件 + Hook 自动注入,让 Agent 的”工作记忆”写在磁盘上,/clear 崩溃、上下文压缩、Session 断裂全不怕。26k Star、96.7% 断言通过率、3/3 盲测 A/B 全胜——这是目前持久化规划领域数据最硬的 Skill。

工作原理:三文件 + Hook 注入循环

核心模型

Context Window = RAM(易失、有限)
Filesystem    = Disk(持久、无限)

→ 任何重要东西都写到磁盘上

三个文件各管什么

文件 职责 更新时机
task_plan.md 阶段划分 + 进度追踪 + 决策记录 每完成一个阶段
findings.md 研究笔记 + 发现 + 决策依据 任何新发现
progress.md Session 日志 + 测试结果 全程持续记录

Hook 注入循环(5 个生命周期钩子)

Agent 工作 → 写决策/发现/错误到文件
     ↓
Hook 每轮开始时重新注入文件内容到上下文
     ↓
/clear 或崩溃 → 文件还在 → 新 Session 读文件恢复
     ↓
所有阶段完成 → Stop Hook 检查 → 释放完成信号

5 个 Hook 分别是:

  1. UserPromptSubmit — 每轮用户输入前注入计划
  1. PreToolUse — 每次工具调用前注入计划
  1. PostToolUse — Write/Edit 后提醒更新 progress.md
  1. Stop — 完成检查门控(gated 模式下阻止提前退出)
  1. PreCompact — 压缩前提醒刷盘

与 Manus AI 的关系

2025 年 12 月 Meta 以 20 亿美元收购 Manus。Manus 的核心秘密就是上下文工程:用 Markdown 文件当”磁盘上的工作记忆”。Planning-with-Files 把这个模式打包成了标准化 Skill,装到任何 Agent 上就能用。

功能拆解:五大模块逐个分析

1. 三文件模板系统

一句话:标准化的 task_plan.mdfindings.mdprogress.md 模板,带完整注释说明每个字段的用途。

核心能力

  • 模板自带 Goal / Next Step / Current Phase / Phases / Decisions / Errors 结构
  • Phase 支持 pending → in_progress → complete 状态流转
  • 决策表和错误表结构化记录,避免重复犯错

适用场景:任何 3+ 步骤或 5+ 工具调用的复杂任务。

2. Hook 自动注入引擎

一句话:5 个生命周期 Hook 让计划文件每轮自动注入上下文,Agent 不需要”记得去读”。

核心能力

  • UserPromptSubmit / PreToolUse 双保险注入
  • PostToolUse 提醒更新进度
  • Stop Hook 门控完成(gated 模式)
  • PreCompact 压缩前刷盘提醒

适用场景:长任务(50+ 工具调用),防止目标漂移。

3. Session 恢复系统

一句话/clear 或崩溃后,自动从 IDE Session Store 读取历史对话 + 从文件恢复计划状态。

核心能力

  • session-catchup.py 自动发现历史 Session
  • 提取上下文丢失后的对话片段
  • 生成恢复报告,帮助 Agent 快速补回状态

实测数据:恢复平均 5.0 turns(裸 Agent 13.3 turns),提速 62%

适用场景:上下文窗口不够用、需要多次 /clear 的超长任务。

4. 并行任务隔离

一句话:v2.36.0+ 支持 .planning/YYYY-MM-DD-slug/ 目录隔离,多个并行任务互不干扰。

核心能力

  • .active_plan 文件指向当前激活的计划目录
  • resolve-plan-dir.sh 智能解析计划路径
  • 防止共享父目录的线程注入无关计划

适用场景:多 Agent 并行、多任务交叉执行。

5. v3 长任务增强

一句话:Autonomous 模式 + Gated 完成门控 + Attestation 计划防篡改 + JSONL 运行日志。

核心能力

  • --autonomous:去掉逐轮计划复述,保留注入
  • --gated:所有阶段完成前阻止 Agent 退出
  • SHA-256 Attestation:计划被篡改时 Hook 拒绝注入
  • JSONL Ledger: append-only 运行日志,可审计

适用场景:数小时级自主运行、需要保证完成质量的无人值守任务。

实测数据:有 Skill vs 没 Skill

Benchmark 总览(v2.21.0,claude-sonnet-4-6,2026-03-06)

测试项 有 Skill 无 Skill 差距
断言通过率(30 项) 96.7%(29/30) 6.7%(2/30) +90.0 pp
三文件模式遵循 5/5 0/5 +100%
盲测 A/B 胜率 3/3(100%) 0/3 全胜
平均评分(10 分制) 10.0 6.8 +3.2

Token 成本对比

维度 有 Skill 无 Skill 差距
平均 Token 19,926 11,899 +68%
平均耗时 115s 98s +17%

结论:多花 68% Token 换 96.7% 结构化输出——这是一笔划算的交易。额外 Token 花在创建 3 个文件、填充决策表和错误表上,不是浪费。

Session 恢复实测(v3.4.0 内部基准,2026-07-06)

恢复方式 恢复所需 Turn 数 正确性
Planning-with-Files 5.0 77/77 pytest 全绿
裸 Agent(无规划) 13.3 77/77 pytest 全绿

恢复提速 62%,零正确性惩罚。两者最终都能完成任务,但有 Skill 的快了将近 3 倍。

盲测 A/B 评语摘录

“Output B(有 Skill)满足所有四项结构化工作流期望……Output A(无 Skill)交付了真实可运行的代码,但不符合结构化多阶段规划格式。” — Eval 1 评审

“Output B 还包含了 pytz/zoneinfo 迁移(4.2 特有问题,Output A 完全遗漏)以及 django-upgrade 工具推荐……18,727 字符 vs 12,847,信息密度更高。” — Eval 4 评审

安装方式 + 适用场景 + 结语

安装(一行命令)

# Claude Code(插件路由,含 Hook + 斜杠命令)
/plugin marketplace add OthmanAdi/planning-with-files
/plugin install planning-with-files@planning-with-files

# 60+ Agent 通用(Agent Skills 标准)
npx skills add OthmanAdi/planning-with-files --skill planning-with-files -g

# npm 锁版本到项目
npm install planning-with-files

安装后输入 /plan 或让 Agent “plan this task” 即可触发。

最适合谁

角色 为什么需要
独立开发者 一个人做复杂项目,需要跨 Session 记住进度
长任务工程师 数小时级 Agent 运行,目标漂移是最大敌人
多 Agent 协作 并行任务隔离 + 计划防篡改
AI 编程初学者 结构化输出强制养成好习惯

不太适合谁

  • 简单 CRUD / 一次性脚本:3 步以内的任务不需要三文件,反而增加摩擦
  • 已有 ECC 等系统级方案的团队:ECC 的 Agent Harness 已经覆盖了规划功能,重复叠加意义不大
  • Token 预算极紧的场景:多花 68% Token 不是所有人都能接受

一句话结语

Planning-with-Files 解决的是 AI 编程中最痛的结构性问题——上下文易失。它的数据足够硬(96.7% 通过率、3/3 A/B 全胜),架构足够通用(60+ Agent、18+ IDE),代价也足够清晰(+68% Token)。如果你的 Agent 经常在长任务中失忆,这是目前最成熟的解法。

数据来源:GitHub OthmanAdi/planning-with-files README + docs/evals.md,截至 2026-08-27。

相关阅读

⚠️ 本文为技术评测,非付费推广。Planning-with-Files 为 MIT 开源项目。

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

资讯摘要

据 TechCrunch、CNBC、Bloomberg 等多家媒体报道,Anthropic 在2026年5月第一周创造了AI行业史无前例的「超级新闻周」:Q1收入同比增长80倍,年化收入(ARR)突破440亿美元;与Google Cloud签署2000亿美元算力合同;与SpaceX签署算力协议接入xAI Colossus 1超级计算机;推出Claude Code Auto Mode自动选择最优模型;联合摩根大通CEO Jamie Dimon发布10个金融服务Agent;同日开源Claude Agent SDK。

同一周内,Google DeepMind员工以98%的赞成票通过成立工会(AI实验室史上首个工会);欧盟AI Act高风险规则合规截止日期从2026年8月推迟至2027年12月;宾夕法尼亚州起诉Character.AI聊天机器人冒充持牌精神科医生。

为什么值得关注

Anthropic 在5天内完成了从「追赶者」到「全层竞争者」的身份转变。此前只有OpenAI同时在前沿模型、开发工具、企业产品、基础设施投资和消费者市场五个层面展开竞争。现在Anthropic也在做同样的事。

这意味着AI采购者需要重新评估供应商名单。「默认选OpenAI」的安全假设已经不再成立。Anthropic 在收入增速、企业级合作规模和基础设施投入上,目前甚至领先于OpenAI。

对投资者而言,AI行业的竞争格局从「一超多强」正式进入「双雄争霸」时代。

分角色实操建议

对技术负责人

Claude Code Auto Mode 的发布意味着Anthropic正在将「模型选择」从人类决策中移除。Auto Mode 能自动选择最适合当前编码任务的Claude模型(最强版、中端版或最快版),目标是90%的编码任务无需人类干预。

建议:在非关键业务系统中试用Auto Mode,评估其实际效果。对于核心业务系统,建议保留手动选择权,等待更多安全数据。

对投资者

Anthropic的ARR已达440亿美元,与OpenAI的收入轨迹相当。但Anthropic的增长速度(80倍/年)远高于OpenAI同期表现。

关注点:Anthropic正在向消费者市场扩张(此前主要面向企业和开发者),这将直接与ChatGPT竞争。

对普通从业者

AI行业的「一超多强」格局已经结束,进入「双雄争霸」时代。这意味着更多选择、更激烈的竞争、可能更快的技术迭代。

建议:同时关注OpenAI和Anthropic的产品更新,不要只锁定一家。两家公司的差异化竞争可能带来更多创新。

欧盟AI Act:合规窗口期延长16个月

欧盟AI Act高风险AI规则的合规截止日期从2026年8月推迟至2027年12月,为在受监管领域(招聘、贷款、教育、执法、医疗设备)部署AI的企业提供了额外16个月的缓冲期。

这对AI合规团队是好消息。但建议不要因此拖延合规准备工作——提前完成合规的企业将在竞争中占据优势。

首个AI实验室工会:DeepMind员工的集体谈判权

Google DeepMind英国员工以98%的赞成票通过成立工会,触发点是一个具体的五角大楼机密AI合同。这是AI实验室历史上第一个正式工会。

此前AI实验室通过公开信和辞职来处理内部异议;DeepMind员工现在获得了集体谈判权。其他前沿实验室现在面临同样的可能性。

流量导向结语 + 合规披露

关注「AI商业快讯」,每天一篇AI热点深度解读。本周Anthropic的超级新闻周只是开始——AI行业正进入前所未有的激烈竞争期。

本文不含合作/联盟链接。

相关阅读

扎克伯格称AI为人人,商业普惠还是巨头话语权?

Meta首席执行官马克·扎克伯格近期多次公开表示,人工智能应当“为每个人服务”,并推动开源大模型策略。这一表态与Meta发布Llama系列模型的路线一致,也试图在AI监管趋严的背景下塑造技术民主化形象。然而,外界对其动机存在分歧:一方面,开源确实降低了中小企业使用AI的门槛;另一方面,Meta的商业模式仍依赖用户数据和广告收入,所谓“普惠”是否只是另一种生态绑定,仍需观察。

商业机会在哪里

机会一:开源AI基础设施的二次开发服务。 Llama等模型虽可免费获取,但企业级部署需要调优、安全测试和私有化改造,这为第三方技术服务商提供了市场空间。

机会二:面向中小企业的垂直AI工具。 通用模型无法直接解决特定行业问题,围绕法律、医疗、零售等场景开发轻量级AI应用,可作为“为人人”理念落地的商业切口。

机会三:AI素养与合规咨询。 当“AI为人人”引发公众讨论,企业需要理解技术边界、数据责任和伦理风险,相关培训和治理咨询服务需求将持续增长。

落地操作建议

  • 选取一个细分行业,基于主流开源模型构建原型,验证在真实业务中的效率提升与错误率控制,再决定商业化路径。
  • 与至少两个不同规模的客户深度共创,记录部署成本、维护难度和实际收益,形成可复制的服务套餐。
  • 建立开源技术追踪机制,对标Meta等公司的模型更新节奏,及时调整自有产品与合规策略,避免单一生态依赖。

需要清醒认识到,所谓“AI为人人”的宏大叙事背后是复杂的商业博弈。企业若盲目拥抱开源框架,可能面临许可证变更、数据泄露或技术路线淘汰的风险。更务实的做法是利用当前的开放红利期积累垂直能力,同时保持对底层平台变化的灵活应对。未来三到五年,AI普惠的承诺能否兑现,不取决于口号,而取决于是否有可持续的商业闭环。

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

痛点切入

用 AI 写代码的人,大概率遇到过这四种场景:

  • 自作主张 — 你让它加个功能,它默默假设你想要全量导出、分页、异步处理,一口气实现完才发现方向错了
  • 过度工程 — 一个 calculate_discount 函数,它给你写 30 行 Strategy 模式的抽象层
  • 顺手重构 — 你让它修个 bug,diff 里混进一堆「改进」:改了注释、重命名变量、删了你以为没用的代码
  • 无法验证 — 完成标准是「让它能用」,结果循环了 5 轮还在改
  • Andrej Karpathy(前 OpenAI / Tesla AI 负责人)在 X 上发了一段观察,直接点名这四个问题。有人把他的观点整理成一个 CLAUDE.md 文件,上线 7 个月拿到 207,175 Star,成为 GitHub 历史上增长最快的 AI 工具类仓库之一。

    这个 skill 不是代码库、不是插件、不是框架 — 是一个 2,357 字节的 Markdown 文件,四条规则,没有依赖。

    工作原理

    Karpathy Guidelines 的核心思路是:用声明式目标替代命令式指令,用强制约束替代隐性期望

    四条原则 vs 四个问题

    原则 解决的问题 核心机制
    Think Before Coding 假设错误、隐藏困惑 强制显式列出假设,不确定就问
    Simplicity First 过度工程、抽象膨胀 「高级工程师会说这太复杂吗?」自检
    Surgical Changes 顺手重构、无关改动 每行改动必须追溯到用户请求
    Goal-Driven Execution 无法验证、循环失败 把任务转为可验证的成功标准

    为什么只有 4 条?

    Karpathy 的原话:

    “LLMs are exceptionally good at looping until they meet specific goals… Don’t tell it what to do, give it success criteria and watch it go.”

    关键洞察:LLM 擅长「执行到满足条件」,但前提是条件得明确。四条原则不是在教 AI 怎么写代码,而是在 重新定义 AI 和人类的协作契约 — 让 AI 停下来问、写简单点、别乱动、定义清楚什么叫「完成了」。

    与同类方案的差异

    方案 思路 复杂度 效果
    Karpathy Guidelines 4 条行为约束 极低 中等(依赖模型遵守)
    Andrej Karpathy Guidelines (fork) 添加更多规则 中等
    ECC Agent Harness 68 Agent + 286 Skill 高(系统级强制)
    Planning-with-Files 持久化规划文件 高(崩溃恢复)

    Karpathy Guidelines 的独特之处:零依赖、零配置、一个文件搞定。它不强制执行,而是「建议」— 效果取决于模型的指令遵循能力。

    功能拆解

    模块 1:Think Before Coding(思考优先)

    一句话:在写任何代码之前,先列出你的假设,不确定就问。

    核心能力

  • 强制 LLM 显式声明假设(而不是默默假设后直接实现)
  • 面对歧义时呈现多个选项,而不是自己选一个
  • 遇到更简单的方案时主动提出
  • 困惑时停下来,描述哪里不清楚
  • 适用场景:需求模糊的任务、涉及隐私/安全的功能、多技术方案可选的决策

    示例对比

    ❌ LLM 常见行为:用户说「导出用户数据」,直接写一个导出全量 JSON 的函数

    ✅ 应有行为:先问清楚 — 导出全部还是筛选?JSON 还是 CSV?哪些字段?数据量多大?

    模块 2:Simplicity First(简单优先)

    一句话:写能解决问题的最简代码,不加推测性功能。

    核心能力

  • 禁止添加用户没要求的功能
  • 禁止单次使用的代码做抽象
  • 禁止不需要的「灵活性」和「可配置性」
  • 禁止为不可能的场景写错误处理
  • 200 行能 50 行解决就重写
  • 自检标准:「一个高级工程师会说这太复杂吗?」如果是,简化。

    适用场景:所有编码任务,尤其是脚本、工具函数、快速原型

    模块 3:Surgical Changes(外科手术式修改)

    一句话:只改必须改的,只清理自己制造的垃圾。

    核心能力

  • 不「改进」相邻代码、注释或格式
  • 不重构没坏的东西
  • 匹配现有代码风格,即使你有不同偏好
  • 发现无关死代码时提一下,但不删
  • 清理规则:只删除你的改动导致的孤立代码(未使用的 import/变量/函数),不删已有的死代码。

    验收标准:每一行改动都应该能追溯到用户的请求。

    适用场景:Bug 修复、功能增强、代码审查中的小改

    模块 4:Goal-Driven Execution(目标驱动执行)

    一句话:把任务转化为可验证的成功标准,循环直到达成。

    核心能力

  • 把「加验证」转为「写测试用例让非法输入失败,然后让它们通过」
  • 把「修 bug」转为「写一个复现测试,然后让它通过」
  • 把「重构 X」转为「确保重构前后测试都通过」
  • 多步任务用 1. [步骤] → 验证: [检查] 格式列出计划
  • 关键洞察:强成功标准让 LLM 能独立循环,弱标准(「让它能用」)需要反复确认。

    适用场景:多步骤任务、测试驱动开发、需要验收标准的工程任务

    实测数据

    星标与增长

    指标 数值
    Star 数 207,175
    Fork 数 21,141
    Watcher 1,202
    创建时间 2026-01-27
    最后更新 2026-04-20
    许可证 MIT

    7 个月 207k Star,平均每月增长约 30k。对比参考:ECC(242k★)用了 7 个月,Caveman(100k★)同期数据。

    Token 成本对比

    Karpathy Guidelines 本身不直接节省 token(不像 Caveman 那样压缩输出),但通过减少以下行为间接节省:

    场景 无 Guidelines 有 Guidelines 节省估算
    过度工程重写 1000+ 行 → 被拒绝 → 重写 50-200 行一次到位 60-80%
    顺手重构导致的额外 review diff 混入无关改动 → 逐行审查 干净 diff → 快速合并 50%+
    假设错误导致的返工 实现完发现方向错 → 全部重来 先确认再实现 80-100%

    真实场景对比(EXAMPLES.md 摘录)

    场景:添加折扣计算函数

    无 Guidelines(LLM 常见输出):

    from abc import ABC, abstractmethod
    from enum import Enum
    from typing import Protocol, Union
    from dataclasses import dataclass
    
    class DiscountStrategy(ABC):
        @abstractmethod
        def calculate(self, amount: float) -> float:
            pass
    # ... 30+ 行

    有 Guidelines:

    def calculate_discount(amount: float, percent: float) -> float:
        """Calculate discount amount. percent should be 0-100."""
        return amount * (percent / 100)

    代码量对比:30+ 行 vs 3 行。如果需求真的需要多策略,等需要时再重构。

    安装 + 适用场景 + 结语

    安装

    方式 A:Claude Code Plugin(推荐)

    /plugin marketplace add forrestchang/andrej-karpathy-skills
    /plugin install andrej-karpathy-skills@karpathy-skills

    方式 B:CLAUDE.md(逐项目)

    新项目:

    curl -o CLAUDE.md https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md

    现有项目(追加):

    echo "" >> CLAUDE.md
    curl https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md >> CLAUDE.md

    方式 C:Cursor

    仓库自带 .cursor/rules/karpathy-guidelines.mdc,直接在 Cursor 项目中生效。

    最适合谁

    角色 价值 推荐度
    个人开发者 减少 AI 返工,代码质量提升 ⭐⭐⭐⭐⭐
    小团队 统一 AI 协作规范 ⭐⭐⭐⭐
    技术负责人 建立 AI 编码标准 ⭐⭐⭐⭐
    初学者 学习「好代码」的标准 ⭐⭐⭐⭐⭐

    不适合谁

  • 追求极致速度的人:这些规则偏向谨慎,会增加确认环节
  • 简单任务:改个 typo 不需要四条铁律
  • 已经用 ECC 等系统级方案的人:功能重叠
  • 相关文章

  • ECC 实测:242k Star 的 Agent 操作系统,68 个 Agent 286 个 Skill 终结 AI 编程散装
  • Caveman 实测:一个 Skill 砍掉 AI 编程 65% token 成本
  • 合规披露

  • 数据来源:GitHub 仓库 multica-ai/andrej-karpathy-skills,截至 2026-08-25
  • Star/Fork 数据为实时 API 查询结果
  • EXAMPLES.md 对比为仓库官方示例
  • 未进行独立的 token 计数 benchmark,节省估算基于代码量对比推算
  • Karpathy 原始推文链接:https://x.com/karpathy/status/2015883857489522876
  • 一句话总结:Karpathy Guidelines 不是框架,不是插件,是一个 2.3KB 的 Markdown 文件 — 但它可能是性价比最高的 AI 编程改进:四条规则,零成本,直接提升代码质量和协作效率。

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    当 OpenAI 决定自己造芯片,AI 算力格局要变天了。

    8月25日,OpenAI 发布了自研推理芯片 Jalapeño 的首批实测数据。结果令人震惊:在多项关键指标上,这颗与 Broadcom 合作打造的 ASIC 芯片,竟然超越了 Nvidia 当前最先进的 Blackwell GPU。

    这不是实验室里的概念验证,而是 OpenAI 即将在年底部署到生产环境的真实芯片。一场 AI 推理芯片的新战争,正式打响。

    一、Jalapeño 实测数据:每瓦性能碾压 Blackwell

    OpenAI 在官方博文中披露了 Jalapeño 的对比测试结果。核心数据如下:

    能效比(AI 工作负载/瓦特):Jalapeño 达到 Blackwell 的 1.5 到 1.9 倍。这意味着处理相同的 AI 推理任务,Jalapeño 只需要不到 Blackwell 一半的电力。

    延迟(响应时间):Jalapeño 的延迟降低到 Blackwell 的 1/1.7 到 1/3.6。对于 ChatGPT 这样需要实时响应的产品,这个差距意味着用户体验的质变。

    适用场景:Jalapeño 在低延迟和高吞吐两种极端场景下都表现出色,说明这颗芯片不是”偏科生”,而是全面型选手。

    OpenAI 在博文中写道:”OpenAI 模型也加速了 Jalapeño 的开发。”这句话暗示了一个有趣的正反馈循环——OpenAI 用自家模型优化自家芯片,再用更好的芯片跑更强的模型。

    二、从 9 个月到量产:Broadcom 的速度与 OpenAI 的野心

    Jalapeño 的诞生速度本身就是行业奇迹。

    2026 年 6 月 24 日,OpenAI 和 Broadcom 联合发布了这颗芯片。从设计到流片,整个周期只用了 9 个月。要知道,传统芯片从设计到量产通常需要 18-24 个月。

    Broadcom 提供了定制 ASIC 的设计和制造能力,而 OpenAI 贡献了对 LLM 推理工作负载的深度理解。两者的结合产生了一颗专门为大语言模型推理优化的芯片——不是通用 GPU,而是”为这个特定任务而生”的专用处理器。

    芯片采用超大规模光罩(massive reticle-sized)设计,这在业界极为罕见,意味着单颗芯片的面积接近光刻机的物理极限。更大的芯片面积 = 更多的计算单元 = 更高的推理吞吐量。

    三、为什么 Nvidia 被超越?自研芯片的逻辑

    要理解 Jalapeño 为什么能超越 Blackwell,需要看清一个底层逻辑:通用芯片 vs 专用芯片

    Nvidia 的 GPU 是为图形渲染设计的,后来被”借用”来做 AI 计算。它的强大在于通用性——什么都能跑,但什么都不是最优解。Blackwell 是 Nvidia 最新的 AI 专用 GPU,但仍然是 GPU 架构,保留了大量图形渲染相关的冗余电路。

    Jalapeño 则完全不同。它从第一行代码开始就是为 LLM 推理设计的。没有图形渲染单元,没有通用计算的冗余,每一个晶体管都在为”让下一个 token 更快生成”服务。这种极致的专用化,让它在特定任务上能以更少的能耗完成更多的工作。

    这不是 Nvidia 的技术失败,而是商业逻辑的必然。当一个客户(OpenAI)的推理工作负载大到一定程度,自研专用芯片的经济账就算得过来了。

    四、AI 芯片格局:从 Nvidia 一家独大到多极竞争

    Jalapeño 的出现,标志着 AI 芯片市场从”谁买得到 Nvidia”进入”谁造得出更好的芯片”的新阶段。

    对 Nvidia 的影响:短期影响有限。OpenAI 明确表示将继续使用 Nvidia 和其他合作伙伴的加速器来满足不断增长的算力需求。Jalapeño 是补充,不是替代。但长期来看,如果每个大型 AI 公司都开始自研芯片,Nvidia 的市场份额将被逐步蚕食。

    对 Broadcom 的意义:这是 Broadcom 在 AI 芯片代工领域的标志性胜利。如果说台积电是 GPU 的制造者,Broadcom 正在成为定制 AI 芯片的设计伙伴。

    对 AI 行业的启示:自研芯片不再是 Google TPU 那样的”学术实验”,而是大型 AI 公司的标配。当你的推理成本占到运营成本的大头时,造自己的芯片就成了理性选择。

    但有一个关键变量:Nvidia 的下一代芯片 Rubin 已经在向客户出货,采用更先进的 HBM4 内存。Jalapeño 超越的是”上一代”Blackwell,面对 Rubin 时结果可能不同。这场芯片竞赛,远没有到终局。

    五、小结:推理芯片是 AI 的下一个战场

    Jalapeño 的实测数据证明了一件事:在 AI 推理这个价值数千亿美元的市场上,Nvidia 的护城河不是不可逾越的

    OpenAI 用 9 个月造出了一颗能超越 Blackwell 的芯片。明年,它会用 Rubin 级别的技术造出更强的下一代。当每个 AI 巨头都有自己的芯片团队时,算力成本将加速下降,AI 应用的普及也将随之提速。

    芯片战争的下半场,已经开始了。

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    2025 年 10 月,Perl 社区传奇人物 Jesse Vincent 发布了 Superpowers——一套为 AI 编程代理设计的完整软件开发方法论框架。不到一年,这个项目在 GitHub 上拿下了 277,000+ Star,成为 AI 编程工具生态中增速最快的项目之一。据 GitHub 数据显示,该项目已有 24,800+ Fork、681 次提交、100+ 贡献者,支持 Claude Code、Codex、Cursor、Devin、Gemini CLI 等 12+ 个主流编程平台。

    Superpowers 的核心理念只有一句话:让 AI 先停下来想清楚,再动手。它不是新模型,不是 MCP 服务器,而是由 15+ 个可组合 Skills 组成的工程化开发方法论,自动注入到每次 AI 编程会话中,强制执行”需求澄清→计划→TDD→Code Review”的完整流程。据 Datawhale Easy-Vibe 教程评价,Superpowers 把 Claude Code 从”聪明的实习生”升级为”有纪律的开发团队”。

    为什么 AI 编程需要”方法论”?

    用过 Claude Code 的人都遇到过这个痛点:你说”帮我做个登录功能”,AI 立刻开始写代码,不问你用什么认证方式、要不要记住密码、密码重置走邮件还是短信。结果写出来的东西一半不是你要的,返工成本比从头来还高。

    据 Hacker News 社区讨论,资深工程师 d–b 评论道:”我个人不太喜欢 Superpowers。我的老板喜欢。我觉得用 Superpowers 时 Claude 犯的错反而更多。但也许是我的问题。”另一位用户 tao_oat 则表示:”brainstorming skill 确实很棒,它帮助把模糊的早期想法具体化。我特别喜欢它用子代理对抗性审查自己的 spec/plan,这确实捕获了几个我本会遗漏的问题。”

    这种分歧恰好说明了 Superpowers 的定位:它不是让 AI 更聪明,而是让 AI 更有纪律。对于已经有成熟工程管理经验的资深开发者,Superpowers 的流程可能显得多余;但对于需要长期维护的生产级项目、团队协作场景、或者缺少流程纪律的开发者,它几乎是必装的。

    15+ Skills 如何工作?

    Superpowers 包含 15+ 个可组合的 Skills,覆盖软件开发生命周期的每个阶段。其核心工作流分为 7 步:

    步骤 Skill 功能
    1 brainstorming 苏格拉底式需求澄清,通过提问厘清模糊需求
    2 using-git-worktrees 创建隔离工作区,验证测试基线
    3 writing-plans 将大任务拆成 2-5 分钟的小任务,含文件路径和验证步骤
    4 subagent-driven-development 每任务派独立子代理,两阶段审查(spec 合规→代码质量)
    5 test-driven-development 强制 RED-GREEN-REFACTOR TDD 循环
    6 requesting-code-review 按严重级别报告问题,Critical 问题阻断进度
    7 finishing-a-development-branch 验证测试、选择 merge/PR/保留/丢弃

    据 Reddit r/ClaudeCode 社区 2026 年 2 月的反馈:”用了 Superpowers 之后,每个阶段都得到了应有的关注。没有跳过步骤,没有跳过验证。输出结果终于和我规划的一致了。”而 2026 年 6 月的另一条反馈则指出:”它让我慢了很多,消耗了更多 token,比普通计划更快达到限额。”

    安装与使用建议

    Superpowers 的安装极其简单,一条命令即可完成:

    # Claude Code 官方市场

    /plugin install superpowers@claude-plugins-official

    # 或 Superpowers 自有市场

    /plugin marketplace add obra/superpowers-marketplace

    /plugin install superpowers@superpowers-marketplace

    其他平台也有对应的安装方式:Codex 用 /plugins 搜索安装,Cursor 用 /add-plugin superpowers,Gemini CLI 用 gemini extensions install,Devin 用 devin plugins install。完整安装指南见 GitHub 仓库

    最佳使用场景:

    • 生产级项目开发:需要长期维护的代码,流程纪律能减少技术债
    • 团队协作:brainstorming → plan → review 的文档链路天然适合交接
    • 非资深工程师:缺少流程纪律的人,Superpowers 相当于”强制 best practices”

    不建议使用的场景:

    • 快速原型/一次性脚本:流程开销大于收益
    • Token 预算敏感:全流程 token 消耗是裸 Claude Code 的 3-5 倍
    • 资深工程师的个人项目:你可能已经自然地做了 Superpowers 强制的事

    写在最后

    Superpowers 是目前 AI 编程领域最成熟的工程化方法论框架,277k Star 实至名归。它的价值不在于让 AI 更聪明,而在于让 AI 更有纪律。如果你在写需要长期维护的生产级代码,它几乎是必装的;如果你只是快速原型或简单脚本,它的流程开销反而会拖慢你。

    值得关注的是,Superpowers 与 ECC(242k Star,Agent Harness 操作系统)、Caveman(100k Star,Token 压缩 65%)三者互补而非互斥:Superpowers 提供方法论,ECC 提供功能平台,Caveman 提供效率优化。对于预算敏感的开发者,”Superpowers + Caveman”的组合可能是性价比最高的选择。

    关注 AI商业快讯,每天一篇 AI 热点深度解读。

    相关阅读: