用过 Claude Code、Codex 这类 AI 编程助手的人,大概都经历过同一个循环:听说某个「技能包」很神,装上;过两天又看到另一个,再装上。装到第二十个的时候你会发现问题来了——助手不但没变聪明,反而开始答非所问,因为它每次开口之前,都得先读完你塞给它的那一大堆说明书。
今天要评测的 mattpocock/skills 走的是完全相反的路线。它挂着 27.4 万个 Star(GitHub 上的收藏数,相当于「赞」),是这一轮 AI 技能热潮里体量最大的仓库之一;但你把它的技能全部下载下来会看到,所有技能文件加起来只有 259 KB——比一张手机照片还小。
它是谁,凭什么这么大
作者 Matt Pocock 是挺有名的 TypeScript 讲师,仓库第一句话写得很直白:「让我每天干真活的技能,不是 vibe coding(指不做设计、完全靠感觉让 AI 写)。」
它反对的东西也写在明面上。GSD、BMAD、Spec Kit 这一批「流程框架」,思路是替你接管整套开发流程;作者的说法是,接管的同时也拿走了你的控制权,一旦流程本身出 bug,你很难改回来。
所以它的设计只有三条:技能要小、要能改、要能互相拼。
这话几乎所有技能库都会说,区别在执行。我把它 clone(把仓库整个拷到本地)到沙箱里数了一遍,实际情况是这样:
| 项目 | 数字 | 说明 |
|---|---|---|
| Star | 274,405 | 2026-10-02 实测 |
| Fork | 23,051 | 别人复制走自己改的次数 |
| 仓库体积 | 688 KB | 不含版本历史 |
| 技能目录 | 259 KB | 全部技能文件 |
| 技能文件 | 37 个 | 其中 27 个随插件发布 |
| 未发布技能 | 10 个 | 6 个标「开发中」、4 个标「杂项」 |
| 协议 | MIT | 可商用、可改 |
关键设计:技能只按「谁来喊」分类
这是整个仓库最值得抄的一点。它不按功能分(写代码 / 调试 / 写文档),只按一个问题分:这个技能由谁触发?
- 用户调用:只有你亲手敲
/grill-me才启动,职责是「指挥」。
- 模型调用:你也能敲,同时助手觉得合适时会自己拿来用,职责是「装规矩」。
这两类不许乱串:一个用户调用的技能,可以去调模型调用的技能,但绝不允许去调另一个用户调用的技能。27 个技能里,16 个归用户调用,11 个归模型调用。
为什么要这么较真?因为 AI 助手最常见的翻车方式是「自说自话地开工」。用户调用的技能负责在开工前把话问清楚,模型调用的技能负责在开工时守住规矩——两类混在一起,就会出现助手自己指挥自己。
实测:它自己定的规矩,我一条条跑了一遍
它把仓库规范写进了项目说明文件,一共六条硬规矩。我把每一条都变成了可执行的检查脚本,在沙箱里跑:
| 它定的规矩 | 我的检查方式 | 结果 |
|---|---|---|
| 正式技能必须全部随插件发布 | 对比技能目录与插件清单 | 27 对 27,通过 |
| 未发布技能不得混进插件 | 检查「开发中/杂项」是否泄漏 | 通过 |
| 每个技能桶要有说明文件 | 逐个目录查找 | 5 个目录齐全,通过 |
| 正式技能要有文档页 | 逐个技能查找对应页面 | 27 个全有,通过 |
| 未发布技能不给文档页 | 反向检查文档目录 | 通过 |
| 全文禁用破折号 | 全文扫描该符号 | 手写内容 0 处,通过 |
六条全过。 这在同类仓库里不算常见——大多数技能库的说明文件和目录结构早就对不上了。
唯一一个「不完全干净」的地方,正好说明了它的严谨程度:那个破折号规矩的最后一条例外,是自动生成的更新日志。我扫出来的 68 处破折号全部落在这个自动生成的文件里,手写的技能正文、文档、说明文件里一处都没有。规矩是人定的,例外也是人写的,而它把例外限定在了机器产出的那一个文件。
最核心的东西只有一个:盘问引擎
整个仓库的心脏叫 grilling,直译是「盘问」。
它的做法是把你要做的一个计划拆成一棵决策树:每个决定下面,挂着依赖它的决定。然后是关键一步——它一次只问「现在就能问」的那一层,每个问题都编号,而且必须附上助手自己推荐的答案。你答完这一轮,树的边界往外推一圈,能问的问题就变多了,再问下一轮。
有一点很实用:找事实是助手的活,不是你的活。某个问题需要先去翻代码或查文件,它就派个子任务去查,而不是回头问你——因为那些问题「等查完再问」,剩下的照问不误。
我数了一下,27 个正式技能里,有 7 个都在用这个盘问引擎:做规格的、分派工单的、做代码评审的、做架构梳理的,全部指向同一个原语,没有一个重新发明提问方法。
也正因如此,最早的两个技能薄到离谱。grill-me 的正文只有一句话——「调用 grilling 技能」;grill-with-docs 的正文也只有一句话——「调用 grilling 和 domain-modeling 两个技能」。它们不是功能,是指针。 真正的方法只有一份,改一次,七处同时生效。
拉两个参照物
第一个是同类里体量最大的:affaan-m/ECC,同样 27 万 Star 上下,同样是「给工程师的技能库」,但走的是完全相反的路——什么都给你。68 个助手、293 个技能、94 个命令,仓库体积 80 MB。mattpocock 这个仓库是 688 KB。换算成「每 KB 换到多少 Star」,两者差了大约 121 倍。
| mattpocock/skills | affaan-m/ECC | |
|---|---|---|
| Star | 274,405 | 270,953 |
| 仓库体积 | 688 KB | 80 MB |
| 技能数 | 27 个(发布) | 293 个 |
| 思路 | 把判断权还给你 | 把所有能力塞给你 |
不是说 ECC 不好——它想做的是一整套「Agent 操作系统」,那是另一种野心,需要的体量也确实不一样。但两个仓库摆在一起,恰好是当下 AI 技能生态的两条分岔路。
第二个参照物更有意思,是它自己承认的一个洞。它的 tdd(测试驱动开发)技能文档里明写着:这个技能决定「在哪些接缝上写测试」,但没有任何东西决定「这个改动到底值不值得写测试」。作者把它记成了 issue #746,到现在还开着。一个 27 万 Star 的仓库,把自己管不了的那块标出来不遮不掩,这比任何功能列表都更能说明它的风格。
我的判断
如果你已经装了十来个技能、助手开始变迟钝,这个仓库值得看的是它的结构思路,而不是某一条具体规则。
- 适合谁:天天写代码、对「流程被框架接管」有戒心的工程师。它默认你懂测试驱动开发、懂领域建模,不负责给你补基础。
- 不适合谁:想要「一键装好就变强」的人。它装的当天几乎没变化,好处是你用久了会形成自己的改法。
- 一个提醒:它上次发版是 8 月 6 日,到现在 57 天,中间积压了 75 个提交、13 个待发布的小改动,版本号还停在 1.2.3。功能一直在动,插件包更新滞后。另外按它自己的说法,插件和手动拷贝两种装法只能二选一,都装你会得到每个技能两份。
同类工程技能库可以对照着看:addyosmani/agent-skills 深度评测(25 个技能、自带评测全绿的另一个路线),以及 Spec Kit 深度评测(同一批「流程框架」里长成插件市场的那一个)。
关注 AI商业快讯,每天一篇 AI 热点深度解读。