Spec Kit 深度评测:13.7 万 Star 一年后长成插件市场,169 个社区扩展实测八成已休眠

Spec Kit 深度评测:13.7 万 Star 一年后长成插件市场,169 个社区扩展实测八成已休眠

过去一年,凡是劝人「先写规格再让 AI 动手」的文章,几乎都会引用同一个仓库:GitHub 的 spec-kit。它 2025 年 8 月上线,13 个月涨到 13.7 万星,成了「规格驱动开发(SDD)」这件事的代名词。

我把它从 PyPI 装进沙盒,跑完初始化、把支持的 41 种 coding agent 逐个初始化了一遍,又把社区目录里的扩展抽了两组样本。结论有点分裂:那套写规格的流程还在、也确实能用,但仓库的重心已经换人了——它现在更像一个给 coding agent 用的插件市场,而这个市场里八成的货架已经休眠。

一年后,它已经不是当初那个模板仓库

2025 年 8 月 21 日的第一版命名很直白:把「Specify → Plan → Tasks → Implement」四步做成四段提示词模板,谁都能抄。一年后打开仓库,根目录躺着 src/、extensions/、presets/、bundles/、workflows/、integrations/ 六个子系统,specify --help 里除了 init,还有 extension、preset、bundle、workflow、artifact、event、self 七个命令组。

它现在对外讲的是三条独立入口,而不是一条流水线:

  • 规格驱动开发(核心):constitution → specify → plan → tasks → implement → converge,另加三个可选质量闸门 clarify / analyze / checklist;
  • Bug 修复(扩展):bug-assess → bug-fix → bug-test,产出落到 .specify/bugs//;
  • 想法评估(扩展):intake → research → define → shape → decide,最后给出 go / needs-clarification / kill。

其中 converge 是这一年里补上的一环:它拿现有代码跟 spec、plan、tasks 对一遍,把还没做完的活追加回 tasks.md,解决「实现到一半断了怎么办」。这个命令对应的正是社区呼声最高的一个 issue(可以编辑、迭代已有规格,而不是每次都新开一个分支),它在 2026 年 4 月被关掉。

规模上的变化更直接:这个仓库现在有 59,078 行 Python 源码,测试 117,530 行,而真正承载「方法论」的核心命令模板加起来只有 2,440 行 Markdown——代码和方法的比例是 24 : 1。同一批作者还在用不到 48 小时一版的节奏迭代,从 v0.0.1 到 v1.0.7 一共发了 221 个 release,平均 1.8 天一个版本。

实测:能用,但支撑它的是「结构」而不是「智能」

我把能跑的公开接口都跑了一遍。下面每一条都是沙盒里的真实输出,不是 README 复述。

实测项 结果
specify init(copilot 集成) 一次生成 30 个文件:10 个 SKILL.md + 5 个模板 + 6 个 bash 脚本 + 集成清单
41 种 agent 集成逐个初始化 40 个一次通过;generic 要求显式传 --commands-dir(报错信息给了完整示例,属设计如此)
直接装社区扩展(extension add <名字>) 6 次全部被拒:社区目录是 discovery-only,不可直接安装
贴归档地址装(add <名字> --from ) 5 个真实地址全部成功,每个 4 到 6 秒
30 个随机社区扩展的下载链接 28 个存活(93%),归档中位体积 14 KB
20 个随机社区扩展的仓库活跃度 只有 4 个在 30 天内有提交;15 个停在 1 到 6 个月前;中位最后一次提交距今 136 天
13 个技能文件的上下文占用 总共 157,976 字符,其中常驻上下文的只有开头元信息,3,900 字符,占 2.5%

第 6 行是这次实测最刺眼的一条。169 个挂名社区扩展听起来像生态,抽 20 个查仓库,结果是 20% 还在动、75% 处于 1 到 6 个月的浅休眠、5% 超过 180 天没动,星数中位数只有 6。下载链接活着(因为 GitHub 的归档地址不会烂),但代码从四月起就没再变过——「链接可用」跟「项目在维护」是两件事,这正是扩展市场最容易给人的错觉。

第 7 行则是这一年里一次很成功的自我修补。2025 年 12 月有人统计过:spec-kit 生成的是 slash command,每次开会话都会被完整塞进上下文,约 18.6k token,在 Cursor 默认窗口里能吃掉 93%。现在默认产出的是 SKILL.md(按需加载,只有描述常驻),我实测常驻部分只有 3,900 字符。同一个 issue 至今还开着,但问题事实上已经被架构调整解决了。

翻车点

扩展市场默认是「只能看不能装」。 这对安全是好事(官方目录是任意第三方代码,139 个扩展里 138 个声明自己会读写文件),但对体验是硬门槛:搜索能搜到 173 条结果,点安装会被明确拒绝,提示你「自己贴归档地址,或者自己维护一个可信目录」。想装,得先自己核一遍压缩包、再敲一遍 URL、再输一次 y。这套流程走通 5 次都很快,但它默认假设你会审代码。

装了 preset 或扩展之后,脚本会开始依赖你系统里的 PyYAML。 我复现了三组对照:纯净项目 + 没有 PyYAML 的 python3,setup-plan.sh 正常;同一个项目装上 preset,同一条命令直接报 Error: PyYAML is required to resolve preset template composition,plan.md 不生成,而且错误信息里没有告诉你怎么装。考虑到 uv tool install 会把依赖装进隔离环境、而脚本调用的是 PATH 上的 python3,这个坑大概率会落到真实用户头上。命令本身是 SKILL.md 指示 agent 去跑的,所以翻车现场往往是「agent 说它按流程走了,但文件没出来」。

四条流水线里两条是空货架。官方每个子系统都配了目录,但内容差得很远:

子系统 官方自带 社区贡献
扩展 extensions 4 169
预设 presets 2 36
agent 集成 integrations 41 0
工作流 workflows 1 2
工作流步骤 steps 0 0
整合包 bundles 0 2

扩展和预设是真生态,另外三个基本是刚立起来的架子。工作流的步骤类型目录是空的,而它的 shell 步骤在自己的发布文档里被标成「没有沙箱,可以读环境变量、改项目外的文件、外传数据」——社区要求给 shell 步骤加显式确认的 issue 到现在还开着。

谁该用,谁先别碰

把 spec-kit 和站内评过的同类放在一起,它的位置其实很清楚。

它对标不了一年前宣传的「让 AI 自己想清楚」:create-new-feature.sh 生成的 spec.md 里有 11 处占位符,脚本只保证结构和文件名一致,内容一个字都不是它写的。它也解决不了 mattpocock/skills 那种「拒绝流程绑架」的诉求——后者是 37 个各干一件事的小工具,前者要你先签一份宪法、再按五个阶段走。它甚至不打算解决 Get Shit Done 关心的上下文工程问题,它选择让技能按需加载来避税。

适合谁:要在团队里推行「需求先落地成文档」这件事的人。它的价值不在代码,而在把一套无聊但有用的规矩变成了可版本控制、可审查的文件——spec、plan、tasks 三个产物能进 code review,这比提示词存在谁的收藏夹里强得多。41 种 agent 集成也意味着换工具不用换流程。

不适合谁:一个人的小项目,或者已经有一套自己跑得顺的 agent 工作流的人。再往仓库里塞 169 个扩展,你得到的大概率是 20% 在维护、80% 停在四月的目录,以及一个每次安装都要手工审一遍的安全流程。

判断

一年前它是「四段提示词模板」,现在它是一个有 221 个版本、59,000 行代码、287 位贡献者的 agent 插件平台——顺便还带着那套写规格的流程。这个转向不算失败,因为核心流程确实还在按社区的抱怨逐条修补(上下文税、规格迭代、规格过期这三个最大的坑都动了手),但它的重心已经不在「规格」上了。

要用就只用核心的 10 个技能,扩展市场先别碰:等那 169 个货架里能有一半在三个月内更新过,再回来逛也不迟。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读

本文数据截至 2026 年 9 月 17 日:仓库 137,383 星、12,302 fork、MIT 协议;实测均在 Alpine Linux 沙盒中完成,specify-cli 版本 1.0.7。

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

给 AI 装了一堆「流程大师」技能包后,你有没有一种失控感:Spec-Kit 让你写规格、GSD 让你跑仪式、BMAD 让你建矩阵——活还没干,先被流程绑架了?

TypeScript 圈顶流 Matt Pocock 看不下去,9 月初把自己天天在用的 .agents 目录直接开源:mattpocock/skills 两天内刷到 24 万 Star,如今 254k★、全球 GitHub 排名第 15。它不教 Agent 走流程,而是塞给你 37 把「小工具」——你挑着用,改着用,用完还能扔。

这套被中文圈称为「反 GSD」的技能库,凭什么成为 2026 年 9 月最炸的开源项目?我把它 clone 下来逐个拆了一遍。

它是什么:一个拒绝「拥有你」的技能军械库

一句话定位:给 Claude Code / Codex 等编码 Agent 用的 37 个工程技能,全部来自 Matt Pocock 日常真实工作流——「real engineering, not vibe coding」。

作者是谁?Matt Pocock 是 TypeScript 教育头牌 Total TypeScript 的创始人,newsletter 订阅 6 万人,在编码圈属于「老师傅」级别。他把 Agent 时代自己踩过的坑,沉淀成一套可组合的斜杠命令。

核心理念在 README 第一段就开炮:

GSD、BMAD、Spec-Kit 这些方案试图「拥有」流程(owning the process),但代价是夺走你的控制权,让流程里的 bug 难以修复。我的 skills 设计成**小而精、易改写、可组合**,适配任何模型。

37 个技能分四桶,按「谁可以触发」双轨制管理:

桶 数量 定位 代表技能
engineering 18 代码日常 /grill-with-docs /tdd /code-review /diagnosing-bugs
productivity 8 通用工作流 /grill-me /teach /to-questionnaire
misc 4 环境工具 git-guardrails scaffold-exercises
in-progress 7 实验区 retro loop-me 写作类×3(未进正式版)

用户触发(/grill-me)负责编排,模型触发(grilling)负责纪律——前者只有你主动敲才运行,后者 Agent 觉得合适可自动调用,互不越权。

最出圈的三个技能,拆开看

1. `/grill-me` — 动手前先被「拷问」

这是 Matt 最受欢迎的技能。核心逻辑反直觉:写代码前,先让 AI 连环追问你,把需求里每个分支问到死。

「没人确切知道自己想要什么」(《程序员修炼之道》),AI 时代的最大失败模式是「你以为说清了,Agent 根本没懂」。grill-me 就是把这段对齐期强制拉长:答不上来的问题不许瞎编,必须停下来问人。第三方实测最常引用的效果是——它把「我以为我说了」变成「我真的说清了」。

注意:Matt 自己提醒,grill-me 别直接拿去 coding,代码场景用升级版 `/grill-with-docs`(拷问同时帮你建 CONTEXT.md 领域词典 + ADR,详见下文)。

2. `/tdd` — 收缩成「参考型」的纪律

v1.2.0 大更新里,tdd 被刻意收缩为参考型 skill:核心只留 Red → Green 循环 + 测试 seam(接缝),重构职责被移去 code-review——「实现阶段别同时背太多目标」。

最狠的规则叫「只在预先商定的 seam 上测试」:写测试前先列出要测的公共接口边界,跟用户确认。不许测私有方法、不许 mock 内部协作者、不许水平切分(先写完所有测试再写实现=在验证想象中的行为)。

3. `/wizard` — 让 AI 生成「引导人类」的脚本

很妙的一个:当有步骤只有人类能做(配 CI secrets、登第三方后台、跑一次性迁移),wizard 会生成一个交互式 bash 向导——每步打开对应 URL、精确说要点哪里复制什么、隐藏输入密钥、幂等写 .env、显示还剩几步。把「教 AI 做事」反转成「AI 教你点按钮」。

实测验证:文档工程做到什么程度

我把仓库 clone 下来跑了硬核检查:

  • 37/37 个 skill 全部带双 harness 元数据:每个 SKILL.md 旁都有 agents/openai.yaml(Codex 专用 UI 元数据),Claude Code 用 frontmatter、Codex 用 yaml,一套源码两处跑,无生成副本——v1.2.0 起刻意这么设计
  • 结构极干净:37 SKILL.md 共 2465 行正文 + 37 个 yaml + 零冗余。单个 skill 最短 7 行(grill-me 本体是薄壳,逻辑在 grilling 里),最长 140 行(teach)——没有一个是「大礼包式」的巨型 prompt
  • 严谨到变态的治理:.out-of-scope/ 目录公开拒绝了三类需求并写清理由——「不给 grilling 加提问数量上限」(#44 有人抱怨 Codex 问了 200 个问题,Matt 说:那是计划真没定清楚)、「不接小众 issue tracker」(#99 要求接 dex,3 个月 300 star 的工具不接)、「不加 verify 模式」。拒绝清单本身就是设计哲学
  • CONTEXT.md 领域词典:把「issue tracker / issue / decision ticket」等术语精确定义并标注已消歧义的历史(backlog 曾同时指工具和积压工作,现已废除)

版本节奏:v1.2.3(8/6)→ 9/4 还在提交(#1025 合并),changesets 规范化发版。contributors 4 人,mattpocock 本人 422 次提交占绝对主导——这是一个活人在维护的真实工作流,不是营销仓。

同类对比:GSD/BMAD/Spec-Kit 与它的路线之争

方案 路线 规模 哲学
GSD(73k★) 上下文工程系统 大而全 流程拥有你,按仪式走
BMAD 全流程矩阵 大而全 每步都要产出物
Spec-Kit spec 驱动 中 先规格后实现
mattpocock/skills(254k★) 个人工作流开源 37 个小工具 你拥有流程,随手改写

站内 8/30 评测过 GSD——那套「上下文工程系统」确实能把事做完,但 Matt 指出的代价真实存在:流程越重,出错越难排查,Agent 越像在表演流程而不是写代码。

他的替代路线是「薄壳 + 引用」:编排型技能(grill-me)只有 7 行,真正纪律放在模型可自动调用的 grilling/tdd 里,实现与重构职责分离。适合谁:有工程判断力、不想被框架绑架、愿意花 10 分钟改 skill 的中高级开发者。不适合谁:想要「一键全自动」的新手——这套东西要求你理解每个技能在干嘛,且 setup 时得选 issue tracker(GitHub/Linear/本地文件)。

安装两条路(二选一,别都装否则技能翻倍):Claude Code 官方 marketplace 直接 /plugin install mattpocock-skills(只读托管、自动更新);想自己改就 npx skills@latest add mattpocock/skills(文件落入仓库,随你 hack)。装完跑一次 /setup-matt-pocock-skills 选 tracker 和标签即用。

我的判断

值得一试,且建议只挑 3-5 个装(什么值得买 15 小时前的热帖也是这结论)。254k★ 的含金量不在「多」,而在 Matt 把 20 年工程直觉压缩进了可组合的小单元——这是目前中文圈最缺的「反过程派」样本。先试 /grill-me 感受拷问式对齐,再加 /tdd 和 /code-review 形成闭环,你会回来删掉那些大而全的流程包。

想先看同路线的对照组?本站拆过 GSD 的上下文工程系统(73k★ 真能把事做完),也实测过 darwin.skill 这种「教 Agent 自我进化」的思路。关注 AI商业快讯,每天一篇 AI 热点深度解读。

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

用过 Claude Code 写营销文案的人,多半撞上过同一堵墙:让 AI 写落地页,它交回来的是一堆「革命性解决方案」「一站式赋能」的空话套话。但换个角度想——如果 AI 的文案水平取决于喂给它的方法论,那为什么不直接喂它一套专业营销框架?

这就是 Corey Haines 的 marketingskills 想干的事:把一套完整的营销知识体系做成 50 个 Agent Skills,塞给 Claude Code / Codex / Cursor。这个仓库 2026 年 1 月创建,8 个月冲到 47k star,GitHub 上专为营销做的技能包里几乎找不到对手。作者不是工程师——是 CRO(转化率优化)领域的老兵、Swipe Files 通讯(2 万+ 订阅)的创办人。

但它也不是没有争议:README 顶部的赞助商墙、每月最高 1500 美元的「品类独占」赞助档位,让不少人质疑这到底是开源技能库还是引流工具。这篇实测把 50 个技能全拆开看了一遍。

它是什么:一个「营销部」装进 .agents/skills

marketingskills 不是单个技能,是 50 个技能的完整体系,覆盖从获客到留存的整条链路:文案(copywriting / copy-editing)、转化(cro / offers / pricing / paywalls / signup / onboarding)、SEO(seo-audit / ai-seo / programmatic-seo / schema / site-architecture)、增长(referrals / churn-prevention / attribution)、冷启动(cold-email / prospecting / lead-magnets)、内容(content-strategy / video / social / events / public-relations)……基本把一家 SaaS 公司市场部做的事全列了一遍。

规模数字很实在:50 个 SKILL.md 共 15,196 行,外加 165 个 references 参考文件、64 个零依赖 Node.js CLI 工具(接 Apollo、Clearbit、Mailchimp、Meta Ads 等平台)、95 份工具集成指南。整个仓库 5MB,装进 .agents/skills/ 就能用。

它有个很聪明的地基设计:第一个要跑的是 product-marketing 技能,它会引导你生成一份 .agents/product-marketing.md——把产品定位、目标人群、核心卖点、客户原话全部沉淀成一个档案。之后你调用任何一个营销技能,AI 都会先读这份档案再动笔。这解决了 agent 写营销最大的毛病:不问背景就开写,写出来全是正确的废话。

内部长什么样:拆开 4 个代表性技能

光看数量没说服力,抽几个看含金量。

seo-audit(499 行,最大号之一)——完整审计框架:可爬取性、索引、Core Web Vitals、移动端、HTTPS、URL 结构,到 On-Page 的标题/描述/H 标签/内链,再到国际 SEO 的 hreflang 与多语言站点地图。这不是「给我优化下 SEO」的敷衍提示词,是一份能照着执行的审计 SOP。

copywriting(457 行)——先查 product-marketing 档案,再按页面类型(首页/落地页/定价页/功能页)给不同框架;写完附 CTA 层级、价值主张、反对意见处理建议。它甚至知道何时该转场:要写邮件去 emails、写弹窗去 popups、改稿去 copy-editing、设计 offer 去 offers——技能之间会互相路由。

cold-email(159 行,最小号之一)——短而务实:像同行而非推销员地写、每句话都要挣得存在的位置、个性化必须连到对方的痛点(「删掉个性化开头邮件依然成立 = 个性化失败」)、一次只提一个低摩擦请求。附 4 级个性化体系参考文件。

marketing-psychology(455 行)——把第一性原理、JTBD、80/20、二阶思维、杠铃策略等 14 个思维模型 + 消费者心理机制编译成 agent 可调用的决策框架。

50/50 全部通过官方校验脚本(Agent Skills spec 的 frontmatter / name 匹配 / 描述 / 500 行红线),165 个引用文件零缺失。就工程严谨度而言,这是我见过最干净的大型技能库之一。

实测结论:方法论是真的,但先看清楚赞助商墙

先说反差点。README 开头就是赞助商名单(◆ Converly、◆ Ploy),GitHub Sponsors 每档 $1–199 到 $200,往上还有 $500/月的 Skill Partner、$1,500/月的 Category Partner——后者买的是某个技能品类里的「官方合作伙伴」独占位。

不过这个项目罕见地写了一整份治理文档(PARTNERS.md)说清楚边界:赞助买的是「带披露的展示位 + 集成指南」,永远买不到的是推荐——技能不会因为谁付钱就改推荐;合作伙伴的集成指南和普通工具的集成指南是同一套中立模板,只多一个披露头;作者自己的工具(Truelist)反而标注更严格,不能占「品类最佳」的位置。披露随文件走,fork 出去也保留。

这个设计是真诚的还是公关话术,我持保留态度——但它至少把「钱能买到什么」写成了白纸黑字,比绝大多数开源项目的隐性恰饭透明得多。

质量上,Reddit 4 个月前(20k star 时期)就有人评价:这不是那种「帮我写点文案」的泛泛提示词,是真正把营销框架塞了进去。8 个月从 20k 涨到 47k,靠的是内容而非炒作。

适合谁 / 不适合谁

适合:技术创始人 / 独立开发者——自己写 landing page、发 cold email、调定价页,但没预算请营销团队;SaaS 小团队想把 CRO/SEO 方法论固化进日常 agent 工作流;想研究「如何把专业领域知识做成技能包」的 agent 开发者(这个仓库的架构值得抄)。

不适合:想要「一键生成爆款文案」的人——它给的是框架和纪律,不是魔法;非技术背景、不碰 Claude Code / Cursor 的纯营销人——门槛在 agent 工具链这一侧;已经养着成熟营销团队的大公司——方法论对你们是常识。

局限也要说清:50 个技能全装会占不少上下文额度,建议按需挑 5–10 个核心的装(npx skills add coreyhaines31/marketingskills --skill cro copywriting 支持单装);技能给的是专业判断框架,最终转化效果仍取决于你的产品和流量质量——它不会替你变出用户。

值得放进观察清单

我的判断:marketingskills 是目前开源 agent 技能生态里「专业领域知识编译」做得最完整的一个。它验证了一件事——2026 年的 agent 技能竞争,正在从「提示词技巧」升级到「把某个职业的完整方法论编译成可执行框架」。50 个技能、165 份参考、带治理文档的赞助模式,是这套打法目前最完整的样本。

值得一试:装 5 个最贴近你痛点的技能(cro / copywriting / cold-email / seo-audit / product-marketing),跑一次让 AI 生成你的 product-marketing 档案,再让它写一版落地页——对比一下和你之前直接问 AI 的差别。

相关阅读:Agent 的「方法论纪律」不止营销——taste-skill 把审美纪律编译进前端、tanweai/pua 用压力话术防 AI 摆烂。想看「去 AI 味」的写作规则,可以翻 Humanizer-zh 实测。关注 AI商业快讯,每天一篇 AI 热点深度解读。

last30days 深度评测:61k Star 的「搜真人」技能实测——免配置只能搜到 HN,12+ 平台源全要钥匙

last30days 深度评测:61k Star 的「搜真人」技能实测——免配置只能搜到 HN,12+ 平台源全要钥匙

一、你搜「真实的人」,Google 搜不到

明天要见一个 AI 圈大佬,你 Google 一下他——大概率看到 2023 年的 LinkedIn 简介。但过去 30 天他到底在做什么?跳槽去了哪家、发过什么暴论、代码提交频率如何、Reddit 上大家怎么撕他——这些 Google 全都没有。

这正是 mvanhorn/last30days-skill 想解决的痛点:它不搜「编辑精选」的内容,而是并行搜 Reddit、X、YouTube、Hacker News、Polymarket 等十几个平台,按真实用户的点赞、转发、真金白银的赌注来排序,再由 AI 综合成一份「过去 30 天,真正关注这事的人在聊什么」的简报。61k Star、拿过 GitHub Trending 单日第一,2026 年 1 月才建仓、9 月还在更新——它把这层能力装进任何 AI Agent(Claude Code、Codex、Cursor、Gemini CLI 等 50+ 宿主),一句话触发。

二、本质:一个 240KB 的「跨平台近 30 天研究引擎」

先说清楚:这不是一个普通 skill,它是一套完整产品。skill 目录 141 个文件,光主引擎 last30days.py 就有 166KB,SKILL.md 指令契约 2307 行(240KB),CHANGELOG 128KB。

它的核心设计是「把模型当规划器,把脚本当执行器」:你输入 /last30days <主题>,托管它的 AI 先解析意图(普通查询/对比/发现模式),生成查询计划;Python 引擎并行抓各平台近 30 天数据,跑多信号综合评分——文本相关性、互动量、传播速度、来源权重、跨平台收敛、时间衰减,Polymarket 还看 24h 交易量和流动性;最后 AI 按严格输出契约(文件里叫 LAW 1-8)综合成简报,禁止发明标题、禁止堆 URL 列表、每条结论带来源。

维度 细节
默认免 key 源 Reddit(公共通道)、Hacker News、Polymarket、GitHub
需配置源 X/Twitter、YouTube、TikTok、Instagram、LinkedIn、Threads、Bluesky、Pinterest 等 12+
输出 带徽章+分簇证据的简报;自动存档到 ~/Documents/Last30Days/
模式 普通查询 / 对比(A vs B)/ 发现(–discover 找爆发话题)/ 找人 / 招聘信号
时间 完整跑 2-8 分钟,–quick 约 2-4 分钟

版本节奏夸张:v3.3 到 v3.11.1 五个月合并 175 个 PR,其中 122 个来自 52 位社区贡献者;9 月 1 日刚发 v3.23.0,9 月 2 日还有提交。小红书的源已经在 issue 里排队加入。

三、实测:免配置状态,和 README 说的差很远

我把它 clone 下来真跑了一遍(沙盒 Python 3.12.13,正满足它要求的 ≥3.12)。先说结论——「开箱即用」要打折扣。

跑 last30days.py doctor 健康检查,四个状态一目了然:

doctor 状态 源
✅ WORKING hackernews、github、library
❌ NOT WORKING reddit(公共通道实际超时)、web(keyless 降级不可达)、polymarket
○ COULD BE ON(需配 key/CLI) x、youtube(要装 yt-dlp)、tiktok、instagram、threads、bluesky、linkedin、digg、techmeme、arxiv、perplexity 等 12+
⚠️ 依赖下载 yt-dlp、gh、digg-pp-cli、techmeme-pp-cli、arxiv-pp-cli、brightdata 全缺失

实测跑 --quick 查「AI agent skills trend」:跑了 230 秒,只有 Hacker News 一个源出了 6 条结果(1257 分/918 评论);Reddit 超时 0 条、Web keyless 不可达 0 条。原始存档里 Source Coverage 白纸黑字:Reddit: 0 items (timeout)、Web: 0 items (unreachable)。

而 README 中文版明明白白写着「Reddit、Hacker News、Polymarket 和 GitHub 无需配置即可搜索」——实测只有 HN 稳定可用。Reddit 公共 RSS 通道时通时断,Polymarket 直连基本不通,web 必须自己配 Brave/Serper key。

想解锁完整能力,配置向导宣称「30 秒搞定」,实际是按平台逐个来:X 要么给 cookies、要么 ScrapeCreators key、要么 xAI/Grok CLI;YouTube 要装 yt-dlp;TikTok/Instagram 要 ScrapeCreators key(GitHub device flow 免费 1 万次调用)。每个围墙花园都有自己的钥匙——这正是它产品逻辑的一部分,但对只想「装上就用」的人,门槛比 README 暗示的高。

值得肯定的翻车防护:SKILL.md 开头就有一段「stale-clone 自查」防加载到旧版本文档,还内置 doctor --postmortem 复盘上次运行哪个源真断了。这种工程自律在 skill 生态里罕见。

四、同类对比:为什么不用 Google/Perplexity?

它的卖点不是「更强的搜索」,而是「AI 原生地桥接围墙花园」。用一张小表看清生态位:Google 搜不到 Reddit 评论、X、YouTube 字幕,也不按互动排序;ChatGPT 虽有 Reddit 合作却搜不了 X 和 TikTok;Gemini 有 YouTube 但没有 Reddit;而 last30days 的目标是全部覆盖、统一按真实互动排序——当然,X 和 YouTube 要配置后才通。

用它的典型姿势:开会前查人(/last30days Peter Steinberger 这种,能挖出「本月加入 OpenAI、23 个 PR 合并率 85%」);选题前找爆发话题(–discover 模式);产品决策前看社区真实口碑而非 SEO 文章;连预测市场 Polymarket 的赔率也当信号——「不是谁声音大,而是谁愿意下注」。

适合谁:内容创作者(找社区已验证的叙事方向)、产品经理/创业者(赛道冷热、口碑走向)、投资人(共识是否形成)。不适合谁:只想「快查一个事实」的人——2-8 分钟等不起,普通搜索更快;不愿折腾 API key 的轻度用户——装完不配置,体验只有 HN 一个源。

五、安装与判断

安装三选一:

# Claude Code(官方推荐,自动更新)
/plugin marketplace add mvanhorn/last30days-skill
/plugin install last30days

# Codex/Cursor/Copilot/Gemini CLI 等 50+ 宿主
npx skills add mvanhorn/last30days-skill -g

# 手动(开发者,软链随仓库实时同步)
git clone https://github.com/mvanhorn/last30days-skill.git
ln -s "$(pwd)/last30days-skill/skills/last30days" ~/.claude/skills/last30days

我的判断:值得装进观察清单,主力使用前先想清楚配置成本。如果你是重度 AI 使用者、研究/选题/尽调是日常,它解决的是真问题——训练数据永远落后社区几个月,而它能给你「此刻真实的人在讨论什么」。装完务必先跑一遍 doctor 看哪些源真的通了,别信 README 的「零配置」。61k Star 和 52 位贡献者证明了需求是真的,但「能不能发挥全力」取决于你愿意配几把钥匙。

相关阅读:LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本 | OpenMAIC 实测:27k Star 的 AI 多代理课堂

关注 AI商业快讯,每天一篇 AI 热点深度解读。

评测基于 2026-09-05 实测(last30days v3.23.0,沙盒 Python 3.12.13);星数 61,257 截至 2026-09-05。

taste-skill 深度评测:84k Star 的「反 AI 味」前端框架,把审美纪律编译进 Agent

taste-skill 深度评测:84k Star 的「反 AI 味」前端框架,把审美纪律编译进 Agent

用 Claude Code 或 Cursor 生成过落地页的人,几乎都撞过同一堵墙:AI 交出来的页面「能用但丑」——按钮全是圆角、卡片全带阴影、标题一律紫蓝渐变,设计师一眼就能认出是 AI 出的。这个问题的解法,过去只能靠人肉在 prompt 里反复强调「别用模板」,直到一个叫 taste-skill 的项目 6 个月冲到 84k star,把「审美纪律」直接编译进 Agent 的指令文件里。

Taste-Skill 给自己的定位是 The Anti-Slop Frontend Framework for AI Agents:它把字体、间距、配色、动效、组件状态的「好品味」写成一组可移植的 SKILL.md,AI 加载后就像多了一个「设计偏见包」。截至 2026-09-04,仓库 Leonxlnx/taste-skill 已获 84,044 star、5,745 fork,MIT 协议,作者是慕尼黑的独立开发者 Leon Lin。

它是什么:13 个技能组成的「反模板武器库」

taste-skill 不是一个单一技能,而是一套 13 个 SKILL.md 的组合(默认主技能 design-taste-frontend 就有 1206 行)。按用途分成两类:

实现类(输出代码)

Skill 定位
taste-skill(v2 实验版) 默认主技能。先读需求推断设计语言,再调三个旋钮(DESIGN_VARIANCE 布局实验度 / MOTION_INTENSITY 动效强度 / VISUAL_DENSITY 信息密度)
taste-skill-v1 原版 v1 的冻结存档,行为与 v2 有差异,可回退
gpt-taste 更激进的 GPT/Codex 变体:Python 模拟随机数强制布局多样性 + GSAP 滚动动效
image-to-code 图片优先流水线:先出参考图 → 分析 → 再实现代码
redesign-skill 改造现有项目:先审计 UI,再动手改
soft / minimalist / brutalist 三套视觉方向预设:昂贵柔和风 / 极简编辑风(Notion/Linear)/ 粗野机械风
stitch-skill 兼容 Google Stitch 语义设计规则
output-skill 治「AI 偷懒截断输出」:禁 placeholder、禁 // ...

生图类(只出图,不出代码):imagegen-frontend-web(网站构图)、imagegen-frontend-mobile(移动端界面)、brandkit(品牌套件),配合 ChatGPT Images / Codex 出参考帧,再喂给编码 Agent。

核心机制:把「AI 味」拆成一张禁令清单

taste-skill 最值钱的部分,是把「AI 生成的页面为什么一眼假」拆成了可执行、可检查的硬规则(v2 的 Section 9「AI Tells」),而不是空泛的「请设计得好看些」。几个代表性规则:

  • em-dash(——)全面禁令:整页不允许出现一个破折号,标题、正文、按钮、alt 文本全禁。作者实测这是 AI 最常犯的文体指纹,v2 里写「如果输出里出现一个 —,Pre-Flight 检查直接失败重写」。
  • 「三张等宽特性卡」是罪:AI 默认的三列等宽 feature 卡片被点名禁止,改用 2 列之字形、不对称网格、横向滚动等替代布局。
  • 中心对称 Hero 是罪:当 DESIGN_VARIANCE > 4 时,居中大标题 + 居中 CTA 的 Hero 是默认输出,属于「无设计」信号,强制改分屏/左文右图/不对称留白。
  • 禁止 AI 紫蓝渐变、禁止纯黑 #000000、禁止 Inter + slate-900 默认组合:这些是 LLM 的训练数据里最常见的「看起来像设计」的偷懒答案。
  • 假数据禁令:不写 “John Doe”、不用 “Acme” 这种假公司名、不写 “99.99%” 这种假完美数字——AI 默认生成的这些内容会让页面「假味」扑面而来。
  • div 拼出来的假产品截图是头号 AI 指纹:用 styled div 模拟的任务列表、终端、仪表盘被点名是 LLM 设计 Tell 第一名,要求用真实截图或真实组件。

这套规则的执行方式也很有工程感:v2 里定义了 §0 Brief Inference(动手前先输出一行「Design Read」声明你读懂了什么需求)、§2 设计系统地图(像 Fluent/Carbon/shadcn 这种有官方包的,必须用官方包,不许手搓)、§14 Final Pre-Flight Check(发布前跑一份 50+ 项的硬检查清单,任何一项不过就不许交付)。

实测:装得上、规则真能查、但也有打脸处

我在 Alpine Linux 沙盒里做了几项可复现的验证:

安装链路:npx skills add https://github.com/Leonxlnx/taste-skill --skill "design-taste-frontend" --yes 实测成功,CLI 正确发现仓库里 13 个技能、识别为 universal 格式(声称覆盖 Amp、Antigravity、Cline、Codex 等 17 个平台),安装到 ./.agents/skills/ 后与仓库源文件逐字节一致。Claude Code 生态则通过 .claude-plugin/ 的 marketplace 清单接入。

规则一致性审计:我对全部 13 个 SKILL.md 做了 frontmatter 校验(name + description 字段齐全 = 可被 npx skills 正常发现安装),13/13 通过,无缺失。但有意思的是「自己打脸」的地方:v2 声称「em-dash 全禁」,它自己的 SKILL.md 里确实 5 处 em-dash 全是规则说明本身(禁用它就得写出它),这是严谨不是违规;但 v1 的 SKILL.md 里有一处真违规——all interactive elements—no linear easing 这个句子自己在用 em-dash 解释规则。README 和 CHANGELOG 则干净(0 处)。

翻车点 1:v2 还是「实验版」,且没有 release。仓库 2026-02-19 创建至今 0 个正式 release,tag 都没有。v2 重写在 CHANGELOG 里明确写着 “This is a pre-release”、”Actively iterating toward v2.0.0 stable”——装默认版等于在追一个还在快速变动的文档,行为可能随版本漂移。旧版用户只能靠 design-taste-frontend-v1 这个名字钉住行为。

翻车点 2:规则再硬,Agent 不遵守就白搭。GitHub issue #106 是 2026-09-03(昨天)刚开的,标题就是 “How to force agent 100% obey the skill?”——这是 SKILL.md 模式的通病:它是「指令」不是「代码」,长上下文里 Agent 可能淡化它。官方自己也承认这点,只给了「v2 用 Brief Inference + Pre-Flight 双保险」这种软约束,没有技术性强制手段。

翻车点 3:文档里埋了商业赞助。README 顶部一整块是 Kimi(月之暗面)的推广横幅,正文有 “Get a Kimi API key – Taste-skill users get 10% bonus API credits”,赞助商墙列了 interfaces.dev、React Bits、animations.dev、IMG.LY 等一堆。这在开源项目里不违规(README 本身也声明了这些是赞助),但说明 84k star 的流量已经被商业化变现,README 约 41% 的 commit 是 sponsor/README 调整——评估项目时要清楚 star 里有营销成分。

同类对比:taste-skill vs Impeccable vs 官方 frontend-design

反 AI 味前端这个赛道,taste-skill 不是唯一玩家,中文圈也常把它和另一个 49.9k star 的项目 Impeccable(pbakaus)对比:

维度 taste-skill Impeccable Anthropic 官方 frontend-design
理念 预设风格库 + 旋钮调节 23 个斜杠命令按需调用 官方基线
用法 装一次,生成时自动生效 生成后敲 /audit /polish 渐进打磨 基础规则
风格 多套视觉语言(Apple/Linear/Awwwards…) 7 大模块知识库,不预设风格 通用
star 84k 49.9k –
协议 MIT Apache 2.0 –

两者可叠加:taste-skill 管「生成阶段别出模板」,Impeccable 管「生成后帮我挑毛病」,且都溯源到 Anthropic 的官方 frontend-design skill。适合谁:vibe coding 重度用户、用 Cursor/Claude Code 做落地页/作品集/官网的人、被 AI 模板页面反复折磨的独立开发者。不适合谁:做数据密集后台/复杂表单的人——v2 的 Out of Scope 明确写了 dashboard、数据表格、多步表单不在服务范围;以及期待「装了就 100% 有效」的人,它是概率性约束不是硬保证。

判断

84k star、6 个月爆发、v2 重写把「反 AI 味」做成了 1206 行可执行规则——taste-skill 是 2026 年 Agent 技能生态里工程完成度最高的一档,值得放进必装清单。但别神化它:它是实验版、无 release、规则靠 Agent 自觉遵守(issue #106 还挂着),而且 README 商业化气息明显。我的建议是装上、把它的 Pre-Flight 检查清单当参考、但别把「装了就高级」当信仰——AI 生成页面的终极解法,可能还是要靠你亲自看一眼。

如果你也被「AI 味」困扰,可以配合 Humanizer-zh 实测:24 条规则去除 AI 痕迹 去文本的 AI 味,配 Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token 治代码输出的啰嗦。关注 AI商业快讯,每天一篇 AI 热点深度解读。

AI 一摆烂就上 PUA?19.6k Star 的 tanweai/pua 实测:压力话术 + 方法论引擎,真能让 Agent「不敢放弃」吗

AI 一摆烂就上 PUA?19.6k Star 的 tanweai/pua 实测:压力话术 + 方法论引擎,真能让 Agent「不敢放弃」吗

你遇到过吗:AI 把同一个命令跑三遍然后说 “I cannot solve this”;报错归因 “可能是环境问题”;修完表面 bug 就停,等你指示下一步。这套「暴力重试 → 甩锅 → 磨洋工」的偷懒模式,几乎每个重度使用 AI 编程的人都被气过。今天实测的项目把大厂绩效文化直接做成了 Agent 技能——用 P8 定级、3.25 考核、毕业警告去驱动模型穷尽所有方案。本文基于真实仓库、测试脚本与两轮本地实测,拆解这套「AI 版绩效管理」到底有效还是噱头。

一、它是什么:把「大厂 PUA 话术」做成 Agent 行为协议

tanweai/pua 由探微安全实验室出品,GitHub 19,569 star、1,196 fork,2026-03-08 创建,6 个月内迭代到 v3.5.0(plugin.json 版本号仍停留在 3.5.0,但 main 分支已合入 v3.3+ 多项新特性),最新提交 2026-08-29。MIT 协议(README 标注,仓库内无 LICENSE 文件),定位是覆盖 11 个平台的 AI Coding Agent 技能插件:Claude Code、OpenAI Codex CLI、Cursor、Kiro、CodeBuddy、OpenClaw、Google Antigravity、OpenCode、VSCode Copilot、Trae、pi coding agent。

它不是单纯骂模型。核心是「三重能力」:PUA 话术让 AI 不敢放弃、调试方法论让 AI 有能力不放弃、能动性鞭策让 AI 主动出击。仓库描述一句话点题:”Your AI has been placed on a PIP. 30 days to show improvement.”

工程体量相当可观:main 分支 221 个文件、7.9MB。核心 skill(skills/pua/SKILL.md)422 行,配套 28 个 references 文档(合计约 160KB),外加 10 个 flavor 子 skill(pua-en / pua-ja / pua-loop / pro / shot / yes / mama / ding / p7 / p9 / p10)、7 个 sub-agent 定义、10+ 个 hooks 脚本、11 个 slash commands 与 14 个 eval 测试脚本。

二、工作原理:三级机制如何让 Agent「不敢摆烂」

加载后 AI 被锚定一个身份——「被寄予厚望的 P8 工程师」,并注入三条红线:闭环意识(没跑验证就别说完成)、事实驱动(未验证的归因是甩锅)、穷尽一切(没走完方法论禁止说无法解决)。三条红线之上是五步调试方法论:闻味道(列全部尝试找共同失败模式)→ 揪头发(读源码、搜报错、反转假设)→ 照镜子(是否在重复?)→ 执行(本质不同的新方案)→ 复盘(主动检查关联问题)。

压力按失败次数四级升级:第 2 次 L1 温和失望(强制切换本质不同方案)→ 第 3 次 L2 灵魂拷问(WebSearch + 读源码)→ 第 4 次 L3 绩效审视(强制 7 项检查清单)→ 第 5 次+ L4 毕业警告(拼命模式)。旁白会嵌入对应大厂味道的黑话:阿里味讲「底层逻辑、抓手、闭环、3.25」,华为味讲「力出一孔、蓝军自攻击」,Musk 味讲「extremely hardcore, ship or die」。

v3 的关键升级是「方法论智能路由」:Debug 任务自动切华为 RCA 根因分析,构建新功能切 Musk 的质疑→删除→简化→加速→自动化五步纪律,调研切百度「搜索先于一切」。连续失败时按失败模式换方法论——原地打转走 Musk→拼多多→华为链,没搜就猜走 百度→Amazon→字节 链。每次切换输出 [方法论切换 🔄] 标注。

Claude Code 专属的 hook 系统是它区别于普通 prompt skill 的护城河:SessionStart 注入行为协议、PostToolUse 检测 Bash 连续失败自动升级压力、UserPromptSubmit 拦截用户挫败短语(”又错了””try harder”)在模型响应前注入 PUA 上下文、PreCompact 保存压力等级跨压缩恢复。这意味着它在模型「说出借口之前」就从系统层介入,而非等模型犯错后由用户手动触发。

三、功能拆解:不只有「骂」,还有一整套治理体系

14 种大厂味道:阿里、字节、华为、腾讯、百度、拼多多、美团、京东、小米、Netflix、Musk、Jobs、Amazon、Microsoft(v3.3 还加了「钉内/钉外」味,源自《置身钉内》离职长文)。每种味道 = 旁白风格 + 独立方法论文档(methodology-*.md),微软味甚至有完整的 Connects / Impact Descriptor / PIP clock 绩效叙事。

多身份模式:/pua:p7 方案驱动骨干、/pua:p9 Tech Lead(管理 Agent 团队)、/pua:p10 CTO 战略、/pua:yes ENFP 夸夸模式(规则不变旁白反转)、/pua:mama 中国式妈妈唠叨、/pua:shot 449 行零依赖单文件浓缩版(适合 sub-agent 注入)、/pua:pua-loop 自动迭代循环。

Harness 防作弊治理(四权分离):行动权 / 自我评价权 / 评分权 / 环境修改权分开。Agent 不能修改评分器后宣布通过;改 tests/evals/CI 必须停下等 human/verifier gate;对 hidden tests、benchmark answers 由 Integrity Guard 直接 deny。四代理拓扑:pua-policy-guardian → pua-action-executor → pua-self-reviewer → pua-verifier 串联,各代理只拥有对应权力。这套设计明显是为 eval 场景(如 SWE-bench)防「看起来完成伪装成真实完成」而写。

Agent 生命周期管理(v3.2+):team-status 列出在场 agent 阵容(PID/TTL/年龄)、reap-orphans 回收无心跳的孤儿 agent、teardown-all 级联释放,还配套 hooks/sanitize-session.sh 本地脱敏工具(三层:格式黑名单 → key=value 识别 → Shannon 熵兜底)。

触发机制分层:description 自动匹配(含中英双语触发词:换个方法/别摆烂/为什么还不行/证据呢/try harder/stop giving up)、slash command 手动触发(11 个子命令)、hook 系统级注入、flavor 味道切换(/pua:flavor)。从代码看,同一套 SKILL.md 以不同 frontmatter description 分发到各平台,Codex 版还专门精简了 description 以兼容其长度限制。

四、实测数据与动手验证

官方实测(README 披露,Claude Opus 4.6,18 组对照):通过率两组均为 100%,修复点数 +36%、验证次数 +65%、工具调用 +50%、隐藏问题发现率 +50%。9 个真实 bug 场景 6 个有详细步骤数据,典型如 SQLite 数据库锁 6 步→9 步(+50%)、循环导入 12 步→16 步(+33%);被动配置审查场景从发现 4/6 问题(漏 Redis 配置错误与 CORS 通配符隐患)提升到 6/6。成本代价也如实标注:多数场景耗时增加 20%-70%(CSV 编码陷阱 57s→71s)。

我在沙盒实测了仓库自带的 14 个 eval 测试脚本(无需 claude CLI 即可跑的部分):

  • evals/test-no-telemetry.sh:16/16 通过——对全仓做反向断言,扫描采集域名/endpoint/出站请求/已删文件,任何数据采集回归都会让测试失败
  • evals/test-integrity-guard.sh:11/11 通过——hidden verifier 读操作被 deny、普通源码写操作放行、memory/CLAUDE.md 写入仅 advisory
  • evals/test-yaml-frontmatter.sh 与 test-platform-compat.sh:通过(多平台 frontmatter 与兼容性校验)
  • evals/test-release-consistency.sh:失败——仓库自检发现 v3.5.0 后多处不一致:plugin.json 与 marketplace.json 版本未同步到最新、SessionStart 协议缺少 Harness Integrity governance 注入、pua skill description 未显式排除「普通首轮请求」等。这是真实存在且未修复的发布纪律问题(截至 2026-09-03 main 分支)
  • 触发类/行为类测试(run-trigger-test、test-behavior)需要 claude CLI,沙盒无法运行——触发词覆盖我做了静态验证:description 中「换个方法/再试试/为什么还不行/try harder/stop giving up/别摆烂」等中英触发词均存在

安装实测(Linux/macOS 类):Codex CLI 一键装 curl 拉 .codex/INSTALL.md 后让 Codex 执行,或手动 mkdir -p ~/.codex/skills/pua && curl -o SKILL.md;Claude Code 走 claude plugin marketplace add tanweai/pua && claude plugin install pua@pua-skills。核心 SKILL.md 同时兼容 OpenClaw/Codex/Antigravity/OpenCode(Agent Skills 开放标准,零修改通用)。我另将 codex 版装入沙盒技能目录做触发验证,description 匹配机制与 hooks 之外的纯文本协议部分工作正常。

五、适合谁、怎么选,以及必须知道的争议

最值得警惕的是隐私历史:README 明示「不收集任何数据」,但 git 历史显示全部五条数据采集通道(session 语料上传、评分反馈上报、静默心跳 telemetry、PUA 排行榜、pua-api 平台含手机号注册与支付流程)直到 2026-08-29(两天前)才被整体移除——提交信息 “Remove all data collection: 5 upload channels, client and server”,且至今未打新 release(plugin.json 仍标 3.5.0)。安全 issue #100 曾报告上传接口把 GitHub 用户名、微信 ID 发往硬编码邮箱且未在 UI 披露;issue #134 的安全审计报告(2026-04)发现私钥脱敏失效(跨行正则因单行化永不匹配,导致 PEM 私钥明文上传到 R2)、存储键目录穿越等 5 个漏洞——作者 8-29 在 issue 里确认全部随代码删除而修复,test-no-telemetry.sh 我实测 16/16 通过也验证了当前 main 分支确实干净。但如果你用的是 8-29 之前克隆的旧版,务必更新;历史包袱是真实的。

产品层面:核心机制(压力升级 + 方法论路由 + hook 系统注入)设计成熟度在同类 skill 中罕见,工程完整度很高——28 个 references、7 个 sub-agent、14 个 eval,几乎是「开源 skill 界最重的项目」。问题同样明显:旁白输出可能让简单任务变得吵闹(虽然有密度控制规范);阿里味等话术与真实绩效黑话高度绑定,非国内大厂文化背景用户会感到困惑;v3 hook 系统仅 Claude Code 可用,其他平台只剩「建议性」的纯文本协议,效果打折。此外 19.6k star 与 6 个月 11 个 release 的热度曲线本身也是这个赛道关注度的注脚——「让 AI 别摆烂」是 2026 年 Agent 大规模落地后最真实的痛点之一。

适合谁:重度 Claude Code 用户、跑 eval/评测需要防作弊约束的开发者、被「AI 原地打转」折磨到想摔键盘的人。不适合谁:对话型轻度用户(会嫌吵)、封闭内网环境(hooks 需要联网拉取 marketplace 的完整安装路径)、对职场黑话无感或反感的用户——可以先试 /pua:yes 夸夸模式或 /pua:shot 轻量版。安装前记得检查版本是否晚于 8-29 的清理提交。

一句话总结:PUA 把「绩效恐惧」做成了 Agent 的燃料,方向邪门但工程认真——它治的是 AI 的「放弃病」,代价是你要接受一个满嘴大厂黑话的工作搭子。理性用法是当调试方法论与验收纪律用,而不是真的指望靠骂提升模型能力。本文基于 2026-09-03 的 main 分支实测,与官方无利益关系。

相关阅读:Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token · 实测 9 款 token 节省工具

K-Dense-AI Scientific Agent Skills 实测:41.5k Star 的「AI 科学家」技能库,165 个技能覆盖 10+ 学科

K-Dense-AI Scientific Agent Skills 实测:41.5k Star 的「AI 科学家」技能库,165 个技能覆盖 10+ 学科

为什么值得关注

当 AI Agent 从「聊天机器人」进化到「自主执行复杂任务」,一个关键瓶颈浮出水面:通用 Agent 缺乏领域知识。你可以让 GPT-4 写代码,但让它跑一个完整的单细胞 RNA-seq 分析流程?它会卡在 Scanpy 的 API 细节和数据库查询的参数格式上。

K-Dense-AI 的 Scientific Agent Skills 解决的正是这个问题——它不是又一个 AI 聊天工具,而是一个标准化的技能包,让你的 AI Agent 直接变成「AI 科学家」。据 GitHub 显示,这个仓库已有 41.5k Star、3.8k Fork、703 Commits,被 190,000+ 科学家使用。

这不仅仅是学术圈的事。当你把「科学技能」标准化后,它实际上在定义一个新的 Agent 能力标准——任何支持 Agent Skills 开放标准的平台(Cursor、Claude Code、Codex、Gemini CLI、Google Antigravity)都能直接加载这套技能。

核心能力拆解

163 个技能覆盖 10+ 学科

从仓库结构看,技能被分为几大类:

  • 生物信息学与基因组学(27 个技能):Scanpy、BioPython、pysam、PyDESeq2、scVelo(RNA velocity)、Cellxgene Census 等
  • 化学信息学与药物发现(10 个技能):RDKit、DiffDock、DeepChem、OpenMM(分子动力学)、PyTDC 等
  • 临床研究与证据工作流(8 个技能):PK/PD 建模、DepMap 癌症依赖图谱、临床试验分析等
  • 机器学习与 AI(14 个核心技能):PyTorch Lightning、scikit-learn、PyMC、TimesFM(Google 零样本预测模型)等
  • 数据分析与可视化(22 个技能):Matplotlib、Seann、GeoPandas、NetworkX 等
  • 100+ 科学数据库访问:PubChem、ChEMBL、UniProt、COSMIC、ClinicalTrials.gov 等 78+ 数据库

每个技能都包含:完整的 SKILL.md 文档、代码示例、使用场景、最佳实践、集成指南,以及配套测试套件。

实际工作流示例

仓库文档中提供了几个典型工作流:

药物发现流水线:从 ChEMBL 查询 EGFR 抑制剂(IC50 < 50nM),用 RDKit 分析构效关系,用 DiffDock 做虚拟筛选,搜索 PubMed 查耐药机制,最终生成综合报告。这原本需要一个博士生花几周时间,现在一个 prompt 搞定。

单细胞 RNA-seq 分析:加载 10X 数据集,执行 QC 和双细胞去除,整合 Cellxgene Census 数据,用 NCBI Gene 标记物识别细胞类型,跑差异表达分析,推断基因调控网络——整个流程在一个对话中完成。

多组学生物标志物发现:整合 RNA-seq、蛋白质组和代谢组数据,跨组学层关联,构建预测模型,最后在 ClinicalTrials.gov 搜索相关临床试验。

安装与兼容性

安装极其简单:

npx skills add K-Dense-AI/scientific-agent-skills

支持的平台包括 Cursor、Claude Code、Codex、Gemini CLI、Google Antigravity。也可以用 GitHub CLI:

gh skill install K-Dense-AI/scientific-agent-skills

甚至支持版本锁定(--pin v2.65.0)和按目标 Agent 指定安装(--agent cursor)。

K-Dense 生态

Scientific Agent Skills 只是 K-Dense 开源生态的一部分。他们还提供了:

  • K-Dense BYOK:本地运行的 AI 共科学家,自带 API Key,支持 40+ 模型
  • Pantheon:80 个 AI 角色同时回答一个问题,每个角色有自己的视角和引用来源
  • Claude Scientific Writer:科研写作工具,支持实时文献查找和引用验证

为什么这很重要

Agent Skills 标准化的信号

K-Dense 的成功证明了一件事:Agent 能力的标准化正在发生。不再是每个 AI 工具各自为政,而是通过 Agent Skills 这个开放标准,让技能可以在不同平台间复用。

这对开发者意味着:你写一个技能,它能在 Cursor、Claude Code、Codex 等多个平台运行。对用户意味着:安装一次,到处使用。

科研效率的质变

用户评价中有个数字很有意思:一个癌症研究者说,原本需要一周到两周完成的分析工作流,让 K-Dense 跑了七小时就高质量输出了。这不是「省 30% 时间」的渐进式改进,而是数量级的效率提升。

安全与信任问题

仓库的安全报告(Cisco AI Defense Skill Scanner 扫描)和明确的安全免责声明值得关注。Skills 可以执行代码、安装包、发起网络请求——这是一个供应链安全问题。K-Dense 的做法是:每周增量扫描,全量至少每 30 天一次,结果公开发布。这种透明度在 AI 工具生态中是少见的。

对不同角色的建议

对科研人员:如果你的日常工作涉及基因组学、药物发现、临床数据分析中的任何一个,这套技能值得立即尝试。它不是玩具,是真正能加速研究流程的工具。

对 AI 开发者:关注 Agent Skills 标准本身。如果你在构建 AI Agent 平台,支持这个标准意味着你的用户可以直接受益于 K-Dense 的 163 个技能。如果你在构建垂直领域 Agent,K-Dense 的技能结构是很好的参考。

对投资者:K-Dense 获得 Google AI Futures Fund 支持,产品线从免费开源到企业级部署完整覆盖。Scientific Agent Skills 的 41.5k Star 不只是数字,它代表的是科研领域对 AI Agent 工具的真实需求。

小结

K-Dense-AI 的 Scientific Agent Skills 代表了 AI Agent 能力标准化的一个里程碑。它不是又一个「AI 写论文」工具,而是把领域专业知识打包成可复用的技能,让任何 AI Agent 都能执行复杂的科学工作流。

190,000+ 科学家的选择、41.5k GitHub Star、Google AI Futures Fund 的背书——这些数字背后是一个清晰的趋势:AI Agent 的下一个战场,不是谁的模型更大,而是谁的技能库更完整。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

—

相关阅读:

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

AI Agent Skill 生态爆发式增长,GitHub 上已有 1497+ 个官方/社区 skill。本文基于 awesome-agent-skills(30.6k★)、awesome-claude-code(52.7k★)和 awesome-claude-skills(72.9k★)三大索引,结合 GitHub 星标和活跃度,精选出 2026 年 8 月最热门的 15 个 AI Skill。

一、生态全景:1497+ Skill 的三大来源

截至 2026 年 8 月,AI Agent Skill 生态已形成三大索引体系:

索引 星标 Skill 数 特点
ComposioHQ/awesome-claude-skills 72.9k★ 1497+ 官方团队(Anthropic/Google/Stripe/Cloudflare)+ 社区精选
hesreallyhim/awesome-claude-code 52.7k★ 精选 100+ 手工策展,质量最高,每条有详细评测
VoltAgent/awesome-agent-skills 30.6k★ 1497+ 跨平台兼容(Claude Code/Cursor/Gemini CLI/Copilot)

覆盖领域:办公文档 / 前端设计 / 营销 / 科研 / 安全 / DevOps / 游戏开发 / 视频制作。

二、Tier 1:必收的 5 个王炸 Skill

1. ECC(Enhanced Claude Code)— Agent 性能优化系统

星标:241,448 ★

  • 核心能力:Skills 性能优化 + Instincts 本能系统 + Memory 记忆持久化 + Session 管理
  • 为什么收:全网最高星标的 AI Agent skill,不是单一功能,而是一套完整的 Agent 增强框架。安装后 Claude Code 的响应速度、代码质量、上下文管理全面提升
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code

2. Graphify — 代码库知识图谱

星标:108,679 ★

  • 核心能力:将任意代码库(含文档、SQL schema、配置、PDF)转化为可查询的知识图谱
  • 为什么收:解决大型项目上下文丢失的核心痛点。不再需要反复粘贴文件,Agent 自动理解项目全貌
  • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / Cursor / Windsurf

3. Anthropic Office 四件套(docx/xlsx/pptx/pdf)

官方出品,17 个 skill

  • 核心能力:Word 文档(跟踪修订+评论)/ Excel(公式+图表+金融模型规范)/ PowerPoint(模板填充+设计指导)/ PDF(提取+合并+表单+OCR)
  • 为什么收:Anthropic 官方维护,生产级质量,金融模型规范含大量避坑指南(pptxgenjs 12 个陷阱)。覆盖办公文档全流程
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code / Claude.ai

4. andrej-karpathy-skills — Karpathy 行为准则

星标:204,375 ★

  • 核心能力:4 条从 Andrej Karpathy 公开笔记提炼的 LLM 编码行为准则,注入 CLAUDE.md
  • 为什么收:安装成本为零(一个文件),效果立竿见影。Karpathy 对 LLM 编码陷阱的理解是业界顶级
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / 任何支持 CLAUDE.md 的工具

5. caveman — 超压缩输出模式

星标:99,612 ★

  • 核心能力:砍掉 65% 输出 token,保留全部技术实质(代码/报错/API 名/数字原样)
  • 为什么收:在 token 计费时代,每次对话省 65% 成本。支持 lite/full/ultra 三级强度,可随时切换
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code

三、Tier 2:精选的 5 个领域王者

Skill 星标 定位 亮点
academic-research-skills 43,162★ 学术研究全流程 研究→写作→审阅→修改→格式化,5 阶段 pipeline
marketing-skills 45,076★ 营销全套 CRO / 文案 / SEO / 数据分析,Claude Code 生态最全营销 skill
scientific-agent-skills 34,004★ AI 科学家 将任何 Agent 变成 AI 科研助手,覆盖 20+ 学科领域
cybersecurity-skills 30,351★ 网络安全 817 个结构化安全 skill,映射 MITRE ATT&CK 等 6 大框架
hallmark 26,163★ 反 AI 味设计 Anti-AI-slop 设计引擎,让 AI 生成内容看起来不像 AI 写的

四、Tier 3:值得关注的 5 个新锐

Skill 星标 定位 为什么值得关注
planning-with-files 26,265★ 持久化任务规划 解决长任务崩溃丢失进度的痛点,文件级持久化
reverse-skill 27,016★ 逆向工程 安全研究/授权渗透测试,覆盖 PE/ELF/Mach-O 多格式
huashu-design 23,343★ HTML 原生设计 中文开发者主导,Claude Code 里直接出 HTML 设计稿
khazix-skills 19,877★ 中文 AI 合集 数字生命卡兹克出品,含 leader/洁癖/hv-analyst 等中文原创
capcut-cli 精选收录 视频编辑 零依赖 CLI,可编程编辑剪映项目,205 个测试覆盖三端

五、官方团队 Skill 速览

以下团队均发布了官方 skill,质量有保障:

团队 Skill 方向 数量
Anthropic 办公四件套 + 设计 + MCP Builder + Web Testing + Internal Comms 17 个
Google Gemini API 开发 + Vertex AI + Live API + Interactions API 4 个
Stripe 支付集成最佳实践 + SDK 升级指南 2 个
Vercel Next.js 部署 + Edge Runtime 2 个
Cloudflare Workers + R2 + D1 集成 3 个
Supabase PostgreSQL 最佳实践 1 个
HashiCorp Terraform Provider 开发全流程 10 个
TestMu AI 46 种测试框架覆盖(Playwright/Jest/Pytest/Selenium…) 46 个

六、安装建议:3 步上手

Step 1:基础增强(5 分钟)

安装 andrej-karpathy-skills + caveman,零成本提升 Agent 基础能力。

Step 2:办公提效(10 分钟)

安装 Anthropic Office 四件套,覆盖 Word/Excel/PPT/PDF 全流程。

Step 3:按需扩展

根据你的领域选择 Tier 2/3 的 skill。科研选 academic-research-skills,营销选 marketing-skills,安全选 cybersecurity-skills。

七、趋势观察

1. Skill 从”功能补丁”进化为”能力系统”

头部 skill(ECC、Graphify)已不再是单一功能,而是完整的 Agent 增强框架。2026 年的 skill 竞争已从”谁功能多”转向”谁的系统设计好”。

2. 官方团队入场加速

Anthropic、Google、Stripe、Cloudflare 等一线团队均发布官方 skill,标志着 skill 生态从社区驱动进入官方+社区双轨时代。

3. 跨平台兼容成标配

VoltAgent 的 awesome-agent-skills 明确标注”兼容 Claude Code / Cursor / Gemini CLI / Copilot / Windsurf”,skill 的平台锁定正在被打破。

4. 中文生态崛起

huashu-design(23k★)、khazix-skills(19k★)等中文原创 skill 已进入全球前列。中国开发者在 AI skill 生态中的存在感显著增强。

八、数据来源与声明

本文数据采集自 2026 年 8 月 21 日,来源包括:

  • GitHub awesome-agent-skills(30,626★,1497+ skill)
  • GitHub awesome-claude-code(52,721★)
  • GitHub awesome-claude-skills(72,902★)
  • GitHub Search API(按星标排序)

星标数据为采集时快照,可能随时间变化。排名不代表绝对优劣,请根据实际需求选择。