darwin.skill 实测:受 Karpathy 启发的 Agent Skill 自动优化器,微软官方集成

darwin.skill 实测:受 Karpathy 启发的 Agent Skill 自动优化器,微软官方集成

你的 Skill 写得再漂亮,跑出来效果差就是零

Agent Skill 生态正在爆发。Claude Code、Codex、OpenClaw、Trae、CodeBuddy 等工具都支持 SKILL.md 格式。当你有 10 个 Skill 可以手动维护,当你有 60+ 个时,你需要一个系统。传统 Skill 审查是纯结构性的——检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill,跑出来的效果可能很差。darwin.skill 同时评估结构质量和实际效果,然后只保留真正有改进的修改。 受 Andrej Karpathy autoresearch 启发,它把”只保留可测量改进”的棘轮机制从模型训练搬到了 Skill 优化领域。

像训练模型一样优化 Skill

darwin.skill 的核心思路来自 Karpathy 的 autoresearch:定义目标和约束,让 agent 自主生成和测试变更,只保留可测量的改进。区别在于:autoresearch 完全自主(loss 只是个数字),Skill 质量有时需要人的判断,所以 darwin.skill 在关键阶段强制暂停等人确认。

整个优化循环分 5 个阶段:

阶段 做什么 人参与度
Phase 0 初始化 扫描 Skill、创建 git 分支、初始化结果文件 低
Phase 0.5 测试 Prompt 设计 为每个 Skill 设计 2-3 个典型测试 prompt 高(需确认)
Phase 1 基线评估 9 维度打分,子 agent 跑实测对比 中(审报告)
Phase 2 优化循环 诊断短板 → 改一个维度 → 独立评委打分 → 保留/回滚 高(每轮 CHECKPOINT)
Phase 3 回归测试 涨幅低于阈值自动停手 低

棘轮机制是核心:分数只能上升。每一轮要么改进 Skill,要么干净地回滚。不会随时间积累局部退化。v2.1 引入了 paired 同-judge 比较(奇数 N 多数决),解决绝对分数 ±8 的 judge 噪音问题——同一份未改文字换个 judge 评,总分可摆动 ±8 分,全是 judge 换尺,不是真实退步。

独立评分是另一个关键设计:评分用子 agent,避免”自己改自己评”的偏差。SkillLens 论文实证 LLM 自评准确率仅 46.4%(接近随机),加入 meta-skill 三维度后升到 73.8%。每轮启动 2 个独立评委,下一轮换全新评委,避免锚定效应。

9 维度评估体系:结构 + 效果 + 反模式

总分 100。v2.0 吸收微软研究院 SkillLens 和 SkillOpt 两篇论文后,从 8 维升级到 9 维:

结构维度(59分)— 静态分析

# 维度 权重 一句话
1 Frontmatter 质量 7 name 规范、description 包含做什么+何时用+触发词
2 工作流清晰度 12 步骤明确可执行、有序号、每步有输入/输出
3 失败模式编码 12 必须显式编码”如果 X 失败 → Y”,只写正向流程扣 ≥3 分
4 检查点设计 6 关键决策前有用户确认,必须显性标记(🔴/STOP)
5 可执行具体性 18 禁止”建议/可以考虑/根据情况/灵活把握”等模糊词
6 资源整合度 4 references/scripts/assets 引用正确、路径可达

效果维度(35分)— 需要实测

# 维度 权重 一句话
7 整体架构 12 结构层次清晰、不冗余不遗漏
8 实测表现 23 跑测试 prompt,对比有/无 Skill 的输出质量

Meta-skill 维度(6分)— 反模式防护

# 维度 权重 一句话
9 反例与黑名单 6 必须有”不要做什么”的反例清单,只写”应该做”扣 ≥3 分

v2.0 新增的三个维度直接来自 SkillLens 论文:

  • 失败模式编码:不只是”告诉 agent 别犯错”,而是把已知失败路径显式编码进 Skill
  • 可执行具体性:明文禁止模糊措辞,出现 ≥3 处扣 ≥3 分
  • 高风险行动黑名单:rm / git reset –hard / force push 等破坏性操作必须显式列禁

实测表现权重最高(23分)。一个格式完美的 Skill,跑出来效果不好就是零。这就是 darwin.skill 与纯结构审查的本质区别。

实测数据:从 80.8 到 91.65 的进化路径

darwin.skill 提供了两个实测案例:

Skill 基线分 优化后 最终分 增益 评委数
huashu-gpt-image 80.8 91.5 91.65 +10.85 6 个独立评委共识
darwin-skill(自评) 86.05 92.05 92.7 +6.65 独立评委

关键数字:

  • 8 条反例黑名单(明文禁止的反模式)
  • 5 条核心原则(单一可编辑资产、双重评估、棘轮机制、独立评分、人在回路)
  • v2.1 改为 paired 比较后,false-revert 率显著下降
  • 每轮涨幅 < 1 分自动早停,避免凑分堆冗余
  • 干跑比例 > 30% 自动告警

before vs after 示例(huashu-gpt-image):

  • before(80.8):结构基本完整,但缺乏失败模式编码,实测输出质量不稳定
  • after(91.65):失败路径显式编码,模糊措辞清除,实测一致性提升

作者还做了 controlled study:对 huashu-research 做 4 类 degradation,5 个独立 judge 盲测一致判定 V1>V2,Δ 均值 +46.5(5/5 high confidence)。结论:rubric 能识别 gross degradation,但 fine-grained quality difference 仍不可信,重要决策必须人审。

安装、适用场景与结语

安装

npx skills add alchaincyf/darwin-skill

安装后在任何支持 Skill 的 Agent 工具中说”优化所有 skills”或”优化某个 skill”就行。无法访问 GitHub 的朋友,可以下载 zip 包解压放到 ~/.claude/skills/darwin-skill/。

前置条件:在 git 仓库里跑优化,先 commit 或 stash 本地改动,darwin.skill 才能干净地保留或回滚实验改动。

适合谁

角色 价值
Skill 开发者(60+ 个 Skill) 批量优化,自动回滚,不再手动维护
Claude Code / Codex 深度用户 提升日常使用 Skill 的输出质量
AI Agent 研究者 9 维度 rubric 可作为评估框架参考
团队 Skill 管理者 棘轮机制确保质量只升不降

不适合谁

  • 只有 1-2 个简单 Skill 的用户(手动改改就够了)
  • 没有 git 基础的用户(需要 git 操作能力)
  • 期望完全自动化的人(人在回路是核心设计,不是缺陷)

内链

评分

8.5/10

维度 分数 说明
概念创新度 9 autoresearch + SkillOpt 映射,棘轮机制新颖
功能完整度 9 5 阶段循环 + 9 维评估 + 人类检查点,设计完整
文档质量 8.5 SKILL.md 519 行/31KB,详尽但偏长
安装便捷度 9 一行 npx install,开箱即用
实测数据 8 有 controlled study,但样本有限(2 个 Skill)
社区认可 9 微软 SkillOpt 官方集成、5.8k Star
局限性 – SKILL.md 31KB 偏重、需要 git 基础、人在回路设计牺牲自动化

一句话总结:darwin.skill 是目前 Agent Skill 优化领域最系统的开源方案,微软官方背书 + autoresearch 灵感 + 9 维度 rubric 构成了扎实的理论基础。它的核心价值不在于”自动改 Skill”,而于”只保留可测量的改进”——棘轮机制让质量只升不降。

—

合规披露:本文基于 darwin-skill 公开 README、SKILL.md 及 Trendshift 数据撰写,未接受作者资助。

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

痛点切入

用 AI 写代码的人,大概率遇到过这四种场景:

  • 自作主张 — 你让它加个功能,它默默假设你想要全量导出、分页、异步处理,一口气实现完才发现方向错了
  • 过度工程 — 一个 calculate_discount 函数,它给你写 30 行 Strategy 模式的抽象层
  • 顺手重构 — 你让它修个 bug,diff 里混进一堆「改进」:改了注释、重命名变量、删了你以为没用的代码
  • 无法验证 — 完成标准是「让它能用」,结果循环了 5 轮还在改
  • Andrej Karpathy(前 OpenAI / Tesla AI 负责人)在 X 上发了一段观察,直接点名这四个问题。有人把他的观点整理成一个 CLAUDE.md 文件,上线 7 个月拿到 207,175 Star,成为 GitHub 历史上增长最快的 AI 工具类仓库之一。

    这个 skill 不是代码库、不是插件、不是框架 — 是一个 2,357 字节的 Markdown 文件,四条规则,没有依赖。

    —

    工作原理

    Karpathy Guidelines 的核心思路是:用声明式目标替代命令式指令,用强制约束替代隐性期望。

    四条原则 vs 四个问题

    原则 解决的问题 核心机制
    Think Before Coding 假设错误、隐藏困惑 强制显式列出假设,不确定就问
    Simplicity First 过度工程、抽象膨胀 「高级工程师会说这太复杂吗?」自检
    Surgical Changes 顺手重构、无关改动 每行改动必须追溯到用户请求
    Goal-Driven Execution 无法验证、循环失败 把任务转为可验证的成功标准

    为什么只有 4 条?

    Karpathy 的原话:

    “LLMs are exceptionally good at looping until they meet specific goals… Don’t tell it what to do, give it success criteria and watch it go.”

    关键洞察:LLM 擅长「执行到满足条件」,但前提是条件得明确。四条原则不是在教 AI 怎么写代码,而是在 重新定义 AI 和人类的协作契约 — 让 AI 停下来问、写简单点、别乱动、定义清楚什么叫「完成了」。

    与同类方案的差异

    方案 思路 复杂度 效果
    Karpathy Guidelines 4 条行为约束 极低 中等(依赖模型遵守)
    Andrej Karpathy Guidelines (fork) 添加更多规则 低 中等
    ECC Agent Harness 68 Agent + 286 Skill 高 高(系统级强制)
    Planning-with-Files 持久化规划文件 中 高(崩溃恢复)

    Karpathy Guidelines 的独特之处:零依赖、零配置、一个文件搞定。它不强制执行,而是「建议」— 效果取决于模型的指令遵循能力。

    —

    功能拆解

    模块 1:Think Before Coding(思考优先)

    一句话:在写任何代码之前,先列出你的假设,不确定就问。

    核心能力:

  • 强制 LLM 显式声明假设(而不是默默假设后直接实现)
  • 面对歧义时呈现多个选项,而不是自己选一个
  • 遇到更简单的方案时主动提出
  • 困惑时停下来,描述哪里不清楚
  • 适用场景:需求模糊的任务、涉及隐私/安全的功能、多技术方案可选的决策

    示例对比:

    ❌ LLM 常见行为:用户说「导出用户数据」,直接写一个导出全量 JSON 的函数

    ✅ 应有行为:先问清楚 — 导出全部还是筛选?JSON 还是 CSV?哪些字段?数据量多大?

    模块 2:Simplicity First(简单优先)

    一句话:写能解决问题的最简代码,不加推测性功能。

    核心能力:

  • 禁止添加用户没要求的功能
  • 禁止单次使用的代码做抽象
  • 禁止不需要的「灵活性」和「可配置性」
  • 禁止为不可能的场景写错误处理
  • 200 行能 50 行解决就重写
  • 自检标准:「一个高级工程师会说这太复杂吗?」如果是,简化。

    适用场景:所有编码任务,尤其是脚本、工具函数、快速原型

    模块 3:Surgical Changes(外科手术式修改)

    一句话:只改必须改的,只清理自己制造的垃圾。

    核心能力:

  • 不「改进」相邻代码、注释或格式
  • 不重构没坏的东西
  • 匹配现有代码风格,即使你有不同偏好
  • 发现无关死代码时提一下,但不删
  • 清理规则:只删除你的改动导致的孤立代码(未使用的 import/变量/函数),不删已有的死代码。

    验收标准:每一行改动都应该能追溯到用户的请求。

    适用场景:Bug 修复、功能增强、代码审查中的小改

    模块 4:Goal-Driven Execution(目标驱动执行)

    一句话:把任务转化为可验证的成功标准,循环直到达成。

    核心能力:

  • 把「加验证」转为「写测试用例让非法输入失败,然后让它们通过」
  • 把「修 bug」转为「写一个复现测试,然后让它通过」
  • 把「重构 X」转为「确保重构前后测试都通过」
  • 多步任务用 1. [步骤] → 验证: [检查] 格式列出计划
  • 关键洞察:强成功标准让 LLM 能独立循环,弱标准(「让它能用」)需要反复确认。

    适用场景:多步骤任务、测试驱动开发、需要验收标准的工程任务

    —

    实测数据

    星标与增长

    指标 数值
    Star 数 207,175
    Fork 数 21,141
    Watcher 1,202
    创建时间 2026-01-27
    最后更新 2026-04-20
    许可证 MIT

    7 个月 207k Star,平均每月增长约 30k。对比参考:ECC(242k★)用了 7 个月,Caveman(100k★)同期数据。

    Token 成本对比

    Karpathy Guidelines 本身不直接节省 token(不像 Caveman 那样压缩输出),但通过减少以下行为间接节省:

    场景 无 Guidelines 有 Guidelines 节省估算
    过度工程重写 1000+ 行 → 被拒绝 → 重写 50-200 行一次到位 60-80%
    顺手重构导致的额外 review diff 混入无关改动 → 逐行审查 干净 diff → 快速合并 50%+
    假设错误导致的返工 实现完发现方向错 → 全部重来 先确认再实现 80-100%

    真实场景对比(EXAMPLES.md 摘录)

    场景:添加折扣计算函数

    无 Guidelines(LLM 常见输出):

    from abc import ABC, abstractmethod
    from enum import Enum
    from typing import Protocol, Union
    from dataclasses import dataclass
    
    class DiscountStrategy(ABC):
        @abstractmethod
        def calculate(self, amount: float) -> float:
            pass
    # ... 30+ 行

    有 Guidelines:

    def calculate_discount(amount: float, percent: float) -> float:
        """Calculate discount amount. percent should be 0-100."""
        return amount * (percent / 100)

    代码量对比:30+ 行 vs 3 行。如果需求真的需要多策略,等需要时再重构。

    —

    安装 + 适用场景 + 结语

    安装

    方式 A:Claude Code Plugin(推荐)

    /plugin marketplace add forrestchang/andrej-karpathy-skills
    /plugin install andrej-karpathy-skills@karpathy-skills

    方式 B:CLAUDE.md(逐项目)

    新项目:

    curl -o CLAUDE.md https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md

    现有项目(追加):

    echo "" >> CLAUDE.md
    curl https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md >> CLAUDE.md

    方式 C:Cursor

    仓库自带 .cursor/rules/karpathy-guidelines.mdc,直接在 Cursor 项目中生效。

    最适合谁

    角色 价值 推荐度
    个人开发者 减少 AI 返工,代码质量提升 ⭐⭐⭐⭐⭐
    小团队 统一 AI 协作规范 ⭐⭐⭐⭐
    技术负责人 建立 AI 编码标准 ⭐⭐⭐⭐
    初学者 学习「好代码」的标准 ⭐⭐⭐⭐⭐

    不适合谁

  • 追求极致速度的人:这些规则偏向谨慎,会增加确认环节
  • 简单任务:改个 typo 不需要四条铁律
  • 已经用 ECC 等系统级方案的人:功能重叠
  • 相关文章

  • ECC 实测:242k Star 的 Agent 操作系统,68 个 Agent 286 个 Skill 终结 AI 编程散装
  • Caveman 实测:一个 Skill 砍掉 AI 编程 65% token 成本
  • 合规披露

  • 数据来源:GitHub 仓库 multica-ai/andrej-karpathy-skills,截至 2026-08-25
  • Star/Fork 数据为实时 API 查询结果
  • EXAMPLES.md 对比为仓库官方示例
  • 未进行独立的 token 计数 benchmark,节省估算基于代码量对比推算
  • Karpathy 原始推文链接:https://x.com/karpathy/status/2015883857489522876
  • —

    一句话总结:Karpathy Guidelines 不是框架,不是插件,是一个 2.3KB 的 Markdown 文件 — 但它可能是性价比最高的 AI 编程改进:四条规则,零成本,直接提升代码质量和协作效率。