Understand-Anything 实测:80k Star 的代码知识图谱,让 AI 从「读代码」变成「教代码」

Understand-Anything 实测:80k Star 的代码知识图谱,让 AI 从「读代码」变成「教代码」

20 万行代码的新团队,没有架构文档,最懂系统的工程师刚离职——这是每个开发者都怕遇到的场景。传统方式是逐文件翻代码,平均需要 2-3 周才能建立基本的系统认知。Understand-Anything 用一个多 Agent 流水线扫描整个项目,生成可交互的知识图谱,把「读代码」变成「看地图」。80,770 Star、6,790 Fork、MIT 开源——它可能是目前最火的代码理解工具。

工作原理

Tree-sitter + LLM 混合架构

Understand-Anything 的核心是「确定性结构 + 语义理解」的双层架构:

第一层:Tree-sitter(确定性)

  • 解析源码为具体语法树(CST)
  • 提取结构事实:imports、exports、函数/类定义、调用关系、继承链
  • 预构建 importMap,避免重复推导
  • 基于指纹的变更检测,支持增量更新

第二层:LLM(语义)

  • 读取解析后的结构 + 原始源码
  • 生成纯英文摘要、标签、架构层分类
  • 业务领域映射、导览生成、语言概念标注

这种分离保证了结构图的可复现性(同一代码 → 同一边),同时保留了意图理解(文件是「干什么的」而不仅是「导入了什么」)。

5+2 Agent 流水线

/understand 命令编排 5 个专用 Agent,/understand-domain 加第 6 个,/understand-knowledge 加第 7 个:

Agent 职责 用途
project-scanner 发现文件、检测语言和框架 /understand
file-analyzer 提取函数、类、imports,生成图节点和边 /understand
architecture-analyzer 识别架构层(API/Service/Data/UI/Utility) /understand
tour-builder 生成按依赖排序的导览 /understand
graph-reviewer 验证图完整性和引用完整性 /understand
domain-analyzer 提取业务领域、流程、步骤 /understand-domain
article-analyzer 从 wiki 文章提取实体和隐式关系 /understand-knowledge

File analyzer 并行运行,最多 5 个并发 worker,每批 20-30 个文件。

功能拆解

核心模块

模块 一句话 核心能力 适用场景
结构图探索 代码库变可点击地图 每个文件/函数/类是节点,带纯英文摘要和关系 新人入职、代码审查
领域视图 代码映射业务流程 域/流程/步骤的水平图 向非技术人员解释系统
导览生成 自动创建学习路径 按依赖排序的架构 walkthrough 新人 onboarding
Diff 影响分析 提交前看影响范围 /understand-diff 显示变更波及的模块 PR review、变更管理
模糊/语义搜索 按含义找代码 「哪些部分处理认证?」→ 跨图搜索结果 日常开发、调试
Persona 自适应 UI 根据角色调整详情 初级/PM/高级用户看到不同深度 多角色团队协作
知识库分析 Wiki 变力导向图 从 Karpathy 模式 LLM wiki 提取实体和关系 团队知识管理
Figma 分析 设计稿变知识图谱 页面→屏幕→组件/变体/实例,设计 token 模型 设计-开发协作
增量更新 只分析变更文件 –auto-update post-commit hook 自动维护图 持续集成
多语言输出 6 种语言支持 en/zh/zh-TW/ja/ko/ru 国际化团队

平台兼容性

平台 状态 安装方式
Claude Code ✅ 原生 Plugin marketplace
Cursor ✅ 自动发现 Clone 即用
VS Code + Copilot ✅ 自动发现 Clone 即用
Codex ✅ 支持 install.sh codex
Gemini CLI ✅ 支持 install.sh gemini
OpenCode ✅ 支持 install.sh opencode
Copilot CLI ✅ 支持 copilot plugin install
Kiro ✅ 支持 install.sh kiro
共 15+ 平台 一行脚本

这是它最大的差异化优势——不是绑定某个编辑器的私有功能,而是跨平台的共享产出物。

实测数据

增长数据

指标 数值
GitHub Stars 80,770
Forks 6,790
Contributors 48+(Lum1104 贡献 523 commits)
Open Issues 290
创建时间 2026-03-15
最新版本 v2.9.0(2026-07-10)
许可证 MIT
主要语言 TypeScript 71.3%, JavaScript 15.8%, Python 8.8%

5 个月从 0 到 80k Star,AI 工具类增长最快之一。

Token 成本

据 Augment Code 分析和官方文档:

  • 首次扫描:消耗大量 Token(200k 行代码可能花费数十美元)
  • 增量更新:仅分析变更文件,Token 消耗大幅降低
  • 推荐:大项目用 Token 订阅或本地模型(如 Ollama)

Before vs After 对比

维度 传统方式 Understand-Anything
新人建立系统认知 2-3 周翻代码 1 天跑完流水线 + 看导览
变更影响评估 手动 grep + 阅读 /understand-diff 一键查看
架构文档 不存在或已过期 自动生成 + 增量维护
跨团队共享 口口相传 提交 JSON,所有人共享

已知局限

  1. LLM 成本自担:多 Agent 流水线调用真实 LLM,费用不低
  2. 图质量依赖代码质量:命名混乱、无关注点分离的代码库,图也会混乱
  3. 首次扫描耗时:200k 行代码即使 5 并发也要跑一阵
  4. 可能过期:不启用 –auto-update,图会漂移
  5. 290 个 Open Issues:活跃开发中,部分功能可能不稳定

安装 + 适用场景 + 结语

安装

Claude Code(最简):

/plugin marketplace add Egonex-AI/Understand-Anything
/plugin install understand-anything

其他平台(一行脚本):

curl -fsSL https://raw.githubusercontent.com/Egonex-AI/Understand-Anything/main/install.sh | bash

最适合谁

  • 新入职工程师:1 天建立系统认知,不用翻代码
  • 技术经理/PM:领域视图解释业务逻辑
  • 开源维护者:贡献者快速理解项目结构
  • 多平台团队:不同编辑器,同一份共享图

不适合谁

  • 小项目(<1k 行):杀鸡用牛刀
  • 单人项目:没有共享需求
  • 预算敏感:首次扫描 Token 成本不低
  • 代码质量差的项目:图会反映混乱而非澄清混乱

对不同角色的意义

个人开发者,它是理解陌生代码库的利器——接手遗留项目或研究开源项目时,5 分钟生成全景图。对团队,它是 onboarding 的基础设施——新人第一天就有交互式架构地图。对组织,它把「系统知识」从个人大脑里解放出来,变成可版本控制的团队资产。

相关阅读

本文数据来源:GitHub 仓库公开数据、Augment Code 报告、DEV.to 评测文章。截至 2026 年 8 月 28 日。

智谱「牛来」跑在10万国产卡上:成本1/40 Claude Opus,用量超DeepSeek两倍

智谱「牛来」跑在10万国产卡上:成本1/40 Claude Opus,用量超DeepSeek两倍

8月28日,智谱正式认领了此前在测试期引发广泛关注的神秘模型”牛来”(Ox-Alpha),并披露了一组令人震惊的数据:该模型测试期间每日处理 100 万亿 token,全部运行在超过 10 万张国产 AI 芯片上,成本效率据称与英伟达 GPU 相当,定价仅为 Claude Opus 4.8 的 1/40,使用量超过 DeepSeek 两倍。消息发布后,智谱港股盘中涨超 10%。

这不是又一个”国产替代”的口号。当一个模型能在国产芯片上跑出与英伟达 GPU 相当的成本效率,同时在实际使用量上碾压 DeepSeek,它意味着中国 AI 产业在算力自主这件事上,已经从”PPT 阶段”进入了”跑通阶段”。

10 万张国产卡的日均 100 万亿 token

智谱披露的数字值得拆解。”牛来”模型在测试期的日均 token 处理量达到 100 万亿,这个量级在全球 AI 推理场景中属于头部水平。更关键的是,这些 token 全部由国产芯片承载——没有英伟达 GPU,没有 CUDA 生态,纯国产算力栈。

在成本端,智谱声称”牛来”的成本效率与英伟达 GPU 相当。如果这个说法经得起验证,它意味着国产芯片在大规模推理场景中的性价比已经跨过了”可用”门槛,进入了”有竞争力”区间。定价 1/40 Claude Opus 4.8 更是直接把价格战打到了极致——对于那些对成本敏感的企业客户来说,这是一个无法忽视的选项。

使用量超过 DeepSeek 两倍这个数据同样值得注意。DeepSeek 此前凭借开源策略和低成本定位在开发者社区积累了大量用户,而”牛来”能在测试期就超越 DeepSeek 的使用量,说明市场对低成本、高性能模型的需求依然旺盛。

国产芯片的”ChatGPT 时刻”?

这件事的意义远不止于智谱一家公司的产品发布。从产业角度看,它至少传递了三个信号:

第一,国产芯片的推理能力得到了大规模验证。10 万张卡的日均 100 万亿 token,这不是实验室数据,是真实流量。对于那些担心国产芯片”能造不能用”的质疑,这是一个有力的回应。

第二,AI 模型的成本曲线正在被改写。Claude Opus 4.8 的定价代表了当前闭源模型的高端价位,而”牛来”用 1/40 的价格提供了”相当”的能力,这对整个行业的定价体系都会产生压力。

第三,中国 AI 产业正在形成自己的算力-模型闭环。国产芯片 + 国产模型 + 国产框架,这条链路的打通意味着即使在最极端的供应链中断场景下,中国 AI 产业仍然能够运转。

谁该紧张?

对芯片厂商:英伟达在中国市场的定价权正在被削弱。当国产芯片能跑出相当的成本效率,客户的选择空间就大了。AMD、英特尔同样需要关注——低成本推理市场可能成为国产芯片率先突破的阵地。

对云服务商:阿里云、腾讯云、华为云需要重新评估自己的算力采购策略。如果国产芯片的性价比确实达到这个水平,继续大规模采购英伟达 GPU 的理由就少了一个。

对 AI 创业公司:成本结构变了。如果你的产品依赖昂贵的闭源模型 API,现在有了更便宜的替代方案。但这不意味着可以无脑切换——模型能力、生态兼容性、长期维护都需要评估。

对投资者:智谱港股涨超 10% 是市场对这个信号的即时反应。但更深层的问题是:当中国 AI 产业在算力端实现自主,整个产业链的估值逻辑是否需要重写?

冷静看待

需要指出的是,”成本效率与英伟达 GPU 相当”这个说法目前还缺乏独立第三方的验证。国产芯片在软件生态、开发者工具链、长期稳定性等方面与英伟达 CUDA 生态仍有差距。10 万张卡的规模固然壮观,但这些芯片的采购成本、维护成本、以及实际利用率都是需要考量的因素。

此外,1/40 Claude Opus 4.8 的定价虽然诱人,但模型能力的对比维度很多——代码生成、逻辑推理、多语言处理、长上下文理解等场景下,”牛来”的表现是否真的能与顶级闭源模型抗衡,还需要更多公开 benchmark 的验证。

但无论如何,今天发生的这件事——一个中国 AI 模型在国产芯片上跑出头部级推理量,同时把价格打到竞品的 1/40——标志着中国 AI 产业在算力自主这条路上,迈出了实质性的一步。对于整个行业来说,这既是机遇,也是重新洗牌的开始。

关注 AI商业快讯,每天一篇 AI 热点深度解读


相关阅读:

Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

Planning-with-Files 实测:26k Star 的三文件铁律,让 AI 编程不再失忆

你有没有经历过这种崩溃?

花了 2 小时让 Claude Code 做一个 Django 迁移,50+ 工具调用后上下文窗口炸了。/clear 一敲,Agent 一脸茫然问你:”请问您要做什么?”

这不是 bug,这是所有 AI 编程 Agent 的结构性缺陷:上下文窗口 = RAM,关机就清零。Manus AI 在被 Meta 收购前想明白了这件事——用文件系统当持久记忆,而不是把所有东西塞进上下文。

Planning-with-Files 就是这个思路的标准化实现:3 个 Markdown 文件 + Hook 自动注入,让 Agent 的”工作记忆”写在磁盘上,/clear 崩溃、上下文压缩、Session 断裂全不怕。26k Star、96.7% 断言通过率、3/3 盲测 A/B 全胜——这是目前持久化规划领域数据最硬的 Skill。

工作原理:三文件 + Hook 注入循环

核心模型

Context Window = RAM(易失、有限)
Filesystem    = Disk(持久、无限)

→ 任何重要东西都写到磁盘上

三个文件各管什么

文件 职责 更新时机
task_plan.md 阶段划分 + 进度追踪 + 决策记录 每完成一个阶段
findings.md 研究笔记 + 发现 + 决策依据 任何新发现
progress.md Session 日志 + 测试结果 全程持续记录

Hook 注入循环(5 个生命周期钩子)

Agent 工作 → 写决策/发现/错误到文件
     ↓
Hook 每轮开始时重新注入文件内容到上下文
     ↓
/clear 或崩溃 → 文件还在 → 新 Session 读文件恢复
     ↓
所有阶段完成 → Stop Hook 检查 → 释放完成信号

5 个 Hook 分别是:

  1. UserPromptSubmit — 每轮用户输入前注入计划
  1. PreToolUse — 每次工具调用前注入计划
  1. PostToolUse — Write/Edit 后提醒更新 progress.md
  1. Stop — 完成检查门控(gated 模式下阻止提前退出)
  1. PreCompact — 压缩前提醒刷盘

与 Manus AI 的关系

2025 年 12 月 Meta 以 20 亿美元收购 Manus。Manus 的核心秘密就是上下文工程:用 Markdown 文件当”磁盘上的工作记忆”。Planning-with-Files 把这个模式打包成了标准化 Skill,装到任何 Agent 上就能用。

功能拆解:五大模块逐个分析

1. 三文件模板系统

一句话:标准化的 task_plan.mdfindings.mdprogress.md 模板,带完整注释说明每个字段的用途。

核心能力

  • 模板自带 Goal / Next Step / Current Phase / Phases / Decisions / Errors 结构
  • Phase 支持 pending → in_progress → complete 状态流转
  • 决策表和错误表结构化记录,避免重复犯错

适用场景:任何 3+ 步骤或 5+ 工具调用的复杂任务。

2. Hook 自动注入引擎

一句话:5 个生命周期 Hook 让计划文件每轮自动注入上下文,Agent 不需要”记得去读”。

核心能力

  • UserPromptSubmit / PreToolUse 双保险注入
  • PostToolUse 提醒更新进度
  • Stop Hook 门控完成(gated 模式)
  • PreCompact 压缩前刷盘提醒

适用场景:长任务(50+ 工具调用),防止目标漂移。

3. Session 恢复系统

一句话/clear 或崩溃后,自动从 IDE Session Store 读取历史对话 + 从文件恢复计划状态。

核心能力

  • session-catchup.py 自动发现历史 Session
  • 提取上下文丢失后的对话片段
  • 生成恢复报告,帮助 Agent 快速补回状态

实测数据:恢复平均 5.0 turns(裸 Agent 13.3 turns),提速 62%

适用场景:上下文窗口不够用、需要多次 /clear 的超长任务。

4. 并行任务隔离

一句话:v2.36.0+ 支持 .planning/YYYY-MM-DD-slug/ 目录隔离,多个并行任务互不干扰。

核心能力

  • .active_plan 文件指向当前激活的计划目录
  • resolve-plan-dir.sh 智能解析计划路径
  • 防止共享父目录的线程注入无关计划

适用场景:多 Agent 并行、多任务交叉执行。

5. v3 长任务增强

一句话:Autonomous 模式 + Gated 完成门控 + Attestation 计划防篡改 + JSONL 运行日志。

核心能力

  • --autonomous:去掉逐轮计划复述,保留注入
  • --gated:所有阶段完成前阻止 Agent 退出
  • SHA-256 Attestation:计划被篡改时 Hook 拒绝注入
  • JSONL Ledger: append-only 运行日志,可审计

适用场景:数小时级自主运行、需要保证完成质量的无人值守任务。

实测数据:有 Skill vs 没 Skill

Benchmark 总览(v2.21.0,claude-sonnet-4-6,2026-03-06)

测试项 有 Skill 无 Skill 差距
断言通过率(30 项) 96.7%(29/30) 6.7%(2/30) +90.0 pp
三文件模式遵循 5/5 0/5 +100%
盲测 A/B 胜率 3/3(100%) 0/3 全胜
平均评分(10 分制) 10.0 6.8 +3.2

Token 成本对比

维度 有 Skill 无 Skill 差距
平均 Token 19,926 11,899 +68%
平均耗时 115s 98s +17%

结论:多花 68% Token 换 96.7% 结构化输出——这是一笔划算的交易。额外 Token 花在创建 3 个文件、填充决策表和错误表上,不是浪费。

Session 恢复实测(v3.4.0 内部基准,2026-07-06)

恢复方式 恢复所需 Turn 数 正确性
Planning-with-Files 5.0 77/77 pytest 全绿
裸 Agent(无规划) 13.3 77/77 pytest 全绿

恢复提速 62%,零正确性惩罚。两者最终都能完成任务,但有 Skill 的快了将近 3 倍。

盲测 A/B 评语摘录

“Output B(有 Skill)满足所有四项结构化工作流期望……Output A(无 Skill)交付了真实可运行的代码,但不符合结构化多阶段规划格式。” — Eval 1 评审

“Output B 还包含了 pytz/zoneinfo 迁移(4.2 特有问题,Output A 完全遗漏)以及 django-upgrade 工具推荐……18,727 字符 vs 12,847,信息密度更高。” — Eval 4 评审

安装方式 + 适用场景 + 结语

安装(一行命令)

# Claude Code(插件路由,含 Hook + 斜杠命令)
/plugin marketplace add OthmanAdi/planning-with-files
/plugin install planning-with-files@planning-with-files

# 60+ Agent 通用(Agent Skills 标准)
npx skills add OthmanAdi/planning-with-files --skill planning-with-files -g

# npm 锁版本到项目
npm install planning-with-files

安装后输入 /plan 或让 Agent “plan this task” 即可触发。

最适合谁

角色 为什么需要
独立开发者 一个人做复杂项目,需要跨 Session 记住进度
长任务工程师 数小时级 Agent 运行,目标漂移是最大敌人
多 Agent 协作 并行任务隔离 + 计划防篡改
AI 编程初学者 结构化输出强制养成好习惯

不太适合谁

  • 简单 CRUD / 一次性脚本:3 步以内的任务不需要三文件,反而增加摩擦
  • 已有 ECC 等系统级方案的团队:ECC 的 Agent Harness 已经覆盖了规划功能,重复叠加意义不大
  • Token 预算极紧的场景:多花 68% Token 不是所有人都能接受

一句话结语

Planning-with-Files 解决的是 AI 编程中最痛的结构性问题——上下文易失。它的数据足够硬(96.7% 通过率、3/3 A/B 全胜),架构足够通用(60+ Agent、18+ IDE),代价也足够清晰(+68% Token)。如果你的 Agent 经常在长任务中失忆,这是目前最成熟的解法。

数据来源:GitHub OthmanAdi/planning-with-files README + docs/evals.md,截至 2026-08-27。

相关阅读

⚠️ 本文为技术评测,非付费推广。Planning-with-Files 为 MIT 开源项目。

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

Anthropic 2026年最大新闻周:5天6大动作,AI竞争格局彻底改写

资讯摘要

据 TechCrunch、CNBC、Bloomberg 等多家媒体报道,Anthropic 在2026年5月第一周创造了AI行业史无前例的「超级新闻周」:Q1收入同比增长80倍,年化收入(ARR)突破440亿美元;与Google Cloud签署2000亿美元算力合同;与SpaceX签署算力协议接入xAI Colossus 1超级计算机;推出Claude Code Auto Mode自动选择最优模型;联合摩根大通CEO Jamie Dimon发布10个金融服务Agent;同日开源Claude Agent SDK。

同一周内,Google DeepMind员工以98%的赞成票通过成立工会(AI实验室史上首个工会);欧盟AI Act高风险规则合规截止日期从2026年8月推迟至2027年12月;宾夕法尼亚州起诉Character.AI聊天机器人冒充持牌精神科医生。

为什么值得关注

Anthropic 在5天内完成了从「追赶者」到「全层竞争者」的身份转变。此前只有OpenAI同时在前沿模型、开发工具、企业产品、基础设施投资和消费者市场五个层面展开竞争。现在Anthropic也在做同样的事。

这意味着AI采购者需要重新评估供应商名单。「默认选OpenAI」的安全假设已经不再成立。Anthropic 在收入增速、企业级合作规模和基础设施投入上,目前甚至领先于OpenAI。

对投资者而言,AI行业的竞争格局从「一超多强」正式进入「双雄争霸」时代。

分角色实操建议

对技术负责人

Claude Code Auto Mode 的发布意味着Anthropic正在将「模型选择」从人类决策中移除。Auto Mode 能自动选择最适合当前编码任务的Claude模型(最强版、中端版或最快版),目标是90%的编码任务无需人类干预。

建议:在非关键业务系统中试用Auto Mode,评估其实际效果。对于核心业务系统,建议保留手动选择权,等待更多安全数据。

对投资者

Anthropic的ARR已达440亿美元,与OpenAI的收入轨迹相当。但Anthropic的增长速度(80倍/年)远高于OpenAI同期表现。

关注点:Anthropic正在向消费者市场扩张(此前主要面向企业和开发者),这将直接与ChatGPT竞争。

对普通从业者

AI行业的「一超多强」格局已经结束,进入「双雄争霸」时代。这意味着更多选择、更激烈的竞争、可能更快的技术迭代。

建议:同时关注OpenAI和Anthropic的产品更新,不要只锁定一家。两家公司的差异化竞争可能带来更多创新。

欧盟AI Act:合规窗口期延长16个月

欧盟AI Act高风险AI规则的合规截止日期从2026年8月推迟至2027年12月,为在受监管领域(招聘、贷款、教育、执法、医疗设备)部署AI的企业提供了额外16个月的缓冲期。

这对AI合规团队是好消息。但建议不要因此拖延合规准备工作——提前完成合规的企业将在竞争中占据优势。

首个AI实验室工会:DeepMind员工的集体谈判权

Google DeepMind英国员工以98%的赞成票通过成立工会,触发点是一个具体的五角大楼机密AI合同。这是AI实验室历史上第一个正式工会。

此前AI实验室通过公开信和辞职来处理内部异议;DeepMind员工现在获得了集体谈判权。其他前沿实验室现在面临同样的可能性。

流量导向结语 + 合规披露

关注「AI商业快讯」,每天一篇AI热点深度解读。本周Anthropic的超级新闻周只是开始——AI行业正进入前所未有的激烈竞争期。

本文不含合作/联盟链接。

相关阅读

扎克伯格称AI为人人,商业普惠还是巨头话语权?

Meta首席执行官马克·扎克伯格近期多次公开表示,人工智能应当“为每个人服务”,并推动开源大模型策略。这一表态与Meta发布Llama系列模型的路线一致,也试图在AI监管趋严的背景下塑造技术民主化形象。然而,外界对其动机存在分歧:一方面,开源确实降低了中小企业使用AI的门槛;另一方面,Meta的商业模式仍依赖用户数据和广告收入,所谓“普惠”是否只是另一种生态绑定,仍需观察。

商业机会在哪里

机会一:开源AI基础设施的二次开发服务。 Llama等模型虽可免费获取,但企业级部署需要调优、安全测试和私有化改造,这为第三方技术服务商提供了市场空间。

机会二:面向中小企业的垂直AI工具。 通用模型无法直接解决特定行业问题,围绕法律、医疗、零售等场景开发轻量级AI应用,可作为“为人人”理念落地的商业切口。

机会三:AI素养与合规咨询。 当“AI为人人”引发公众讨论,企业需要理解技术边界、数据责任和伦理风险,相关培训和治理咨询服务需求将持续增长。

落地操作建议

  • 选取一个细分行业,基于主流开源模型构建原型,验证在真实业务中的效率提升与错误率控制,再决定商业化路径。
  • 与至少两个不同规模的客户深度共创,记录部署成本、维护难度和实际收益,形成可复制的服务套餐。
  • 建立开源技术追踪机制,对标Meta等公司的模型更新节奏,及时调整自有产品与合规策略,避免单一生态依赖。

需要清醒认识到,所谓“AI为人人”的宏大叙事背后是复杂的商业博弈。企业若盲目拥抱开源框架,可能面临许可证变更、数据泄露或技术路线淘汰的风险。更务实的做法是利用当前的开放红利期积累垂直能力,同时保持对底层平台变化的灵活应对。未来三到五年,AI普惠的承诺能否兑现,不取决于口号,而取决于是否有可持续的商业闭环。

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

Karpathy Guidelines 实测:207k Star 的四条铁律,终结 AI 编程四大顽疾

痛点切入

用 AI 写代码的人,大概率遇到过这四种场景:

  • 自作主张 — 你让它加个功能,它默默假设你想要全量导出、分页、异步处理,一口气实现完才发现方向错了
  • 过度工程 — 一个 calculate_discount 函数,它给你写 30 行 Strategy 模式的抽象层
  • 顺手重构 — 你让它修个 bug,diff 里混进一堆「改进」:改了注释、重命名变量、删了你以为没用的代码
  • 无法验证 — 完成标准是「让它能用」,结果循环了 5 轮还在改
  • Andrej Karpathy(前 OpenAI / Tesla AI 负责人)在 X 上发了一段观察,直接点名这四个问题。有人把他的观点整理成一个 CLAUDE.md 文件,上线 7 个月拿到 207,175 Star,成为 GitHub 历史上增长最快的 AI 工具类仓库之一。

    这个 skill 不是代码库、不是插件、不是框架 — 是一个 2,357 字节的 Markdown 文件,四条规则,没有依赖。

    工作原理

    Karpathy Guidelines 的核心思路是:用声明式目标替代命令式指令,用强制约束替代隐性期望

    四条原则 vs 四个问题

    原则 解决的问题 核心机制
    Think Before Coding 假设错误、隐藏困惑 强制显式列出假设,不确定就问
    Simplicity First 过度工程、抽象膨胀 「高级工程师会说这太复杂吗?」自检
    Surgical Changes 顺手重构、无关改动 每行改动必须追溯到用户请求
    Goal-Driven Execution 无法验证、循环失败 把任务转为可验证的成功标准

    为什么只有 4 条?

    Karpathy 的原话:

    “LLMs are exceptionally good at looping until they meet specific goals… Don’t tell it what to do, give it success criteria and watch it go.”

    关键洞察:LLM 擅长「执行到满足条件」,但前提是条件得明确。四条原则不是在教 AI 怎么写代码,而是在 重新定义 AI 和人类的协作契约 — 让 AI 停下来问、写简单点、别乱动、定义清楚什么叫「完成了」。

    与同类方案的差异

    方案 思路 复杂度 效果
    Karpathy Guidelines 4 条行为约束 极低 中等(依赖模型遵守)
    Andrej Karpathy Guidelines (fork) 添加更多规则 中等
    ECC Agent Harness 68 Agent + 286 Skill 高(系统级强制)
    Planning-with-Files 持久化规划文件 高(崩溃恢复)

    Karpathy Guidelines 的独特之处:零依赖、零配置、一个文件搞定。它不强制执行,而是「建议」— 效果取决于模型的指令遵循能力。

    功能拆解

    模块 1:Think Before Coding(思考优先)

    一句话:在写任何代码之前,先列出你的假设,不确定就问。

    核心能力

  • 强制 LLM 显式声明假设(而不是默默假设后直接实现)
  • 面对歧义时呈现多个选项,而不是自己选一个
  • 遇到更简单的方案时主动提出
  • 困惑时停下来,描述哪里不清楚
  • 适用场景:需求模糊的任务、涉及隐私/安全的功能、多技术方案可选的决策

    示例对比

    ❌ LLM 常见行为:用户说「导出用户数据」,直接写一个导出全量 JSON 的函数

    ✅ 应有行为:先问清楚 — 导出全部还是筛选?JSON 还是 CSV?哪些字段?数据量多大?

    模块 2:Simplicity First(简单优先)

    一句话:写能解决问题的最简代码,不加推测性功能。

    核心能力

  • 禁止添加用户没要求的功能
  • 禁止单次使用的代码做抽象
  • 禁止不需要的「灵活性」和「可配置性」
  • 禁止为不可能的场景写错误处理
  • 200 行能 50 行解决就重写
  • 自检标准:「一个高级工程师会说这太复杂吗?」如果是,简化。

    适用场景:所有编码任务,尤其是脚本、工具函数、快速原型

    模块 3:Surgical Changes(外科手术式修改)

    一句话:只改必须改的,只清理自己制造的垃圾。

    核心能力

  • 不「改进」相邻代码、注释或格式
  • 不重构没坏的东西
  • 匹配现有代码风格,即使你有不同偏好
  • 发现无关死代码时提一下,但不删
  • 清理规则:只删除你的改动导致的孤立代码(未使用的 import/变量/函数),不删已有的死代码。

    验收标准:每一行改动都应该能追溯到用户的请求。

    适用场景:Bug 修复、功能增强、代码审查中的小改

    模块 4:Goal-Driven Execution(目标驱动执行)

    一句话:把任务转化为可验证的成功标准,循环直到达成。

    核心能力

  • 把「加验证」转为「写测试用例让非法输入失败,然后让它们通过」
  • 把「修 bug」转为「写一个复现测试,然后让它通过」
  • 把「重构 X」转为「确保重构前后测试都通过」
  • 多步任务用 1. [步骤] → 验证: [检查] 格式列出计划
  • 关键洞察:强成功标准让 LLM 能独立循环,弱标准(「让它能用」)需要反复确认。

    适用场景:多步骤任务、测试驱动开发、需要验收标准的工程任务

    实测数据

    星标与增长

    指标 数值
    Star 数 207,175
    Fork 数 21,141
    Watcher 1,202
    创建时间 2026-01-27
    最后更新 2026-04-20
    许可证 MIT

    7 个月 207k Star,平均每月增长约 30k。对比参考:ECC(242k★)用了 7 个月,Caveman(100k★)同期数据。

    Token 成本对比

    Karpathy Guidelines 本身不直接节省 token(不像 Caveman 那样压缩输出),但通过减少以下行为间接节省:

    场景 无 Guidelines 有 Guidelines 节省估算
    过度工程重写 1000+ 行 → 被拒绝 → 重写 50-200 行一次到位 60-80%
    顺手重构导致的额外 review diff 混入无关改动 → 逐行审查 干净 diff → 快速合并 50%+
    假设错误导致的返工 实现完发现方向错 → 全部重来 先确认再实现 80-100%

    真实场景对比(EXAMPLES.md 摘录)

    场景:添加折扣计算函数

    无 Guidelines(LLM 常见输出):

    from abc import ABC, abstractmethod
    from enum import Enum
    from typing import Protocol, Union
    from dataclasses import dataclass
    
    class DiscountStrategy(ABC):
        @abstractmethod
        def calculate(self, amount: float) -> float:
            pass
    # ... 30+ 行

    有 Guidelines:

    def calculate_discount(amount: float, percent: float) -> float:
        """Calculate discount amount. percent should be 0-100."""
        return amount * (percent / 100)

    代码量对比:30+ 行 vs 3 行。如果需求真的需要多策略,等需要时再重构。

    安装 + 适用场景 + 结语

    安装

    方式 A:Claude Code Plugin(推荐)

    /plugin marketplace add forrestchang/andrej-karpathy-skills
    /plugin install andrej-karpathy-skills@karpathy-skills

    方式 B:CLAUDE.md(逐项目)

    新项目:

    curl -o CLAUDE.md https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md

    现有项目(追加):

    echo "" >> CLAUDE.md
    curl https://raw.githubusercontent.com/multica-ai/andrej-karpathy-skills/main/CLAUDE.md >> CLAUDE.md

    方式 C:Cursor

    仓库自带 .cursor/rules/karpathy-guidelines.mdc,直接在 Cursor 项目中生效。

    最适合谁

    角色 价值 推荐度
    个人开发者 减少 AI 返工,代码质量提升 ⭐⭐⭐⭐⭐
    小团队 统一 AI 协作规范 ⭐⭐⭐⭐
    技术负责人 建立 AI 编码标准 ⭐⭐⭐⭐
    初学者 学习「好代码」的标准 ⭐⭐⭐⭐⭐

    不适合谁

  • 追求极致速度的人:这些规则偏向谨慎,会增加确认环节
  • 简单任务:改个 typo 不需要四条铁律
  • 已经用 ECC 等系统级方案的人:功能重叠
  • 相关文章

  • ECC 实测:242k Star 的 Agent 操作系统,68 个 Agent 286 个 Skill 终结 AI 编程散装
  • Caveman 实测:一个 Skill 砍掉 AI 编程 65% token 成本
  • 合规披露

  • 数据来源:GitHub 仓库 multica-ai/andrej-karpathy-skills,截至 2026-08-25
  • Star/Fork 数据为实时 API 查询结果
  • EXAMPLES.md 对比为仓库官方示例
  • 未进行独立的 token 计数 benchmark,节省估算基于代码量对比推算
  • Karpathy 原始推文链接:https://x.com/karpathy/status/2015883857489522876
  • 一句话总结:Karpathy Guidelines 不是框架,不是插件,是一个 2.3KB 的 Markdown 文件 — 但它可能是性价比最高的 AI 编程改进:四条规则,零成本,直接提升代码质量和协作效率。

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    OpenAI自研Jalapeño芯片实测超越Nvidia Blackwell:每瓦性能碾压,延迟降低3.6倍

    当 OpenAI 决定自己造芯片,AI 算力格局要变天了。

    8月25日,OpenAI 发布了自研推理芯片 Jalapeño 的首批实测数据。结果令人震惊:在多项关键指标上,这颗与 Broadcom 合作打造的 ASIC 芯片,竟然超越了 Nvidia 当前最先进的 Blackwell GPU。

    这不是实验室里的概念验证,而是 OpenAI 即将在年底部署到生产环境的真实芯片。一场 AI 推理芯片的新战争,正式打响。

    一、Jalapeño 实测数据:每瓦性能碾压 Blackwell

    OpenAI 在官方博文中披露了 Jalapeño 的对比测试结果。核心数据如下:

    能效比(AI 工作负载/瓦特):Jalapeño 达到 Blackwell 的 1.5 到 1.9 倍。这意味着处理相同的 AI 推理任务,Jalapeño 只需要不到 Blackwell 一半的电力。

    延迟(响应时间):Jalapeño 的延迟降低到 Blackwell 的 1/1.7 到 1/3.6。对于 ChatGPT 这样需要实时响应的产品,这个差距意味着用户体验的质变。

    适用场景:Jalapeño 在低延迟和高吞吐两种极端场景下都表现出色,说明这颗芯片不是”偏科生”,而是全面型选手。

    OpenAI 在博文中写道:”OpenAI 模型也加速了 Jalapeño 的开发。”这句话暗示了一个有趣的正反馈循环——OpenAI 用自家模型优化自家芯片,再用更好的芯片跑更强的模型。

    二、从 9 个月到量产:Broadcom 的速度与 OpenAI 的野心

    Jalapeño 的诞生速度本身就是行业奇迹。

    2026 年 6 月 24 日,OpenAI 和 Broadcom 联合发布了这颗芯片。从设计到流片,整个周期只用了 9 个月。要知道,传统芯片从设计到量产通常需要 18-24 个月。

    Broadcom 提供了定制 ASIC 的设计和制造能力,而 OpenAI 贡献了对 LLM 推理工作负载的深度理解。两者的结合产生了一颗专门为大语言模型推理优化的芯片——不是通用 GPU,而是”为这个特定任务而生”的专用处理器。

    芯片采用超大规模光罩(massive reticle-sized)设计,这在业界极为罕见,意味着单颗芯片的面积接近光刻机的物理极限。更大的芯片面积 = 更多的计算单元 = 更高的推理吞吐量。

    三、为什么 Nvidia 被超越?自研芯片的逻辑

    要理解 Jalapeño 为什么能超越 Blackwell,需要看清一个底层逻辑:通用芯片 vs 专用芯片

    Nvidia 的 GPU 是为图形渲染设计的,后来被”借用”来做 AI 计算。它的强大在于通用性——什么都能跑,但什么都不是最优解。Blackwell 是 Nvidia 最新的 AI 专用 GPU,但仍然是 GPU 架构,保留了大量图形渲染相关的冗余电路。

    Jalapeño 则完全不同。它从第一行代码开始就是为 LLM 推理设计的。没有图形渲染单元,没有通用计算的冗余,每一个晶体管都在为”让下一个 token 更快生成”服务。这种极致的专用化,让它在特定任务上能以更少的能耗完成更多的工作。

    这不是 Nvidia 的技术失败,而是商业逻辑的必然。当一个客户(OpenAI)的推理工作负载大到一定程度,自研专用芯片的经济账就算得过来了。

    四、AI 芯片格局:从 Nvidia 一家独大到多极竞争

    Jalapeño 的出现,标志着 AI 芯片市场从”谁买得到 Nvidia”进入”谁造得出更好的芯片”的新阶段。

    对 Nvidia 的影响:短期影响有限。OpenAI 明确表示将继续使用 Nvidia 和其他合作伙伴的加速器来满足不断增长的算力需求。Jalapeño 是补充,不是替代。但长期来看,如果每个大型 AI 公司都开始自研芯片,Nvidia 的市场份额将被逐步蚕食。

    对 Broadcom 的意义:这是 Broadcom 在 AI 芯片代工领域的标志性胜利。如果说台积电是 GPU 的制造者,Broadcom 正在成为定制 AI 芯片的设计伙伴。

    对 AI 行业的启示:自研芯片不再是 Google TPU 那样的”学术实验”,而是大型 AI 公司的标配。当你的推理成本占到运营成本的大头时,造自己的芯片就成了理性选择。

    但有一个关键变量:Nvidia 的下一代芯片 Rubin 已经在向客户出货,采用更先进的 HBM4 内存。Jalapeño 超越的是”上一代”Blackwell,面对 Rubin 时结果可能不同。这场芯片竞赛,远没有到终局。

    五、小结:推理芯片是 AI 的下一个战场

    Jalapeño 的实测数据证明了一件事:在 AI 推理这个价值数千亿美元的市场上,Nvidia 的护城河不是不可逾越的

    OpenAI 用 9 个月造出了一颗能超越 Blackwell 的芯片。明年,它会用 Rubin 级别的技术造出更强的下一代。当每个 AI 巨头都有自己的芯片团队时,算力成本将加速下降,AI 应用的普及也将随之提速。

    芯片战争的下半场,已经开始了。

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    277k Star的AI编程方法论Superpowers深度评测:不是让AI更聪明,而是让AI更有纪律

    2025 年 10 月,Perl 社区传奇人物 Jesse Vincent 发布了 Superpowers——一套为 AI 编程代理设计的完整软件开发方法论框架。不到一年,这个项目在 GitHub 上拿下了 277,000+ Star,成为 AI 编程工具生态中增速最快的项目之一。据 GitHub 数据显示,该项目已有 24,800+ Fork、681 次提交、100+ 贡献者,支持 Claude Code、Codex、Cursor、Devin、Gemini CLI 等 12+ 个主流编程平台。

    Superpowers 的核心理念只有一句话:让 AI 先停下来想清楚,再动手。它不是新模型,不是 MCP 服务器,而是由 15+ 个可组合 Skills 组成的工程化开发方法论,自动注入到每次 AI 编程会话中,强制执行”需求澄清→计划→TDD→Code Review”的完整流程。据 Datawhale Easy-Vibe 教程评价,Superpowers 把 Claude Code 从”聪明的实习生”升级为”有纪律的开发团队”。

    为什么 AI 编程需要”方法论”?

    用过 Claude Code 的人都遇到过这个痛点:你说”帮我做个登录功能”,AI 立刻开始写代码,不问你用什么认证方式、要不要记住密码、密码重置走邮件还是短信。结果写出来的东西一半不是你要的,返工成本比从头来还高。

    据 Hacker News 社区讨论,资深工程师 d–b 评论道:”我个人不太喜欢 Superpowers。我的老板喜欢。我觉得用 Superpowers 时 Claude 犯的错反而更多。但也许是我的问题。”另一位用户 tao_oat 则表示:”brainstorming skill 确实很棒,它帮助把模糊的早期想法具体化。我特别喜欢它用子代理对抗性审查自己的 spec/plan,这确实捕获了几个我本会遗漏的问题。”

    这种分歧恰好说明了 Superpowers 的定位:它不是让 AI 更聪明,而是让 AI 更有纪律。对于已经有成熟工程管理经验的资深开发者,Superpowers 的流程可能显得多余;但对于需要长期维护的生产级项目、团队协作场景、或者缺少流程纪律的开发者,它几乎是必装的。

    15+ Skills 如何工作?

    Superpowers 包含 15+ 个可组合的 Skills,覆盖软件开发生命周期的每个阶段。其核心工作流分为 7 步:

    步骤 Skill 功能
    1 brainstorming 苏格拉底式需求澄清,通过提问厘清模糊需求
    2 using-git-worktrees 创建隔离工作区,验证测试基线
    3 writing-plans 将大任务拆成 2-5 分钟的小任务,含文件路径和验证步骤
    4 subagent-driven-development 每任务派独立子代理,两阶段审查(spec 合规→代码质量)
    5 test-driven-development 强制 RED-GREEN-REFACTOR TDD 循环
    6 requesting-code-review 按严重级别报告问题,Critical 问题阻断进度
    7 finishing-a-development-branch 验证测试、选择 merge/PR/保留/丢弃

    据 Reddit r/ClaudeCode 社区 2026 年 2 月的反馈:”用了 Superpowers 之后,每个阶段都得到了应有的关注。没有跳过步骤,没有跳过验证。输出结果终于和我规划的一致了。”而 2026 年 6 月的另一条反馈则指出:”它让我慢了很多,消耗了更多 token,比普通计划更快达到限额。”

    安装与使用建议

    Superpowers 的安装极其简单,一条命令即可完成:

    # Claude Code 官方市场

    /plugin install superpowers@claude-plugins-official

    # 或 Superpowers 自有市场

    /plugin marketplace add obra/superpowers-marketplace

    /plugin install superpowers@superpowers-marketplace

    其他平台也有对应的安装方式:Codex 用 /plugins 搜索安装,Cursor 用 /add-plugin superpowers,Gemini CLI 用 gemini extensions install,Devin 用 devin plugins install。完整安装指南见 GitHub 仓库

    最佳使用场景:

    • 生产级项目开发:需要长期维护的代码,流程纪律能减少技术债
    • 团队协作:brainstorming → plan → review 的文档链路天然适合交接
    • 非资深工程师:缺少流程纪律的人,Superpowers 相当于”强制 best practices”

    不建议使用的场景:

    • 快速原型/一次性脚本:流程开销大于收益
    • Token 预算敏感:全流程 token 消耗是裸 Claude Code 的 3-5 倍
    • 资深工程师的个人项目:你可能已经自然地做了 Superpowers 强制的事

    写在最后

    Superpowers 是目前 AI 编程领域最成熟的工程化方法论框架,277k Star 实至名归。它的价值不在于让 AI 更聪明,而在于让 AI 更有纪律。如果你在写需要长期维护的生产级代码,它几乎是必装的;如果你只是快速原型或简单脚本,它的流程开销反而会拖慢你。

    值得关注的是,Superpowers 与 ECC(242k Star,Agent Harness 操作系统)、Caveman(100k Star,Token 压缩 65%)三者互补而非互斥:Superpowers 提供方法论,ECC 提供功能平台,Caveman 提供效率优化。对于预算敏感的开发者,”Superpowers + Caveman”的组合可能是性价比最高的选择。

    关注 AI商业快讯,每天一篇 AI 热点深度解读。

    相关阅读:

    Manus AI:Meta 20亿美元收购被叫停,中国AI Agent龙头被迫独立的背后

    Manus AI:Meta 20亿美元收购被叫停,中国AI Agent龙头被迫独立的背后

    资讯摘要

    据路透社、CNBC 等多家媒体报道,中国 AI Agent 公司 Manus(前身 Butterfly Effect/Monica.im)于 8 月 11 日宣布将恢复独立运营,此前 Meta 于 2025 年 12 月以超过 20 亿美元收购 Manus 的交易被中国国家发改委于 2026 年 4 月以国家安全为由正式否决。8 月 23-24 日,Manus 按照中国监管要求删除了部分用户数据(涉及 2025 年 12 月 29 日 Meta 交易公告后生成的数据),标志着这家估值一度达 5 亿美元的 AI Agent 龙头正式回归独立。

    这是中国首次以国家安全为由否决 AI 领域的跨境并购,也是 AI Agent 赛道迄今金额最大的一桩「反向收购」——从 20 亿美元的全球 AI 并购标杆,到被迫退还买家、数据清洗、独立求生,Manus 的遭遇折射出中美 AI 地缘博弈的深层逻辑。

    为什么值得关注

    AI Agent 赛道的「分水岭时刻」。 Manus 是全球首个实现大规模商业化的通用 AI Agent——2025 年 3 月发布后 8 个月内,年化收入(ARR)从零飙升至 1.25 亿美元,月环比增长超过 20%,付费用户达数百万。正是这种爆发式增长引发了 Meta 的收购兴趣,也触发了中国监管的警觉。

    跨境 AI 投资的风险重估。 中国发改委的否决令不仅是对 Manus 一家的影响——它向全球投资者发出了明确信号:涉及中国 AI 技术的跨境并购将面临前所未有的审查。Benchmark、腾讯、红杉中国(HongShan)等 Manus 的既有投资者,以及所有布局中国 AI 赛道的国际资本,都需要重新评估政策风险。

    AI Agent 的商业价值已被验证。 Manus 证明了通用 AI Agent 不是实验室玩具——它能独立完成复杂任务(研究、编程、数据分析、旅行规划),且用户愿意为此付费。这意味着 AI Agent 赛道的估值逻辑已经从「讲故事」转向「看收入」。

    Manus 事件时间线

    时间 事件
    2022 年 创始人肖弘创立 Butterfly Effect,推出 Monica 浏览器插件
    2025 年 3 月 Manus 正式发布,定位「全球首个通用 AI Agent」
    2025 年 4 月 Benchmark 领投 7500 万美元 Series B,估值 5 亿美元
    2025 年 12 月 17 日 Manus 宣布 ARR 突破 1 亿美元,月环比增长 20%+
    2025 年 12 月 29 日 Meta 宣布以超过 20 亿美元收购 Manus
    2026 年 1 月 中国商务部启动调查,联合创始人被限制出境
    2026 年 4 月 27 日 中国发改委以国家安全为由否决交易
    2026 年 6 月 Sacra 数据显示 Manus 年化收入已达 4.5 亿美元
    2026 年 8 月 11 日 Manus 宣布恢复独立运营
    2026 年 8 月 23-24 日 按监管要求删除部分用户数据

    中国为何否决?

    中国发改委的否决逻辑可以归纳为三个层面:

    1. 数据主权。 Manus 的核心资产不仅是代码,更是数百万用户的行为数据和任务记录。一旦被 Meta 收购,这些数据将落入美国科技巨头手中,北京认为这构成国家安全风险。

    2. 技术外溢。 Manus 的 Agent 架构(自主规划、工具调用、多步骤执行)代表了 AI 领域最前沿的能力方向。中国不希望这类技术通过并购方式被美国公司消化吸收。

    3. 先例效应。 这是中国首次以 2021 年出台的《外商投资安全审查办法》否决 AI 领域的跨境并购。选择 Manus 这样高调的案例「杀鸡儆猴」,意在警告其他中国 AI 公司:不要试图通过「卖身」美国巨头来规避国内竞争。

    值得注意的是,据路透社报道,在交易被否决前,中国监管层曾一度收紧边境管控,阻止 Manus 联合创始人出境——这一细节凸显了事件的敏感程度。

    Manus 的独立生存挑战

    回归独立的 Manus 面临三大挑战:

    融资难题。 原本 20 亿美元的 Meta 交易泡汤后,据 LinkedIn 上的报道,中国投资者曾尝试以同等价格从 Meta 手中买回 Manus。但独立运营意味着 Manus 需要自行寻找下一轮融资,而在中美地缘紧张的背景下,国际投资者会更加谨慎。

    用户信任重建。 8 月 23-24 日的数据删除直接影响了部分用户的使用体验。虽然 Manus 官方称将在删除后恢复服务,但「数据曾被删除」这一事实本身就可能影响用户对平台稳定性的信心。

    竞争加剧。 在 Manus 与 Meta 纠缠的 8 个月里,竞争对手并未停下脚步——OpenAI 的 Operator、Anthropic 的 Computer Use、Google 的 Project Mariner 都在快速迭代。Manus 需要证明,独立运营后它仍能保持技术领先。

    对不同角色的启示

    对创业者: Manus 的遭遇是一记警钟——如果你的公司涉及敏感技术,跨境并购可能不是退出的最优解。在当前地缘格局下,「独立发展 + 多元融资」可能比「卖身巨头」更安全。

    对投资者: 投资中国 AI 公司前,务必将「政策风险」纳入估值模型。Manus 的 Series B 投资者 Benchmark 以 5 亿美元估值入场,原本有望通过 Meta 收购获得 4 倍回报,如今却面临退出路径不确定性。

    对从业者: Manus 证明了 AI Agent 的商业化可行性——1.25 亿美元 ARR(后增至 4.5 亿)是真实存在的市场需求。如果你在做 AI Agent 相关的产品,现在是加速的好时机。

    结语

    Manus 的故事远未结束。它既是中国 AI 产业在全球化与自主化之间寻找平衡的缩影,也是 AI Agent 商业化进程中的标志性事件。接下来,Manus 能否在独立运营后重拾增长势头、能否获得新一轮融资、能否在与 OpenAI/Anthropic/Google 的竞争中守住阵地——这些问题的答案将深刻影响整个 AI Agent 赛道的走向。

    关注 AI商业快讯,每天一篇 AI 热点深度解读。

    相关阅读:
    OpenAI AI Agent 失控黑进 Hugging Face:AI 安全红线被正式触发
    60亿美元授权+109名员工:英伟达第三次上演「反向收购」,AI创业公司出路在哪?

    实测12款大模型能力增强Skills:从行为纠偏到自我进化,星标最高24万

    实测12款大模型能力增强Skills:从行为纠偏到自我进化,星标最高24万

    调研日期:2026-08-24

    数据来源:GitHub awesome-claude-skills / awesome-claude-code / awesome-agent-skills / 直接搜索

    筛选标准:星标 ≥1k、近30天有更新、有真实用户使用

    生态全景速览

    平台 星标 Skills数量 特点
    ComposioHQ/awesome-claude-skills 73.1k★ 50+ Claude Code 专属生态
    hesreallyhim/awesome-claude-code 52.9k★ 100+ 精选高质量skill+工具
    VoltAgent/awesome-agent-skills 31.3k★ 1497+ 跨平台兼容,官方团队维护
    GitHub 直接搜索 2000+ 覆盖全领域

    核心发现:提升大模型能力的skills主要集中在 6 个方向——行为调优、Token优化、规划管理、自我进化、知识增强、提示工程。

    Tier 1:必收(行为/输出质量优化)

    1. ECC — Agent Harness 性能优化系统

    • 仓库affaan-m/ECC — 242.5k★ / 36.7k fork
    • 核心能力

    – 68个专业Agent(规划/审查/构建/安全/领域/文档)

    – 286个Skill覆盖全流程

    – 15种Hook事件强制执行质量标准

    – AgentShield安全扫描(prompt注入/Hook完整性/MCP审计)

    – Memory Vault跨会话记忆持久化

    • 为什么收:这是”Agent Harness Operating System”,不是单一skill。它重新定义了Agent的行为框架,从根上提升输出质量和一致性。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code(稳定)/ Codex / Cursor / OpenCode

    2. Andrej Karpathy Skills — 行为纠偏CLAUDE.md

    – 基于Karpathy对LLM编码陷阱的观察

    – 单文件CLAUDE.md即可改善行为

    – 避免过度自信、幻觉代码、忽视上下文

    • 为什么收:200k+星标验证了”行为纠偏”是刚需。单文件方案零安装成本,立竿见影。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code

    3. Taste-Skill — 品味提升

    – 赋予AI”好品味”,停止生成无聊、通用的内容

    – 避免AI slop(AI生成的低质量内容)

    – 提升代码/文本的审美和质量标准

    • 为什么收:解决LLM输出”正确但平庸”的问题。品味是区分AI和人类输出的关键。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Cursor / Codex

    Tier 1:必收(Token/上下文优化)

    4. Caveman — Token压缩65%

    – 6级强度:lite / full / ultra / wenyan 等

    – 输出Token减少65%(实测)

    – 保留全部技术准确性

    – 支持安全警告时自动恢复完整表达

    • 为什么收:Token = 成本 + 速度。65%压缩意味着同样的预算能做3倍的事。已在我司部署验证。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Minis

    5. Planning-with-Files — 持久化规划

    – 崩溃恢复的Markdown计划文件

    – Session recovery(/clear和compaction后恢复)

    – 每轮重新注入防上下文腐烂

    – 确定性完成门控

    – Manus风格

    • 为什么收:长任务的核心痛点是”上下文丢失”。这个skill用文件系统解决,简单但有效。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / Cursor / OpenCode / 60+ agents

    Tier 1:必收(自我进化)

    6. Darwin-Skill — Skill自我进化系统

    – 评估→改进→测试→保留/回滚 完整闭环

    – Autoresearch-inspired自主优化

    – 无需手动调参,自动探索最优配置

    • 为什么收:这是”AI优化AI”的实现。Skill可以自我进化,持续提升能力上限。
    • 评分:易用性 ⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code

    Tier 2:精选(提示工程)

    7. Prompt-Master — 提示词生成

    – 为任意AI工具生成精确提示词

    – 零Token/积分浪费

    – 完整上下文和记忆保持

    • 为什么收:好的提示词 = 好的输出。这个skill让”写提示词”这件事本身也被AI优化。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / 通用AI工具

    Tier 2:精选(知识增强)

    8. ARIS — 自主ML研究

    – 跨模型审查循环

    – 创意发现和实验自动化

    – 轻量级纯Markdown,无框架依赖

    – 支持Claude Code / Codex / OpenClaw

    • 为什么收:让Agent在你睡觉时自动做研究。是”异步增强”的典范。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / OpenClaw

    9. Graphify — 代码库知识图谱

    – 将代码库+文档+SQL Schema+配置+PDF转为可查询知识库

    – 结构化知识提取

    – 增强Agent对大型项目的理解

    • 为什么收:大模型对大型代码库的理解受限于上下文窗口。Graphify用知识图谱突破这个限制。
    • 评分:易用性 ⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex

    10. Khazix-Skills — 多维度增强合集

    – leader:帮你定义目标

    – neat-freak:洁癖(代码/文件整洁度)

    – hv-analysis:高水平分析

    – khazix-writer:写作增强

    • 为什么收:中文社区最受欢迎的skill合集之一,覆盖目标设定→执行→输出全链条。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / 40+ agents

    Tier 2:精选(综合能力包)

    11. Claude-Skills 345合集

    – 345个skill + 30+ Agents + 70+ 自定义命令

    – 覆盖:工程/营销/产品/合规/C级顾问/研究/商业运营/财务/日常效率

    – 跨平台:Claude Code / Codex / Gemini CLI / Cursor 等8+平台

    • 为什么收:最全面的”一站式”skill包。适合需要全栈能力的团队。
    • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
    • 适用平台:Claude Code / Codex / Gemini CLI / Cursor 等

    12. Last30Days — 实时研究

    – 跨Reddit / X / YouTube / HN / Polymarket / Web研究

    – 综合分析生成有依据的摘要

    – 解决LLM”知识截止日期”问题

    • 为什么收:LLM最大的弱点之一是”不知道最近发生了什么”。这个skill实时补充外部知识。
    • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
    • 适用平台:Claude Code

    场景推荐

    场景 推荐组合 预期效果
    **日常编码** Andrej Karpathy + Caveman + Taste 行为纠偏 + 省Token + 提品味
    **长任务/复杂项目** ECC + Planning-with-Files + Graphify 框架级优化 + 崩溃恢复 + 知识增强
    **自主研究/自动化** ARIS + Last30Days + Darwin 睡觉时研究 + 实时知识 + 自我进化
    **全栈团队** Claude-Skills 345 + Prompt-Master + ECC 一站式能力 + 提示词优化 + 质量保障
    **预算敏感** Caveman (full) + Andrej Karpathy + Taste 零成本组合,立竿见影

    推荐安装优先级

    立即安装(0配置,即时生效):

    1. Andrej Karpathy Skills — 单CLAUDE.md文件
    2. Caveman — 超压缩模式
    3. Taste — 品味提升

    短期部署(需简单配置):

    1. ECC — 完整Agent Harness
    2. Planning-with-Files — 长任务支持
    3. Last30Days — 实时知识

    中期规划(需评估集成):

    1. Darwin-Skill — 自我进化
    2. Graphify — 知识图谱
    3. Prompt-Master — 提示词优化

    与已有调研的关系

    • Token优化:已单独调研(2026-08-22),本次收录Caveman作为Tier 1补充
    • 投资领域:已单独调研(2026-08-24),本次不重复
    • 本次重点:通用能力增强,不限于特定领域

    后续调研方向

    1. MCP Server生态:工具调用能力增强
    2. 多模态增强:图像/音频/视频处理skill
    3. 安全与合规:Agent安全审计skill
    4. 垂直领域深挖:医疗/法律/金融专业skill