CSS样式测试-可删除

测试表格样式:

列A 列B
数据1 数据2
数据3 数据4
分类 未分类

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

AI 编程代理的账单正在失控。一个中度使用 Claude Code 的开发者,日均消耗 50 万 token,按 Claude Sonnet 5 定价月费约 $150。重度用户日均 200 万 token,月费突破 $600。而这些 token 里,至少 40% 是”废话”——客套话、填充词、重复解释、格式修饰。

JuliusBrussee 在 2026 年 4 月发布的 Caveman skill,用一个激进的思路解决了这个问题:让 AI 说”洞穴语”。去掉所有修饰,只留技术实质。结果?输出 token 平均减少 65%。这个 skill 在 4 个月内拿到 99,628 颗星,成为 GitHub 上增长最快的 AI skill 之一。

但输出压缩只是故事的一半。2026 年 8 月发布的 Caveman 2.0 新增了本地代理(Proxy),可以压缩 Agent 读入的内容——包括工具返回的日志、JSON 配置、代码文件。在官方基准测试中,代理输入 token 减少了 33.2%,且所有 18 个精确答案检查全部通过。

Caveman 怎么工作的?

Caveman 分两层运作:输出 skill(原始功能)和输入代理(2.0 新增)。

输出 Skill:让模型少说话

核心机制是一份 ~5KB 的系统提示词(SKILL.md),注入到 Agent 的上下文中。这份提示词定义了一套”洞穴语”写作规则:

  • 删除冠词(a/an/the)、填充词(just/really/basically)、客套话(sure/certainly/happy to)
  • 允许片段句、短同义词(big 代替 extensive)
  • 禁止工具调用前的解说、装饰性表格、冗长错误日志
  • 保留全部技术实质:代码块、API 名、错误信息、数字原样不动
  • 支持 6 种强度:lite / full(默认) / ultra / wenyan-lite / wenyan-full / wenyan-ultra

例如,解释”React 组件为什么重渲染”:

普通回答(69 token):

The reason your React component is re-rendering is likely because you’re creating a new object reference on each render cycle. When you pass an inline object as a prop, React’s shallow comparison sees it as a different object every time, which triggers a re-render. I’d recommend using useMemo to memoize the object.

Caveman 回答(19 token):

New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

同一个修复方案,token 消耗减少 72%。

输入代理:让模型少读东西

Caveman 2.0 的核心创新是本地代理(Caveman Proxy)。它以 sidecar 模式运行在你的机器上,Agent 的所有 API 请求都经过它转发。代理对不同类型的载荷(payload)执行针对性压缩:

载荷类型 保留内容 压缩目标
JSON 键、结构、错误子树;折叠重复数组 70–90%
日志 错误、堆栈、首尾行;丢弃 INFO 和进度噪声 85–95%
代码 import、签名、类型;省略函数体 40–70%
Diff 文件/块头和变更行;省略重复上下文 60–80%
搜索结果 顶部/底部命中 + 诊断/安全命中 80–95%
文本/HTML 标题、首尾上下文、重要段落 50–80%

关键安全机制:CCR(Content-Addressed Recovery)。原始字节在任何有损变换之前,先存入本地磁盘的内容寻址存储。Agent 通过 caveman_retrieve 随时取回原始数据。解析失败或压缩后更大时,直接透传原始字节。

还有一个大胆的功能:Pixel 模式。将密集文本渲染成 PNG 图片,让视觉模型直接”看图”而非读文本。在 63.7k 字符的 JSON 工具目录上,55,413 个文本 token 被压缩为 11,402 个图片 token,减少 79%。

功能拆解

1. 输出 Skill(原始功能)

一句话:让 AI 用洞穴语回答,输出 token 平均减 65%。

  • 6 种强度级别,从轻度去修饰(lite)到中文文言文(wenyan)
  • 代码块、命令、错误信息完全保留,不压缩技术内容
  • 支持 30+ Agent:Claude Code、Codex、Gemini CLI、Cursor、Windsurf、Cline 等
  • 附带子命令:/caveman-commit(简洁提交信息)、/caveman-review(一行审查)

适用场景:日常编码对话、代码审查、文档生成——所有”输出长、重复多”的场景。

2. Caveman Proxy(2.0 输入压缩)

一句话:本地代理压缩 Agent 读入的所有内容,输入 token 减 33.2%。

  • 基于 Go 的本地代理,零云端依赖
  • 8 个原生 wrap 配置:Claude Code、Codex、Gemini CLI、Aider、opencode、Hermes、OpenClaw、Pi
  • caveman learn 扫描历史会话,输出 token 消耗排名和优化建议
  • caveman learn implement 让 Agent 自己修复发现的问题,逐个确认

适用场景:长会话、大量工具调用、日志密集型任务——所有”输入 token 爆炸”的场景。

3. Pixel 模式

一句话:把文本渲染成 PNG,用视觉 token 替代文本 token。

  • 只在长行密集内容上有利(JSON 工具目录、长日志)
  • 短行稀疏代码不划算,PNG 开销超过节省
  • 通过 caveman convert 可以将 SKILL.md 本身转为图片,省 61%

适用场景:大量 JSON/日志处理、工具 schema 注入。

4. 辅助工具集

工具 功能
caveman learn 扫描真实历史,输出 Cave Score + token 浪费排名
caveman shrink 压缩命令输出,可恢复
caveman browse 本地 Chrome 的压缩 a11y 树,121 token vs Playwright 的 15,704 token
caveman mem 持久化记忆,支持原始字节恢复
caveman trial A/B 测试真实会话
caveman stats 查看实际压缩统计

实测数据

输出压缩:官方 Benchmark

Caveman 仓库提供了 10 个标准化任务的对比数据:

任务 普通输出 (token) Caveman 输出 (token) 节省
解释 React 重渲染 1180 159 87%
修复 auth 中间件 704 121 83%
PostgreSQL 连接池 2347 380 84%
Git rebase vs merge 702 292 58%
回调重构为 async/await 387 301 22%
微服务 vs 单体架构 446 310 30%
PR 安全审查 678 398 41%
Docker 多阶段构建 1042 290 72%
PostgreSQL 竞态调试 1200 232 81%
React Error Boundary 3454 456 87%
平均 1214 294 65%

诚实数字警告:输出 skill 本身每次对话增加 ~1–1.5k 输入 token(SKILL.md 注入成本)。如果输出本身已经很简洁,净节省可能为负。官方建议:对你的实际工作负载做 A/B 测试。

输入压缩:Wrap Benchmark

在 6 个确定性工具输出负载上,54 次运行(每个 arm 18 次)的对比:

指标 数值
直连 Claude Code 输入 token 885,793
Caveman 代理输入 token 591,673
减少比例 33.2%
95% 置信区间 14.6% – 48.5%
精确答案通过率 18/18(100%)

分负载看,日志压缩最猛(50.2%),JSON/YAML 次之(26–46%),HTML 因无压缩变换反而微增(-9.9%)。

成本估算

以 Claude Sonnet 5 定价(输入 $3/M,输出 $15/M)计算:

场景 日均 token 无 Caveman 月费 有 Caveman 月费 月省
轻度(50万输入+10万输出) 60万 $195 $145 $50
中度(200万输入+50万输出) 250万 $750 $525 $225
重度(500万输入+200万输出) 700万 $1,800 $1,260 $540

注:以上为理想情况。实际节省取决于输出长度、会话长度、负载类型。如果输出已经很简洁,skill 的固定输入成本可能超过节省。

一个真实例子

Before(无 Caveman):

I’d be happy to help you debug that race condition. The issue you’re experiencing is likely caused by multiple concurrent writes to the same database record without proper locking. Let me walk you through the fix step by step. First, we need to add a mutex lock around the critical section…

After(Caveman full):

Race condition: concurrent writes without lock. Add mutex around critical section:
mu.Lock()
defer mu.Unlock()
Check isolation level — READ COMMITTED may still allow phantom reads.

同样的诊断,从 5 行客套变成 3 行干货。

安装 + 适用场景 + 结语

安装

输出 Skill(最简单):

npx skills add JuliusBrussee/caveman

一行命令,立即生效。Claude Code 用户也可以:

claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman

输入代理(完整安装):

npm install -g @caveman-ai/cli && caveman setup --install
caveman claude        # 你的 agent 名

谁最适合用?

  • 高频 AI 编程用户(日均 >100 次对话):输出 + 输入双压缩,月省 $50–500+
  • 长会话重度用户(单会话 >50 轮):输入压缩效果随会话长度递增
  • 日志/JSON 密集型任务:代理对这类负载压缩 50–95%
  • 成本敏感的团队:统一部署到所有开发者,集体省钱

谁不需要?

  • 短问答为主的轻度用户:skill 固定输入成本可能吃掉节省
  • 按请求计费的平台(如 GitHub Copilot):缩短回答不减少请求数
  • 输出已经很简洁的 Agent:净节省可能为负

对不同角色的意义

  • 个人开发者:每月省 $50–200,相当于免费用一个月 Claude Pro
  • 技术团队:10 人团队年省 $6,000–60,000,够雇一个初级工程师
  • AI 产品经理:理解 token 经济学,优化 Agent 的成本结构

结语

Caveman 从一个 meme 级的”洞穴语”提示词,演变成了一个完整的 token 优化系统。输出压缩 65%、输入压缩 33%、Pixel 模式 79%——这些数字背后是扎实的工程:内容寻址恢复、按类型压缩、A/B 基准测试框架。

它不是银弹。短会话、简洁输出、按请求计费的场景下可能净亏损。但对于日均百万 token 级别的重度用户,Caveman 可能是目前 ROI 最高的 AI 成本优化工具。

GitHub 仓库:JuliusBrussee/caveman(99,628★,MIT + BSL 双许可)

延伸阅读:

本文数据来源:JuliusBrussee/caveman GitHub 仓库 README、docs/HONEST-NUMBERS.md、docs/WRAP-BENCHMARK.md。所有基准测试数据均为官方发布,未独立验证。作者使用过 Caveman skill 进行实际编码工作。

Etched 估值一个月翻倍至 210 亿美元:Transformer 专用芯片路线获资本疯狂押注

Etched 估值一个月翻倍至 210 亿美元:Transformer 专用芯片路线获资本疯狂押注

AI 芯片赛道正在上演一场疯狂的估值竞赛。据 TechCrunch 8 月 19 日报道,专注 Transformer 推理的 ASIC 芯片初创公司 Etched 估值在一个月内翻倍,达到 210 亿美元。这是继 Cerebras 昨日发布 CS-4 之后,AI 算力领域又一重磅信号——资本市场正在用真金白银押注”GPU 之外”的推理芯片路线。

从 100 亿到 210 亿:一个月发生了什么

Etched 成立于 2022 年,总部位于加州圣克拉拉,由前 Groq 工程师 Gavin Uberti 和 Chris Zhu 创立。公司核心产品是一款名为”Sohu”的专用芯片,专为 Transformer 模型推理设计。与通用 GPU 不同,Sohu 将 Transformer 的注意力机制直接固化在硅片上,号称在 Llama 70B 等大模型上可实现每秒 50 万 token 的推理速度。

一个月前,Etched 刚完成一轮融资,估值约 100 亿美元。如今翻倍至 210 亿,背后推动力来自两个方面:一是企业级 AI 推理需求的爆发式增长,二是 Nvidia GPU 供不应求且价格高企,迫使下游客户寻找替代方案。据 The Information 此前报道,Etched 的投资者阵容包括 Peter Thiel 的 Founders Fund、Qualified Capital 等顶级 VC。

为什么资本市场疯狂押注 ASIC 路线

要理解 Etched 的估值逻辑,需要看清 AI 推理市场的结构性变化:

推理需求已超过训练需求。随着 GPT-5、Claude 4 等大模型进入大规模部署阶段,全球推理算力消耗已远超训练阶段。据 Stanford HAI 报告,2025 年推理算力支出首次超过训练,占比达 58%。这意味着”谁能用更低成本提供更快推理”将成为下一个万亿级市场的核心竞争力。

GPU 的”过度通用”成为负担。Nvidia H100/B200 是为训练和推理双重场景设计的通用芯片,但在纯推理场景下,大量晶体管面积被浪费在训练专用的 FP64 精度和反向传播电路上。Etched 的 Sohu 芯片只保留 Transformer 推理必需的组件,用面积换速度,用专注换效率。

Transformer 已成为”事实标准”。尽管学术界不断提出新架构(Mamba、RWKV、xLSTM),但在商业部署中,Transformer 及其变体(GQA、MLA)仍然占据 95% 以上的市场份额。Etched 的赌注是:如果 Transformer 至少还要统治 3-5 年,那么为它造专用芯片就是一门好生意。

Sohu 芯片的技术差异化

与 Cerebras 的”晶圆级计算”路线不同,Etched 选择了另一条极端路径——将 Transformer 的注意力计算直接硬编码进芯片。这意味着:

极致的推理速度。据 Etched 官方数据,Sohu 在 Llama 70B 上的推理速度是 H100 的 10 倍以上。对于需要实时流式输出的应用(聊天机器人、代码生成、实时翻译),这种速度差异直接转化为用户体验的巨大提升。

更低的单 token 成本。由于去掉了训练所需的冗余电路,Sohu 的芯片面积利用率更高,理论上可以在相同硅片面积上提供更高的 token/瓦特比。对于大规模部署的企业客户,这意味着每年数百万美元的运营成本节省。

但灵活性是最大短板。Sohu 只能运行 Transformer 架构,如果未来出现架构范式转移(比如 Mamba 系列在长序列场景全面超越 Transformer),这颗芯片将面临”专用变无用”的风险。这也是为什么 Etched 的估值虽然高,但争议同样巨大。

对行业意味着什么

对芯片从业者:AI 推理芯片赛道正在从”概念验证”进入”规模量产”阶段。Etched 的 210 亿估值证明,只要能拿出可验证的性能数据,资本市场愿意为”后 Nvidia 时代”的潜在赢家支付高溢价。但这也意味着窗口期正在收窄——如果 2027 年还无法大规模出货,先发优势将被稀释。

对企业 AI 负责人:如果你的推理工作负载以 Transformer 为主(大概率是),Etched 的 Sohu 值得进入技术评估清单。但现阶段建议采用”双轨策略”:主力继续用 Nvidia GPU 保持灵活性,同时用小规模集群测试 ASIC 方案的实际性能和稳定性。

对投资者:AI 芯片赛道的”军备竞赛”正在加速。Cerebras(SRAM 路线)、Etched(ASIC 路线)、Groq(LPU 路线)、Tenstorrent(RISC-V 路线)各自押注不同的技术方向。短期内,Nvidia 仍是绝对霸主,但 2027-2028 年将是格局重塑的关键窗口。关注 Etched 的出货时间表和首批标杆客户落地情况。

写在最后

一个月估值翻倍至 210 亿美元,Etched 正在用最激进的方式宣告:AI 推理芯片的”后 Nvidia 时代”已经到来。但正如所有硬科技创业一样,从 PPT 到量产之间,横亘着良率、生态、客户信任三座大山。2027 年将是 Etched 的”证明之年”——要么用出货数据兑现承诺,要么面对估值回调的残酷现实。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

AI Agent Skill 生态爆发式增长,GitHub 上已有 1497+ 个官方/社区 skill。本文基于 awesome-agent-skills(30.6k★)、awesome-claude-code(52.7k★)和 awesome-claude-skills(72.9k★)三大索引,结合 GitHub 星标和活跃度,精选出 2026 年 8 月最热门的 15 个 AI Skill

一、生态全景:1497+ Skill 的三大来源

截至 2026 年 8 月,AI Agent Skill 生态已形成三大索引体系:

索引 星标 Skill 数 特点
ComposioHQ/awesome-claude-skills 72.9k★ 1497+ 官方团队(Anthropic/Google/Stripe/Cloudflare)+ 社区精选
hesreallyhim/awesome-claude-code 52.7k★ 精选 100+ 手工策展,质量最高,每条有详细评测
VoltAgent/awesome-agent-skills 30.6k★ 1497+ 跨平台兼容(Claude Code/Cursor/Gemini CLI/Copilot)

覆盖领域:办公文档 / 前端设计 / 营销 / 科研 / 安全 / DevOps / 游戏开发 / 视频制作

二、Tier 1:必收的 5 个王炸 Skill

1. ECC(Enhanced Claude Code)— Agent 性能优化系统

星标:241,448 ★

  • 核心能力:Skills 性能优化 + Instincts 本能系统 + Memory 记忆持久化 + Session 管理
  • 为什么收:全网最高星标的 AI Agent skill,不是单一功能,而是一套完整的 Agent 增强框架。安装后 Claude Code 的响应速度、代码质量、上下文管理全面提升
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code

2. Graphify — 代码库知识图谱

星标:108,679 ★

  • 核心能力:将任意代码库(含文档、SQL schema、配置、PDF)转化为可查询的知识图谱
  • 为什么收:解决大型项目上下文丢失的核心痛点。不再需要反复粘贴文件,Agent 自动理解项目全貌
  • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / Cursor / Windsurf

3. Anthropic Office 四件套(docx/xlsx/pptx/pdf)

官方出品,17 个 skill

  • 核心能力:Word 文档(跟踪修订+评论)/ Excel(公式+图表+金融模型规范)/ PowerPoint(模板填充+设计指导)/ PDF(提取+合并+表单+OCR)
  • 为什么收:Anthropic 官方维护,生产级质量,金融模型规范含大量避坑指南(pptxgenjs 12 个陷阱)。覆盖办公文档全流程
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code / Claude.ai

4. andrej-karpathy-skills — Karpathy 行为准则

星标:204,375 ★

  • 核心能力:4 条从 Andrej Karpathy 公开笔记提炼的 LLM 编码行为准则,注入 CLAUDE.md
  • 为什么收:安装成本为零(一个文件),效果立竿见影。Karpathy 对 LLM 编码陷阱的理解是业界顶级
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / 任何支持 CLAUDE.md 的工具

5. caveman — 超压缩输出模式

星标:99,612 ★

  • 核心能力:砍掉 65% 输出 token,保留全部技术实质(代码/报错/API 名/数字原样)
  • 为什么收:在 token 计费时代,每次对话省 65% 成本。支持 lite/full/ultra 三级强度,可随时切换
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code

三、Tier 2:精选的 5 个领域王者

Skill 星标 定位 亮点
academic-research-skills 43,162★ 学术研究全流程 研究→写作→审阅→修改→格式化,5 阶段 pipeline
marketing-skills 45,076★ 营销全套 CRO / 文案 / SEO / 数据分析,Claude Code 生态最全营销 skill
scientific-agent-skills 34,004★ AI 科学家 将任何 Agent 变成 AI 科研助手,覆盖 20+ 学科领域
cybersecurity-skills 30,351★ 网络安全 817 个结构化安全 skill,映射 MITRE ATT&CK 等 6 大框架
hallmark 26,163★ 反 AI 味设计 Anti-AI-slop 设计引擎,让 AI 生成内容看起来不像 AI 写的

四、Tier 3:值得关注的 5 个新锐

Skill 星标 定位 为什么值得关注
planning-with-files 26,265★ 持久化任务规划 解决长任务崩溃丢失进度的痛点,文件级持久化
reverse-skill 27,016★ 逆向工程 安全研究/授权渗透测试,覆盖 PE/ELF/Mach-O 多格式
huashu-design 23,343★ HTML 原生设计 中文开发者主导,Claude Code 里直接出 HTML 设计稿
khazix-skills 19,877★ 中文 AI 合集 数字生命卡兹克出品,含 leader/洁癖/hv-analyst 等中文原创
capcut-cli 精选收录 视频编辑 零依赖 CLI,可编程编辑剪映项目,205 个测试覆盖三端

五、官方团队 Skill 速览

以下团队均发布了官方 skill,质量有保障:

团队 Skill 方向 数量
Anthropic 办公四件套 + 设计 + MCP Builder + Web Testing + Internal Comms 17 个
Google Gemini API 开发 + Vertex AI + Live API + Interactions API 4 个
Stripe 支付集成最佳实践 + SDK 升级指南 2 个
Vercel Next.js 部署 + Edge Runtime 2 个
Cloudflare Workers + R2 + D1 集成 3 个
Supabase PostgreSQL 最佳实践 1 个
HashiCorp Terraform Provider 开发全流程 10 个
TestMu AI 46 种测试框架覆盖(Playwright/Jest/Pytest/Selenium…) 46 个

六、安装建议:3 步上手

Step 1:基础增强(5 分钟)

安装 andrej-karpathy-skills + caveman,零成本提升 Agent 基础能力。

Step 2:办公提效(10 分钟)

安装 Anthropic Office 四件套,覆盖 Word/Excel/PPT/PDF 全流程。

Step 3:按需扩展

根据你的领域选择 Tier 2/3 的 skill。科研选 academic-research-skills,营销选 marketing-skills,安全选 cybersecurity-skills。

七、趋势观察

1. Skill 从”功能补丁”进化为”能力系统”

头部 skill(ECC、Graphify)已不再是单一功能,而是完整的 Agent 增强框架。2026 年的 skill 竞争已从”谁功能多”转向”谁的系统设计好”。

2. 官方团队入场加速

Anthropic、Google、Stripe、Cloudflare 等一线团队均发布官方 skill,标志着 skill 生态从社区驱动进入官方+社区双轨时代。

3. 跨平台兼容成标配

VoltAgent 的 awesome-agent-skills 明确标注”兼容 Claude Code / Cursor / Gemini CLI / Copilot / Windsurf”,skill 的平台锁定正在被打破。

4. 中文生态崛起

huashu-design(23k★)、khazix-skills(19k★)等中文原创 skill 已进入全球前列。中国开发者在 AI skill 生态中的存在感显著增强。

八、数据来源与声明

本文数据采集自 2026 年 8 月 21 日,来源包括:

  • GitHub awesome-agent-skills(30,626★,1497+ skill)
  • GitHub awesome-claude-code(52,721★)
  • GitHub awesome-claude-skills(72,902★)
  • GitHub Search API(按星标排序)

星标数据为采集时快照,可能随时间变化。排名不代表绝对优劣,请根据实际需求选择。

AI 办公革命:6 个必装的文档处理技能

AI 办公革命:6 个必装的文档处理技能

Anthropic 在 2025 年底将 Agent Skills 标准开源后,办公文档处理领域迅速涌现出一批生产级技能。我们从 awesome-claude-skills(72.7k★)、Anthropic 官方仓库和 Cursor Directory(86.8k 开发者)中,筛选出 6 个最值得安装的文档处理技能——覆盖 Word、Excel、PPT、PDF 全格式,以及协作文档编辑和内部沟通两大高频场景。

为什么办公文档处理是 AI Agent 的必争之地

据 Gartner 预测,到 2026 年底全球 40% 的企业应用将嵌入 AI Agent,但目前仅有 16.3% 的企业深耕专业场景。办公文档处理恰恰是那个”高频、低门槛、高价值”的切入点——每个知识工作者每天都在和 Word、Excel、PPT、PDF 打交道,而这些工作的大量时间花在了格式调整、数据整理、模板填充等重复性劳动上。

2025 年 10 月 Anthropic 推出 Agent Skills 格式、12 月开源以来,文档处理类技能成为生态中质量最高、最成熟的品类。这不仅因为 Anthropic 官方投入了四个核心技能(docx/xlsx/pptx/pdf),更因为文档处理天然是”结构化输入→结构化输出”的任务,与 LLM 的能力高度契合。

我们实际测试了 15+ 个办公相关技能,从易用性、实用性和维护度三个维度打分,最终选出以下 6 个——它们要么是官方 production-ready 实现,要么在特定场景下解决了真实痛点。

6 个必装技能详解

Tier 1

1. Anthropic docx — Word 文档全流程处理

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑、分析 Word 文档,支持跟踪修订、评论系统、格式化验证。

这是 Claude.ai 底层文档能力的核心实现。创建新文档走 docx-js 脚本,支持目录、页码、页眉页脚、信头等专业排版;编辑现有文档通过 unzip→修改 XML→zip 的方式,能精确处理跟踪修订(ins/del 标签)和评论系统(六个交叉引用文件);读取内容用 pandoc 转 markdown。最实用的是验证环节——LibreOffice 渲染 + pdftoppm 截图 QA,确保输出在 Word 和 Google Docs 中都能正确显示。

避坑指南:docx-js 默认 A4 纸,美式信纸需手动设尺寸;表格需要双重宽度(columnWidths + 每个 cell 的 width);列表必须用 numbering config,不能手打”•”;图片必须带 type 字段。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

2. Anthropic xlsx — 电子表格操作与金融模型

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑 Excel 表格,支持公式、图表、数据转换和金融模型规范。

这个技能的含金量藏在避坑指南里。openpyxl 写公式后必须跑 LibreOffice recalc(脚本封装好了),否则所有公式返回 None;data_only=True 保存会永久丢失公式;外部链接引用的文件不在本地时会被静默破坏。它还内置了一套完整的金融模型规范:蓝色字=硬编码输入、黑色=公式、绿色=跨 sheet 链接、红色=跨文件链接、黄色填充=关键假设。

特别注意:XLOOKUP、XMATCH、SORT、FILTER、UNIQUE、SEQUENCE 这些新函数在 LibreOffice 环境下不可用,必须用 INDEX/MATCH 替代。post-2007 函数(TEXTJOIN、CONCAT、IFS 等)需要加 _xlfn. 前缀。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

3. Anthropic pptx — 演示文稿创建与模板填充

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑、读取 PowerPoint 演示文稿,含设计理念指导和配色方案表。

从”创建空白”到”模板填充”到”读取分析”全覆盖。创建走 pptxgenjs 脚本,支持原生图表、react-icons 渲染的图标、speaker notes;编辑走 unzip→XML→zip,含 add_slide.py(复制幻灯片)、clean.py(清理孤立资源)、validate.py(验证)完整工具链。读取用 markitdown + thumbnail.py 生成缩略图网格。

设计彩蛋:技能内置了 5 套配色方案(Midnight Executive / Forest & Moss / Coral Energy / Warm Terracotta 等),还给出了”深浅对比 sandwich 结构””视觉母题重复”等设计理念指导。12 个 pptxgenjs 已知陷阱中,最致命的是”stacked bar 的 dataLabelPosition 必须用 ctr/inEnd/inBase,用 outEnd 会损坏文件”。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

4. Anthropic pdf — PDF 处理全流程

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:PDF 提取、合并、拆分、旋转、表单填写、OCR、加密解密,全流程覆盖。

PDF 是办公中最高频的格式之一,这个技能覆盖了几乎所有常见操作。读取用 pypdf(文本+元数据)和 pdfplumber(表格提取,保留布局);写入/合并/拆分/旋转都用 pypdf 的 PdfWriter;表单填写有专门的 FORMS.md 指南(含字段类型识别、JavaScript 动作处理等进阶内容)。OCR 场景用 pytesseract 处理扫描件。

实用场景:合同审批(提取条款+填写表单+加密)、报告合并(多部门 PDF 合一)、发票处理(表格提取→Excel 导出)。

★★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 2

5. doc-coauthoring — 协作文档编辑工作流

仓库:anthropics/skills · 许可:Apache 2.0 · 平台:Claude Code / Claude.ai / API

一句话:三阶段结构化协作流程,引导用户高效产出文档。

这不是一个”生成文档”的技能,而是一个”引导协作”的技能。三个阶段分别是:上下文收集(Claude 问清文档类型、受众、期望影响、模板要求,用户倾倒所有背景信息)、迭代精炼(逐节构建,brainstorm + 编辑)、读者测试(用一个全新的 Claude 实例,在无上下文状态下阅读文档,检测盲点和歧义)。

独特价值:读者测试阶段用新实例模拟”首次阅读者”,能发现作者因熟悉内容而忽略的逻辑断层。支持 PRD、设计文档、决策文档、RFC 等多种类型,还能自动为没有 alt-text 的图片生成描述。

★★★★★ 易用性 ★★★★ 实用性 ★★★★★ 维护度

Tier 2

6. Internal Comms — 内部沟通模板库

仓库:anthropics/skills · 许可:Apache 2.0 · 平台:Claude Code / Claude.ai / API

一句话:覆盖 3P 更新、新闻稿、FAQ、状态报告等 7 种内部沟通模板。

内部沟通是被严重低估的办公场景。这个技能提供了完整的模板库:3P 更新(Progress/Plans/Problems)是硅谷最常用的团队周报格式,公司新闻稿、FAQ 撰写、状态报告、领导层更新、项目更新、事故报告都有对应的 guideline 文件。使用时只需告诉 Claude “写一份本周 3P 更新”,它会自动加载对应的模板并引导你填充内容。

适用团队:工程团队周报、产品团队状态同步、管理层汇报、跨部门沟通。特别适合远程团队标准化沟通格式。

★★★★★ 易用性 ★★★★ 实用性 ★★★★★ 维护度

对不同角色的实操建议

对研发负责人

优先安装 docx + xlsx + pdf 三件套。日常的 API 文档编写、测试报告生成、数据表格处理都能直接用上。doc-coauthoring 特别适合技术方案评审前的文档打磨——先让 Claude 帮你过一遍逻辑,再提交给团队。

对产品经理 / 项目管理者

pptx + Internal Comms 是你的效率倍增器。周报、OKR 汇报、产品评审 deck 都能快速产出。doc-coauthoring 的三阶段流程非常适合 PRD 和产品需求文档的协作编辑。

对投资者 / 分析师

xlsx 的金融模型规范直接可用——蓝字输入、黑字公式、绿链接、红跨文件、黄假设,颜色编码让审阅者一眼看清数据流向。配合 pdf 的表格提取能力,可以从财报 PDF 中快速抽取关键数据并结构化到 Excel。

对远程团队

Internal Comms + doc-coauthoring 组合拳:前者标准化沟通格式(3P 更新、状态报告),后者保证文档质量(读者测试防盲点)。特别适合跨时区团队异步协作。

安装与使用

Anthropic 官方四个技能(docx/xlsx/pptx/pdf)已内置在 Claude.ai 付费计划中,也可通过 Claude Code 插件市场安装:

/plugin marketplace add anthropics/skills

/plugin install document-skills@anthropic-agent-skills

doc-coauthoring 和 Internal Comms 同样在官方仓库中,安装方式相同。社区技能(如 Google Workspace Skills)可从 GitHub 仓库手动复制到 .claude/skills/ 目录。

小结

办公文档处理是 AI Agent 最接地气的落地场景。Anthropic 官方的四件套已经做到了生产级水准,而 doc-coauthoring 和 Internal Comms 则在”协作流程”和”沟通标准化”两个维度补齐了办公全链路。对于想要提升知识工作者效率的团队来说,这 6 个技能是 2026 年最值得投入的基础设施。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

AI 时代的教育革命:5 个必装的 AI 教学技能

AI 时代的教育革命:5 个必装的 AI 教学技能

在 AI 编程工具飞速发展的今天,一个悖论正在形成:AI 越会写代码,人类越不会写代码。开发者们复制粘贴 AI 生成的代码,却从未真正理解这些代码背后的逻辑。这不仅是个技术问题,更是个教育危机。

核心问题:AI 编程工具可能导致学习退化——生成效应、流畅性错觉、间隔效应、元认知缺失、测试与检索缺失。我们需要在效率与学习之间找到平衡。

为什么你需要这些技能?

传统的编程学习路径正在被 AI 工具颠覆。当你让 Claude 写一个函数,然后直接复制到项目中,你失去了:

  • 主动生成:自己思考解决方案的机会
  • 检索练习:回忆和应用知识的过程
  • 间隔重复:长期记忆形成的关键
  • 元认知:监控自己理解程度的能力

幸运的是,AI 社区已经开发出了一系列技能来解决这些问题。以下是经过验证的 5 个最实用的教育技能。

Tier 1:必装技能

1. Learning Opportunities — AI 辅助编程中的刻意练习

仓库:github.com/DrCatHicks/learning-opportunities

星标:⭐⭐⭐⭐⭐ 2,363

核心能力:

  • 动态教材:在 AI 辅助编码时提供 10-15 分钟的学习练习
  • 基于证据的学习科学:预测、生成、检索练习、间隔重复
  • 仓库导航:`orient` skill 帮助快速理解新代码库
  • 自动提示:可选的 post-commit 钩子自动提供学习机会

为什么必装:这是唯一专门解决”AI 编程导致学习退化”问题的技能。它基于教育心理学研究,提供科学验证的学习方法。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐

适用平台:Claude Code Codex Hermes Agent

2. AntiVibe — 代码学习与审计框架

仓库:github.com/mohi-devhub/antivibe

星标:⭐⭐⭐⭐ 1,091

核心能力:

  • 深度解析:将任何代码库转化为教育性深度讲解
  • 审计模式:高级架构审计——决策、标志、边缘情况、可测试性
  • 技能级别:可调节深度到 `junior`、`mid` 或 `senior`
  • 输出模式:`compact`(默认,低 token 成本)或 `full`(资源 + 逐行)

为什么必装:解决”AI 写代码,开发者复制粘贴,没人学习”的核心问题。它不只是解释代码,而是教你理解代码背后的设计决策。

评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐

适用平台:Claude Code

3. Education Agent Skills — 165 个教育技能库

仓库:github.com/GarethManning/education-agent-skills

星标:⭐⭐⭐⭐ 635

核心能力:

  • 165 个基于证据的教育技能,覆盖 20 个领域
  • 教师和设计师导向:教学法、学习科学、课程、评估
  • 学生导向:实时 AI 交互模式,塑造学习过程
  • 跨平台:Claude、Codex、Hermes Agent

为什么必装:最全面的教育技能库,适合教师、学校领导和 EdTech 开发者。每个技能都有科学依据。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐

适用平台:Claude Codex Hermes Agent

4. Bloom — 苏格拉底式 AI 家教

仓库:github.com/Li-Evan/Bloom

星标:⭐⭐⭐ 235

核心能力:

  • 2-Sigma 研究:基于教育心理学的 AI 家教系统
  • 中文优先:苏格拉底式教学方法
  • 自适应学习:根据学习者的表现调整教学内容
  • 可自托管 Web 应用

为什么必装:专注中文教育,有教育理论支撑。苏格拉底式教学法能有效促进深度学习。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐

适用平台:Claude Code

5. Universal Diagnostic Tutor Skill — STEM 诊断式家教

仓库:github.com/SenmuuuuW/universal-diagnostic-tutor-skill

星标:⭐⭐⭐ 170

核心能力:

  • 诊断优先:先诊断学习问题,再进行教学
  • 概念教学:教授概念,检查理解,建立掌握
  • STEM 专注:专注于科学、技术、工程、数学

为什么必装:诊断式教学方法有效,能针对性地解决学习难点。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐

适用平台:Claude Code

如何选择?

开发者学习新代码库:AntiVibe + Learning Opportunities

教师备课:Education Agent Skills

学生自学:Bloom + Universal Diagnostic Tutor

EdTech 开发者:Education Agent Skills + Teaching Site Skills

安装教程

Learning Opportunities

# Claude Code
/plugin marketplace add https://github.com/DrCatHicks/learning-opportunities.git
/plugin install learning-opportunities@learning-opportunities

# Codex
codex plugin marketplace add https://github.com/DrCatHicks/learning-opportunities.git

AntiVibe

git clone https://github.com/mohi-devhub/antivibe.git
cp -r antivibe ~/.claude/skills/antivibe

Education Agent Skills

# Claude
claude plugin install https://github.com/GarethManning/education-agent-skills

# Codex
git clone https://github.com/GarethManning/education-agent-skills.git
cd education-agent-skills
codex plugin marketplace add "$PWD"

结语:AI 教育的未来

AI 不是要取代教育,而是要重新定义教育。这些技能证明,AI 可以成为强大的教育工具,而不仅仅是生产力工具。

关键在于有意识地使用 AI——不是让它替我们思考,而是用它来增强我们的学习能力。当我们把 AI 编程工具从”代码生成器”转变为”学习伙伴”,我们就能在提高效率的同时,保持甚至提升我们的技能。

这 5 个技能只是开始。随着 AI 教育生态的发展,我们将会看到更多创新的学习工具。但核心原则不会变:学习是为了理解,不是为了复制。

你已经在使用 AI 编程工具了吗?试试这些技能,让 AI 成为你的学习伙伴,而不仅仅是代码生成器。

立即开始学习 →

“AI 编程工具可以创建特定的风险,通过引入低效的学习习惯来降低用户的学习参与度。这些效果可以根据基础科学支持的学习原则来预测。” —— Learning Opportunities README

Cerebras CS-4发布:30倍推理速度改写算力格局,SRAM路线正面挑战英伟达GPU霸权

Cerebras CS-4发布:30倍推理速度改写算力格局,SRAM路线正面挑战英伟达GPU霸权

据36氪8月19日报道,AI芯片公司Cerebras System于当地时间周二正式发布第四代晶圆级AI推理系统CS-4。这是Cerebras迄今为止最大胆的一次产品迭代:单个机架系统集成3颗WSE-3 Turbo晶圆级处理器,集成了4万亿个晶体管,号称在单用户场景下,每秒输出token的能力可达传统GPU服务器的30倍。更关键的是,这套系统全部采用SRAM(静态随机存取存储器)而非行业主流的DRAM(动态随机存取存储器),走了一条与英伟达完全不同的技术路线。

Cerebras表示,CS-4基于全新的Nexus机架式平台,计算、电源、互连三大子系统全部重新设计,整体组件数量减少了50%,制造自动化比例大幅提升。与上一代CS-3相比,WSE-3 Turbo在FP16稀疏AI算力、内存带宽、片上互联带宽和I/O带宽四个维度均实现了约2倍提升,性能几乎线性增长。值得注意的是,这套系统专注于AI推理而非模型训练,明确瞄准了当前AI应用落地中最大的瓶颈——推理延迟和成本。

为什么这件事值得关注

Cerebras CS-4的发布,本质上是AI算力市场的一次”范式挑战”。过去三年,英伟达凭借A100/H100/B200系列GPU几乎垄断了AI算力市场,其核心优势在于CUDA生态和大规模并行计算能力。但Cerebras选择了一条截然不同的路:用整片晶圆做芯片(WSE = Wafer Scale Engine),用SRAM替代DRAM,用硬件级的互联延迟(2微秒)替代软件调度。

这意味着什么?AI推理的游戏规则可能正在被改写。 当前大模型应用的最大痛点不是训练,而是推理——用户等待一个回答的时间、企业为每次API调用支付的成本,直接决定了AI产品的商业化天花板。Cerebras声称的30倍推理速度,如果在真实生产环境中得到验证,将对AI推理云服务的定价模型、AI应用的用户体验、以及企业AI部署的成本结构产生深远影响。

更值得关注的是Cerebras的客户生态。从其官方博客可以看到,OpenAI、GPT-5.6、Gemma 4、GLM-4.7等主流大模型均已支持在Cerebras平台上运行推理。这意味着CS-4不是”纸上谈兵”,而是已有真实模型验证的商业化产品。

对不同角色意味着什么

对AI应用开发者: 如果CS-4的30倍推理速度属实,你的AI应用的用户体验将发生质变——从”等待3秒出结果”变成”几乎实时响应”。这对聊天机器人、代码助手、实时翻译等延迟敏感型应用尤其重要。建议关注Cerebras推理API的开放时间和定价,提前评估迁移方案。

对企业IT决策者: AI推理成本是当前企业AI落地的最大障碍之一。Cerebras的SRAM路线虽然芯片成本更高,但推理效率的提升可能带来整体TCO(总拥有成本)的优势。建议在下次AI基础设施评估中,将Cerebras作为英伟达的替代选项纳入考量,尤其是推理密集型工作负载。

对投资者: AI芯片赛道正在从”训练为王”转向”推理为王”。Cerebras的CS-4、Etched的7亿美元融资(估值一个月翻倍至210亿美元)、以及英伟达自己推出推理专用芯片,都在印证这个趋势。推理芯片的市场空间可能比训练芯片更大——因为每个训练出来的模型,都需要无数次推理来服务终端用户。

SRAM vs DRAM:一条少有人走的路

Cerebras选择SRAM而非DRAM,是一个大胆的技术赌注。SRAM的优势是速度极快(纳秒级访问延迟),但密度低、成本高;DRAM密度高、成本低,但速度慢且需要刷新。英伟达的GPU全部使用HBM(高带宽DRAM),这已经是行业标准。

Cerebras的逻辑是:通过整片晶圆的巨大面积来弥补SRAM的密度劣势,同时用2微秒的片上互联来消除DRAM带来的延迟瓶颈。这有点像用”人海战术”来替代”精兵路线”——单个芯片面积是英伟达GPU的数十倍,但换来的是数量级的推理速度提升。

这条路线能否成功,取决于两个关键因素:一是良率(整片晶圆做芯片,任何一个缺陷都可能报废整片),二是成本(SRAM的单位比特成本远高于DRAM)。Cerebras此前的CS-2和CS-3已经证明了晶圆级芯片的可行性,CS-4则是在推理场景的进一步押注。

相关阅读

· Groq再融3.5亿美元转向neocloud:AI推理云成算力投资新战场 —— 另一家押注AI推理的玩家,从芯片到云服务的全栈布局

· Stripe以70亿美元收购OpenRouter:支付巨头押注AI模型路由入口 —— 模型路由与推理入口的争夺战正在升温

写在最后

Cerebras CS-4的发布,标志着AI算力市场从”英伟达一家独大”向”多路线竞争”的转变。SRAM vs DRAM、晶圆级 vs 芯片级、推理优先 vs 训练优先——这些技术路线的分化,最终将为AI应用开发者和企业带来更多的选择、更低的成本、更好的体验。

当然,30倍的速度提升仍需第三方独立验证,SRAM的良率和成本问题也尚未完全解决。但无论如何,Cerebras已经向市场证明:AI推理的未来,不只有英伟达一条路。

关注 AI商业快讯,每天一篇AI热点深度解读。

GreatCTO 实测:69 个 AI Agent 帮你从设计到上线,一个功能只要 $3.40

GreatCTO 实测:69 个 AI Agent 帮你从设计到上线,一个功能只要 $3.40

Solo 开发者最大的痛点不是写代码,而是一个人要干一个团队的活:架构设计、前后端开发、测试、安全审查、部署上线——每一步都需要不同领域的专业知识。现在,一个叫 GreatCTO 的开源工具声称:描述一个产品,批准两次,就能拿到一个完整可运行的应用。

它背后是 69 个专家 AI Agent,按软件开发生命周期(SDLC)编排成一条流水线。实测数据:一个功能从描述到上线 1 小时 26 分钟,token 成本 $3.40;完整产品中位数 $171。

它怎么工作?

GreatCTO 的流程极其简洁:

描述产品 → AI 生成 spec + 架构 + 数据模型 + 界面设计 → 🟢 你审批设计 → AI 脚手架 + 后端 + 前端 + 测试 + 代码审查 + 安全审计 → 🟢 你审批部署 → 上线

你全程只做两件事:批准”建什么”批准”上不上线”。中间 69 个 agent 自动协作。

日常使用三个命令:

  • /start "描述你的产品" — 启动流水线
  • /inbox — 查看待审批项和阻塞任务
  • /digest — 周报:DORA 指标 + 每个功能的成本

69 个 Agent 是怎么分工的?

GreatCTO 把 69 个 agent 按角色分成 7 个团队:

1. 产品定义团队(Prototyper)— 4 个 agent
把模糊的想法变成可执行的方案:

  • product-owner:第一个启动的 agent。把原始想法变成产品简报,甚至会启动”多 LLM 辩论”(4 个 AI 角色在 4 个模型上辩论)来验证方案
  • architect:生成架构文档、ADR(架构决策记录)、成本估算
  • decision-scorer:给 2+ 个架构方案打分,输出加权评分表
  • design-advisor:选设计系统、列组件清单、写文字版线框图

2. 开发团队(Builder)— 11 个 agent
各司其职的全栈开发:

  • app-scaffolder:搭建 Next.js + TypeScript + Tailwind 骨架,配好数据库和认证
  • senior-dev:主力开发,TDD 方式实现功能(可并行运行多个)
  • auth-engineer:认证和权限专家(Auth.js / Clerk / RBAC / 多租户隔离)
  • integrations-engineer:第三方 API 对接(Stripe / Twilio / Google Calendar / Shopify)
  • subscription-billing-engineer:订阅计费(Stripe Billing / 用量计费 / 试用期 / 退款)
  • mobile-app-builder:React Native 移动端开发
  • geo-routing-engineer:地理空间和路径优化
  • media-pipeline-engineer:视频/图片处理管线
  • connector-builder:数据源连接器(Stripe / GA / QuickBooks)
  • migration-import-engineer:数据迁移和导入
  • ai-eval-engineer:AI 产品的评估管线

3. 质量团队(Sweeper)— 3 个 agent
代码审查 + 测试:

  • qa-engineer:分析实际代码,按类型做 QA
  • code-reviewer:读 diff,报 bug,给裁决
  • e2e-test-engineer:生成 Playwright 端到端测试,部署后自动跑

4. 安全与合规团队(Reviewers & Safety)— 30+ 个 agent
这是 GreatCTO 的核心护城河。覆盖 30+ 个垂直行业的合规审查:

  • pci-reviewer:PCI-DSS 支付合规
  • healthcare-reviewer:HIPAA 医疗数据合规
  • gdpr-reviewer:GDPR + EU AI Act + NIS2
  • ai-security-reviewer:OWASP LLM Top 10
  • legal-reviewer:律师-客户特权 / UPL 防护
  • insurance-reviewer:NAIC 保险合规
  • tax-reviewer:IRS 电子报税
  • ……还有政府、教育、游戏、流媒体、固件、DAO 等 30+ 个领域

每个 reviewer 的工作方式相同:分析项目类型 → 输出威胁模型(TM-{slug}.md)→ 在 senior-dev 开发前签署关键/高危缓解措施。

5. 增长团队(Grower)— 2 个 agent

  • performance-engineer:性能测试(k6/Locust)、延迟分析、容量规划
  • growth-engineer:北极星指标、激活/留存漏斗、增长实验设计

6. 运维团队(Maintainer)— 3 个 agent

  • devops:部署执行
  • infra-provisioner:基础设施配置(Neon 数据库 / Vercel 托管 / DNS / TLS)
  • l3-support:线上问题排查和事故响应

7. 编排团队(Orchestration & Meta)— 4 个 agent

  • pm:读架构文档,分解任务,生成 Gantt 图,分配 agent
  • coordinator:多流协调,跨 agent 调度
  • project-auditor:技术债务审计和重构计划
  • continuous-learner:会话结束时提取模式和经验,写入全局知识库

实测数据

GreatCTO 在公开 benchmark 上跑了 7 个完整产品:

指标 数据
单功能端到端 1 小时 26 分钟 / $3.40 token 成本
完整产品(7 个基准) 中位数 $171 / 质量 70/100(58-86)
典型月度(20 次流水线) ~$34
支持的产品类型 60 种,覆盖 15 个美国行业

质量评分来自运行产品自身的测试(不是数文件数),所以是 70 而不是 100——这恰恰说明数据是真实的。

安全性设计

几个值得注意的设计:

  • 范围隔离:agent 在写入时就被限制在自己的职责范围内,不是审查时才检查
  • 合规永不跳过:即使设为”auto”模式(无人审批),安全和合规门控仍然强制执行
  • 本地运行:所有代码在本地执行,prompt 只发给你自己的 LLM 提供商
  • 遥测默认关闭:不收集任何使用数据

安装

npx great-cto init

一行命令。自动安装 Companion 插件(Superpowers、Beads)。重启 Claude Code 后即可使用。支持 Claude Code(默认)和 OpenAI Codex(加 --host codex)。

需要 Node ≥ 18.17。

适用场景与局限

最适合:独立开发者、Solo 创业者、CTO 一个人扛一个产品。你有一个想法,想快速验证——GreatCTO 帮你从 0 到上线。

不适合:多人协作的团队(”For one builder”是作者原话);需要 CI/CD 系统的成熟项目;需要正式合规认证的场景(PCI/HIPAA 脚手架是起点不是终点)。

对不同角色的意义

对独立开发者:你不再需要自己搞安全审查、写测试、配基础设施。69 个 agent 分工覆盖了你一个人顾不到的角落。$3.40 一个功能,$171 一个产品——这个成本结构改变了”一个人能做什么”的上限。

对创业团队:用 GreatCTO 快速出 MVP,验证产品假设,再决定是否组建正式团队。先跑通流程再招人。

对 AI 应用开发者:GreatCTO 的多 agent 编排架构(7 团队 69 agent + 范围隔离 + 合规门控)是一个值得研究的参考实现。它证明了”LLM + 多 agent 协作”不是 demo,而是已经跑通的工程实践。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

GreatCTO 为开源项目(MIT 协议),本文不构成投资建议。
相关阅读:AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能LeanCTX 实测:砍掉 86% token 成本

GPT-6代号泄露周四见:OpenAI数学突破+网络安全Critical级,多智能体原生时代来临

GPT-6代号泄露周四见:OpenAI数学突破+网络安全Critical级,多智能体原生时代来临

据36氪报道,OpenAI下一代模型GPT-6的内部代号”mewfour”再次泄露,开发者Chetaslua在openai/codex仓库的commit记录中发现该代号痕迹,结合Polymarket上OpenAI本周发布Astra的概率飙涨至52%,以及多位OpenAI员工的公开暗示,GPT-6最快可能于本周四(8月20日)正式发布。

数学突破:2000美元破解十年难题

8月1日,OpenAI发布长达249页的数学论文,揭示Astra内部版本解决了10个至少十年未取得进展的数学和理论计算机科学难题,涵盖高维几何、编码理论、群论、量子复杂性、格密码学、极值组合学等领域。其中包括首个非sofic群的显式构造——被称为群论里的圣杯级问题。

按照GPT-5.6 Sol当前的API费率,生成全部十个解答的token成本约2000美元。这意味着数学界过去十年的产出效率,正在被一个API调用重新定义。

网络安全达Critical级:强到自己都害怕

8月7日,OpenAI官方声明:初步评估显示Astra可能达到Preparedness Framework下的网络安全”Critical”能力阈值——这是最高一档。在该级别下,模型可以独立识别并开发多种严重程度的零日漏洞,或针对加固目标制定并执行端到端的攻击策略。

Sam Altman回应称:”Astra非常强大,我们会做好安全准备,然后让所有人都能用上。”

多智能体原生时代:预训练阶段就端到端训练协作能力

据The Information报道,Astra被训练为能让多个智能体长时间协同解决复杂问题,传闻约有10万亿参数,采用混合专家架构(MoE)。更重要的是,它在推理、编码、写作、知识、多模态理解和智能体任务上全面超越Claude Fable。

如果消息属实,这将是大模型历史上首次从预训练阶段就把多智能体协作能力端到端训练进去。结合OpenAI在GPT-5.6家族上已搭建的多智能体基础设施(Sol、Terra、Luna三层协作体系),Astra天生就具备长时程协作能力,开箱就能在Codex里协调多个智能体。

对从业者的实操建议

对研发负责人:关注Astra的多智能体协作能力,评估其在复杂项目自动化中的应用潜力,提前规划团队工作流适配。

对投资者:OpenAI若成功发布Astra,将巩固其技术领先地位,关注相关产业链(算力、安全、协作工具)的投资机会。

对普通从业者:AI工具正在从辅助编码向全流程协作演进,学习如何与多智能体系统高效协作将成为关键技能。

关注AI商业快讯

每天一篇AI热点深度解读,助你把握技术趋势与商业机会。关注我们,不错过任何重要更新。

相关阅读:Groq再融3.5亿美元转向neocloud

相关阅读:Stripe以70亿美元收购OpenRouter

LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本,月费从 $450 降到 $60

LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本,月费从 $450 降到 $60

用 AI 写代码的人都有一个共同的痛:token 太贵了

Claude Sonnet 输入 $3/百万 token,GPT-4o 也不便宜。一个中等规模的代码仓库,AI 每次读几个文件、跑几条 shell 命令,一个 session 随随便便烧掉 60 万 token——$1.5 美元。一天跑 10 次就是 $15,一个月 $450。更扎心的是,其中大部分 token 是”废话”:重复读同一个文件、git log 的冗余输出、shell 命令的无关行。

现在,一个 Rust 写的本地工具声称能砍掉 60-87% 的 token。它叫 LeanCTX,GitHub 上有实测 benchmark,数据可复现。

一个数字说清问题

LeanCTX 团队对自身代码库(Rust + TypeScript + Python,约 5 万行)做了 30 分钟编码 session 模拟:

配置 Token 消耗 成本 节省
无压缩(原始) 605,400 $1.51
LeanCTX 全模式 84,400 $0.21 86.1%
LeanCTX + CRP 79,900 $0.20 86.8%

从 $1.51 降到 $0.20。如果你一天跑 10 个 session,月费从 $450 降到 $60。这不是理论值——用的是 tiktoken cl100k_base 精确计数,不是字符除以 4 的粗估。

它到底做了什么?

LeanCTX 的核心思路:在 AI 读文件和跑命令之前,先替它”读一遍”,把无关信息过滤掉,只把有价值的部分送给模型。

它由五大模块组成:

1. 上下文压缩(Context Compression)
这是最核心的能力。10 种读取模式自动选择:

  • map 模式:只提取依赖关系和 API 接口,跳过实现细节。Rust 文件省 96.5%,JS 文件省 99.1%
  • signatures 模式:只保留函数签名和类型定义,Python 文件省 94.5%
  • cache_hit:重复读取同一文件只需 ~13 token(原始 ~2000 token),省 99.8%
  • aggressive 模式:去注释去空行,适用于文档和配置文件

2. 智能分流(Intelligent Triage)
不是所有任务都需要读完整文件。LeanCTX 会分析任务类型,自动选择最经济的读取模式。简单查询走轻量模式,复杂分析才用全文。

3. 知识路由(Knowledge Routing)
跨会话记忆持久化——AI 记住你上次看了什么文件、做了什么决策。下次新会话不需要重新发现,直接 recall。记忆以 .ctxpkg 格式导出,换模型不丢失。

4. 成本追踪(AI Value Gate)
内置仪表盘实时显示 token 消耗和成本。引入 CPAO(Cost per Accepted Outcome)指标——不只看省了多少 token,还看”花出去的 token 产出了多少有用结果”。

5. 影子模式(Shadow Recommendations)
对比压缩前后的输出质量,只在确认质量不降的前提下推荐节省方案。

实测数据:按语言拆解

LeanCTX 在 9 种语言的 50 个文件上做了精确 benchmark:

语言 文件数 原始 Token 最佳模式 节省率
Rust 10 144,295 map 96.5%
JavaScript 10 71,352 map 99.1%
TypeScript 4 13,974 map 95.6%
Python 9 26,688 signatures 94.5%
Markdown 10 80,376 aggressive 5.6%
JSON 5 67,430 aggressive 0.5%

规律很明显:代码文件压缩率极高(94-99%),因为结构化信息(函数签名、API 表面)只占源码的一小部分;数据文件压缩率低,因为本身就没有冗余结构。

CLI 输出压缩同样亮眼——1794 条真实命令的统计:

  • git log --stat -10:8,693 字符 → 636 字符,省 92.7%
  • git diff HEAD~5 --stat:3,077 字符 → 179 字符,省 94.2%
  • git status:2,350 字符 → 1,585 字符,省 32.6%

LeanCTX 内置 95+ 种 shell 输出压缩规则,覆盖 git、npm、cargo、docker、kubectl、terraform 等主流工具。

一个例子:auth 模块的上下文查询

当 AI 被问”auth 模块怎么工作的?”时:

没有 LeanCTX:读 auth.rs(2,500 token)+ middleware.rs(1,800 token)+ config.rs(900 token)= 5,200 token

有 LeanCTX:map 模式读 auth.rs(65 token)+ map 模式读 middleware.rs(42 token)+ map 模式读 config.rs(18 token)= 125 token

节省 97.6%。AI 拿到的是依赖关系图和 API 签名——这对回答”怎么工作的”已经足够了。如果需要深入实现细节,再用 ctx_expand 按需展开。

安装:一条命令,30 秒

# Cargo(推荐)
cargo install lean-ctx

# 或从源码
git clone https://github.com/yvgude/lean-ctx
cd lean-ctx/rust && cargo build --release

安装后一行命令启动:

lean-ctx setup

零配置。它会自动识别你的 coding agent(Cursor / Claude Code / Copilot / Windsurf / Codex / Gemini CLI 等 30+ 种),插入代理层。不需要改任何配置文件。

对比”6 工具栈”的安装体验:6 个仓库、3 种语言、15 分钟配置、各种 bridge 脚本……LeanCTX 把这一切压缩成一个二进制。

生态兼容:不只是压缩工具

LeanCTX 还内置了 addon 系统,可以把其他 MCP server 接入它的网关:

lean-ctx addon search memory   # 浏览 addon 注册表
lean-ctx addon add headroom    # 安装并接入
lean-ctx addon list            # 查看已接入的 addon

注册表覆盖压缩(Headroom、Sophon)、代码智能(Repomix、Serena)、记忆(Mem0、Cognee、Letta)和推理(Sequential Thinking)等类别。所有 addon 输出经过安全扫描和不可信标记后才送达模型。

对不同角色的意义

对独立开发者:月费 $450 → $60,一年省 $4,680。LeanCTX 已经在生产环境跑了 1794 条命令,数据可复现。

对团队:本地优先,记忆可导出为 .ctxpkg。换模型(OpenAI ↔ Anthropic ↔ Gemini)不丢上下文。不存在数据锁在某个厂商黑箱里的问题。

对 AI 应用开发者:CPAO 指标(Cost per Accepted Outcome)是一个新的评估框架——不只看”省了多少 token”,还看”省下的 token 是否真的降低了输出质量”。这个思路值得借鉴。

模型在趋同,算力在降价,但上下文的控制权才是 AI 时代的真正护城河。LeanCTX 把这道护城河搬到了你本地。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

LeanCTX 为开源项目(MIT 协议),本文不构成投资建议。
相关阅读:AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能Groq 再融 3.5 亿美元转向 neocloud