实测9款Token节省工具:输出砍65%、输入省80%,组合拳最高省80%

实测9款Token节省工具:输出砍65%、输入省80%,组合拳最高省80%

调研日期:2026-08-22 | 数据来源:GitHub awesome-claude-skills / awesome-claude-code / awesome-agent-skills / GitHub Search


为什么重要

LLM API 按 token 计费,Claude Opus $5/M input, $15/M output。开发者平均每月花 $100+,其中 30-50% 是浪费的 token(无关文件读取、冗余上下文、冗长输出)。一个 200 行配置文件 = 800 token = $0.004/次;一天读 100 次 = $0.4/天 = $12/月。


生态全景速览

分类 代表工具 核心机制 节省幅度
**输出压缩** caveman 风格压缩(删填充词/冠词) 65% output
**输入/上下文压缩** lean-ctx session caching + 压缩代理 50-80% input
**上下文优化器** claude-context-optimizer 追踪读取模式,学习有用文件 30-50% input
**框架级优化** token-diet 全流程管道(检索→剪枝→缓存→压缩) 最高 20x
**指南/模板** CCTCRG 最佳实践 + prompt 模板 随用法而异
**Skill 优化** skill-optimizer 优化 SKILL.md 本身减少 token 间接节省
**泄漏检测** cc-probeline / Ctxlint 检测 token 浪费/过时引用 检测工具

Tier 1 — 必收(成熟 + 实用 + 有数据)

1. caveman — 输出超压缩

仓库:https://github.com/JuliusBrussee/caveman

星标:99,628★

定位:砍掉 65% output token,保持技术准确性

核心能力:

  • 6 级强度:lite / full / ultra / wenyan-lite / wenyan-full / wenyan-ultra
  • 输出压缩 65%(10 任务 benchmark)
  • 输入压缩 33%(54 次运行)
  • Pixel 模式:79% token 节省
  • 按类型压缩:JSON 70-90% / 日志 85-95% / 代码 40-70%
  • CCR 恢复机制(防止信息丢失)

适用场景:

  • ✅ 日常对话式开发(bug fix、快速迭代)
  • ✅ 输出密集型任务(生成代码、写文档)
  • ✅ 预算敏感场景(个人开发者、学生)
  • ❌ 需要详细解释的场景(新手教学、code review 解释)

2. lean-ctx — 上下文代理

仓库:https://github.com/yvgude/lean-ctx

定位:MCP server + context runtime,智能压缩 + 缓存

核心能力:

  • Session caching:重复读取同一文件,2000 token → 13 token
  • Git status 压缩:800 token → 120 token
  • 代理压缩:每个请求自动压缩,prompt-cache-safe
  • 跨会话持久化 session memory
  • 实时 dashboard + budget 控制

适用场景:

  • ✅ 大型代码库开发(频繁读取同一文件)
  • ✅ 长会话编程(累积上下文多)
  • ✅ 团队协作(共享 session memory)
  • ❌ 简单任务(overkill)

3. claude-context-optimizer — 上下文优化器

仓库:https://github.com/egorfedorov/claude-context-optimizer

星标:在 awesome-claude-code 推荐

定位:追踪文件读取模式,学习哪些文件真正有用

核心能力:

  • 追踪每个 Read/Edit/Search 调用
  • 学习文件使用模式(哪些文件真正被用到)
  • 生成 profile,指出 token 浪费点
  • 模型感知:自动检测 Claude 版本(Fable 5/Opus/Sonnet/Haiku)
  • 零配置

适用场景:

  • ✅ 个人开发习惯分析
  • ✅ 优化 CLAUDE.md / 项目上下文文件
  • ✅ 识别”读了但从没用”的文件
  • ❌ 需要团队协作场景(目前是本地优化)

4. token-diet — 生产级框架

仓库:https://github.com/VDADev2022/token-diet

版本:v3.0

定位:全流程 token 优化管道

核心能力:

  • 完整管道:Query → Retrieve → Prune → Cache → Route → Build → Compress → Measure
  • 检索剪枝(dedupe → sentence-trim → topK):30-60% reduction
  • 有状态记忆(JSON 结构化上下文,防止上下文漂移)
  • 手术级语言压缩(仅处理自然语言,保护代码/JSON/URL)
  • 工程护栏:必须追踪 tokens_in / tokens_out / latency_ms
  • 最高 20x reduction

适用场景:

  • ✅ 生产环境 LLM 应用
  • ✅ 成本敏感的 API 调用
  • ✅ 需要可度量的优化
  • ❌ 简单对话场景(框架太重)

5. CCTCRG — Claude Code 优化指南

仓库:https://github.com/gino2013/CCTCRG

定位:综合优化方案(指南 + 模板 + 配置)

核心能力:

  • 一键安装脚本
  • Token 节省策略文档
  • 现成 prompt 模板
  • 项目级配置(CLAUDE.md)
  • 快速开始 5 分钟上手

适用场景:

  • ✅ Claude Code 新手入门优化
  • ✅ 需要最佳实践指导
  • ✅ 想快速开始但不想折腾配置
  • ❌ 已经有优化经验的高级用户

Tier 2 — 精选(有特色)

6. context-engineering-kit(NeoLabHQ)

仓库:https://github.com/NeoLabHQ/context-engineering-kit

定位:上下文工程技能套件(含压缩/优化子技能)

包含 skills:

  • context-compression — 上下文压缩
  • context-optimization — 上下文优化
  • write-concisely — 精简写作
  • prompt-engineering — prompt 工程

适用场景:

  • ✅ 想要一揽子解决方案
  • ✅ 学习上下文工程概念
  • ❌ 单独使用每个 skill 星标不高

7. skill-optimizer

仓库:https://github.com/hqhq1025/skill-optimizer

定位:优化 SKILL.md 本身,减少加载 token

三个子技能:

  • skill-miner — 挖掘可复用工作流
  • skill-personalizer — 适配本地环境
  • skill-generalizer — 泛化为可发布 skill

适用场景:

  • ✅ 维护多个 skill 的开发者
  • ✅ 想让 skill 加载更高效
  • ❌ 只用一两个 skill 的用户

8. cc-probeline — Token 泄漏检测

仓库:https://github.com/labzink/cc-probeline

定位:状态栏,实时显示每个 turn 的 token 消耗

核心能力:

  • 每个 turn 定价(输入/输出/cache 重建)
  • 子 agent 的 token 也追踪
  • 无网络请求,本地计算
  • 隐私安全

适用场景:

  • ✅ 想知道钱花在哪
  • ✅ 对比不同 prompt 的成本
  • ❌ 不提供优化,只提供可见性

9. Ctxlint — 上下文文件 Linter

仓库:https://github.com/ctxlint/Ctxlint

定位:检测 AGENTS.md / CLAUDE.md 等上下文文件的问题

核心能力:

  • 检测过时文件引用
  • 检测死构建命令
  • 检测硬编码 secrets
  • 检测 token 浪费
  • 118 个测试用例

适用场景:

  • ✅ 维护大型上下文文件
  • ✅ 团队协作时确保上下文文件健康
  • ❌ 简单项目

场景推荐矩阵

场景 推荐工具 理由
**个人开发者日常** caveman + CCTCRG caveman 砍输出,CCTCRG 指导最佳实践
**大型代码库开发** lean-ctx + claude-context-optimizer caching + 学习读取模式
**生产环境 API** token-diet 完整管道 + 工程护栏 + 可度量
**预算敏感(学生/新手)** caveman (full) + CCTCRG 零配置,立即见效
**团队协作** lean-ctx + Ctxlint 共享 session + 上下文文件健康检查
**Skill 开发者** skill-optimizer 优化 SKILL.md 本身
**成本可见性** cc-probeline 实时追踪每个 turn 的花费
**综合优化** lean-ctx + caveman + token-diet 输入+输出+全流程覆盖

组合拳推荐

方案 A:最小配置(立即见效)

caveman (full) + CCTCRG
  • 5 分钟安装
  • 输出立即砍 65%
  • 总 token 节省:30-40%

方案 B:深度优化(开发者)

lean-ctx + claude-context-optimizer + caveman
  • 输入压缩 50-80%
  • 输出压缩 65%
  • 学习你的使用模式
  • 总 token 节省:60-70%

方案 C:生产级(团队/企业)

token-diet + lean-ctx + caveman + Ctxlint
  • 全流程管道
  • 工程护栏 + 可度量
  • 团队上下文健康
  • 总 token 节省:70-80%

已知局限

工具 局限
caveman 过度压缩可能影响可读性(ultra/wenyan 模式)
lean-ctx 需要 MCP server 运行环境
claude-context-optimizer 目前仅本地优化,无团队协作
token-diet 框架较重,简单场景 overkill
CCTCRG 指南性质,不自动执行
cc-probeline 只提供可见性,不自动优化

后续调研方向

  1. 对比 caveman vs token-diet 的 linguistic compression 效果
  2. 测试 lean-ctx 在不同代码库大小下的表现
  3. 探索 prompt caching(Anthropic Cache)与这些工具的协同
  4. 关注 ContextIQ 等新框架的发展

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

AI 编程代理的账单正在失控。一个中度使用 Claude Code 的开发者,日均消耗 50 万 token,按 Claude Sonnet 5 定价月费约 $150。重度用户日均 200 万 token,月费突破 $600。而这些 token 里,至少 40% 是”废话”——客套话、填充词、重复解释、格式修饰。

JuliusBrussee 在 2026 年 4 月发布的 Caveman skill,用一个激进的思路解决了这个问题:让 AI 说”洞穴语”。去掉所有修饰,只留技术实质。结果?输出 token 平均减少 65%。这个 skill 在 4 个月内拿到 99,628 颗星,成为 GitHub 上增长最快的 AI skill 之一。

但输出压缩只是故事的一半。2026 年 8 月发布的 Caveman 2.0 新增了本地代理(Proxy),可以压缩 Agent 读入的内容——包括工具返回的日志、JSON 配置、代码文件。在官方基准测试中,代理输入 token 减少了 33.2%,且所有 18 个精确答案检查全部通过。

Caveman 怎么工作的?

Caveman 分两层运作:输出 skill(原始功能)和输入代理(2.0 新增)。

输出 Skill:让模型少说话

核心机制是一份 ~5KB 的系统提示词(SKILL.md),注入到 Agent 的上下文中。这份提示词定义了一套”洞穴语”写作规则:

  • 删除冠词(a/an/the)、填充词(just/really/basically)、客套话(sure/certainly/happy to)
  • 允许片段句、短同义词(big 代替 extensive)
  • 禁止工具调用前的解说、装饰性表格、冗长错误日志
  • 保留全部技术实质:代码块、API 名、错误信息、数字原样不动
  • 支持 6 种强度:lite / full(默认) / ultra / wenyan-lite / wenyan-full / wenyan-ultra

例如,解释”React 组件为什么重渲染”:

普通回答(69 token):

The reason your React component is re-rendering is likely because you’re creating a new object reference on each render cycle. When you pass an inline object as a prop, React’s shallow comparison sees it as a different object every time, which triggers a re-render. I’d recommend using useMemo to memoize the object.

Caveman 回答(19 token):

New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

同一个修复方案,token 消耗减少 72%。

输入代理:让模型少读东西

Caveman 2.0 的核心创新是本地代理(Caveman Proxy)。它以 sidecar 模式运行在你的机器上,Agent 的所有 API 请求都经过它转发。代理对不同类型的载荷(payload)执行针对性压缩:

载荷类型 保留内容 压缩目标
JSON 键、结构、错误子树;折叠重复数组 70–90%
日志 错误、堆栈、首尾行;丢弃 INFO 和进度噪声 85–95%
代码 import、签名、类型;省略函数体 40–70%
Diff 文件/块头和变更行;省略重复上下文 60–80%
搜索结果 顶部/底部命中 + 诊断/安全命中 80–95%
文本/HTML 标题、首尾上下文、重要段落 50–80%

关键安全机制:CCR(Content-Addressed Recovery)。原始字节在任何有损变换之前,先存入本地磁盘的内容寻址存储。Agent 通过 caveman_retrieve 随时取回原始数据。解析失败或压缩后更大时,直接透传原始字节。

还有一个大胆的功能:Pixel 模式。将密集文本渲染成 PNG 图片,让视觉模型直接”看图”而非读文本。在 63.7k 字符的 JSON 工具目录上,55,413 个文本 token 被压缩为 11,402 个图片 token,减少 79%。

功能拆解

1. 输出 Skill(原始功能)

一句话:让 AI 用洞穴语回答,输出 token 平均减 65%。

  • 6 种强度级别,从轻度去修饰(lite)到中文文言文(wenyan)
  • 代码块、命令、错误信息完全保留,不压缩技术内容
  • 支持 30+ Agent:Claude Code、Codex、Gemini CLI、Cursor、Windsurf、Cline 等
  • 附带子命令:/caveman-commit(简洁提交信息)、/caveman-review(一行审查)

适用场景:日常编码对话、代码审查、文档生成——所有”输出长、重复多”的场景。

2. Caveman Proxy(2.0 输入压缩)

一句话:本地代理压缩 Agent 读入的所有内容,输入 token 减 33.2%。

  • 基于 Go 的本地代理,零云端依赖
  • 8 个原生 wrap 配置:Claude Code、Codex、Gemini CLI、Aider、opencode、Hermes、OpenClaw、Pi
  • caveman learn 扫描历史会话,输出 token 消耗排名和优化建议
  • caveman learn implement 让 Agent 自己修复发现的问题,逐个确认

适用场景:长会话、大量工具调用、日志密集型任务——所有”输入 token 爆炸”的场景。

3. Pixel 模式

一句话:把文本渲染成 PNG,用视觉 token 替代文本 token。

  • 只在长行密集内容上有利(JSON 工具目录、长日志)
  • 短行稀疏代码不划算,PNG 开销超过节省
  • 通过 caveman convert 可以将 SKILL.md 本身转为图片,省 61%

适用场景:大量 JSON/日志处理、工具 schema 注入。

4. 辅助工具集

工具 功能
caveman learn 扫描真实历史,输出 Cave Score + token 浪费排名
caveman shrink 压缩命令输出,可恢复
caveman browse 本地 Chrome 的压缩 a11y 树,121 token vs Playwright 的 15,704 token
caveman mem 持久化记忆,支持原始字节恢复
caveman trial A/B 测试真实会话
caveman stats 查看实际压缩统计

实测数据

输出压缩:官方 Benchmark

Caveman 仓库提供了 10 个标准化任务的对比数据:

任务 普通输出 (token) Caveman 输出 (token) 节省
解释 React 重渲染 1180 159 87%
修复 auth 中间件 704 121 83%
PostgreSQL 连接池 2347 380 84%
Git rebase vs merge 702 292 58%
回调重构为 async/await 387 301 22%
微服务 vs 单体架构 446 310 30%
PR 安全审查 678 398 41%
Docker 多阶段构建 1042 290 72%
PostgreSQL 竞态调试 1200 232 81%
React Error Boundary 3454 456 87%
平均 1214 294 65%

诚实数字警告:输出 skill 本身每次对话增加 ~1–1.5k 输入 token(SKILL.md 注入成本)。如果输出本身已经很简洁,净节省可能为负。官方建议:对你的实际工作负载做 A/B 测试。

输入压缩:Wrap Benchmark

在 6 个确定性工具输出负载上,54 次运行(每个 arm 18 次)的对比:

指标 数值
直连 Claude Code 输入 token 885,793
Caveman 代理输入 token 591,673
减少比例 33.2%
95% 置信区间 14.6% – 48.5%
精确答案通过率 18/18(100%)

分负载看,日志压缩最猛(50.2%),JSON/YAML 次之(26–46%),HTML 因无压缩变换反而微增(-9.9%)。

成本估算

以 Claude Sonnet 5 定价(输入 $3/M,输出 $15/M)计算:

场景 日均 token 无 Caveman 月费 有 Caveman 月费 月省
轻度(50万输入+10万输出) 60万 $195 $145 $50
中度(200万输入+50万输出) 250万 $750 $525 $225
重度(500万输入+200万输出) 700万 $1,800 $1,260 $540

注:以上为理想情况。实际节省取决于输出长度、会话长度、负载类型。如果输出已经很简洁,skill 的固定输入成本可能超过节省。

一个真实例子

Before(无 Caveman):

I’d be happy to help you debug that race condition. The issue you’re experiencing is likely caused by multiple concurrent writes to the same database record without proper locking. Let me walk you through the fix step by step. First, we need to add a mutex lock around the critical section…

After(Caveman full):

Race condition: concurrent writes without lock. Add mutex around critical section:
mu.Lock()
defer mu.Unlock()
Check isolation level — READ COMMITTED may still allow phantom reads.

同样的诊断,从 5 行客套变成 3 行干货。

安装 + 适用场景 + 结语

安装

输出 Skill(最简单):

npx skills add JuliusBrussee/caveman

一行命令,立即生效。Claude Code 用户也可以:

claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman

输入代理(完整安装):

npm install -g @caveman-ai/cli && caveman setup --install
caveman claude        # 你的 agent 名

谁最适合用?

  • 高频 AI 编程用户(日均 >100 次对话):输出 + 输入双压缩,月省 $50–500+
  • 长会话重度用户(单会话 >50 轮):输入压缩效果随会话长度递增
  • 日志/JSON 密集型任务:代理对这类负载压缩 50–95%
  • 成本敏感的团队:统一部署到所有开发者,集体省钱

谁不需要?

  • 短问答为主的轻度用户:skill 固定输入成本可能吃掉节省
  • 按请求计费的平台(如 GitHub Copilot):缩短回答不减少请求数
  • 输出已经很简洁的 Agent:净节省可能为负

对不同角色的意义

  • 个人开发者:每月省 $50–200,相当于免费用一个月 Claude Pro
  • 技术团队:10 人团队年省 $6,000–60,000,够雇一个初级工程师
  • AI 产品经理:理解 token 经济学,优化 Agent 的成本结构

结语

Caveman 从一个 meme 级的”洞穴语”提示词,演变成了一个完整的 token 优化系统。输出压缩 65%、输入压缩 33%、Pixel 模式 79%——这些数字背后是扎实的工程:内容寻址恢复、按类型压缩、A/B 基准测试框架。

它不是银弹。短会话、简洁输出、按请求计费的场景下可能净亏损。但对于日均百万 token 级别的重度用户,Caveman 可能是目前 ROI 最高的 AI 成本优化工具。

GitHub 仓库:JuliusBrussee/caveman(99,628★,MIT + BSL 双许可)

延伸阅读:

本文数据来源:JuliusBrussee/caveman GitHub 仓库 README、docs/HONEST-NUMBERS.md、docs/WRAP-BENCHMARK.md。所有基准测试数据均为官方发布,未独立验证。作者使用过 Caveman skill 进行实际编码工作。