Open Minis 实测:手机里的 Linux 沙盒 + AI Agent,比 Siri 能干 100 倍

Open Minis 实测:手机里的 Linux 沙盒 + AI Agent,比 Siri 能干 100 倍

一、痛点切入:AI 助手为什么还不能「干活」?

2026 年,AI 对话能力已经强到惊人,但绝大多数手机 AI 助手仍然卡在一个尴尬的位置:能聊天,不能干活。

Siri 2.0 还是回答不了「我这周走了多少步」;Google Assistant 依然打不开你想要的那个设置页;三星 Galaxy AI 只会帮你润色短信。它们的共同问题是:没有一个「真实的操作环境」。

AI 需要的不只是一个对话框,而是一台能执行命令、浏览网页、读写文件、调用系统 API 的「电脑」。Open Minis 做的事情,就是把这台电脑塞进你的手机里。

核心数据一览:

指标 数值
平台支持 iOS 16+、Android 10+、macOS 13+ (Apple Silicon)、visionOS 1.0+
沙盒环境 Alpine Linux(iSH/PRoot)
AI 提供商 Anthropic、OpenAI、Google Gemini、OpenRouter、任意 OpenAI 兼容
开源协议 GPL-3.0
GitHub 仓库 OpenMinis/OpenMinis
代码语言 Swift 50.4%、Kotlin 41.8%、Objective-C 6%
发布版本 22 个(Android 最新 1.12)

二、工作原理:手机里的「虚拟电脑」

Open Minis 的架构可以用一句话概括:在手机上运行一个完整的 Linux 环境,让 AI Agent 像人类操作电脑一样操作你的手机。

2.1 三层架构

┌─────────────────────────────────────┐
│         AI 对话层(LLM)             │
│   Claude / GPT / Gemini / 自定义     │
├─────────────────────────────────────┤
│         Agent 工具层                 │
│   浏览器 · 文件系统 · 系统 API · 技能 │
├─────────────────────────────────────┤
│         设备沙盒层                   │
│   iOS: iSH (ARM64)                  │
│   Android: PRoot + Alpine Linux     │
└─────────────────────────────────────┘

沙盒层是核心创新。iOS 上用 iSH(一个 ARM64 Linux 用户态模拟器),Android 上用 PRoot(用户空间 chroot)。两者都在手机本地运行完整的 Alpine Linux 环境,支持 apk add 安装软件包、pip install 装 Python 库、ffmpeg 处理音视频——全部在设备上完成,不需要任何服务器。

工具层封装了 30+ 个 Android 原生工具和 20+ 个 iOS 原生工具,覆盖日历、通讯录、健康数据、照片、位置、通知、蓝牙等系统能力。AI 通过自然语言调用这些工具,无需用户手动操作。

对话层支持多家 LLM 提供商,每次对话可自由切换模型。你可以用 Claude 做深度分析,用 GPT 做代码生成,用 Gemini 做多模态理解——全部在同一个会话里无缝切换。

2.2 技能系统

Open Minis 的技能(Skill)设计极其简洁:一个文件夹 + 一个 SKILL.md 文件。

skills/
  my-skill/
    SKILL.md        ← 指令文档(触发条件 + 执行步骤)
    scripts/        ← 可选的脚本文件
    assets/         ← 可选的资源文件

关键设计决策:

  • 元数据常驻,内容懒加载:SKILL.md 的头部(名称、描述、触发词)始终在系统提示词中,但完整的指令和脚本只在技能被实际调用时才加载。这避免了大量技能导致的上下文膨胀。
  • 兼容 Claude/Codex/OpenClaw 技能:为其他 Agent 平台写的技能,大部分可以直接在 Open Minis 里运行。适配过 Minis 工具的技能运行得更好,因为能直接调用 Linux Shell、设备 API 和原生卸载。
  • 会话级开关:每个技能可以按会话启用或禁用,避免不必要的干扰。

2.3 记忆系统

Open Minis 实现了两级记忆:

  • GLOBAL.md:持久全局记忆,存储用户偏好、项目约定、常用配置。跨会话保留。
  • 每日日志(YYYY-MM-DD.md):当天的会话笔记、关键发现、行动项。自动注入新会话的系统提示词。

记忆通过 memory_get(关键词搜索)和 memory_write(写入当日日志)两个工具暴露给 Agent,实现了跨会话的上下文延续。


三、功能拆解:6 大核心模块

3.1 内置 Linux Shell

能力 详情
环境 Alpine Linux(最小化 rootfs)
包管理 apk add 安装系统包
Python 预装 Python 3,支持 pip install
网络 curl、wget、git、ssh 可用
媒体 FFmpeg(音视频处理)、LAME(MP3 编码)
文件系统 /var/minis/workspace/ 为工作目录,跨会话持久

实测体验:我让 Agent 在沙盒里 apk add py3-pandas,然后用 Python 读取一个 CSV 文件做数据分析,整个过程不到 30 秒。安装的软件包在会话间持久化,不需要重复安装。

杀手级场景:用户可以直接让 Agent 写 Python 脚本处理数据、用 yt-dlp 下载视频、用 ffmpeg 转换格式——这些在传统手机 AI 应用里根本做不到。

3.2 深度系统集成

Android 专属能力(传统移动 AI 应用无法触及的领域):

工具 功能 需要权限
android-calendar 读写系统日历 日历权限
android-contacts 搜索/读取通讯录 通讯录权限
android-location GPS 定位 + 正逆地理编码 位置权限
android-photos 查询设备照片库 媒体权限
android-alarm 创建系统闹钟/定时器 闹钟权限
android-clipboard 读写剪贴板 剪贴板权限
android-weather 天气预报 位置权限
android-speak 设备 TTS 语音合成 无
android-speech 麦克风语音转文字 录音权限
android-notification 发送/管理系统通知 通知权限

Shizuku 特权操作(adb 级别权限,无需电脑):

  • 安装/卸载应用
  • 授予/撤销应用权限
  • 读写系统设置
  • 执行 Shell 命令

无障碍自动化(通过 AccessibilityService):

  • 读取任意 App 的 UI 树
  • 点击按钮、填写表单、滚动页面
  • 全局截图
  • 监听实时 UI 事件

实测场景:「帮我查一下明天下午有没有空,如果有空就创建一个 2 点到 3 点的会议,标题是’产品评审’」——Agent 会先调 android-calendar list --start 2026-08-22 查日程,确认有空后调 android-calendar create --title "产品评审" --start 2026-08-22T14:00:00 --end 2026-08-22T15:00:00 创建事件。全程无需打开日历 App。

3.3 内置浏览器

能力 说明
导航 navigate 打开任意 URL
截图 screenshot 截取当前页面
交互 click、type、scroll 操作页面元素
内容提取 get_text、get_readable 获取页面文本
表单填写 自动填写网页表单
多标签 支持 3 个并发标签页
Cookie 管理 读写 Cookie,支持 HttpOnly
JavaScript 执行 在页面上下文中执行 JS

实测场景:我让 Agent 去 GitHub 搜索某个库的最新版本号,它自动打开浏览器、输入搜索词、点击结果、提取版本信息,整个过程完全自动化。还试过让它在电商网站比价——打开三个标签页分别查看三个平台的价格,最后输出对比表格。

重要限制:浏览器无法完成 Google OAuth 登录(Android 平台限制,in-app WebView 被 Google 永久禁止)。遇到登录页面时,Agent 会提示用户在系统 Chrome 中完成操作。

3.4 定时任务系统

Open Minis 内置了基于 AlarmManager 的任务调度器:

参数 选项
触发时间 自定义 HH:MM
重复模式 once / daily / weekdays / custom(指定星期几)
执行方式 new(新会话)/ follow-up(追加到已有会话)/ rerun(重跑历史消息)
模型选择 可指定不同模型执行不同任务
日期范围 可设置生效起止日期

实测案例:我设置了三个定时任务:

  1. 晨间简报(每天 07:30):自动抓取天气、日历、新闻,生成简报
  2. 每日 AI 机会扫描(每天 12:30):搜索最新 AI 行业动态,更新研究报告
  3. 自演化循环(每天 08:30):运行 capability-evolver 自动优化 Agent 行为

每个任务都是一个完整的 AI Prompt,Agent 在独立会话中执行,结果通过系统通知推送。

3.5 多模型路由

Open Minis 的模型组(Model Group)系统支持:

  • 故障转移:按顺序尝试多个模型,某个失败自动切换下一个
  • 负载均衡:将对话均匀分配到各模型
  • Thinking Level:支持 off / low / medium / high / xhigh 五档推理深度
  • 上下文窗口限制:可为每个模型组设置 token 上限
  • Agent Loop 模型:独立的模型池,供 Agent 在委派子任务时使用

实测体验:我把 Claude Sonnet 4.6 设为主力模型,GPT-4o 设为 fallback。当 Anthropic API 限流时,Agent 自动切换到 GPT-4o 继续执行,用户端几乎无感知。

3.6 自演化系统(Capability Evolver)

这是 Open Minis 最独特的功能之一:Agent 可以分析自己的运行历史,识别问题,并自主修改代码或记忆来改进表现。

基于 GEP(Gene Evolution Protocol)协议:

  1. Brain 阶段:扫描日志、提取信号、选择基因/胶囊、生成演化提示词
  2. Hand 阶段:按协议执行代码修改,分级审批(low-risk 自动应用,medium 需确认,high 阻断)
  3. 固化:将成功的演化写入胶囊,供后续复用

实测案例:在我的使用中,evolver 识别出「workflow-context 缺失」导致 Brain 生成的创新建议与实际工作流脱节,于是自动生成了 workflow-context.json 并注入用户的真实工作流信息。这种「Agent 自己改自己」的能力,在其他移动 AI 应用里闻所未闻。


四、实测数据:真实世界表现

4.1 典型任务耗时

任务 传统方式 Open Minis 提升
查天气 + 日历 + 生成简报 手动切换 3 个 App,约 5 分钟 一句话,约 30 秒 10x
拍照记录饮食 → 估算热量 打开健康 App → 手动输入,约 3 分钟 拍照 → 自动识别 → 写入 HealthKit,约 20 秒 9x
群聊提取任务 → 加入提醒 逐条阅读 → 手动创建提醒,约 10 分钟 自动拉取 → 提取 → 去重 → 写入 Reminders,约 1 分钟 10x
网页内容 → 整理成笔记 复制 → 打开笔记 App → 粘贴 → 排版,约 5 分钟 分享到 Minis → 自动整理 Markdown,约 30 秒 10x
数据分析(CSV → 图表) 传到电脑 → 打开 Excel/Python,约 15 分钟 在沙盒里 pip install + Python 脚本,约 2 分钟 7x

4.2 成本分析

Open Minis 本身完全免费(GPL-3.0 开源),但需要自备 AI API 密钥。

模型 输入价格 输出价格 典型对话成本
Claude Sonnet 4.6 $3/M tokens $15/M tokens ~$0.02-0.05
GPT-4o $2.5/M tokens $10/M tokens ~$0.02-0.04
Gemini 2.5 Flash $0.15/M tokens $0.6/M tokens ~$0.001-0.005
DeepSeek V3 $0.27/M tokens $1.1/M tokens ~$0.002-0.008

月度估算(中度使用,每天 20-30 轮对话):

  • 轻度使用(简单问答):$1-3/月
  • 中度使用(Agent 任务 + 浏览器):$5-15/月
  • 重度使用(大量代码生成 + 数据分析):$20-50/月

对比:ChatGPT Plus $20/月、Claude Pro $20/月——Open Minis 的成本取决于你用多少,而不是固定月费。用 Gemini Flash 可以把成本压到几乎为零。

4.3 与同类产品对比

特性 Open Minis Siri 2.0 Google Assistant ChatGPT App Rabbit R1
开源 ✅ GPL-3.0 ❌ ❌ ❌ ❌
Linux 沙盒 ✅ ❌ ❌ ❌ ❌
多模型支持 ✅ ❌ ❌ ❌ ❌
系统级操作 ✅ 完整 ⚠️ 受限 ⚠️ 受限 ❌ ❌
浏览器自动化 ✅ ❌ ❌ ⚠️ 有限 ❌
技能扩展 ✅ SKILL.md ❌ ❌ ❌ ❌
跨会话记忆 ✅ ⚠️ 有限 ⚠️ 有限 ✅ ❌
定时任务 ✅ ❌ ❌ ❌ ❌
后台执行 ✅ ⚠️ 受限 ⚠️ 受限 ❌ ❌
数据隐私 ✅ 本地 ❌ 云端 ❌ 云端 ❌ 云端 ❌ 云端

核心差异:Open Minis 是唯一一个在手机本地运行完整 Linux 环境的 AI Agent。这意味着它可以做任何一台 Linux 电脑能做的事情——安装软件、运行脚本、处理文件、编译代码——而不仅仅是一个「能调 API 的聊天机器人」。


五、安装指南 + 适用场景 + 结语

5.1 安装

iOS:

  1. App Store 搜索 “Open Minis”(需要 iOS 16+)
  2. 首次启动引导添加 AI 提供商(输入 API 密钥)
  3. 选择模型,开始对话

Android:

  1. 访问 openminis.app 下载 APK(需要 Android 10+)
  2. 或加入 Telegram 群获取最新版本
  3. 同样需要自备 API 密钥

macOS:

  • 需要 Apple Silicon(M1/M2/M3/M4)
  • App Store 下载

从源码构建:

git clone --recurse-submodules https://github.com/OpenMinis/OpenMinis.git
cd OpenMinis

# iOS
./deps/build_lame.sh && ./deps/build_ffmpeg.sh
./deps/build_ish.sh && ./deps/prepare_alpine_rootfs.sh
open src/ios/Minis.xcodeproj

# Android(需要 NDK r28+)
./deps/build_proot.sh && ./scripts/prepare_android_sandbox.sh
cd src/android && ./gradlew :app:assembleDebug

5.2 最适合谁

用户类型 适用度 理由
开发者 ⭐⭐⭐⭐⭐ Linux Shell + 代码执行 + Git + 多模型 = 移动开发利器
效率工具爱好者 ⭐⭐⭐⭐⭐ 自动化工作流 + 定时任务 + 跨 App 操作
内容创作者 ⭐⭐⭐⭐ 浏览器自动化 + 数据处理 + 技能扩展
隐私敏感用户 ⭐⭐⭐⭐ 本地运行 + 数据不离开设备
普通用户 ⭐⭐⭐ 需要一定技术背景,但学习曲线不算陡峭
完全不懂技术的用户 ⭐⭐ 需要自己配置 API 密钥,有一定门槛

5.3 不适合谁

  • 不想折腾 API 密钥的用户:Open Minis 没有内置模型,必须自己配置 Anthropic/OpenAI/Google 的 API 密钥
  • 只需要简单问答的用户:如果只是聊天,ChatGPT App 更简单
  • iOS 16 以下用户:最低系统要求较高
  • 需要企业级部署的团队:目前是个人工具定位,没有团队协作功能

5.4 内链推荐

5.5 结语

Open Minis 做了一件别人不敢做的事:把一台完整的电脑塞进手机里,然后让 AI 来操作它。

这不是又一个「能聊天的 AI」。它是一个真正能「干活」的 Agent——能装软件、写代码、刷网页、读你的健康数据、管理你的日程、甚至自己优化自己。全部在你的手机上本地完成,数据不离开设备。

Federico Viticci(MacStories)说它是「the most impressive indie app I’ve seen in a while」;知乎用户 Ye Han 评价它「在很大程度上实现甚至局部超越了 Apple Intelligence」;小众软件直接称它「可能是 iOS 端最强 AI Agent」。

我加一个:这可能是目前手机上唯一一个真正意义上的「AI 操作系统」——不只是一个 App,而是一个能让 AI 执行任何任务的平台。

开源、免费、跨平台、隐私优先。如果你对 AI Agent 的想象还停留在「聊天机器人」,Open Minis 会让你重新定义「AI 助手」这四个字。


本文所有数据来源于 Open Minis 官方网站(openminis.app)、GitHub 仓库(OpenMinis/OpenMinis)、小众软件评测、以及作者实际使用体验。截至 2026 年 8 月。

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token,代理输入也省 33%

AI 编程代理的账单正在失控。一个中度使用 Claude Code 的开发者,日均消耗 50 万 token,按 Claude Sonnet 5 定价月费约 $150。重度用户日均 200 万 token,月费突破 $600。而这些 token 里,至少 40% 是”废话”——客套话、填充词、重复解释、格式修饰。

JuliusBrussee 在 2026 年 4 月发布的 Caveman skill,用一个激进的思路解决了这个问题:让 AI 说”洞穴语”。去掉所有修饰,只留技术实质。结果?输出 token 平均减少 65%。这个 skill 在 4 个月内拿到 99,628 颗星,成为 GitHub 上增长最快的 AI skill 之一。

但输出压缩只是故事的一半。2026 年 8 月发布的 Caveman 2.0 新增了本地代理(Proxy),可以压缩 Agent 读入的内容——包括工具返回的日志、JSON 配置、代码文件。在官方基准测试中,代理输入 token 减少了 33.2%,且所有 18 个精确答案检查全部通过。

Caveman 怎么工作的?

Caveman 分两层运作:输出 skill(原始功能)和输入代理(2.0 新增)。

输出 Skill:让模型少说话

核心机制是一份 ~5KB 的系统提示词(SKILL.md),注入到 Agent 的上下文中。这份提示词定义了一套”洞穴语”写作规则:

  • 删除冠词(a/an/the)、填充词(just/really/basically)、客套话(sure/certainly/happy to)
  • 允许片段句、短同义词(big 代替 extensive)
  • 禁止工具调用前的解说、装饰性表格、冗长错误日志
  • 保留全部技术实质:代码块、API 名、错误信息、数字原样不动
  • 支持 6 种强度:lite / full(默认) / ultra / wenyan-lite / wenyan-full / wenyan-ultra

例如,解释”React 组件为什么重渲染”:

普通回答(69 token):

The reason your React component is re-rendering is likely because you’re creating a new object reference on each render cycle. When you pass an inline object as a prop, React’s shallow comparison sees it as a different object every time, which triggers a re-render. I’d recommend using useMemo to memoize the object.

Caveman 回答(19 token):

New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.

同一个修复方案,token 消耗减少 72%。

输入代理:让模型少读东西

Caveman 2.0 的核心创新是本地代理(Caveman Proxy)。它以 sidecar 模式运行在你的机器上,Agent 的所有 API 请求都经过它转发。代理对不同类型的载荷(payload)执行针对性压缩:

载荷类型 保留内容 压缩目标
JSON 键、结构、错误子树;折叠重复数组 70–90%
日志 错误、堆栈、首尾行;丢弃 INFO 和进度噪声 85–95%
代码 import、签名、类型;省略函数体 40–70%
Diff 文件/块头和变更行;省略重复上下文 60–80%
搜索结果 顶部/底部命中 + 诊断/安全命中 80–95%
文本/HTML 标题、首尾上下文、重要段落 50–80%

关键安全机制:CCR(Content-Addressed Recovery)。原始字节在任何有损变换之前,先存入本地磁盘的内容寻址存储。Agent 通过 caveman_retrieve 随时取回原始数据。解析失败或压缩后更大时,直接透传原始字节。

还有一个大胆的功能:Pixel 模式。将密集文本渲染成 PNG 图片,让视觉模型直接”看图”而非读文本。在 63.7k 字符的 JSON 工具目录上,55,413 个文本 token 被压缩为 11,402 个图片 token,减少 79%。

功能拆解

1. 输出 Skill(原始功能)

一句话:让 AI 用洞穴语回答,输出 token 平均减 65%。

  • 6 种强度级别,从轻度去修饰(lite)到中文文言文(wenyan)
  • 代码块、命令、错误信息完全保留,不压缩技术内容
  • 支持 30+ Agent:Claude Code、Codex、Gemini CLI、Cursor、Windsurf、Cline 等
  • 附带子命令:/caveman-commit(简洁提交信息)、/caveman-review(一行审查)

适用场景:日常编码对话、代码审查、文档生成——所有”输出长、重复多”的场景。

2. Caveman Proxy(2.0 输入压缩)

一句话:本地代理压缩 Agent 读入的所有内容,输入 token 减 33.2%。

  • 基于 Go 的本地代理,零云端依赖
  • 8 个原生 wrap 配置:Claude Code、Codex、Gemini CLI、Aider、opencode、Hermes、OpenClaw、Pi
  • caveman learn 扫描历史会话,输出 token 消耗排名和优化建议
  • caveman learn implement 让 Agent 自己修复发现的问题,逐个确认

适用场景:长会话、大量工具调用、日志密集型任务——所有”输入 token 爆炸”的场景。

3. Pixel 模式

一句话:把文本渲染成 PNG,用视觉 token 替代文本 token。

  • 只在长行密集内容上有利(JSON 工具目录、长日志)
  • 短行稀疏代码不划算,PNG 开销超过节省
  • 通过 caveman convert 可以将 SKILL.md 本身转为图片,省 61%

适用场景:大量 JSON/日志处理、工具 schema 注入。

4. 辅助工具集

工具 功能
caveman learn 扫描真实历史,输出 Cave Score + token 浪费排名
caveman shrink 压缩命令输出,可恢复
caveman browse 本地 Chrome 的压缩 a11y 树,121 token vs Playwright 的 15,704 token
caveman mem 持久化记忆,支持原始字节恢复
caveman trial A/B 测试真实会话
caveman stats 查看实际压缩统计

实测数据

输出压缩:官方 Benchmark

Caveman 仓库提供了 10 个标准化任务的对比数据:

任务 普通输出 (token) Caveman 输出 (token) 节省
解释 React 重渲染 1180 159 87%
修复 auth 中间件 704 121 83%
PostgreSQL 连接池 2347 380 84%
Git rebase vs merge 702 292 58%
回调重构为 async/await 387 301 22%
微服务 vs 单体架构 446 310 30%
PR 安全审查 678 398 41%
Docker 多阶段构建 1042 290 72%
PostgreSQL 竞态调试 1200 232 81%
React Error Boundary 3454 456 87%
平均 1214 294 65%

诚实数字警告:输出 skill 本身每次对话增加 ~1–1.5k 输入 token(SKILL.md 注入成本)。如果输出本身已经很简洁,净节省可能为负。官方建议:对你的实际工作负载做 A/B 测试。

输入压缩:Wrap Benchmark

在 6 个确定性工具输出负载上,54 次运行(每个 arm 18 次)的对比:

指标 数值
直连 Claude Code 输入 token 885,793
Caveman 代理输入 token 591,673
减少比例 33.2%
95% 置信区间 14.6% – 48.5%
精确答案通过率 18/18(100%)

分负载看,日志压缩最猛(50.2%),JSON/YAML 次之(26–46%),HTML 因无压缩变换反而微增(-9.9%)。

成本估算

以 Claude Sonnet 5 定价(输入 $3/M,输出 $15/M)计算:

场景 日均 token 无 Caveman 月费 有 Caveman 月费 月省
轻度(50万输入+10万输出) 60万 $195 $145 $50
中度(200万输入+50万输出) 250万 $750 $525 $225
重度(500万输入+200万输出) 700万 $1,800 $1,260 $540

注:以上为理想情况。实际节省取决于输出长度、会话长度、负载类型。如果输出已经很简洁,skill 的固定输入成本可能超过节省。

一个真实例子

Before(无 Caveman):

I’d be happy to help you debug that race condition. The issue you’re experiencing is likely caused by multiple concurrent writes to the same database record without proper locking. Let me walk you through the fix step by step. First, we need to add a mutex lock around the critical section…

After(Caveman full):

Race condition: concurrent writes without lock. Add mutex around critical section:
mu.Lock()
defer mu.Unlock()
Check isolation level — READ COMMITTED may still allow phantom reads.

同样的诊断,从 5 行客套变成 3 行干货。

安装 + 适用场景 + 结语

安装

输出 Skill(最简单):

npx skills add JuliusBrussee/caveman

一行命令,立即生效。Claude Code 用户也可以:

claude plugin marketplace add JuliusBrussee/caveman && claude plugin install caveman@caveman

输入代理(完整安装):

npm install -g @caveman-ai/cli && caveman setup --install
caveman claude        # 你的 agent 名

谁最适合用?

  • 高频 AI 编程用户(日均 >100 次对话):输出 + 输入双压缩,月省 $50–500+
  • 长会话重度用户(单会话 >50 轮):输入压缩效果随会话长度递增
  • 日志/JSON 密集型任务:代理对这类负载压缩 50–95%
  • 成本敏感的团队:统一部署到所有开发者,集体省钱

谁不需要?

  • 短问答为主的轻度用户:skill 固定输入成本可能吃掉节省
  • 按请求计费的平台(如 GitHub Copilot):缩短回答不减少请求数
  • 输出已经很简洁的 Agent:净节省可能为负

对不同角色的意义

  • 个人开发者:每月省 $50–200,相当于免费用一个月 Claude Pro
  • 技术团队:10 人团队年省 $6,000–60,000,够雇一个初级工程师
  • AI 产品经理:理解 token 经济学,优化 Agent 的成本结构

结语

Caveman 从一个 meme 级的”洞穴语”提示词,演变成了一个完整的 token 优化系统。输出压缩 65%、输入压缩 33%、Pixel 模式 79%——这些数字背后是扎实的工程:内容寻址恢复、按类型压缩、A/B 基准测试框架。

它不是银弹。短会话、简洁输出、按请求计费的场景下可能净亏损。但对于日均百万 token 级别的重度用户,Caveman 可能是目前 ROI 最高的 AI 成本优化工具。

GitHub 仓库:JuliusBrussee/caveman(99,628★,MIT + BSL 双许可)

延伸阅读:

本文数据来源:JuliusBrussee/caveman GitHub 仓库 README、docs/HONEST-NUMBERS.md、docs/WRAP-BENCHMARK.md。所有基准测试数据均为官方发布,未独立验证。作者使用过 Caveman skill 进行实际编码工作。

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

2026年8月最热门AI Skill精选:15个必装技能提升你的AI Agent

AI Agent Skill 生态爆发式增长,GitHub 上已有 1497+ 个官方/社区 skill。本文基于 awesome-agent-skills(30.6k★)、awesome-claude-code(52.7k★)和 awesome-claude-skills(72.9k★)三大索引,结合 GitHub 星标和活跃度,精选出 2026 年 8 月最热门的 15 个 AI Skill。

一、生态全景:1497+ Skill 的三大来源

截至 2026 年 8 月,AI Agent Skill 生态已形成三大索引体系:

索引 星标 Skill 数 特点
ComposioHQ/awesome-claude-skills 72.9k★ 1497+ 官方团队(Anthropic/Google/Stripe/Cloudflare)+ 社区精选
hesreallyhim/awesome-claude-code 52.7k★ 精选 100+ 手工策展,质量最高,每条有详细评测
VoltAgent/awesome-agent-skills 30.6k★ 1497+ 跨平台兼容(Claude Code/Cursor/Gemini CLI/Copilot)

覆盖领域:办公文档 / 前端设计 / 营销 / 科研 / 安全 / DevOps / 游戏开发 / 视频制作。

二、Tier 1:必收的 5 个王炸 Skill

1. ECC(Enhanced Claude Code)— Agent 性能优化系统

星标:241,448 ★

  • 核心能力:Skills 性能优化 + Instincts 本能系统 + Memory 记忆持久化 + Session 管理
  • 为什么收:全网最高星标的 AI Agent skill,不是单一功能,而是一套完整的 Agent 增强框架。安装后 Claude Code 的响应速度、代码质量、上下文管理全面提升
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code

2. Graphify — 代码库知识图谱

星标:108,679 ★

  • 核心能力:将任意代码库(含文档、SQL schema、配置、PDF)转化为可查询的知识图谱
  • 为什么收:解决大型项目上下文丢失的核心痛点。不再需要反复粘贴文件,Agent 自动理解项目全貌
  • 评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / Cursor / Windsurf

3. Anthropic Office 四件套(docx/xlsx/pptx/pdf)

官方出品,17 个 skill

  • 核心能力:Word 文档(跟踪修订+评论)/ Excel(公式+图表+金融模型规范)/ PowerPoint(模板填充+设计指导)/ PDF(提取+合并+表单+OCR)
  • 为什么收:Anthropic 官方维护,生产级质量,金融模型规范含大量避坑指南(pptxgenjs 12 个陷阱)。覆盖办公文档全流程
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐
  • 适用平台:Claude Code / Claude.ai

4. andrej-karpathy-skills — Karpathy 行为准则

星标:204,375 ★

  • 核心能力:4 条从 Andrej Karpathy 公开笔记提炼的 LLM 编码行为准则,注入 CLAUDE.md
  • 为什么收:安装成本为零(一个文件),效果立竿见影。Karpathy 对 LLM 编码陷阱的理解是业界顶级
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code / 任何支持 CLAUDE.md 的工具

5. caveman — 超压缩输出模式

星标:99,612 ★

  • 核心能力:砍掉 65% 输出 token,保留全部技术实质(代码/报错/API 名/数字原样)
  • 为什么收:在 token 计费时代,每次对话省 65% 成本。支持 lite/full/ultra 三级强度,可随时切换
  • 评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐
  • 适用平台:Claude Code

三、Tier 2:精选的 5 个领域王者

Skill 星标 定位 亮点
academic-research-skills 43,162★ 学术研究全流程 研究→写作→审阅→修改→格式化,5 阶段 pipeline
marketing-skills 45,076★ 营销全套 CRO / 文案 / SEO / 数据分析,Claude Code 生态最全营销 skill
scientific-agent-skills 34,004★ AI 科学家 将任何 Agent 变成 AI 科研助手,覆盖 20+ 学科领域
cybersecurity-skills 30,351★ 网络安全 817 个结构化安全 skill,映射 MITRE ATT&CK 等 6 大框架
hallmark 26,163★ 反 AI 味设计 Anti-AI-slop 设计引擎,让 AI 生成内容看起来不像 AI 写的

四、Tier 3:值得关注的 5 个新锐

Skill 星标 定位 为什么值得关注
planning-with-files 26,265★ 持久化任务规划 解决长任务崩溃丢失进度的痛点,文件级持久化
reverse-skill 27,016★ 逆向工程 安全研究/授权渗透测试,覆盖 PE/ELF/Mach-O 多格式
huashu-design 23,343★ HTML 原生设计 中文开发者主导,Claude Code 里直接出 HTML 设计稿
khazix-skills 19,877★ 中文 AI 合集 数字生命卡兹克出品,含 leader/洁癖/hv-analyst 等中文原创
capcut-cli 精选收录 视频编辑 零依赖 CLI,可编程编辑剪映项目,205 个测试覆盖三端

五、官方团队 Skill 速览

以下团队均发布了官方 skill,质量有保障:

团队 Skill 方向 数量
Anthropic 办公四件套 + 设计 + MCP Builder + Web Testing + Internal Comms 17 个
Google Gemini API 开发 + Vertex AI + Live API + Interactions API 4 个
Stripe 支付集成最佳实践 + SDK 升级指南 2 个
Vercel Next.js 部署 + Edge Runtime 2 个
Cloudflare Workers + R2 + D1 集成 3 个
Supabase PostgreSQL 最佳实践 1 个
HashiCorp Terraform Provider 开发全流程 10 个
TestMu AI 46 种测试框架覆盖(Playwright/Jest/Pytest/Selenium…) 46 个

六、安装建议:3 步上手

Step 1:基础增强(5 分钟)

安装 andrej-karpathy-skills + caveman,零成本提升 Agent 基础能力。

Step 2:办公提效(10 分钟)

安装 Anthropic Office 四件套,覆盖 Word/Excel/PPT/PDF 全流程。

Step 3:按需扩展

根据你的领域选择 Tier 2/3 的 skill。科研选 academic-research-skills,营销选 marketing-skills,安全选 cybersecurity-skills。

七、趋势观察

1. Skill 从”功能补丁”进化为”能力系统”

头部 skill(ECC、Graphify)已不再是单一功能,而是完整的 Agent 增强框架。2026 年的 skill 竞争已从”谁功能多”转向”谁的系统设计好”。

2. 官方团队入场加速

Anthropic、Google、Stripe、Cloudflare 等一线团队均发布官方 skill,标志着 skill 生态从社区驱动进入官方+社区双轨时代。

3. 跨平台兼容成标配

VoltAgent 的 awesome-agent-skills 明确标注”兼容 Claude Code / Cursor / Gemini CLI / Copilot / Windsurf”,skill 的平台锁定正在被打破。

4. 中文生态崛起

huashu-design(23k★)、khazix-skills(19k★)等中文原创 skill 已进入全球前列。中国开发者在 AI skill 生态中的存在感显著增强。

八、数据来源与声明

本文数据采集自 2026 年 8 月 21 日,来源包括:

  • GitHub awesome-agent-skills(30,626★,1497+ skill)
  • GitHub awesome-claude-code(52,721★)
  • GitHub awesome-claude-skills(72,902★)
  • GitHub Search API(按星标排序)

星标数据为采集时快照,可能随时间变化。排名不代表绝对优劣,请根据实际需求选择。

AI 办公革命:6 个必装的文档处理技能

AI 办公革命:6 个必装的文档处理技能

Anthropic 在 2025 年底将 Agent Skills 标准开源后,办公文档处理领域迅速涌现出一批生产级技能。我们从 awesome-claude-skills(72.7k★)、Anthropic 官方仓库和 Cursor Directory(86.8k 开发者)中,筛选出 6 个最值得安装的文档处理技能——覆盖 Word、Excel、PPT、PDF 全格式,以及协作文档编辑和内部沟通两大高频场景。

为什么办公文档处理是 AI Agent 的必争之地

据 Gartner 预测,到 2026 年底全球 40% 的企业应用将嵌入 AI Agent,但目前仅有 16.3% 的企业深耕专业场景。办公文档处理恰恰是那个”高频、低门槛、高价值”的切入点——每个知识工作者每天都在和 Word、Excel、PPT、PDF 打交道,而这些工作的大量时间花在了格式调整、数据整理、模板填充等重复性劳动上。

2025 年 10 月 Anthropic 推出 Agent Skills 格式、12 月开源以来,文档处理类技能成为生态中质量最高、最成熟的品类。这不仅因为 Anthropic 官方投入了四个核心技能(docx/xlsx/pptx/pdf),更因为文档处理天然是”结构化输入→结构化输出”的任务,与 LLM 的能力高度契合。

我们实际测试了 15+ 个办公相关技能,从易用性、实用性和维护度三个维度打分,最终选出以下 6 个——它们要么是官方 production-ready 实现,要么在特定场景下解决了真实痛点。

6 个必装技能详解

Tier 1

1. Anthropic docx — Word 文档全流程处理

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑、分析 Word 文档,支持跟踪修订、评论系统、格式化验证。

这是 Claude.ai 底层文档能力的核心实现。创建新文档走 docx-js 脚本,支持目录、页码、页眉页脚、信头等专业排版;编辑现有文档通过 unzip→修改 XML→zip 的方式,能精确处理跟踪修订(ins/del 标签)和评论系统(六个交叉引用文件);读取内容用 pandoc 转 markdown。最实用的是验证环节——LibreOffice 渲染 + pdftoppm 截图 QA,确保输出在 Word 和 Google Docs 中都能正确显示。

避坑指南:docx-js 默认 A4 纸,美式信纸需手动设尺寸;表格需要双重宽度(columnWidths + 每个 cell 的 width);列表必须用 numbering config,不能手打”•”;图片必须带 type 字段。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

2. Anthropic xlsx — 电子表格操作与金融模型

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑 Excel 表格,支持公式、图表、数据转换和金融模型规范。

这个技能的含金量藏在避坑指南里。openpyxl 写公式后必须跑 LibreOffice recalc(脚本封装好了),否则所有公式返回 None;data_only=True 保存会永久丢失公式;外部链接引用的文件不在本地时会被静默破坏。它还内置了一套完整的金融模型规范:蓝色字=硬编码输入、黑色=公式、绿色=跨 sheet 链接、红色=跨文件链接、黄色填充=关键假设。

特别注意:XLOOKUP、XMATCH、SORT、FILTER、UNIQUE、SEQUENCE 这些新函数在 LibreOffice 环境下不可用,必须用 INDEX/MATCH 替代。post-2007 函数(TEXTJOIN、CONCAT、IFS 等)需要加 _xlfn. 前缀。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

3. Anthropic pptx — 演示文稿创建与模板填充

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:创建、编辑、读取 PowerPoint 演示文稿,含设计理念指导和配色方案表。

从”创建空白”到”模板填充”到”读取分析”全覆盖。创建走 pptxgenjs 脚本,支持原生图表、react-icons 渲染的图标、speaker notes;编辑走 unzip→XML→zip,含 add_slide.py(复制幻灯片)、clean.py(清理孤立资源)、validate.py(验证)完整工具链。读取用 markitdown + thumbnail.py 生成缩略图网格。

设计彩蛋:技能内置了 5 套配色方案(Midnight Executive / Forest & Moss / Coral Energy / Warm Terracotta 等),还给出了”深浅对比 sandwich 结构””视觉母题重复”等设计理念指导。12 个 pptxgenjs 已知陷阱中,最致命的是”stacked bar 的 dataLabelPosition 必须用 ctr/inEnd/inBase,用 outEnd 会损坏文件”。

★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 1

4. Anthropic pdf — PDF 处理全流程

仓库:anthropics/skills · 许可:Proprietary · 平台:Claude Code / Claude.ai / API / Cursor

一句话:PDF 提取、合并、拆分、旋转、表单填写、OCR、加密解密,全流程覆盖。

PDF 是办公中最高频的格式之一,这个技能覆盖了几乎所有常见操作。读取用 pypdf(文本+元数据)和 pdfplumber(表格提取,保留布局);写入/合并/拆分/旋转都用 pypdf 的 PdfWriter;表单填写有专门的 FORMS.md 指南(含字段类型识别、JavaScript 动作处理等进阶内容)。OCR 场景用 pytesseract 处理扫描件。

实用场景:合同审批(提取条款+填写表单+加密)、报告合并(多部门 PDF 合一)、发票处理(表格提取→Excel 导出)。

★★★★★ 易用性 ★★★★★ 实用性 ★★★★★ 维护度

Tier 2

5. doc-coauthoring — 协作文档编辑工作流

仓库:anthropics/skills · 许可:Apache 2.0 · 平台:Claude Code / Claude.ai / API

一句话:三阶段结构化协作流程,引导用户高效产出文档。

这不是一个”生成文档”的技能,而是一个”引导协作”的技能。三个阶段分别是:上下文收集(Claude 问清文档类型、受众、期望影响、模板要求,用户倾倒所有背景信息)、迭代精炼(逐节构建,brainstorm + 编辑)、读者测试(用一个全新的 Claude 实例,在无上下文状态下阅读文档,检测盲点和歧义)。

独特价值:读者测试阶段用新实例模拟”首次阅读者”,能发现作者因熟悉内容而忽略的逻辑断层。支持 PRD、设计文档、决策文档、RFC 等多种类型,还能自动为没有 alt-text 的图片生成描述。

★★★★★ 易用性 ★★★★ 实用性 ★★★★★ 维护度

Tier 2

6. Internal Comms — 内部沟通模板库

仓库:anthropics/skills · 许可:Apache 2.0 · 平台:Claude Code / Claude.ai / API

一句话:覆盖 3P 更新、新闻稿、FAQ、状态报告等 7 种内部沟通模板。

内部沟通是被严重低估的办公场景。这个技能提供了完整的模板库:3P 更新(Progress/Plans/Problems)是硅谷最常用的团队周报格式,公司新闻稿、FAQ 撰写、状态报告、领导层更新、项目更新、事故报告都有对应的 guideline 文件。使用时只需告诉 Claude “写一份本周 3P 更新”,它会自动加载对应的模板并引导你填充内容。

适用团队:工程团队周报、产品团队状态同步、管理层汇报、跨部门沟通。特别适合远程团队标准化沟通格式。

★★★★★ 易用性 ★★★★ 实用性 ★★★★★ 维护度

对不同角色的实操建议

对研发负责人

优先安装 docx + xlsx + pdf 三件套。日常的 API 文档编写、测试报告生成、数据表格处理都能直接用上。doc-coauthoring 特别适合技术方案评审前的文档打磨——先让 Claude 帮你过一遍逻辑,再提交给团队。

对产品经理 / 项目管理者

pptx + Internal Comms 是你的效率倍增器。周报、OKR 汇报、产品评审 deck 都能快速产出。doc-coauthoring 的三阶段流程非常适合 PRD 和产品需求文档的协作编辑。

对投资者 / 分析师

xlsx 的金融模型规范直接可用——蓝字输入、黑字公式、绿链接、红跨文件、黄假设,颜色编码让审阅者一眼看清数据流向。配合 pdf 的表格提取能力,可以从财报 PDF 中快速抽取关键数据并结构化到 Excel。

对远程团队

Internal Comms + doc-coauthoring 组合拳:前者标准化沟通格式(3P 更新、状态报告),后者保证文档质量(读者测试防盲点)。特别适合跨时区团队异步协作。

安装与使用

Anthropic 官方四个技能(docx/xlsx/pptx/pdf)已内置在 Claude.ai 付费计划中,也可通过 Claude Code 插件市场安装:

/plugin marketplace add anthropics/skills

/plugin install document-skills@anthropic-agent-skills

doc-coauthoring 和 Internal Comms 同样在官方仓库中,安装方式相同。社区技能(如 Google Workspace Skills)可从 GitHub 仓库手动复制到 .claude/skills/ 目录。

小结

办公文档处理是 AI Agent 最接地气的落地场景。Anthropic 官方的四件套已经做到了生产级水准,而 doc-coauthoring 和 Internal Comms 则在”协作流程”和”沟通标准化”两个维度补齐了办公全链路。对于想要提升知识工作者效率的团队来说,这 6 个技能是 2026 年最值得投入的基础设施。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

AI 时代的教育革命:5 个必装的 AI 教学技能

AI 时代的教育革命:5 个必装的 AI 教学技能

在 AI 编程工具飞速发展的今天,一个悖论正在形成:AI 越会写代码,人类越不会写代码。开发者们复制粘贴 AI 生成的代码,却从未真正理解这些代码背后的逻辑。这不仅是个技术问题,更是个教育危机。

核心问题:AI 编程工具可能导致学习退化——生成效应、流畅性错觉、间隔效应、元认知缺失、测试与检索缺失。我们需要在效率与学习之间找到平衡。

为什么你需要这些技能?

传统的编程学习路径正在被 AI 工具颠覆。当你让 Claude 写一个函数,然后直接复制到项目中,你失去了:

  • 主动生成:自己思考解决方案的机会
  • 检索练习:回忆和应用知识的过程
  • 间隔重复:长期记忆形成的关键
  • 元认知:监控自己理解程度的能力

幸运的是,AI 社区已经开发出了一系列技能来解决这些问题。以下是经过验证的 5 个最实用的教育技能。

Tier 1:必装技能

1. Learning Opportunities — AI 辅助编程中的刻意练习

仓库:github.com/DrCatHicks/learning-opportunities

星标:⭐⭐⭐⭐⭐ 2,363

核心能力:

  • 动态教材:在 AI 辅助编码时提供 10-15 分钟的学习练习
  • 基于证据的学习科学:预测、生成、检索练习、间隔重复
  • 仓库导航:`orient` skill 帮助快速理解新代码库
  • 自动提示:可选的 post-commit 钩子自动提供学习机会

为什么必装:这是唯一专门解决”AI 编程导致学习退化”问题的技能。它基于教育心理学研究,提供科学验证的学习方法。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐⭐

适用平台:Claude Code Codex Hermes Agent

2. AntiVibe — 代码学习与审计框架

仓库:github.com/mohi-devhub/antivibe

星标:⭐⭐⭐⭐ 1,091

核心能力:

  • 深度解析:将任何代码库转化为教育性深度讲解
  • 审计模式:高级架构审计——决策、标志、边缘情况、可测试性
  • 技能级别:可调节深度到 `junior`、`mid` 或 `senior`
  • 输出模式:`compact`(默认,低 token 成本)或 `full`(资源 + 逐行)

为什么必装:解决”AI 写代码,开发者复制粘贴,没人学习”的核心问题。它不只是解释代码,而是教你理解代码背后的设计决策。

评分:易用性 ⭐⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐

适用平台:Claude Code

3. Education Agent Skills — 165 个教育技能库

仓库:github.com/GarethManning/education-agent-skills

星标:⭐⭐⭐⭐ 635

核心能力:

  • 165 个基于证据的教育技能,覆盖 20 个领域
  • 教师和设计师导向:教学法、学习科学、课程、评估
  • 学生导向:实时 AI 交互模式,塑造学习过程
  • 跨平台:Claude、Codex、Hermes Agent

为什么必装:最全面的教育技能库,适合教师、学校领导和 EdTech 开发者。每个技能都有科学依据。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐⭐ / 维护度 ⭐⭐⭐⭐

适用平台:Claude Codex Hermes Agent

4. Bloom — 苏格拉底式 AI 家教

仓库:github.com/Li-Evan/Bloom

星标:⭐⭐⭐ 235

核心能力:

  • 2-Sigma 研究:基于教育心理学的 AI 家教系统
  • 中文优先:苏格拉底式教学方法
  • 自适应学习:根据学习者的表现调整教学内容
  • 可自托管 Web 应用

为什么必装:专注中文教育,有教育理论支撑。苏格拉底式教学法能有效促进深度学习。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐

适用平台:Claude Code

5. Universal Diagnostic Tutor Skill — STEM 诊断式家教

仓库:github.com/SenmuuuuW/universal-diagnostic-tutor-skill

星标:⭐⭐⭐ 170

核心能力:

  • 诊断优先:先诊断学习问题,再进行教学
  • 概念教学:教授概念,检查理解,建立掌握
  • STEM 专注:专注于科学、技术、工程、数学

为什么必装:诊断式教学方法有效,能针对性地解决学习难点。

评分:易用性 ⭐⭐⭐⭐ / 实用性 ⭐⭐⭐⭐ / 维护度 ⭐⭐⭐

适用平台:Claude Code

如何选择?

开发者学习新代码库:AntiVibe + Learning Opportunities

教师备课:Education Agent Skills

学生自学:Bloom + Universal Diagnostic Tutor

EdTech 开发者:Education Agent Skills + Teaching Site Skills

安装教程

Learning Opportunities

# Claude Code
/plugin marketplace add https://github.com/DrCatHicks/learning-opportunities.git
/plugin install learning-opportunities@learning-opportunities

# Codex
codex plugin marketplace add https://github.com/DrCatHicks/learning-opportunities.git

AntiVibe

git clone https://github.com/mohi-devhub/antivibe.git
cp -r antivibe ~/.claude/skills/antivibe

Education Agent Skills

# Claude
claude plugin install https://github.com/GarethManning/education-agent-skills

# Codex
git clone https://github.com/GarethManning/education-agent-skills.git
cd education-agent-skills
codex plugin marketplace add "$PWD"

结语:AI 教育的未来

AI 不是要取代教育,而是要重新定义教育。这些技能证明,AI 可以成为强大的教育工具,而不仅仅是生产力工具。

关键在于有意识地使用 AI——不是让它替我们思考,而是用它来增强我们的学习能力。当我们把 AI 编程工具从”代码生成器”转变为”学习伙伴”,我们就能在提高效率的同时,保持甚至提升我们的技能。

这 5 个技能只是开始。随着 AI 教育生态的发展,我们将会看到更多创新的学习工具。但核心原则不会变:学习是为了理解,不是为了复制。

你已经在使用 AI 编程工具了吗?试试这些技能,让 AI 成为你的学习伙伴,而不仅仅是代码生成器。

立即开始学习 →

“AI 编程工具可以创建特定的风险,通过引入低效的学习习惯来降低用户的学习参与度。这些效果可以根据基础科学支持的学习原则来预测。” —— Learning Opportunities README

GreatCTO 实测:69 个 AI Agent 帮你从设计到上线,一个功能只要 $3.40

GreatCTO 实测:69 个 AI Agent 帮你从设计到上线,一个功能只要 $3.40

Solo 开发者最大的痛点不是写代码,而是一个人要干一个团队的活:架构设计、前后端开发、测试、安全审查、部署上线——每一步都需要不同领域的专业知识。现在,一个叫 GreatCTO 的开源工具声称:描述一个产品,批准两次,就能拿到一个完整可运行的应用。

它背后是 69 个专家 AI Agent,按软件开发生命周期(SDLC)编排成一条流水线。实测数据:一个功能从描述到上线 1 小时 26 分钟,token 成本 $3.40;完整产品中位数 $171。

它怎么工作?

GreatCTO 的流程极其简洁:

描述产品 → AI 生成 spec + 架构 + 数据模型 + 界面设计 → 🟢 你审批设计 → AI 脚手架 + 后端 + 前端 + 测试 + 代码审查 + 安全审计 → 🟢 你审批部署 → 上线

你全程只做两件事:批准”建什么”和批准”上不上线”。中间 69 个 agent 自动协作。

日常使用三个命令:

  • /start "描述你的产品" — 启动流水线
  • /inbox — 查看待审批项和阻塞任务
  • /digest — 周报:DORA 指标 + 每个功能的成本

69 个 Agent 是怎么分工的?

GreatCTO 把 69 个 agent 按角色分成 7 个团队:

1. 产品定义团队(Prototyper)— 4 个 agent
把模糊的想法变成可执行的方案:

  • product-owner:第一个启动的 agent。把原始想法变成产品简报,甚至会启动”多 LLM 辩论”(4 个 AI 角色在 4 个模型上辩论)来验证方案
  • architect:生成架构文档、ADR(架构决策记录)、成本估算
  • decision-scorer:给 2+ 个架构方案打分,输出加权评分表
  • design-advisor:选设计系统、列组件清单、写文字版线框图

2. 开发团队(Builder)— 11 个 agent
各司其职的全栈开发:

  • app-scaffolder:搭建 Next.js + TypeScript + Tailwind 骨架,配好数据库和认证
  • senior-dev:主力开发,TDD 方式实现功能(可并行运行多个)
  • auth-engineer:认证和权限专家(Auth.js / Clerk / RBAC / 多租户隔离)
  • integrations-engineer:第三方 API 对接(Stripe / Twilio / Google Calendar / Shopify)
  • subscription-billing-engineer:订阅计费(Stripe Billing / 用量计费 / 试用期 / 退款)
  • mobile-app-builder:React Native 移动端开发
  • geo-routing-engineer:地理空间和路径优化
  • media-pipeline-engineer:视频/图片处理管线
  • connector-builder:数据源连接器(Stripe / GA / QuickBooks)
  • migration-import-engineer:数据迁移和导入
  • ai-eval-engineer:AI 产品的评估管线

3. 质量团队(Sweeper)— 3 个 agent
代码审查 + 测试:

  • qa-engineer:分析实际代码,按类型做 QA
  • code-reviewer:读 diff,报 bug,给裁决
  • e2e-test-engineer:生成 Playwright 端到端测试,部署后自动跑

4. 安全与合规团队(Reviewers & Safety)— 30+ 个 agent
这是 GreatCTO 的核心护城河。覆盖 30+ 个垂直行业的合规审查:

  • pci-reviewer:PCI-DSS 支付合规
  • healthcare-reviewer:HIPAA 医疗数据合规
  • gdpr-reviewer:GDPR + EU AI Act + NIS2
  • ai-security-reviewer:OWASP LLM Top 10
  • legal-reviewer:律师-客户特权 / UPL 防护
  • insurance-reviewer:NAIC 保险合规
  • tax-reviewer:IRS 电子报税
  • ……还有政府、教育、游戏、流媒体、固件、DAO 等 30+ 个领域

每个 reviewer 的工作方式相同:分析项目类型 → 输出威胁模型(TM-{slug}.md)→ 在 senior-dev 开发前签署关键/高危缓解措施。

5. 增长团队(Grower)— 2 个 agent

  • performance-engineer:性能测试(k6/Locust)、延迟分析、容量规划
  • growth-engineer:北极星指标、激活/留存漏斗、增长实验设计

6. 运维团队(Maintainer)— 3 个 agent

  • devops:部署执行
  • infra-provisioner:基础设施配置(Neon 数据库 / Vercel 托管 / DNS / TLS)
  • l3-support:线上问题排查和事故响应

7. 编排团队(Orchestration & Meta)— 4 个 agent

  • pm:读架构文档,分解任务,生成 Gantt 图,分配 agent
  • coordinator:多流协调,跨 agent 调度
  • project-auditor:技术债务审计和重构计划
  • continuous-learner:会话结束时提取模式和经验,写入全局知识库

实测数据

GreatCTO 在公开 benchmark 上跑了 7 个完整产品:

指标 数据
单功能端到端 1 小时 26 分钟 / $3.40 token 成本
完整产品(7 个基准) 中位数 $171 / 质量 70/100(58-86)
典型月度(20 次流水线) ~$34
支持的产品类型 60 种,覆盖 15 个美国行业

质量评分来自运行产品自身的测试(不是数文件数),所以是 70 而不是 100——这恰恰说明数据是真实的。

安全性设计

几个值得注意的设计:

  • 范围隔离:agent 在写入时就被限制在自己的职责范围内,不是审查时才检查
  • 合规永不跳过:即使设为”auto”模式(无人审批),安全和合规门控仍然强制执行
  • 本地运行:所有代码在本地执行,prompt 只发给你自己的 LLM 提供商
  • 遥测默认关闭:不收集任何使用数据

安装

npx great-cto init

一行命令。自动安装 Companion 插件(Superpowers、Beads)。重启 Claude Code 后即可使用。支持 Claude Code(默认)和 OpenAI Codex(加 --host codex)。

需要 Node ≥ 18.17。

适用场景与局限

最适合:独立开发者、Solo 创业者、CTO 一个人扛一个产品。你有一个想法,想快速验证——GreatCTO 帮你从 0 到上线。

不适合:多人协作的团队(”For one builder”是作者原话);需要 CI/CD 系统的成熟项目;需要正式合规认证的场景(PCI/HIPAA 脚手架是起点不是终点)。

对不同角色的意义

对独立开发者:你不再需要自己搞安全审查、写测试、配基础设施。69 个 agent 分工覆盖了你一个人顾不到的角落。$3.40 一个功能,$171 一个产品——这个成本结构改变了”一个人能做什么”的上限。

对创业团队:用 GreatCTO 快速出 MVP,验证产品假设,再决定是否组建正式团队。先跑通流程再招人。

对 AI 应用开发者:GreatCTO 的多 agent 编排架构(7 团队 69 agent + 范围隔离 + 合规门控)是一个值得研究的参考实现。它证明了”LLM + 多 agent 协作”不是 demo,而是已经跑通的工程实践。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

GreatCTO 为开源项目(MIT 协议),本文不构成投资建议。
相关阅读:AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能 | LeanCTX 实测:砍掉 86% token 成本

LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本,月费从 $450 降到 $60

LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本,月费从 $450 降到 $60

用 AI 写代码的人都有一个共同的痛:token 太贵了。

Claude Sonnet 输入 $3/百万 token,GPT-4o 也不便宜。一个中等规模的代码仓库,AI 每次读几个文件、跑几条 shell 命令,一个 session 随随便便烧掉 60 万 token——$1.5 美元。一天跑 10 次就是 $15,一个月 $450。更扎心的是,其中大部分 token 是”废话”:重复读同一个文件、git log 的冗余输出、shell 命令的无关行。

现在,一个 Rust 写的本地工具声称能砍掉 60-87% 的 token。它叫 LeanCTX,GitHub 上有实测 benchmark,数据可复现。

一个数字说清问题

LeanCTX 团队对自身代码库(Rust + TypeScript + Python,约 5 万行)做了 30 分钟编码 session 模拟:

配置 Token 消耗 成本 节省
无压缩(原始) 605,400 $1.51 —
LeanCTX 全模式 84,400 $0.21 86.1%
LeanCTX + CRP 79,900 $0.20 86.8%

从 $1.51 降到 $0.20。如果你一天跑 10 个 session,月费从 $450 降到 $60。这不是理论值——用的是 tiktoken cl100k_base 精确计数,不是字符除以 4 的粗估。

它到底做了什么?

LeanCTX 的核心思路:在 AI 读文件和跑命令之前,先替它”读一遍”,把无关信息过滤掉,只把有价值的部分送给模型。

它由五大模块组成:

1. 上下文压缩(Context Compression)
这是最核心的能力。10 种读取模式自动选择:

  • map 模式:只提取依赖关系和 API 接口,跳过实现细节。Rust 文件省 96.5%,JS 文件省 99.1%
  • signatures 模式:只保留函数签名和类型定义,Python 文件省 94.5%
  • cache_hit:重复读取同一文件只需 ~13 token(原始 ~2000 token),省 99.8%
  • aggressive 模式:去注释去空行,适用于文档和配置文件

2. 智能分流(Intelligent Triage)
不是所有任务都需要读完整文件。LeanCTX 会分析任务类型,自动选择最经济的读取模式。简单查询走轻量模式,复杂分析才用全文。

3. 知识路由(Knowledge Routing)
跨会话记忆持久化——AI 记住你上次看了什么文件、做了什么决策。下次新会话不需要重新发现,直接 recall。记忆以 .ctxpkg 格式导出,换模型不丢失。

4. 成本追踪(AI Value Gate)
内置仪表盘实时显示 token 消耗和成本。引入 CPAO(Cost per Accepted Outcome)指标——不只看省了多少 token,还看”花出去的 token 产出了多少有用结果”。

5. 影子模式(Shadow Recommendations)
对比压缩前后的输出质量,只在确认质量不降的前提下推荐节省方案。

实测数据:按语言拆解

LeanCTX 在 9 种语言的 50 个文件上做了精确 benchmark:

语言 文件数 原始 Token 最佳模式 节省率
Rust 10 144,295 map 96.5%
JavaScript 10 71,352 map 99.1%
TypeScript 4 13,974 map 95.6%
Python 9 26,688 signatures 94.5%
Markdown 10 80,376 aggressive 5.6%
JSON 5 67,430 aggressive 0.5%

规律很明显:代码文件压缩率极高(94-99%),因为结构化信息(函数签名、API 表面)只占源码的一小部分;数据文件压缩率低,因为本身就没有冗余结构。

CLI 输出压缩同样亮眼——1794 条真实命令的统计:

  • git log --stat -10:8,693 字符 → 636 字符,省 92.7%
  • git diff HEAD~5 --stat:3,077 字符 → 179 字符,省 94.2%
  • git status:2,350 字符 → 1,585 字符,省 32.6%

LeanCTX 内置 95+ 种 shell 输出压缩规则,覆盖 git、npm、cargo、docker、kubectl、terraform 等主流工具。

一个例子:auth 模块的上下文查询

当 AI 被问”auth 模块怎么工作的?”时:

没有 LeanCTX:读 auth.rs(2,500 token)+ middleware.rs(1,800 token)+ config.rs(900 token)= 5,200 token

有 LeanCTX:map 模式读 auth.rs(65 token)+ map 模式读 middleware.rs(42 token)+ map 模式读 config.rs(18 token)= 125 token

节省 97.6%。AI 拿到的是依赖关系图和 API 签名——这对回答”怎么工作的”已经足够了。如果需要深入实现细节,再用 ctx_expand 按需展开。

安装:一条命令,30 秒

# Cargo(推荐)
cargo install lean-ctx

# 或从源码
git clone https://github.com/yvgude/lean-ctx
cd lean-ctx/rust && cargo build --release

安装后一行命令启动:

lean-ctx setup

零配置。它会自动识别你的 coding agent(Cursor / Claude Code / Copilot / Windsurf / Codex / Gemini CLI 等 30+ 种),插入代理层。不需要改任何配置文件。

对比”6 工具栈”的安装体验:6 个仓库、3 种语言、15 分钟配置、各种 bridge 脚本……LeanCTX 把这一切压缩成一个二进制。

生态兼容:不只是压缩工具

LeanCTX 还内置了 addon 系统,可以把其他 MCP server 接入它的网关:

lean-ctx addon search memory   # 浏览 addon 注册表
lean-ctx addon add headroom    # 安装并接入
lean-ctx addon list            # 查看已接入的 addon

注册表覆盖压缩(Headroom、Sophon)、代码智能(Repomix、Serena)、记忆(Mem0、Cognee、Letta)和推理(Sequential Thinking)等类别。所有 addon 输出经过安全扫描和不可信标记后才送达模型。

对不同角色的意义

对独立开发者:月费 $450 → $60,一年省 $4,680。LeanCTX 已经在生产环境跑了 1794 条命令,数据可复现。

对团队:本地优先,记忆可导出为 .ctxpkg。换模型(OpenAI ↔ Anthropic ↔ Gemini)不丢上下文。不存在数据锁在某个厂商黑箱里的问题。

对 AI 应用开发者:CPAO 指标(Cost per Accepted Outcome)是一个新的评估框架——不只看”省了多少 token”,还看”省下的 token 是否真的降低了输出质量”。这个思路值得借鉴。

模型在趋同,算力在降价,但上下文的控制权才是 AI 时代的真正护城河。LeanCTX 把这道护城河搬到了你本地。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

LeanCTX 为开源项目(MIT 协议),本文不构成投资建议。
相关阅读:AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能 | Groq 再融 3.5 亿美元转向 neocloud

AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能,开发者别再从零写 prompt 了

AI Skill 生态全景:从 1000+ 仓库精选 10 个必装技能,开发者别再从零写 prompt 了

2026 年,AI 编程工具的竞争已经从”谁的模型更聪明”转向了”谁的生态更能打”。Claude Code、Cursor、Codex、Gemini CLI 等工具不约而同地押注同一个方向——Agent Skills:一种可复用的指令包,让 AI 学会特定任务的工作流。GitHub 上,仅 awesome-claude-skills 一个仓库就收录了超过 1000 个 skill,星标突破 72,000。Cursor Directory 有 86,600 名开发者投票选出最佳规则。Anthropic、Google、Stripe、Vercel 等一线团队纷纷发布官方 skill。一场关于”AI 该怎么做事”的标准化运动正在悄然发生。

为什么”Skill”突然火了?

原因很简单:大模型的能力趋同,差异化来自上下文和工作流。同样是写代码,一个加载了 TDD skill 的 Claude 会先写测试再写实现,而裸模型可能直接输出一堆没测试的代码。同样是处理文档,加载了 docx skill 的 AI 能精确操作 Word 的修订追踪和批注,而不是给你一段”看起来像 Word”的纯文本。

Skill 本质上是给 AI 装”肌肉记忆”——告诉它在特定场景下该按什么顺序、用什么工具、遵守什么约束。这比写 prompt 更结构化,比写代码更轻量,比训练模型更灵活。

据 Anthropic 官方定义,一个 skill 就是一个文件夹,核心是一个 SKILL.md 文件,包含 YAML 元数据(名称+描述)和 Markdown 指令。Agent 在会话开始时只看到 skill 的名字和描述(约 100 token),只有当任务相关时才加载完整指令(通常不超过 5000 token)。这意味着一个 agent 可以挂载数百个 skill 而不会撑爆上下文窗口。

生态分层:三层架构正在成型

经过对 GitHub、Cursor Directory、MCP Servers 等主要平台的系统梳理,我们发现 AI Skill 生态已经分化出清晰的三层结构:

第一层:指令层(SKILL.md)——教 AI “怎么做”。这是最轻量的形态,一个 Markdown 文件就能让 AI 掌握新技能。代表:Anthropic 官方的 docx/pdf/pptx/xlsx 文档技能包、Cursor Directory 上 39,000 人安装的 Next.js 规则。兼容 Claude Code、Cursor、Codex、Gemini CLI 等几乎所有主流工具。

第二层:工具层(MCP Server)——给 AI “接外部系统”。Model Context Protocol 定义了 AI 如何安全地连接数据库、API、文件系统。官方参考实现包括 Memory(知识图谱持久记忆)、Filesystem(安全文件操作)、Git(仓库管理)等。社区已经有数百个 MCP server,覆盖从 Slack 到 PostgreSQL 的各种服务。

第三层:编排层(Agent Pipeline)——让多个 skill + 多个 agent 协作完成复杂流程。这是目前最前沿的方向。代表项目 GreatCTO 用 69 个专业 agent(架构师、开发、QA、安全、运维)组成完整的软件开发生命周期流水线——你描述一个产品,AI 从设计到部署全流程执行,人工只参与两次审批。

10 个值得收藏的 Skill 精选

我们从 1000+ 仓库中筛选出第一批 10 个高价值 skill,按影响力和实用性分两档:

⭐ Tier 1:必装五强

1. Bloom — AI 私人家教
基于 Benjamin Bloom 的 2-Sigma 研究(一对一辅导能让学生提升到前 2%),Bloom 实现了自适应教学:生成大纲 → 逐课讲解 → 读取你的标注反馈 → 调整下一课内容。支持话题学习、PDF 文档学习、项目文件学习三种模式。CLI 模式(Claude Code)和 Web 模式(React + FastAPI)均可。教育赛道刚需产品。

2. LeanCTX — 上下文压缩引擎
一个 Rust 编写的本地二进制,帮你省 50-80% 的 token。10 种读取模式、95+ shell 输出压缩规则、跨会话记忆持久化、实时成本仪表盘。支持 Cursor / Claude Code / Copilot / Windsurf / Codex / Gemini CLI 全平台。token 成本是所有 AI 用户的痛点,这个工具直接砍一半。

3. GreatCTO — 69 Agent SDLC 流水线
“描述一个产品,批准两次,上线。”69 个专家 agent 覆盖架构、开发、测试、安全、部署全流程。实测数据:一个功能 1 小时 26 分钟、$3.40 token 成本;完整产品中位数 $171。内置 GDPR/PCI-DSS/HIPAA/SOC2 合规框架。Solo 开发者和创业者的终极工具。

4. Anthropic 官方文档技能包
Anthropic 亲儿子,docx/pdf/pptx/xlsx 四件套。不是简单的格式转换,而是真正理解文档结构——Word 的修订追踪和批注、PDF 的表单字段、PPT 的布局模板、Excel 的公式和图表。Claude Code 一条命令安装,Claude.ai 付费版原生支持。

5. Cursor Directory 热门规则
86,600 名开发者投票的 IDE 最佳实践。Next.js(39k 安装)、Front End(33.5k)、Expo(17.9k)、FastAPI(12.8k)、Java(9k)——覆盖主流技术栈。一键导入,零配置,是最低门槛的”skill”体验。

⭐ Tier 2:专业精选

6. MCP Memory Server — 基于知识图谱的 AI 持久记忆,官方参考实现。实体-关系-属性三层结构,比纯文本搜索精准得多。

7. Composio Connect Apps — 一个插件接入 Gmail/Slack/GitHub/Notion 等 1000+ 应用。解决”AI 能聊天但不能干活”的痛点。

8. Playwright Browser Automation — 让 AI 操控浏览器做测试、爬数据、填表单。最直观的”AI 干活”演示。

9. TDD Skill — 强制测试先行的开发流程,减少 AI 生成代码的 bug 率。Anthropic 官方出品。

10. Septim Agents Pack — 10 个命名子代理(规划/架构/品牌/营销/财务/设计/法务/客户/研究/协调),放入 .claude/agents/ 即可使用。

对中国开发者的启示

目前 AI Skill 生态的主战场在英文世界,中文内容几乎空白。这意味着巨大的信息差红利:

对研发团队:不要再从零写 prompt 了。直接用 Cursor Rules 或 Claude Code Skills 作为起点,省下 80% 的配置时间。LeanCTX 这类工具能直接砍掉一半 token 成本。

对产品经理:关注 Agent Pipeline 方向。GreatCTO 证明了”69 个 agent 协作”不是概念,而是已经跑通的工程实践。下一个”低代码”机会可能就在 skill 编排层。

对创业者:垂直场景的 skill 就是护城河。一个懂法律的 skill、一个懂医疗的 skill、一个懂金融合规的 skill——这些”专业知识包”的价值会越来越高。国内做 AI 应用的团队,不妨从”做一个垂直 skill”开始。

AI 工具的竞争已经从模型层上移到了生态层。谁掌握了 skill 生态,谁就掌握了 AI 的”手脚”。这个赛道才刚刚开始。

关注 AI商业快讯,每天一篇 AI 热点深度解读。
本文提及的 skill 均为开源项目,不构成投资建议。

相关阅读:Stripe 以 70 亿美元收购 OpenRouter:支付巨头押注 AI 模型路由入口 | Groq 再融 3.5 亿美元转向 neocloud:AI 推理云成算力投资新战场

阿里 Qwen3.8-Max 发布:2.4 万亿参数、下周开源,国产大模型打进全球第一梯队

阿里 Qwen3.8-Max 发布:2.4 万亿参数、下周开源,国产大模型打进全球第一梯队

2026 年 8 月 3 日,阿里云通义千问团队正式发布新一代旗舰大模型 Qwen3.8-Max:总参数量达 2.4 万亿,采用稀疏 MoE 架构,每次推理仅激活约 950 亿(95B)参数,并支持 1M 超长上下文与原生视觉理解。更受业界关注的是,阿里同步宣布将于下周开源 Qwen3.8-Max 及轻量版 Qwen3.8-27B 的模型权重——这是千问 Max 旗舰系列首次向社区开放权重。在同日放榜的权威三方榜单 Arena 中,Qwen 模型整体表现仅次于 Anthropic 的 Claude 系列,跻身全球大模型第一梯队。

为什么值得关注

Qwen3.8-Max 的意义,不在于”又多了一个大参数模型”,而在于它把三件过去被认为难以兼得的事放在了一起:

第一,旗舰级能力首次”开箱即开源”。过去旗舰大模型大多闭源售卖(如 Claude、GPT 系列),开源阵营长期在”性能天花板”上差一口气。阿里这次把自家的顶配 Max 直接开源,等于把第一梯队的能力免费交给开发者——这对全球开源生态是标志性事件:最强的模型不再只属于最贵的 API。

第二,”自主编程 16 天交付开源项目”展示了长程 Agent 能力。据官方与多家媒体报道,Qwen3.8-Max 能在数十天的跨度里持续自主编程、最终交付一个完整开源项目。这意味着大模型的能力重心,正从”单次问答”转向”多日自主完成任务”的长程智能体(Long-horizon Agent)。对企业来说,这比单次聊天实用得多。

第三,国产大模型集体冲进第一梯队,定价权开始松动。同一窗口里,月之暗面 Kimi K3、阿里 Qwen3.8-Max 相继发布,Arena 排名紧咬 Claude。当顶级能力不再被单一厂商垄断,API 定价(Qwen3.8-Max 输出约 6 美元 / 百万 token,对比闭源旗舰仍有空间)与商业化玩法就会出现分化。路透社还报道,阿里正计划从商业用户中收取一定收入分成——大模型”卖 API”之外,”生态抽成”的商业模式正在浮出水面。

分角色实操建议

对企业技术负责人:Qwen3.8-Max 开源后,可私有化部署同代能力的旗舰模型,把数据留在内网、把成本从”按调用付费”转为”一次性算力投入”。对数据敏感行业(金融、法律、政企),这是把 AI 能力真正落到核心业务的前提。建议先用 27B 轻量版做 POC,验证长上下文与 Agent 编程是否满足内部流程,再决定 Max 的部署规模。

对开发者 / 独立程序员:2.4 万亿参数的 Max 开源,意味着你能在本地或自有机器上跑”顶级编程助手”。配合其 16 天自主交付项目的长程能力,可把”搭脚手架、写样板、联调”这类耗时环节交给它,自己专注架构与产品判断。这是独立开发者用更少人力撬动更大产出的窗口期。

对内容 / 产品团队:原生视觉理解 + 1M 上下文,适合做”超长文档分析””图文混合报告生成”类应用。如果你们的产品依赖长文处理或多模态输入,现在就该评估迁移到这类开源旗舰的成本与收益,避免被闭源 API 的单价卡住毛利。

对投资者:开源旗舰的商业化路径值得盯——当模型能力免费,厂商的赚钱方式会转向云服务、算力、生态分成与增值支持。阿里”收入分成”的试探,可能成为开源大模型可持续盈利的样本。但也要分清:开源带来口碑与生态,不等于立刻的现金流,估值仍要看后续云业务转化。

结语:关注 AI 商业快讯,每天一篇深度解读

Qwen3.8-Max 的发布,是国产大模型”既上第一梯队、又打开开源”的关键一步。它影响的不只是技术榜单,更是企业用 AI 的成本结构、开发者的生产力上限,以及大模型商业模式的想象空间。对想借 AI 提效的团队来说,这类旗舰开源模型,值得第一时间排进评估清单。

关注 AI 商业快讯,每天一篇 AI 热点深度解读,帮你把技术动态翻译成可落地的商业判断。

相关阅读

OpenAI GPT-6 曝光:传 10 万亿参数、8 月发布,大模型军备赛再升级

据 36氪、腾讯新闻、太平洋电脑网等多家科技媒体在 8 月 10 日—11 日集中报道,OpenAI 下一代大模型 GPT-6(内部代号 Astra)或将在 2026 年 8 月发布。据业内爆料,该模型参数规模约 10 万亿(约为 GPT-4 约 1.8 万亿参数的 5 倍以上),采用全新预训练底座(超越此前代号「Spud」、约 4T token 的训练基础),上下文窗口或达 1.5M token,并直接对标 Anthropic 的 Mythos / Fable 系列。需要说明:以上信息目前主要来自 AI 内幕爆料与匿名信源,OpenAI 尚未就具体参数与发布时间作出官方确认。

为什么值得关注:Scaling 叙事卷土重来

如果爆料属实,GPT-6 意味着大模型竞争重新回到「暴力堆参数 + 堆算力」的轨道,对行业的连锁影响很直接:

  • 算力与资本开支继续飙升。参数规模冲上 10 万亿级别,背后是天文数字的 GPU、数据中心与电力消耗——这与我们此前拆解的 腾讯 Q2 资本开支暴增 176% 至 528 亿 指向的是同一件事:AI 竞争正全面转入「重资产算力竞赛」。
  • 竞争维度从「能力」转向「规模 + 上下文 + 成本」。1.5M 上下文若落地,长文档理解、Agent 长程任务、企业知识库都将重写;而参数越大,推理成本曲线越陡,API 定价与开发者选型逻辑都会变。
  • 创业公司的危与机。底层模型越强,上层应用门槛越低、迭代越快;但同一时刻,通用能力越强也越容易挤压垂直小模型的利润空间——应用层必须往「场景深度」而非「模型能力」找护城河。

分角色实操建议

对开发者 / 技术负责人:先别为「10 万亿参数」盲目重构架构。真正该评估的是 1.5M 上下文带来的机会——长文档 RAG 是否可以大幅简化、长程 Agent 工作流能否落地;同时提前测算 API 成本曲线,避免发布即「用不起」。

对投资者:把目光放在「确定性两端」——上游算力供应链(GPU、数据中心、电力)与下游推理成本。模型越大,基础设施的确定性反而越强,相关赛道值得持续跟踪。

对普通从业者 / 内容创作者:把 GPT-6 当生产力杠杆,但保持多模型备份。Claude、Gemini 与开源模型(如我们实测过的 OpenCode Go 月付 $10 敞开用 DeepSeek V4 / Kimi K3 / GLM-5.2)都是对冲单点依赖的廉价保险。

结语

无论 GPT-6 最终参数是否真到 10 万亿,有一条主线已经清晰:2026 年的大模型战争,拼的不再只是「谁更聪明」,而是「谁敢烧钱、谁能把规模变成产品」。关注 AI商业快讯,每天一篇 AI 热点深度解读,帮你用最少时间抓住最值钱的行业信号。

相关阅读