OpenMontage 实测:57k Star 的开源视频 Agent,121 个工具零密钥能跑几个?

OpenMontage 实测:57k Star 的开源视频 Agent,121 个工具零密钥能跑几个?

用 AI 做过视频的人都熟这套流程:脚本问 ChatGPT、图给 Midjourney、配音上 ElevenLabs、最后回剪映里一帧帧对时间轴。四个工具、四轮复制粘贴、一次成片半天就没了。

OpenMontage 想干的就是把这一串收进一句话:你在 Claude Code 或 Cursor 里说「做个 60 秒的神经网络讲解视频」,剩下的交给 Agent。

这个项目 3 月底建仓,现在 5.7 万 Star,还挂上了 GitHub Trending 当日第一的徽章。我把它拉进手机里的 Linux 沙盒实测了一遍:一个 ffmpeg、零 API 密钥,121 个注册工具里究竟有几个能真正跑起来——结论比宣传语有意思。

它的核心设计:没有编排器的 Agent 流水线

大多数「AI 做视频」项目本质是一个带 UI 的调用链:Prompt 进、片段出。OpenMontage 反过来——它没有代码编排器,你的 AI 编程助手本身就是编排器。

仓库里被拆成四层,职责很清晰:

  • tools/ —— 121 个 Python 工具,是 Agent 的「手」(生成、配音、剪辑、分析)
  • pipeline_defs/ —— YAML 管线清单,是「剧本」(哪些阶段、用什么工具、什么验收标准)
  • skills/ —— 157 个 Markdown 技能文件,是「怎么做」(每个阶段的导演手册、创作技巧、评审标准)
  • .agents/skills/ —— 90 个技术知识包,是「底层原理」(各家模型 API 怎么用)

每次生产都走同一条流水线:研究 → 提案 → 脚本 → 分镜 → 素材 → 剪辑 → 合成 →(发布)。每个阶段都配一份「导演技能」文件,Agent 读完再动手,做完自查,再停下来等你点头。

比较少见的是它的闸门设计:提案、脚本、分镜、素材生成、发布五个节点默认强制人工确认,官方写明「checkpoint 写入器会拒绝一个没有审批记录的阶段」。素材生成前还会弹一张分镜接触表,把每个镜头的取景、Prompt、预估花费、质量分列出来——钱花在哪儿,先看再批。

配套还有个本地看板 Backlot,管线跑到哪一步、花了多少、哪个 provider 被选中,实时显示在一块板子上,跑完还能按时间戳回放整个生产过程。

内置 12 条管线,覆盖的场景比想象中宽:动画讲解(Animated Explainer)、纯动效(Animation)、数字人播报(Avatar Spokesperson)、电影感预告(Cinematic)、长视频切条(Clip Factory)、纪录片式混剪(Documentary Montage)、实拍+AI 混合(Hybrid)、多语言配音(Localization & Dub)、播客转视频(Podcast Repurpose)、软件录屏(Screen Demo)、口播(Talking Head),以及用 SVG 骨骼做角色动画的 Character Animation。

实测:官方说 100+ 工具,到底几个能跑

实测环境:手机内的 Alpine Linux 沙盒(aarch64,PRoot),Python 3.12,没有配置任何 API 密钥。所有数字来自 sudo 无关的两条命令——工具的注册表发现接口和仓库自带测试套件。

先把官方宣传和实测数字摆一起:

官方说法 实测结果
100+ 生产工具 注册表实际发现 121 个工具
60+ provider 集成 代码里实际 66 个 provider 标识
700+ 技能与知识文件 skills/ 157 个 + .agents/skills/ 577 个 = 734 个
12 条生产管线 pipeline_defs/ 下 13 个 YAML(多出的是冒烟测试管线)
零密钥可做真视频 装完 ffmpeg 后 121 个工具只有 36 个可用

数字对得上,宣传没注水。但最后一行值得展开——因为这决定了你上手第一天的体验。

密钥不是门槛,运行时才是。 装上 ffmpeg 之前,注册表报告 121 个工具全部不可用。装完 ffmpeg(一条 apk add ffmpeg),状态变成:36 个可用、84 个不可用、1 个降级。

拆开看结构更清楚:43 个纯本地工具里 32 个立刻转正,剩下的靠缺失的运行时卡住——Piper 语音要装 piper 二进制、转写要 faster_whisper、语义检索素材要 PyTorch 模型、本地视频生成要 GPU。而 55 个云端 API 工具,零密钥时可用数为 1。

最扎眼的一格是视频生成:27 个视频生成工具,零密钥时可用数量为 0。官方的「零密钥也能出片」指的是另一条路——用 Piper 配音 + 免费素材库/档案馆的现成画面 + Remotion/FFmpeg 做动画合成。这是一条真实存在的路,但它是「拿现成素材剪出视频」,不是「凭空生成画面」。

我挑了几个 ffmpeg 系工具做了实际的端到端调用:

工具 实测任务 结果
auto_reframe 1280×720 横屏转竖屏 4.4 秒输出 1080×1920,帧数一致
frame_sampler 均匀抽 4 帧 1.2 秒,4 张 JPG
video_trimmer 裁 1–3 秒片段 0.3 秒
silence_cutter 静音段处理 0.5 秒
audio_probe 音频流探测 0.3 秒

手机沙盒里跑竖屏重构,4.4 秒——这类活它干得干净。

然后是翻车点,这两个才是真正该看的。

第一个是硬编码的 Windows 字体。showcase_card(给视频加标题卡)的默认字体写死成 segoeuib.ttf——Segoe UI Bold,Windows 专有。在 Linux/macOS 上 ffmpeg 直接退出码 254,报错信息只有一行 FFmpeg failed。有意思的是它的参数说明写着「Uses system font lookup」(使用系统字体查找),但源码里根本没有查找逻辑,三处字体位置全是 segoeui*.ttf 字面量。我显式传入 title_font=/usr/share/fonts/dejavu/DejaVuSerifCondensed-BoldItalic.ttf 后,4.0 秒正常出片。

第二个更值得警惕:注册表的状态字段会撒谎。仓库里一个 9 月 6 日新开的 issue(#637)由踩坑者提出:diagram_gen 在没装 mermaid-cli 的情况下依然报告 AVAILABLE,然后把 mermaid 源码原样渲染成一张文字卡片,还返回 success: True。提问者写道:「一个信任注册表状态和 success 标志的 Agent,会把代码图片当成图表交付出去。」根因是源码里用 or 判定可用性——只要装了 Pillow 就报可用。

我在自己的沙盒里撞上了同一类问题:face_tracker 的工具契约声明依赖只有 cmd:ffmpeg,实际 get_status 检查的却是 mediapipe + opencv。照着契约装 ffmpeg 永远也变不成可用。

最后是仓库自己的测试套件。我没有挑测试,直接跑 pytest tests/contracts tests/tools:1730 项通过、18 项失败、7 项跳过,耗时 32 分钟。18 个失败全部集中在 Google 系后端(Vertex、Imagen、Lyria),原因是我沙盒里没装 google-genai 包——属于环境缺依赖,不是代码缺陷。一个视频项目把契约测试做到 1700+ 项,说明工程纪律是真的。

谁该用、谁等等:三条现实约束

第一条是许可证。OpenMontage 用的是 AGPL-3.0,不是 MIT。你自己用、内部用都没问题,但如果你打算把它集成进一个对外提供服务的 SaaS 产品,AGPL 的传染性会咬人——这一点官方在 README 里没有专门提示,选型时必须自己过一遍。

第二条是单人项目的风险。仓库 52 位贡献者,作者 calesthio 一个人贡献了 311 次提交,其余贡献者都在 30 次以下;当前 317 个 issue 挂在那里(历史总量 152 个已关闭)。项目背后有一个官网和云服务「OpenMontage Studio」的等候名单,也就是说这是「开源核心 + 云产品」的商业结构,长期维护有动力,但节奏完全取决于一个人和一家新公司。

第三条是要选对参照物。同类的视频自动化项目里:MoneyPrinterTurbo 12.2 万 Star、MIT 许可、昨天还在提交,胜在简单直接但只覆盖「素材拼接 + 配音字幕」这一条链路;Open-Sora 2.97 万 Star、Apache-2.0,做的是模型本身不是生产管线;ShortGPT 已经一年多没提交,可以划掉了;Remotion 5.9 万 Star,是 OpenMontage 底层实际使用的合成引擎,属于互补而非竞争。

顺带提醒一句:官方在 9 月 4 日专门开了 issue 声明有假冒的「OpenMontage-app」安装包仓库在传播,这个项目本身不发布任何安装程序。搜索时别装错了。

如果你已经有 Claude Code / Cursor 的订阅,想批量化生产讲解类视频又不想按月付视频生成 API 的钱,它值得放进工具箱第一格——装好 ffmpeg 和 Node,第一天就能跑通素材类管线。如果你期待的是「打开网页、输入主题、十分钟出片」,或者你要把它塞进商业 SaaS,那先放观察清单,等云版本和许可证策略明朗再说。

一句实话:这次实测我没有注册账号、没有购买任何 API 密钥,官方云产品的报价(官网演示账单约 $2.09 一条 60 秒视频)来自官方页面而非我的账单;沙盒环境是 Alpine Linux,与官方推荐的 Ubuntu/macOS 有差异,少数工具的表现可能受环境限制。上面每一个数字都可以复现——仓库是公开的。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

AMD Token Factory 全景拆解:每天 10 美元的免费大模型 API,DeepSeek 与 Qwen 双协议真能白拿?

AMD Token Factory 全景拆解:每天 10 美元的免费大模型 API,DeepSeek 与 Qwen 双协议真能白拿?

如果你每个月在 AI 模型 API 上花钱,AMD 最近这个东西值得看一眼:不用买显卡,不用先开云实例,登录网页复制一个 Key,就能调用跑在 AMD 自己服务器上的大模型,官方标注「免费」。

它叫 Token Factory,挂在 AMD Radeon Cloud 上,目前标着 BETA。里面并列摆着 DeepSeek 和 Qwen 的模型,都支持 OpenAI 接口格式——也就是说,Cherry Studio、openCode、Cline 这类工具改个 Base URL 就能用;它同时还提供 Anthropic 格式接口,Claude Code 也能直接指过去。

但「免费」两个字后面藏着两个数字:一个算不平的额度,和一条没人细看的条款。这篇把官方文档翻了一遍,把该说的都摆出来。

它是什么:AMD 把免费 API 挂在自己的云上

AMD Radeon Cloud 是 AMD 官方的云端算力平台,分两层:

免费共享端点(Public Free Model APIs) —— 常开、不消耗任何东西、不用开实例。模型由 AMD 挑,你只管调用。Base URL 是 https://developer.amd.com.cn/radeon/api/v1。

专属端点(Dedicated Model APIs) —— 你自己开一个 GPU 实例、用 vLLM 或 SGLang 部署想跑的模型,这部分要烧 credits,不算免费。

免费层提供四个接口:OpenAI 的 /v1/chat/completions 和 /v1/models,Anthropic 的 /v1/messages 和 /v1/messages/count_tokens。注意它不提供 embeddings、rerank、音频、图像生成和 /v1/responses,打到这些路径一律 404——想做 RAG 的人得另找向量化服务。

拿 Key 的路径极短:打开 Token Factory 页面首次登录,Key 会自动签发,格式是 rc- 加 48 位十六进制;同一个 Key 通吃所有免费模型,换模型只改请求里的 model 字段,不用重新申请。Key 可通过 POST /api/profile/api-token 轮换,旧 Key 立刻失效。

登录方式对中国用户比较友好:手机号、邮箱、以及 GitHub / CSDN / 魔搭社区快捷登录都行。但站点有区域限制——中国站是 developer.amd.com.cn,国际站是 radeon-global.anruicloud.com,两边账号不互通,而且我实测打开国际站只有一个启动实例的控制台,没有 Token Factory 入口。所以现阶段,这基本是一份中国站限定福利。

现在免费能拿到什么

这是今天的实际目录(模型会变,官方明说可以随时增减):

模型 上下文 图片输入 思考模式
DeepSeek-V4-Flash-0731 1,048,576 不支持 默认关闭,可手动开
DeepSeek-V4-Flash-Vision-Exp 1,048,576 支持 默认关闭
Qwen3.8-Flash-Next 262,144 支持 默认开启
MiniCPM5-2B 131,072 不支持 不思考

两个值得说的点。一是 Qwen3.8-Flash-Next 是 Qwen4 架构的开放权重预览版,125B 总参数、每 token 只激活 6B,官方宣称在编程与 Agent 任务上超过 Qwen3.7-Plus;二是 百万 token 上下文和图片理解都在免费层里,这个组合在免费 API 里很少见。

但模型页里那几行「使用限制」才是真正的坑,而且官方文档写得很细:

  • Qwen3.8-Flash-Next 只接受一条 system 消息,且必须排在数组第一位,角色必须拼 system。 这不是网关规则,是它权重自带的 Jinja 模板强制的。新版 OpenAI SDK 会把 system 发成 developer,直接违反它自己的模板——用官方 SDK 反而报错。DeepSeek 两个模型没这毛病,system 消息位置随意、可多条。
  • 有一批参数会被静默丢弃,不报错、不提示。 stop、seed、logit_bias、logprobs、top_k、min_p、repetition_penalty 全在丢弃名单里。你以为设了停止词,其实是没设。
  • 思考模式的默认状态两个模型相反。 DeepSeek 不发 reasoning_effort 就不思考;Qwen3.8-Flash-Next 不发也在思考,而且默认档是它最长的 xhigh。要写一套跨模型代码,档位取 low 或 medium 才通用——顶层档位的名字不统一,Qwen 叫 xhigh,DeepSeek 还额外接受 max,两者不通用。

额度算不平:两个官方口径差了 74 倍

社区口径一致:每天约 10 美元的等值额度,每日重置、不过夜。这个 $10 在官方文档里能对上——GET /api/profile/model-usage 的示例响应里写着 daily_cost_limit_usd: 10。

问题在于,这 $10 到底能换多少 token,官方给了两套互相打架的口径。

口径一:模型卡上的积分换算。 展示价是输入 0.14 pts / 百万 token、输出 0.28 pts / 百万 token、缓存命中 0.0028 pts / 百万 token。这三个数字恰好等于 DeepSeek V4-Flash 涨价前的官方美元价。按这个算,$10 能换约 3570 万个输出 token。

口径二:官方 usage 接口的示例。 同一份文档里,示例响应写着「今天 142 次请求、88,214 token、花费 $1.8412」,last_30_days 是「2840 次请求、1,904,221 token、$39.77」。两条数据折算下来都是 每百万 token 约 20.9 美元。按这个算,$10 只能换约 48 万个 token。

两个口径差 74 倍。同一天花同样的钱,一个能跑三十多万字,一个只能跑几千字。

官方对这个问题的回答是:「上面的数字只是示例,你的真实限额以接口返回的为准——账号之间不一样,而且会变。」换句话说,注册完第一件事应该是调一次 GET /api/profile/model-usage,看自己账号到底记的是什么价,再决定要不要把它当主力通道。

作为参照系:DeepSeek 官方 API 现在的价格是 V4-Flash 输出 4.5 元/百万 token(空闲时段)到 9 元(高峰),折合 0.63 到 1.27 美元。如果 AMD 走的是口径一,那确实白拿;如果走口径二,那它按的是「原价」,只是不向你收钱。

额外提一句,AMD 的免费共享 API 和 Radeon Cloud 的 credits 是两套完全独立的账:免费模型不吃 credits,credits 只在跑 GPU 实例时消耗,而且实例闲置照样烧,一个账号同时只能开一个实例。别把「领了 100 美元云信用额」和「每天 10 美元模型额度」当成一回事。

限流和条款:真正卡住你的是这两样

额度之外还有两道独立的闸门,任一道都能把你拦下来:

  • 平台准入层:每个 Key 30 请求/分钟、每 IP 120 请求/分钟、每 Key 8 个并发,另有按模型、按服务进程、按平台全局三档并发限制。
  • 网关计量层:每个账号 20 请求/分钟(60 秒滑动窗口),外加每日消费上限。

账号级 20 RPM 比 Key 级 30 RPM 更严,这点很容易被忽略——只盯着 30 配限流的人会莫名撞 429。好在限流状态不用猜,每个成功响应都带余量头:X-RateLimit-Remaining-User-RPM 看分钟余量,X-RateLimit-Remaining-User-Daily-USD 看当天还剩多少额度。被限时返回 429 加 Retry-After(分钟限制给 60 秒,并发限制给 1 秒)。

需要提醒的是,文档里对「每日额度什么时候重置」有两处矛盾表述:一处说是「从你第一个计费请求起算的滚动周期,不是固定午夜边界」,另一处说是「按 Asia/Shanghai 每日重置」,示例又给了零点。以自己账号返回的 daily_reset_at 为准——这直接影响你的批处理任务会不会跑一半断在半夜。

真正需要逐字读的是服务条款,官方这次写得很直白,几条红线:

  • 一人一个 Key。 同一个人开多个账号持 Key,包括用邮箱加点、+tag 别名绕过,会导致 Key 被停用;共用、转让、出售 Key 同样停用。
  • 禁止任何形式的转售,包括藏在代理、网关、聚合器后面。 官方原话是:任何人都可以自己注册免费使用,没有任何第三方被授权转卖这项服务;把服务或模型包装成自己的产品、指示模型谎报自己是哪家的、池化账号提升团队容量,都在禁止之列。市面上那些「AMD 免费 API 中转站」,接入即违规。
  • 它记录你的 prompt 和模型输出。 官方明说会记录 API 请求内容,对话内容保留约 2 天滚动窗口后删除,元数据保留更久;不用于训练、不出售、不共享第三方。文档里那句写得很实在:「我们告诉你这件事是因为它属实,不是因为舒服——如果某段 prompt 你不希望被存下来,就别发。」
  • 禁止处理个人、健康、金融等敏感数据。 这是试用服务,机密内容一律不要发。
  • 它不是生产服务。 无 SLA、无可用性承诺、无支持义务;模型可随时增删,端点和 Key 可因运维原因重启或吊销。

和 NVIDIA、商汤、魔搭放在一起比

同量级的免费 API 通道不多,横向摆一下:

服务 免费形式 主要短板
AMD Token Factory 每日额度上限,OpenAI + Anthropic 双协议 中国站限定,账号级 20 RPM,记录 prompt
NVIDIA NIM 40 RPM,无每日上限,模型 100+ 全站共享 40 RPM,社区反馈经常超时
商汤 SenseNova 公测免费,滚动 5 小时 60k 积分 限时公测,付费档已在路上
魔搭 ModelScope 约 200 次/日 需阿里云实名,仅限个人非商用
火山方舟 每日 200 万 token 需注册实名

AMD 的差异点很清楚:唯一同时提供 OpenAI 和 Anthropic 两种接口格式的免费通道,意味着 Claude Code 这类只认 Anthropic 协议的客户端不用装任何转换中间件就能直连;再加上百万上下文和图片理解都在免费层,这个组合目前独一份。

输的地方也清楚:模型只有四个、目录随时变、账号级 20 RPM 比 NVIDIA 的 40 RPM 更紧、中国站限定。

适合谁:想免费跑 DeepSeek-V4-Flash 或 Qwen3.8-Flash-Next 写代码、搭 Agent、做长文档实验的个人开发者;手上有 Claude Code 想换个便宜后端的人。

不适合谁:要上生产的(无 SLA)、要发敏感数据的(记录 prompt)、要分享给团队或对外转发的(条款直接封)、要依赖 embeddings 做 RAG 的(免费层不提供)。

我的判断

值得注册,但别当主力。

它免费、官方托管、协议标准、接入成本几乎为零——对中国开发者来说,这是当前最容易白拿到 DeepSeek 旗舰和 Qwen4 预览版模型的途径之一,光这一点就值得花十分钟把 Key 拿到手。

但三个前提必须摆清楚:额度口径没算平(两个官方数字差 74 倍,注册后第一件事是查自己的实际计价);它记录 prompt(约 2 天滚动窗口,方便调试,但任何机密内容别发);它明说不是生产服务(模型今天有明天可能没,别硬编码模型名,用 GET /v1/models 现查)。

观望信号也很明确:等官方把计价口径写清楚,或者等它走出中国站。

顺便说一句,AMD 这几年在「开发者免费额度」上给得比硬件大方——AI 开发者计划里还有 100 美元 AMD Developer Cloud 信用额(约合单卡 MI300X 跑 50 小时)、50 美元 Fireworks AI 额度,不过云信用额激活后 30 天过期,领了不用的记得别放过期。

价格与额度截至 2026-09-10,以官网为准(官方文档多处标注 Last updated: 2026-09-10)。本文为独立评测,与 AMD 无利益关系,未接受任何形式的赞助或免费额度;本次未注册账号、未自购任何档位,以上为官方文档(含官方端点实测记录)与公开社区信息解析,非本人实测体验。

延伸阅读:

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

ECC(Everything Claude Code)深度评测:25.5 万 Star 的开源 Agent 操作系统,让 AI 编码工具自带工程纪律

你的 AI 编码工具很强,但它不像一个团队:每次新任务都要你重新叮嘱上下文、流程和规矩,写代码行,可「先想清楚再动手、写完自己测、改完自己审」这套工程纪律它不记得。于是有人把整个「工程操作系统」打包成了技能库——8 个月拿下 25.5 万星。

ECC 是什么:给 Agent 装的「操作系统」,不是又一个工具

ECC(Everything Claude Code)是 affaan-m(Affaan Mustafa,纽约,AI 算力交易平台 Itô Markets 创始人)自 2026-01-18 起单人维护的开源项目,MIT 协议。它的自我定位是「agent harness operating system」——不写一行模型代码,而是给 Claude Code、Codex、Cursor、OpenCode、Gemini、Zed 等 10 个 AI 编码工具套上一层工程方法论:技能(Skills)、专职 Agent、钩子门禁(Hooks)、记忆与安全扫描。

核心循环一句话:plan → test → implement → review → verify → remember → improve(规划→测试→实现→评审→验证→记忆→改进),口号是「优化上下文窗口,其余全部持久化」。装一次,agent 从此自带团队纪律,不用每次把流程写进 prompt。

仓库当前规模(2026-09-10 实测 clone 全量核实):68 个专职 Agent、286 个技能、94 个命令、22 种语言规则集、4 组钩子,外加实验性的 ecc2/——Rust 写的「跨 harness 统一控制面」(终端面板 + SQLite 会话库 + 守护进程,仍为 alpha)。

暴涨曲线:21 天 4 万星,8 个月 25.5 万

时间 星数 事件
2026-01-18 1 仓库创建
01-21(第 4 天) 6,400 病毒式传播启动
01-26(第 9 天) 28,800
02-07(第 21 天) 40,000 官方 star-history 曲线(仓库内嵌数据)
03-23 100,000 augmentcode.com 报道破 10 万
05 月底 ~200,000 多个第三方评测时点
2026-09-10 255,150 GitHub API 实测;fork 38,224

星数已达 GitHub 全站头部级别,且今日仍在合 PR(编号 #2907+)。增速从单日数千星回落到月均约 3 万——非刷量式瞬时爆发,是持续近 8 个月的稳定增长。npm 侧:ecc-universal 月下载约 1.9 万次、ecc-agentshield 约 2.9 万次,最新 2.2.1(2026-08-25 发 v2.2.0,单次迭代 108 commits / 530 文件 / 4 万行增改)。

拆解:68 个 Agent 和 286 个技能,质量如何?

Agent(68 个,每个约 5KB 角色文档):architect(架构师)等角色在 frontmatter 里直接指定 model: opus 和工具白名单,正文开头是完整的「Prompt Defense Baseline」反提示注入基线——unicode 同形字、零宽字符、上下文窗口溢出攻击、第三方抓取内容一律按不可信处理。把安全基线写进每个 Agent 的,在开源技能库里不多见。

技能(286 个,实测 0 空壳):90%(258 个)是约 12KB 的扎实单文件 SKILL.md,10% 带 scripts/examples/references 五件套(如 agent-self-evaluation 含评分脚本 + 高低分对照例)。内容质量抽样很高:article-writing 技能直接内置禁语清单——game-changer、cutting-edge、「In today’s rapidly evolving landscape」这类 AI 套话全部拉黑,要求「用证据不用形容词」;benchmark 技能给出 LCP/CLS/INP 等 Core Web Vitals 可执行测量流程。覆盖从 accessibility、android-clean-architecture 到 kubernetes-patterns、agent-payment-x402 的广度。

钩子与治理:Bash 前置钩子在每次命令执行前跑质量/tmux/推送/GateGuard 检查,可阻断(exit 2);SessionStart 自动恢复上次会话上下文。2026 年 6 月做过一次 MCP 审计:默认连接器从 6 个砍到 1 个(github/context7/exa/memory 等全部退役,改由技能包 CLI 直连)——与「MCP 收紧」行业趋势同步。

数字之外:三处必须泼的冷水

①星多、装少:25.5 万星 vs 双 npm 包合计月下载不足 5 万。配置型仓库本就 clone 即用、无需反复安装,比例合理,但「收藏 > 实际部署」的现实要认清——155MB 全家桶装进日常 workflow 是另一回事。

②「免费」的分层:README 功能表把 AgentShield 标为 Included,但完整扫描(私仓、PR 触发审计、AgentShield 扫描服务)实际在 ECC Pro,$19/席/月;免费层 = OSS 本体 + GitHub App 公开仓每月 10 次分析。核心方法论免费,深度自动化要订阅——与同类「开源引流、SaaS 收费」模式一致,但宣传口径值得留意。

③单点风险:25.5 万星项目由单人维护(赞助商列表含其自家公司 Itô Markets,利益需自行判断);中文社区流传的「Anthropic 黑客松一等奖」头衔在官方 README/CHANGELOG 中未见佐证;HN 等圈外社区几乎没有高热度讨论——热度高度集中在 GitHub 生态内部。

安装、适合谁、值不值

# Claude Code 内两行装(二选一,勿叠加)
/plugin marketplace add https://github.com/affaan-m/ECC
/plugin install ecc@ecc
# 或终端引导安装
npx ecc-universal setup

适合:重度 Claude Code/Codex 用户,尤其想给多个 Agent 会话统一纪律、要安全基线和审计的企业开发者——68 个专职 Agent + 反注入基线 + 记忆系统是实打实的工程资产。不适合:轻度用户——286 个技能默认全装进上下文管理面,对「偶尔用一次 AI 写代码」的人是负担。

坐标系里看:若说 context-mode 深度评测(21k★ MCP 沙箱) 管的是「上下文输入」、Caveman 实测(99k★ 输出纪律) 管的是「输出纪律」,ECC 管的是整条工程流水线——它是目前这个品类里体量最大、方法论最完整的一个。结论:值得一试,但先想清楚你是要「收藏一套方法论」还是「真的把工程队纪律装进日常」——后者需要投入,不是 npx 一下就能白得。

本文基于 2026-09-10 全量 clone(3,538 文件)静态实证 + GitHub API/npm 官方数据交叉核验;沙盒环境无 Claude Code,未做安装后运行态实测。ECC 含 $19/席/月的 Pro 商业层,评测立场独立。

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

微软管着数千万个 AI Agent,你的系统敢让 Agent 操作业务数据吗?

一、Agent 正在大规模进企业,但「敢不敢让它碰系统」成了刹车

产业数据已经不再抽象:微软披露数以万计的企业在管理数千万个 AI Agent,法国 IT 服务商 Atos 一家就在管 1.9 万个;Salesforce 的 Agentforce 累计完成了 24 亿个「agentic work units」——AI 真正替企业完成一件工作的次数。

但与此同时,安全案例也在刷新认知。36氪 2026 年 9 月 8 日转载的一篇文章讲了几个实验:骗子把指令藏在网页屏幕外 -9999 像素的位置,人类看不见、Agent 读得到;研究人员拿 26 个模型测一个假网站,GPT-5.4、Claude Sonnet 4.5 在只看到假站时都把它当成了可信入口;还有人伪造 Python 库诱导 Agent 付 3 美元买「软件许可证」,Llama、Gemini 共 4 个模型真的执行了付款。安全公司披露的 EchoLeak 漏洞更直接:员工不用点击任何链接,Copilot 处理邮件时,藏在邮件里的指令就能诱导它把内部信息带出去——「有了 Agent 帮忙,钓鱼邮件都不用你点击了」。

安全圈与产业界正在形成一个共识:Agent 越接近真实业务,治理越要前置。网易智企 6 月给 CEO 们发了一份检查清单,把内容边界、权限边界、数据边界、操作边界、审计记录和责任归属列为上线前必须回答的问题(出处:网易智企《安全合规治理不应等问题发生后再补》2026-06-17)。落到自己公司,问题会浓缩成一句很具体的话:让 AI Agent 操作业务系统之前,你怎么保证它不会乱建乱改数据?出了事,查得到是哪次操作、哪个账号干的吗?

二、为什么多数系统接不住 Agent

想让 Agent 干活,先得有接口。但大部分企业系统天生不是给 AI 用的:

  • 契约靠人写人读的文档:接口文档由人维护,版本一升级就漂移,Agent 按旧文档调新接口必然出错。有厂商吐槽过这个现状:「AI 不知道有什么内部系统、如何接入」(出处:火山引擎开发者社区 2025-06-12)。
  • 开放裸 API 却没有校验:Agent 的幻觉会直接变成脏数据——字段名拼错一个字母,一张坏表单就进了库。AI 接入的协议层(如 MCP)解决了「怎么连」,但正如一篇治理文章提醒的:它同时扩大了攻击面,企业必须配套认证机制和治理可见性,否则「连得上」不等于「敢让它操作」(出处:知乎《当MCP成为AI Agent的”企业接口”》2026-07-22)。
  • 审计缺失:AI 做了什么只能靠猜。行业对 AI 审计的要求是能回答四个问题:什么数据进来了、输出了什么、系统做了什么、谁批准的(出处:Collibra 2026-06-24)——多数系统一条都答不上。

三、GTS 的做法:把 AI native 做成机制,而不是口号

GTS 是一个多租户、元数据驱动的「表单+审批流」平台,走的是另一条路:既然 AI Agent 要进业务流程,那就从系统层面回答好三个问题——看得懂、改不坏、赖不掉。

① 看得懂:机器可读契约,Agent 自己拉取,永不漂移

GTS 提供两个公开只读端点,无需登录,任何 Agent 启动时都能自己拉取:

  • /discovery/routes:当前全部 58 个 API 端点自动导出。后端每加一个路由,列表自动多一条——写作当天实测已是 58 条,任何静态文档都追不上这个更新速度。
  • /discovery/contract:配置域契约——认证方式、响应信封、多租户纪律、12 种字段类型及其附加属性、流程节点属性、单据状态机、审批动作枚举、字典用法。

因为契约从系统实现自动导出、与代码同源,它不会像人手维护的文档那样过时。AI 学的是系统自己的配置语言,不是一份翻译稿。(浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 当场可验。)

② 改不坏:服务端强校验,幻觉写不进数据库

表单 schema、流程 nodes 在落库前全部经服务端校验:字段类型必须在白名单内、字段 key 唯一且合法、select 必须有选项、流程节点名唯一、审批人规则必须合法。非法配置直接返回 400,并带精确到位置的报错——比如把 required 拼成 requred,会收到 schema_json[0] has unknown key(s): requred。Agent 收到报错可以自己修正重发;非法内容根本不落库。模型幻觉再离谱,也污染不了数据库。这正对应治理清单里那条底线:「系统接口返回异常时,不能反复提交或绕过校验」——GTS 把这条做死在了服务端。

③ 赖不掉:全操作审计,人与 Agent 一视同仁

每一次管理/变更写操作都记入审计日志:租户、操作者账号、动作、对象、IP、User-Agent、摘要,操作者自动从 token 解析。无论是人还是 Agent、用的是哪个账号、做了什么,全部可回看。前面说的四个问题(什么进来了、输出了什么、系统做了什么、谁批准的),在这里逐条有答案。

④ 官方直接把「Agent 上岗说明书」做成了可下载的技能包

GTS 把「AI 怎么操作这套系统」打包成一个官方技能包 gts-operator,下载地址:https://www.geeyo.com/s/gts/dist/skills/gts-operator.zip 。支持 skills 机制的 Agent(Claude Code / Codex 类)装上之后,用自然语言就能完成整套管理操作:帮客户开通租户并配管理员、维护组织架构与人员、配置表单与审批流(字段类型 / 条件分支 / 审批人规则)、发起业务单据、执行审批(同意 / 驳回 / 转办 / 加急)、查询与导出。它采用「动态发现」模式——先拉取 discovery 契约再动手,后端演进时技能无需手改。关键设计:Agent 与人类走的是同一套 API、同一份校验、同一份审计,系统没有给 AI 开任何后门。官方已用它跑通「注册租户→建组织→配表单/流程→发起单据→审批」的全链路验证。

四、三个值得展开的设计取舍

为什么「校验+审计+隔离」三件套缺一不可? GTS 的设计哲学是「安全是前提,不是功能」:校验保证非法内容不落库,审计保证每个操作可追溯,行级多租户保证跨租户访问一律 404。三件事同时存在,才敢把写操作开放给 AI——缺了任何一件,开放 API 给 Agent 都是在裸奔。

为什么契约能精确到字段级? 因为 GTS 本身是元数据驱动的:表单、流程、字典都是数据、都是配置。契约描述的正是系统实际运行的语言——字段类型、校验规则、状态机与实现同源,不存在「说明书和实物是两回事」。这是 AI native 能落地的地基,也是它和「事后补文档」式集成的根本区别。

边界在哪里? GTS 的 AI 能力覆盖表单+审批这类配置化业务域。它不是通用 BPM 重引擎,也不是 Agent 托管平台——它解决的是企业接 Agent 最前面那道坎:接得进、改不坏、赖不掉。

五、十分钟自己验证

三步就能验证上面说的每一句:浏览器打开 https://www.geeyo.com/s/gts/api.php?route=/discovery/contract 看契约长什么样;下载 gts-operator.zip 装给手边的 Agent,用自然语言让它开一个租户、配一张报销单;再到演示站 https://www.geeyo.com/s/gts/ 注册、走完一张单的审批。AI native 是真机制还是噱头,动手十分钟就有答案。

context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

context-mode 深度评测:21k Star 的 MCP 沙箱把 315KB 工具输出压成 5.4KB,AI 编程终于不用怕上下文爆了

用过 Claude Code、Cursor 这类 AI 编程工具的人,大概都撞过同一堵墙:会话跑着跑着,AI 开始「失忆」——忘了在改哪个文件、忘了进行到哪一步。不是模型笨,是上下文被工具输出吃光了。一次 Playwright 页面快照 56 KB,20 条 GitHub issue 59 KB,一条访问日志 45 KB,官方说半小时就能烧掉 40% 的窗口。今天评的这个项目反着来:不压缩数据,干脆别让脏数据进门。mksglu/context-mode,21k★,官方基准把 315 KB 工具输出压成 5.4 KB(省 98%),npm 累计下载 51.5 万,登过 Hacker News 榜首(570+ 分)。

它做了什么:在工具输出和上下文之间,加一道沙箱闸门

context-mode 是一个 MCP server + 插件套件,支持 18 个客户端——Claude Code、Cursor、VS Code Copilot、Codex CLI、Gemini CLI、Kimi、Qwen Code 等全在列,还挂 OpenClaw 网关。核心免费(ELv2 source-available),作者是伦敦 MKSF LTD 的 Mert Köseoğlu,2026-02-23 创建仓库。

它的思路和「压缩派」相反:LeanCTX 那类工具是等上下文满了再压缩重写,context-mode 是在源头拦截——模型每次调工具,钩子先截住,把命令丢进独立子进程沙箱执行,只有 stdout 进窗口。四个板斧:

板斧 机制 效果(官方口径)
沙箱路由 ctx_execute/ctx_execute_file 隔离执行,12 种语言运行时,>100KB 输出自动入索引只回指针 56 KB 快照 → 299 B
会话记忆 编辑/git/错误/用户决定实时写 SQLite FTS5,compact 后按 BM25 检索回填 治「压缩后失忆」
Think in Code 让模型写脚本算完再 console.log,而不是读 47 个文件进窗口 700 KB → 3.6 KB
不强制话术 不逼模型说人话,引 Moonshot 研究指 aggressive brevity 会降 benchmark 与输出纪律派划界

工具设计上有个反直觉点值得单独说:它把「分析」和「读」拆开了。以前模型要 grep、要 Read 一堆文件进上下文自己数,context-mode 逼它写段脚本在沙箱里数完只报结果——一次调用顶十次工具调用。hooks 能程序化拦截的平台(Claude Code 等)实测合规率约 98%;没 hooks 的 Zed 之类只能靠指令文件,作者自标约 60%。

仓库实证:6.5 个月、169 个版本、51.5 万下载

我 clone 了仓库全量核实(599 个文件):创建于 2026-02-23,6.5 个月冲到 21,024★ / 1,524 fork;HEAD 提交停在 2026-09-07 中午(写稿前一天还在推),版本号 v1.0.169。npm 侧数据能对上徽章:累计下载 515,145,5 月冲到单月 12.3 万的峰值,9 月第一周仍有 1.6 万。发布节奏极快——223 个 npm 发布记录,6.5 个月 169 个版本,约每天一个。

它的流量故事也清楚:2 月 25 日 Show HN 拿了 84 分,三天后作者博客长文直接登 HN 榜首 570+ 分、30 条讨论,之后 5 月下载量二次冲高。官方 BENCHMARK.md 给了可复现的 fixture 基准(21 个真实工具输出场景,非合成数据):总计 376 KB → 16.5 KB(省 96%),其中结构化数据处理那组 315 KB → 5.5 KB(省 98%),代码示例 100% 保真——文档类内容是精确检索不是摘要,125 个测试全过。

必须说明口径:以上基准是官方自测,我没有装进真实 Claude Code 会话复测(评测基于仓库 clone、官方 benchmark 与公开数据);Insight 付费分析层($20/座/月)也未购买,不评。

争议与边界:五个要自己掂量的坑

① npm 渠道已停更约 10 周。 最新版 1.0.169 在 npm 上停在 6 月 29 日,但仓库日更——分发明显迁到了 Claude Code 插件市场 + 自带的 ctx_upgrade 直拉 GitHub。从 npm 直接装可能拿到旧版,装完记得跑 ctx_upgrade。

② 用户数口径混乱。 GitHub 徽章自称 54.6 万用户,Insight 官网却写「331,200+ 开发者」——两处自报数字对不上;npm 累计 51.5 万下载可核实,量级可信,但「用户」的定义存疑(下载≠活跃)。

③ ELv2 不是 OSI 开源。 能 fork 能改能内部用,但禁止打包成托管 SaaS 转售、禁止删许可声明。作者明说选它就是为了防 MIT 被套壳——个人和公司内部用无碍,想基于它做生意的绕道。

④ 沙箱是进程边界,不是 OS 隔离。 作者自己在文档里承认:ctx_execute 跑的是任意代码且继承进程文件系统权限,「批准执行 = 批准任意代码」,#852 号 issue 就修过借 MCP 沙箱逃逸宿主读文件限制的漏洞。要配宿主层沙箱双保险,别裸奔。

⑤ 上手摩擦不小。 它激进地拦截 curl、裸 Read、grep 等常规操作逼你走沙箱——CLAUDE.md 里一长串「BLOCKED」清单。习惯「先想再写代码」的老手觉得爽,新手会觉得被管头管脚。另 214 个 open issues、无 hooks 平台只有 ~60% 合规、Codex 的 PreToolUse 只能拒绝不能改写参数(上游限制)。

坐标系与结论:省 token 正在从「压缩」走向「拦截」

站内评过这条赛道的几个代表:LeanCTX(压缩派,Rust 重写省 86% token)、Caveman(输出纪律派,砍 65% 输出 token)、flowctx(OpenClaw 上下文引擎,砍 56%)。context-mode 站在输入侧——它不动你的输出风格,甚至引用研究反对 Caveman 式的激进话术压缩,只管「什么数据能进窗口」。三种思路其实互补:输入拦截 + 输出克制 + 事后压缩,叠起来才是完整解。

适合:接了 Context7 / GitHub / Playwright 一堆 MCP 工具的重度用户、长会话多任务协作、被 compact 失忆反复折磨的人——尤其 Claude Code 用户,插件市场一条命令装完,10 分钟能见效果。不适合:轻度用户、不想改变工具习惯的人、必须在无 hooks 平台上要强约束的团队。

我的判断:上下文治理从「压缩」走向「源头拦截」是个真趋势,context-mode 是这条路上工程化最完整的选手——6.5 个月 169 个版本、18 客户端、HN 榜首、安全文档写得比多数商业软件诚实。免费层功能完整,值得装来试试;想省钱先看懂它的路由哲学,比装十个省 token skill 都值。相关阅读:LeanCTX 实测(压缩派) | Caveman 实测(输出纪律派) | flowctx(OpenClaw 上下文引擎)

关注「AI商业快讯」,每天一篇 AI 热点深度解读。(本文基于 2026-09-08 仓库快照与公开数据独立评测,与项目方无利益关系;Insight 付费层未购买、不构成推荐。)

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

白嫖党关心的问题永远只有一个:Cloudflare 的免费额度,到底够干什么?中文圈给出的答案相当诱人——掘金上流传最广的教程写着,Vectorize 免费额度”支持 500 万向量、每月 300 万次查询”。这个数字让很多人以为捡到了宝。但翻开 Cloudflare 官方定价文档一算,完全是另一回事:免费层只够存 6,500 条 768 维向量(约等于 5M 维度 ÷ 768),和”500 万”差了三个数量级。这篇不吹不黑,把 Vectorize 与 Workers AI 两个免费服务的真实额度算清账,顺便盘点它们最近一年到底”升级”了什么。

免费额度两年没动,动的是”上限”和”模型目录”

先说结论,可能和你的体感相反:两个核心免费额度,两年多没涨过一分钱。

Vectorize 免费层(每月 3000 万查询维度 + 500 万存储维度)2024-09 定下至今未变;Workers AI 每天 10,000 Neurons(神经元,Cloudflare 的 AI 算力计费单位)更是 2024-04 上线时就是这个数,2026-08 的最新定价文档依旧如此。

真正的升级发生在别处(额度单位不变,但同样的钱能买到更多):

  • 索引容量上限:单索引最多 500 万向量 → 2026-01 翻倍到 1000 万 → 2026-08 的 limits 文档已显示 2000 万向量(架构上限,与免费存储额度是两码事,后面细说)
  • 模型目录:从早期几十个小模型扩到 50+,2026 年密集上新——Kimi K2.6/K2.7 Code(1 万亿参数级)、GLM-5.2/5.3、DeepSeek-V4、Gemma 4 26B、NVIDIA Nemotron-3、FLUX.2 生图全家桶
  • 工程体验:2026-02 起 OpenAI 兼容 API 的 tool calling 全面修 bug(多轮函数调用终于不抽风);2026-03 上线 prompt caching(缓存输入价格仅为原价 1/30-1/90)与异步批量 API
  • 周边额度:KV 免费层 2026-02 提升(读 10 万次/天 + 1GB);Workers 代码包体积 2026-09 从 3MB 放宽到 64MB——之前塞不进 Worker 的大依赖,现在可以了

一句话:Cloudflare 走的是”额度冻结、内容升值”路线——每天同样的 10,000 Neurons,2024 年只能玩 7B 小模型,2026 年能碰 1T 级开源前沿。但坏消息是,额度没涨的同时纪律在收紧(见第四节)。

Vectorize:额度按”维度”算,不是按”条数”算

Vectorize 免费额度难懂,是因为它的计量单位不是”向量条数”,而是向量维度数(stored dimensions / queried dimensions)。一个 768 维的向量,就消耗 768 个存储维度。

免费账本:5,000,000 存储维度/月 + 30,000,000 查询维度/月(官方定价文档,2026-04 更新,链接)。除以维度,真实容量如下:

嵌入模型(维度) 免费可存向量数 备注
bge-small(384 维) ≈ 13,000 条 英文轻量场景
bge-base / base-zh(768 维) ≈ 6,500 条 中文常用档
bge-m3 / qwen3-embedding(1024 维) ≈ 4,880 条 多语言/长文本
OpenAI text-embedding-3(1536 维) ≈ 3,255 条 外部模型需自调 API

查询侧公式是(月查询次数 + 存量向量数)× 维度 ≤ 3000 万。存 5,000 条 768 维向量的索引,每月约可查 3.4 万次,折合每天 1,100 次左右——个人博客语义搜索、几百页文档的私有知识库、MVP 验证,完全够用。这也是 Cloudflare 官方明说的定位:免费层永远支持”原型和实验”。

超了也不贵(这才是 Vectorize 真正的杀手锏):官方示例,5 万条 768 维向量 + 每月 20 万次查询,约 $1.94/月,前 10M 存储维度与前 50M 查询维度甚至直接包含在 $5/月的 Workers Paid 里。对比 Pinecone 最低 $50/月起步,差距是数量级的。

Workers AI:10,000 Neurons/天到底能干什么

Neurons 按 GPU 算力成本折算——模型越强,单价越贵,免费额度能跑的次数越少。这也是”有人说够用、有人说一小时烧光 12%”吵翻天的原因:两人用的是不同模型。按 2026-08 官方模型价格表换算:

模型/用途 单价(输出) 每天 10,000 Neurons ≈
Embedding(bge-m3 等) ~1,075 Neurons/M tokens 近千万 token,建库不是瓶颈
Whisper 语音转写 ~41-47 Neurons/分钟 约 4 小时音频
FLUX.1-schnell 生图 ~10 Neurons/步 200+ 张图
llama-3.2-1b(小模型) ~18,252 Neurons/M tokens 500-1,000 次对话(每次 500 输出 token)
gemma-4-26b / qwen3-30b ~27,000-30,000/M tokens 约 700 次
gpt-oss-20b ~27,273/M tokens 约 700 次
Kimi K2.6 / K2.7 Code / GLM-5.3 ~360,000-400,000/M tokens 只有 50-70 次

看懂这张表,就知道正确用法是分层:批量分类、改写、embedding 全部走小模型;Kimi K2.6 这类前沿模型只留给关键推理步;多轮 agent 会话加 x-session-affinity 头吃 prompt cache(缓存输入单价只有原来的 1/30-1/90,Neurons 直接省一个量级)。纯免费栈跑通一个带 AI 检索的个人应用,Reddit 上 2026-06 已有人验证可行。

三个真实的坑

① 模型目录滚动淘汰:2026-05-30 一次性下架 17 个旧模型——gemma-3-12b、llama-3.1-8b 全系、mistral-7b、phi-2 都在列;kimi-k2.5 被自动别名到价格更高的 k2.6。代码里写死的模型 ID 会直接 404,dashboard 用量也可能莫名上涨。

② 免费层超限即停:免费额度打满后请求直接失败(Free 无自动计费),要超用必须升 $5/月 Workers Paid。2026-09-01 起 D1(SQLite 数据库)免费层已改为超限直接失败——以前”超一点还能跑”的宽松时代结束了,Vectorize 同理。

③ 前沿模型限流很紧:Kimi K2.6/GLM-5.2 等只有 20 rpm(充值 AI Gateway credits 可到 50 rpm);另外免费额度 UTC 0 点重置后偶发 error 4006 误报超限(2026-09 社区仍有人中招),遇到重试即可。embedding 模型选型时也注意:索引维度定死后中途不能换模型,否则要重建索引重灌数据。

与同类对比:免费向量库中 Vectorize 的 5M 维度 ≈ 6,500 条(768 维)比 Pinecone 免费层(单索引 100 向量级)慷慨得多;但要存几十万条以上还是得上付费云或自建。Workers AI 免费额度做 demo 富余、做生产不足,定位是”Workers 生态的拼图”——它的真正价值不是省钱,而是向量库、embedding、推理、对象存储(R2 10GB 免流量费)全部在同一生态内,零 API key 管理,全球 300 城边缘分发。适合:个人站语义搜索、私有知识库 MVP、已在 Cloudflare 部署的全栈应用。不适合:亿级向量生产库、要求 10ms 级延迟的实时推荐、以及重度依赖前沿模型每日推理的业务。

总评:免费层是当下个人开发者做 AI 应用性价比最高的起点——额度对”几千条文档、每天千次查询、混合使用小模型”的量级绰绰有余,超出后的付费价格又便宜到可以忽略。真正的成本是维护:模型下架要跟进、额度上限要按维度盯着算。别信”免费 500 万向量”的教程,信自己的除法。

(额度与价格截至 2026-09-08,以 Cloudflare 官方定价文档为准。本文为独立评测,与 Cloudflare 无利益关系,未接受任何形式的赞助或免费额度;文中核算基于官方公开文档,未自购套餐跑真实负载。)

相关阅读:10 美元买 70 美元额度?CommandCode GOAT 订阅拆解 | 实测 9 款 Token 节省工具横评 | 谷歌 Gemini 视频开关:号称砍 88% token 实测翻车

关注 AI商业快讯,每天一篇 AI 热点深度解读。

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

oh-my-openagent 深度评测:68.8k Star 的 OmO 把多个 AI 组队成开发团队,被 Anthropic 封禁反而更火

同时订阅着 Claude Code、Codex、Kimi 的人,多半撞过同一堵墙:订阅费交着,真正干活的却只有一个模型;想换模型得手动切配置,调 Agent 的时间比写代码还长。

开源圈有个项目专治这个。装上它敲一个命令,Claude、GPT、Kimi、GLM 会自己组队把活干完——任务不结束不撒手。它叫 oh-my-openagent(社区简称 OmO),9 个月冲到 68.8k Star、npm 下载 380 万次,还因为太「越狱」,成了被 Anthropic 点名封禁的导火索。

OmO 是什么:把「一个 AI」升级成「一支开发团队」

一句话定位:OmO 是跑在开源编码工具 OpenCode 之上的多模型 Agent 编排系统,把单个 AI 助手变成一支能并行协作、彼此通信的开发团队。

它原本叫 oh-my-opencode,2025 年 12 月创建后一路暴涨;今年 5 月改名 oh-my-openagent,从「OpenCode 专用插件」重构为多 harness 体系——Codex CLI(Light 版,npx lazycodex-ai install)、Senpi 都已接入,路线图还排着 Pi 和 Claude Code。装上后你会得到:

Agent 角色 干的活 反差点
Sisyphus 主指挥官 拆解任务、派活给专家、盯到完成 默认可跑 Claude/Kimi/GPT/GLM 任选
Hephaestus 深度执行者 领了任务自己探索代码库干完,不回头要你当保姆 故意用「被大厂封杀后」的模型
Prometheus 战略规划师 动代码前先访谈式提问、定范围写计划 先问后写,防「理解错就开干」
后台专家群 Oracle/Librarian/Explore 并行调研、查资料、探代码库 5+ 个同时跑,上下文互不污染

核心反直觉点:Sisyphus 派活时不指定模型,只指定工种——前端、深度调研、快速修 bug、硬核架构。系统自动把工种路由到最合适的模型,比如「ultrabrain」类硬骨头任务默认交给 GPT-6 Astra max。作者的原话是:模型每个月都在变便宜变聪明,没有任何一个供应商该成为天花板。

实测证据:9 个月 68.8k★,两周发 30 个版本

先看硬数据(截至 2026-09-08):仓库 68,796★ / 5,650 fork / 955 open issues,2025-12-03 创建,9 个月涨到 6.9 万星;最新版本 v5.0.0-beta.48 于 9 月 7 日发布——而 8 月 24 日的文档快照还停留在 beta.18,两周发了 30 个 beta;我克隆仓库时(今天上午),它还在合并当天的新 PR。npm 官方 badge 显示累计下载 3.8M。

OmO 有个罕见的「奇观」:它的维护者本身是一个 AI——跑在 OpenClaw 深度定制版上的助手 Jobdori,开发全程在 Discord 直播(Building in Public)。仓库根目录的 CLAUDE.md 用全大写写着铁律:任何触碰 OpenCode/Codex 组件的改动必须跑 QA 并把证据写入 .omo/evidence/,「没有证据文件 = 没有 QA = 不许提交」。一个 AI 维护的仓库,对「自己人」的纪律要求比大多数人类团队还狠——仓库里 64 个 SKILL.md、近 14 万行文档就是这么攒出来的。

再说它最出圈的「封禁事件」,时间线如下:

  • 2026 年 1 月 9 日深夜,Anthropic 更新政策:Claude Code 订阅($100–200/月)不得用于第三方 harness,OpenCode 用户大量中招,有人账号直接被 ban;
  • Hacker News 当天炸出 625 分、513 条评论;DHH 公开炮轰:「Anthropic 故意屏蔽 OpenCode 和其他第三方 harness,偏执地想把开发者锁进 Claude Code」;
  • OmO 自认是导火索,README 直接写「Anthropic 因为我们屏蔽了 OpenCode」,还把自家深度执行 Agent 命名为 Hephaestus(希腊神话里被众神抛弃的瘸腿铁匠)——故意的反讽;
  • 今年 5 月 TheNewStack 以「为什么 15.7 万开发者用 OpenCode 对冲 Anthropic」为题做了报道,生态裂痕已成明牌。

社区反馈(转述自 README 与 X,未经本站实测):有人用它一天清掉 8000 条 eslint 警告;有人一夜把 4.5 万行的 Tauri 桌面应用改造成 SaaS 网站;也有人直接取消了 Cursor 订阅。这类「多模型组队」叙事真实度如何,建议装 Light 版亲自跑一个任务验证。

局限也摆出来:① 许可证是 SUL-1.0(可持续使用许可),不是 OSI 认证的开源协议,商用场景先读 LICENSE 再部署;② 匿名遥测默认开启(可用环境变量关闭);③ v5 多 harness 重构进行中,CLAUDE.md 自己都警告「结构不稳」,beta 高频迭代意味着升级可能破坏配置;④ 955 个 open issues 挂着,主力生态是 OpenCode,想配 Claude Code 原生还得绕路。

同类怎么选:它跟官方、跟 OpenClaw 派的区别

  • Claude Code 官方:$200/月全家桶,Agent Teams 也已上线,但模型被 Anthropic 一家锁死;OmO 的路子是——订阅便宜的 ChatGPT $20、Kimi Code $19 或 GLM $10,让它们组队跑,总成本远低于一个 Max 订阅;
  • Codex CLI:OmO 的 Light 版就是把 rules、ultrawork 等组件移植进 Codex 插件体系,Claude 党与 OpenAI 党都能用;
  • OpenClaw 系(站内评过的 flowctx 上下文引擎是它的组件):另一派开源 harness,主打模型自由与本地化;OmO 更强调「多供应商编排 + 团队协作 + 玩法激进」;
  • deer-flow 等长任务 SuperAgent:学术研究向的长时任务,跟 OmO 的「日常开发加速」定位不同。

适合谁:多模型党、被订阅墙卡住的 Claude Code 重度用户、喜欢围观 AI 组队干活的尝鲜派。不适合谁:要开箱即用绝对稳定的人、公司合规敏感的团队(SUL 协议 + 遥测默认开都要评估)。

结论:值得一试,但把它当「风向标」看

我的判断:值得一试——先从 Codex Light 版(或 OpenCode 版)装起,跑一个小任务感受「组队干活」和单 Agent 的差别,再决定要不要上 Team Mode。不必把它神化:它本质是把「多模型编排」这个趋势做成产品的先行者,beta 血统决定了它适合玩,不适合当生产环境的唯一依赖。

OmO 真正的信号意义在于:当开源社区开始用「编排」绕过「订阅墙」,AI 编程工具的竞争就从模型参数转向了生态开放度。这事跟 OpenAI 切断 Cursor 合作(站内旧文)是同一条主线,而比纯上下文优化(flowctx 实测)又往前迈了一步——Agent 不再是单打独斗的工具,而是一支可以自由组队的队伍。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

mattpocock/skills 深度评测:254k Star 的「反 GSD」技能库,37 个小工具拒绝流程绑架

给 AI 装了一堆「流程大师」技能包后,你有没有一种失控感:Spec-Kit 让你写规格、GSD 让你跑仪式、BMAD 让你建矩阵——活还没干,先被流程绑架了?

TypeScript 圈顶流 Matt Pocock 看不下去,9 月初把自己天天在用的 .agents 目录直接开源:mattpocock/skills 两天内刷到 24 万 Star,如今 254k★、全球 GitHub 排名第 15。它不教 Agent 走流程,而是塞给你 37 把「小工具」——你挑着用,改着用,用完还能扔。

这套被中文圈称为「反 GSD」的技能库,凭什么成为 2026 年 9 月最炸的开源项目?我把它 clone 下来逐个拆了一遍。

它是什么:一个拒绝「拥有你」的技能军械库

一句话定位:给 Claude Code / Codex 等编码 Agent 用的 37 个工程技能,全部来自 Matt Pocock 日常真实工作流——「real engineering, not vibe coding」。

作者是谁?Matt Pocock 是 TypeScript 教育头牌 Total TypeScript 的创始人,newsletter 订阅 6 万人,在编码圈属于「老师傅」级别。他把 Agent 时代自己踩过的坑,沉淀成一套可组合的斜杠命令。

核心理念在 README 第一段就开炮:

GSD、BMAD、Spec-Kit 这些方案试图「拥有」流程(owning the process),但代价是夺走你的控制权,让流程里的 bug 难以修复。我的 skills 设计成**小而精、易改写、可组合**,适配任何模型。

37 个技能分四桶,按「谁可以触发」双轨制管理:

桶 数量 定位 代表技能
engineering 18 代码日常 /grill-with-docs /tdd /code-review /diagnosing-bugs
productivity 8 通用工作流 /grill-me /teach /to-questionnaire
misc 4 环境工具 git-guardrails scaffold-exercises
in-progress 7 实验区 retro loop-me 写作类×3(未进正式版)

用户触发(/grill-me)负责编排,模型触发(grilling)负责纪律——前者只有你主动敲才运行,后者 Agent 觉得合适可自动调用,互不越权。

最出圈的三个技能,拆开看

1. `/grill-me` — 动手前先被「拷问」

这是 Matt 最受欢迎的技能。核心逻辑反直觉:写代码前,先让 AI 连环追问你,把需求里每个分支问到死。

「没人确切知道自己想要什么」(《程序员修炼之道》),AI 时代的最大失败模式是「你以为说清了,Agent 根本没懂」。grill-me 就是把这段对齐期强制拉长:答不上来的问题不许瞎编,必须停下来问人。第三方实测最常引用的效果是——它把「我以为我说了」变成「我真的说清了」。

注意:Matt 自己提醒,grill-me 别直接拿去 coding,代码场景用升级版 `/grill-with-docs`(拷问同时帮你建 CONTEXT.md 领域词典 + ADR,详见下文)。

2. `/tdd` — 收缩成「参考型」的纪律

v1.2.0 大更新里,tdd 被刻意收缩为参考型 skill:核心只留 Red → Green 循环 + 测试 seam(接缝),重构职责被移去 code-review——「实现阶段别同时背太多目标」。

最狠的规则叫「只在预先商定的 seam 上测试」:写测试前先列出要测的公共接口边界,跟用户确认。不许测私有方法、不许 mock 内部协作者、不许水平切分(先写完所有测试再写实现=在验证想象中的行为)。

3. `/wizard` — 让 AI 生成「引导人类」的脚本

很妙的一个:当有步骤只有人类能做(配 CI secrets、登第三方后台、跑一次性迁移),wizard 会生成一个交互式 bash 向导——每步打开对应 URL、精确说要点哪里复制什么、隐藏输入密钥、幂等写 .env、显示还剩几步。把「教 AI 做事」反转成「AI 教你点按钮」。

实测验证:文档工程做到什么程度

我把仓库 clone 下来跑了硬核检查:

  • 37/37 个 skill 全部带双 harness 元数据:每个 SKILL.md 旁都有 agents/openai.yaml(Codex 专用 UI 元数据),Claude Code 用 frontmatter、Codex 用 yaml,一套源码两处跑,无生成副本——v1.2.0 起刻意这么设计
  • 结构极干净:37 SKILL.md 共 2465 行正文 + 37 个 yaml + 零冗余。单个 skill 最短 7 行(grill-me 本体是薄壳,逻辑在 grilling 里),最长 140 行(teach)——没有一个是「大礼包式」的巨型 prompt
  • 严谨到变态的治理:.out-of-scope/ 目录公开拒绝了三类需求并写清理由——「不给 grilling 加提问数量上限」(#44 有人抱怨 Codex 问了 200 个问题,Matt 说:那是计划真没定清楚)、「不接小众 issue tracker」(#99 要求接 dex,3 个月 300 star 的工具不接)、「不加 verify 模式」。拒绝清单本身就是设计哲学
  • CONTEXT.md 领域词典:把「issue tracker / issue / decision ticket」等术语精确定义并标注已消歧义的历史(backlog 曾同时指工具和积压工作,现已废除)

版本节奏:v1.2.3(8/6)→ 9/4 还在提交(#1025 合并),changesets 规范化发版。contributors 4 人,mattpocock 本人 422 次提交占绝对主导——这是一个活人在维护的真实工作流,不是营销仓。

同类对比:GSD/BMAD/Spec-Kit 与它的路线之争

方案 路线 规模 哲学
GSD(73k★) 上下文工程系统 大而全 流程拥有你,按仪式走
BMAD 全流程矩阵 大而全 每步都要产出物
Spec-Kit spec 驱动 中 先规格后实现
mattpocock/skills(254k★) 个人工作流开源 37 个小工具 你拥有流程,随手改写

站内 8/30 评测过 GSD——那套「上下文工程系统」确实能把事做完,但 Matt 指出的代价真实存在:流程越重,出错越难排查,Agent 越像在表演流程而不是写代码。

他的替代路线是「薄壳 + 引用」:编排型技能(grill-me)只有 7 行,真正纪律放在模型可自动调用的 grilling/tdd 里,实现与重构职责分离。适合谁:有工程判断力、不想被框架绑架、愿意花 10 分钟改 skill 的中高级开发者。不适合谁:想要「一键全自动」的新手——这套东西要求你理解每个技能在干嘛,且 setup 时得选 issue tracker(GitHub/Linear/本地文件)。

安装两条路(二选一,别都装否则技能翻倍):Claude Code 官方 marketplace 直接 /plugin install mattpocock-skills(只读托管、自动更新);想自己改就 npx skills@latest add mattpocock/skills(文件落入仓库,随你 hack)。装完跑一次 /setup-matt-pocock-skills 选 tracker 和标签即用。

我的判断

值得一试,且建议只挑 3-5 个装(什么值得买 15 小时前的热帖也是这结论)。254k★ 的含金量不在「多」,而在 Matt 把 20 年工程直觉压缩进了可组合的小单元——这是目前中文圈最缺的「反过程派」样本。先试 /grill-me 感受拷问式对齐,再加 /tdd 和 /code-review 形成闭环,你会回来删掉那些大而全的流程包。

想先看同路线的对照组?本站拆过 GSD 的上下文工程系统(73k★ 真能把事做完),也实测过 darwin.skill 这种「教 Agent 自我进化」的思路。关注 AI商业快讯,每天一篇 AI 热点深度解读。

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

Corey Haines 的 50 个营销技能实测:47k Star 的 marketingskills 把营销部装进 Agent,赞助商墙背后藏着什么

用过 Claude Code 写营销文案的人,多半撞上过同一堵墙:让 AI 写落地页,它交回来的是一堆「革命性解决方案」「一站式赋能」的空话套话。但换个角度想——如果 AI 的文案水平取决于喂给它的方法论,那为什么不直接喂它一套专业营销框架?

这就是 Corey Haines 的 marketingskills 想干的事:把一套完整的营销知识体系做成 50 个 Agent Skills,塞给 Claude Code / Codex / Cursor。这个仓库 2026 年 1 月创建,8 个月冲到 47k star,GitHub 上专为营销做的技能包里几乎找不到对手。作者不是工程师——是 CRO(转化率优化)领域的老兵、Swipe Files 通讯(2 万+ 订阅)的创办人。

但它也不是没有争议:README 顶部的赞助商墙、每月最高 1500 美元的「品类独占」赞助档位,让不少人质疑这到底是开源技能库还是引流工具。这篇实测把 50 个技能全拆开看了一遍。

它是什么:一个「营销部」装进 .agents/skills

marketingskills 不是单个技能,是 50 个技能的完整体系,覆盖从获客到留存的整条链路:文案(copywriting / copy-editing)、转化(cro / offers / pricing / paywalls / signup / onboarding)、SEO(seo-audit / ai-seo / programmatic-seo / schema / site-architecture)、增长(referrals / churn-prevention / attribution)、冷启动(cold-email / prospecting / lead-magnets)、内容(content-strategy / video / social / events / public-relations)……基本把一家 SaaS 公司市场部做的事全列了一遍。

规模数字很实在:50 个 SKILL.md 共 15,196 行,外加 165 个 references 参考文件、64 个零依赖 Node.js CLI 工具(接 Apollo、Clearbit、Mailchimp、Meta Ads 等平台)、95 份工具集成指南。整个仓库 5MB,装进 .agents/skills/ 就能用。

它有个很聪明的地基设计:第一个要跑的是 product-marketing 技能,它会引导你生成一份 .agents/product-marketing.md——把产品定位、目标人群、核心卖点、客户原话全部沉淀成一个档案。之后你调用任何一个营销技能,AI 都会先读这份档案再动笔。这解决了 agent 写营销最大的毛病:不问背景就开写,写出来全是正确的废话。

内部长什么样:拆开 4 个代表性技能

光看数量没说服力,抽几个看含金量。

seo-audit(499 行,最大号之一)——完整审计框架:可爬取性、索引、Core Web Vitals、移动端、HTTPS、URL 结构,到 On-Page 的标题/描述/H 标签/内链,再到国际 SEO 的 hreflang 与多语言站点地图。这不是「给我优化下 SEO」的敷衍提示词,是一份能照着执行的审计 SOP。

copywriting(457 行)——先查 product-marketing 档案,再按页面类型(首页/落地页/定价页/功能页)给不同框架;写完附 CTA 层级、价值主张、反对意见处理建议。它甚至知道何时该转场:要写邮件去 emails、写弹窗去 popups、改稿去 copy-editing、设计 offer 去 offers——技能之间会互相路由。

cold-email(159 行,最小号之一)——短而务实:像同行而非推销员地写、每句话都要挣得存在的位置、个性化必须连到对方的痛点(「删掉个性化开头邮件依然成立 = 个性化失败」)、一次只提一个低摩擦请求。附 4 级个性化体系参考文件。

marketing-psychology(455 行)——把第一性原理、JTBD、80/20、二阶思维、杠铃策略等 14 个思维模型 + 消费者心理机制编译成 agent 可调用的决策框架。

50/50 全部通过官方校验脚本(Agent Skills spec 的 frontmatter / name 匹配 / 描述 / 500 行红线),165 个引用文件零缺失。就工程严谨度而言,这是我见过最干净的大型技能库之一。

实测结论:方法论是真的,但先看清楚赞助商墙

先说反差点。README 开头就是赞助商名单(◆ Converly、◆ Ploy),GitHub Sponsors 每档 $1–199 到 $200,往上还有 $500/月的 Skill Partner、$1,500/月的 Category Partner——后者买的是某个技能品类里的「官方合作伙伴」独占位。

不过这个项目罕见地写了一整份治理文档(PARTNERS.md)说清楚边界:赞助买的是「带披露的展示位 + 集成指南」,永远买不到的是推荐——技能不会因为谁付钱就改推荐;合作伙伴的集成指南和普通工具的集成指南是同一套中立模板,只多一个披露头;作者自己的工具(Truelist)反而标注更严格,不能占「品类最佳」的位置。披露随文件走,fork 出去也保留。

这个设计是真诚的还是公关话术,我持保留态度——但它至少把「钱能买到什么」写成了白纸黑字,比绝大多数开源项目的隐性恰饭透明得多。

质量上,Reddit 4 个月前(20k star 时期)就有人评价:这不是那种「帮我写点文案」的泛泛提示词,是真正把营销框架塞了进去。8 个月从 20k 涨到 47k,靠的是内容而非炒作。

适合谁 / 不适合谁

适合:技术创始人 / 独立开发者——自己写 landing page、发 cold email、调定价页,但没预算请营销团队;SaaS 小团队想把 CRO/SEO 方法论固化进日常 agent 工作流;想研究「如何把专业领域知识做成技能包」的 agent 开发者(这个仓库的架构值得抄)。

不适合:想要「一键生成爆款文案」的人——它给的是框架和纪律,不是魔法;非技术背景、不碰 Claude Code / Cursor 的纯营销人——门槛在 agent 工具链这一侧;已经养着成熟营销团队的大公司——方法论对你们是常识。

局限也要说清:50 个技能全装会占不少上下文额度,建议按需挑 5–10 个核心的装(npx skills add coreyhaines31/marketingskills --skill cro copywriting 支持单装);技能给的是专业判断框架,最终转化效果仍取决于你的产品和流量质量——它不会替你变出用户。

值得放进观察清单

我的判断:marketingskills 是目前开源 agent 技能生态里「专业领域知识编译」做得最完整的一个。它验证了一件事——2026 年的 agent 技能竞争,正在从「提示词技巧」升级到「把某个职业的完整方法论编译成可执行框架」。50 个技能、165 份参考、带治理文档的赞助模式,是这套打法目前最完整的样本。

值得一试:装 5 个最贴近你痛点的技能(cro / copywriting / cold-email / seo-audit / product-marketing),跑一次让 AI 生成你的 product-marketing 档案,再让它写一版落地页——对比一下和你之前直接问 AI 的差别。

相关阅读:Agent 的「方法论纪律」不止营销——taste-skill 把审美纪律编译进前端、tanweai/pua 用压力话术防 AI 摆烂。想看「去 AI 味」的写作规则,可以翻 Humanizer-zh 实测。关注 AI商业快讯,每天一篇 AI 热点深度解读。

last30days 深度评测:61k Star 的「搜真人」技能实测——免配置只能搜到 HN,12+ 平台源全要钥匙

last30days 深度评测:61k Star 的「搜真人」技能实测——免配置只能搜到 HN,12+ 平台源全要钥匙

一、你搜「真实的人」,Google 搜不到

明天要见一个 AI 圈大佬,你 Google 一下他——大概率看到 2023 年的 LinkedIn 简介。但过去 30 天他到底在做什么?跳槽去了哪家、发过什么暴论、代码提交频率如何、Reddit 上大家怎么撕他——这些 Google 全都没有。

这正是 mvanhorn/last30days-skill 想解决的痛点:它不搜「编辑精选」的内容,而是并行搜 Reddit、X、YouTube、Hacker News、Polymarket 等十几个平台,按真实用户的点赞、转发、真金白银的赌注来排序,再由 AI 综合成一份「过去 30 天,真正关注这事的人在聊什么」的简报。61k Star、拿过 GitHub Trending 单日第一,2026 年 1 月才建仓、9 月还在更新——它把这层能力装进任何 AI Agent(Claude Code、Codex、Cursor、Gemini CLI 等 50+ 宿主),一句话触发。

二、本质:一个 240KB 的「跨平台近 30 天研究引擎」

先说清楚:这不是一个普通 skill,它是一套完整产品。skill 目录 141 个文件,光主引擎 last30days.py 就有 166KB,SKILL.md 指令契约 2307 行(240KB),CHANGELOG 128KB。

它的核心设计是「把模型当规划器,把脚本当执行器」:你输入 /last30days <主题>,托管它的 AI 先解析意图(普通查询/对比/发现模式),生成查询计划;Python 引擎并行抓各平台近 30 天数据,跑多信号综合评分——文本相关性、互动量、传播速度、来源权重、跨平台收敛、时间衰减,Polymarket 还看 24h 交易量和流动性;最后 AI 按严格输出契约(文件里叫 LAW 1-8)综合成简报,禁止发明标题、禁止堆 URL 列表、每条结论带来源。

维度 细节
默认免 key 源 Reddit(公共通道)、Hacker News、Polymarket、GitHub
需配置源 X/Twitter、YouTube、TikTok、Instagram、LinkedIn、Threads、Bluesky、Pinterest 等 12+
输出 带徽章+分簇证据的简报;自动存档到 ~/Documents/Last30Days/
模式 普通查询 / 对比(A vs B)/ 发现(–discover 找爆发话题)/ 找人 / 招聘信号
时间 完整跑 2-8 分钟,–quick 约 2-4 分钟

版本节奏夸张:v3.3 到 v3.11.1 五个月合并 175 个 PR,其中 122 个来自 52 位社区贡献者;9 月 1 日刚发 v3.23.0,9 月 2 日还有提交。小红书的源已经在 issue 里排队加入。

三、实测:免配置状态,和 README 说的差很远

我把它 clone 下来真跑了一遍(沙盒 Python 3.12.13,正满足它要求的 ≥3.12)。先说结论——「开箱即用」要打折扣。

跑 last30days.py doctor 健康检查,四个状态一目了然:

doctor 状态 源
✅ WORKING hackernews、github、library
❌ NOT WORKING reddit(公共通道实际超时)、web(keyless 降级不可达)、polymarket
○ COULD BE ON(需配 key/CLI) x、youtube(要装 yt-dlp)、tiktok、instagram、threads、bluesky、linkedin、digg、techmeme、arxiv、perplexity 等 12+
⚠️ 依赖下载 yt-dlp、gh、digg-pp-cli、techmeme-pp-cli、arxiv-pp-cli、brightdata 全缺失

实测跑 --quick 查「AI agent skills trend」:跑了 230 秒,只有 Hacker News 一个源出了 6 条结果(1257 分/918 评论);Reddit 超时 0 条、Web keyless 不可达 0 条。原始存档里 Source Coverage 白纸黑字:Reddit: 0 items (timeout)、Web: 0 items (unreachable)。

而 README 中文版明明白白写着「Reddit、Hacker News、Polymarket 和 GitHub 无需配置即可搜索」——实测只有 HN 稳定可用。Reddit 公共 RSS 通道时通时断,Polymarket 直连基本不通,web 必须自己配 Brave/Serper key。

想解锁完整能力,配置向导宣称「30 秒搞定」,实际是按平台逐个来:X 要么给 cookies、要么 ScrapeCreators key、要么 xAI/Grok CLI;YouTube 要装 yt-dlp;TikTok/Instagram 要 ScrapeCreators key(GitHub device flow 免费 1 万次调用)。每个围墙花园都有自己的钥匙——这正是它产品逻辑的一部分,但对只想「装上就用」的人,门槛比 README 暗示的高。

值得肯定的翻车防护:SKILL.md 开头就有一段「stale-clone 自查」防加载到旧版本文档,还内置 doctor --postmortem 复盘上次运行哪个源真断了。这种工程自律在 skill 生态里罕见。

四、同类对比:为什么不用 Google/Perplexity?

它的卖点不是「更强的搜索」,而是「AI 原生地桥接围墙花园」。用一张小表看清生态位:Google 搜不到 Reddit 评论、X、YouTube 字幕,也不按互动排序;ChatGPT 虽有 Reddit 合作却搜不了 X 和 TikTok;Gemini 有 YouTube 但没有 Reddit;而 last30days 的目标是全部覆盖、统一按真实互动排序——当然,X 和 YouTube 要配置后才通。

用它的典型姿势:开会前查人(/last30days Peter Steinberger 这种,能挖出「本月加入 OpenAI、23 个 PR 合并率 85%」);选题前找爆发话题(–discover 模式);产品决策前看社区真实口碑而非 SEO 文章;连预测市场 Polymarket 的赔率也当信号——「不是谁声音大,而是谁愿意下注」。

适合谁:内容创作者(找社区已验证的叙事方向)、产品经理/创业者(赛道冷热、口碑走向)、投资人(共识是否形成)。不适合谁:只想「快查一个事实」的人——2-8 分钟等不起,普通搜索更快;不愿折腾 API key 的轻度用户——装完不配置,体验只有 HN 一个源。

五、安装与判断

安装三选一:

# Claude Code(官方推荐,自动更新)
/plugin marketplace add mvanhorn/last30days-skill
/plugin install last30days

# Codex/Cursor/Copilot/Gemini CLI 等 50+ 宿主
npx skills add mvanhorn/last30days-skill -g

# 手动(开发者,软链随仓库实时同步)
git clone https://github.com/mvanhorn/last30days-skill.git
ln -s "$(pwd)/last30days-skill/skills/last30days" ~/.claude/skills/last30days

我的判断:值得装进观察清单,主力使用前先想清楚配置成本。如果你是重度 AI 使用者、研究/选题/尽调是日常,它解决的是真问题——训练数据永远落后社区几个月,而它能给你「此刻真实的人在讨论什么」。装完务必先跑一遍 doctor 看哪些源真的通了,别信 README 的「零配置」。61k Star 和 52 位贡献者证明了需求是真的,但「能不能发挥全力」取决于你愿意配几把钥匙。

相关阅读:LeanCTX 实测:一个 Rust 工具砍掉 AI 编程 86% token 成本 | OpenMAIC 实测:27k Star 的 AI 多代理课堂

关注 AI商业快讯,每天一篇 AI 热点深度解读。

评测基于 2026-09-05 实测(last30days v3.23.0,沙盒 Python 3.12.13);星数 61,257 截至 2026-09-05。