Anthropic 开源购物 Agent:购物车大 35%、成交率高 60%,Shopify Visa 已上车

Anthropic 开源购物 Agent:购物车大 35%、成交率高 60%,Shopify Visa 已上车

购物车平均大 35%、成交意愿高 60%——Anthropic 本周扔出了一个直接抄作业的开源蓝图,把「购物助手 + 商家后台」两个 Agent 的完整代码、提示词、护栏全摆上了 GitHub。合作方名单里躺着 Shopify、Visa、Mastercard 这些名字。它不抢收银台,只卖「大脑」。

事件速览:一套蓝图,两个 Agent,四个行业

9 月 2 日,Anthropic 开源 Claude Commerce Agents(Apache-2.0 协议),仓库 anthropics/commerce-agents 里是一套可直接运行的参考实现:

  • Shopping Agent(购物代理):面向消费者,帮用户搜索商品、对比选项、加购物车、回答退换货问题,嵌在商家自己的 App 或网站里
  • Merchant Agent(商家代理):面向商家运营,处理后台的商品上架、订单、库存等事务
  • 四个可跑行业 Demo:零售、旅游、电信、娱乐票务
  • 一个 Claude Code 插件 + 完整工程文档(产品公告 + 架构深潜)

每个 Agent「只定义一次」,同一套 prompt、skills、工具契约、审批闸门,可部署到 Claude Messages API、Claude Agent SDK 和 Managed Agents,也能跑在 Amazon Bedrock、Microsoft Foundry、Google Cloud Vertex AI 上。

为什么值得关注:电商 Agent 第一次有「标准答案」

过去 18 个月,想做购物 Agent 的团队都在重复造轮子:Agent 循环、商品目录工具层、审批闸门、评测套件——每家用不同姿势写一遍,踩同一批坑(幻觉商品、乱承诺、越权改价)。Anthropic 把这套脚手架开源,等于给了行业一份「官方标准答案」。

更关键的是它的架构立场:单 Agent + Skills,而不是多 Agent 协作。Anthropic 在工程深潜里给出实测理由——多智能体在商业场景里协调开销大、错误难追踪,单 Agent 挂 Skills 更稳。合作方实测数据:购物车规模最高提升 30-35%,购买完成率提高约 60%(官方口径,非独立基准测试)。

对普通用户和开发者意味着什么:未来半年你会在越来越多品牌 App 里遇到「AI 导购」,而这个导购背后的骨架很可能就是这套开源代码。想先玩的人现在就能拿去改。

护栏设计:它凭什么敢让 Agent 碰钱

购物 Agent 直接碰商品价格和用户决策,Anthropic 在护栏上花了大力气,这是整套蓝图最「反直觉」的部分:

  • 价格与商品严格绑定目录数据:Agent 不能凭空捏造商品或价格,只能操作目录里真实存在的东西
  • 禁止操纵性推销:明确排除「利用用户心理弱点的 upselling 模式」
  • 关键操作走审批闸门:下单、付款等动作必须经人类确认(approval gate),商家 Agent 的合规、税务信息被设定为不可改动
  • 支付与履约不碰:Anthropic 明确不进入收单和物流环节,把结账台留给商家自己

一句话概括它的商业边界:Claude 只做推理,商家保留收银台。对 Shopify 这类平台和 Visa、Mastercard 这种支付网络,Anthropic 是「帮我把店开得更聪明」的伙伴,而不是抢走交易环节的对手——这也是它们愿意当早期合作方的原因。

对比与背景:谁在抢「Agent 购物」这张船票

Agentic Commerce 正在成为大厂必争地:OpenAI 的 ChatGPT 购物入口、Google 的 Gemini 购物体验都在抢「消费者在 AI 对话里完成购买」的入口。Anthropic 的差异化是把入口让给商家——自己不做消费者平台,而是给商家提供能在自家店面里跑的 Agent 骨架。

这条路线和 Anthropic 8 月底的「最大新闻周」一脉相承(模型发布 + 企业级安全产品组合拳),也是它在企业服务上继续加码的信号。值得注意的是,9 月初 OpenAI 刚发布 GPT-6 Astra,Anthropic 本周的动作明显在打「落地」牌:不拼参数拼场景。

判断:蓝图免费,护城河在别处

开源蓝图本身不赚钱,Anthropic 真正要的是商家把购物 Agent 跑在 Claude 的 API 上——代码免费,推理按量收费,这是标准的「开源获客、API 变现」打法。真正的护城河是模型质量 + 企业信任(这周刚上线的企业级数据隔离方案就是配套)。

值得泼的冷水:蓝图只是脚手架,不是开箱即用的产品。想落地仍需要工程团队把目录、库存、支付系统接进来,Anthropic 的官方数据也是自家口径。但对想赶 Agent 购物这班车的团队来说,从抄这份作业开始,成本比从零写低一个数量级。

关注 AI商业快讯,每天一篇 AI 热点深度解读。相关阅读:Claude Fable 5.1 发布深度解读Anthropic 2026 最大新闻周:5 天 6 大动作

10 美元买 70 美元额度?CommandCode GOAT 订阅实测:7 倍额度是真的,DeepSeek V4 Flash 还比 OpenCode Go 快

10 美元买 70 美元额度?CommandCode GOAT 订阅实测:7 倍额度是真的,DeepSeek V4 Flash 还比 OpenCode Go 快

过去两个月,AI 编程订阅市场打起了「倍率战」:OpenCode Go 用 $10 卖 $60 额度,CommandCode 的 GOAT 直接喊出 $10 买 $70——7 倍,还声称带优惠能到 10 倍以上。对每月在编码模型上花真金白银的开发者,这不是噱头,是实打实的月账单问题。

我买了 GOAT 用了一周多,主力跑 DeepSeek V4 Flash。先说结论:同样 $10,GOAT 给的额度比 OpenCode Go 多 17%,DeepSeek V4 Flash 的月请求量约为后者的 2 倍,限流更松,实测速度还更快。下面把数学和体验都摊开。

一、GOAT 是什么:$10 买 $70 额度的开源模型订阅

Command Code(commandcode.ai)是开源模型向的编码 agent,创始人 Ahmad Awais,主推「会学习你编程品味」的 taste-1。今年 8 月初上线 GOAT 计划,定位是「重度开源模型用户」这一档:$10/月换 $70 月度额度(官方口径 7x 倍率),官方估算约 7.5 万次请求/月。

它不是「一个模型一个价」的共享池,而是额度按模型独立分配——每个模型各有一笔额度,你在 30+ 模型间随便切,互不挤占:

模型 月度额度 官方估算请求量/月
GPT-5.6 Sol $70 ~2,070
GLM-5.2 $70 ~4,740
Tencent Hy3 $70 ~35,400
Qwen 3.8 27B $70 ~24,000
DeepSeek V4 Flash $60 ~91,200*
MiMo V2.5(另有 -98% deal) $30 ~97,400
新模型(无 deal 期) $20 起步

*注:GOAT 文档给出的估算口径与 OpenCode 不同(缓存假设差异大),该数字来自 GOAT 官方估算;OpenCode Go 对同模型的官方估算为 37,800/月——差异来自估算假设而非额度,正文第三节会细拆。

「7 倍怎么来的」:CommandCode 说自己直接跟模型厂商谈容量、跑 ~95-98% 缓存命中率,把省下的推理成本折回成额度。所以额度高低 = 它跟厂商 deal 谈得怎么样:谈成的(GPT-5.6 Sol、GLM-5.2、Hy3)给满 $70,没 deal 的新模型只给 2x($20)。

二、限流窗口:比 OpenCode Go 松一档

订阅真正要看的不是「月总额度」,是短窗限制——决定了你一天内能不能猛干。两家的滚动窗口对比:

限流窗 CommandCode GOAT OpenCode Go
5 小时 $14 $12
$35 $30
$70 $60

每个窗口独立刷新。GOAT 每个窗都比 OpenCode Go 高约 17%。代价是额度花完(且没开自动充值)时付费模型会暂停到窗口结束——免费模型(Laguna S 2.1、LongCat 2.0 等)不停。

三、纸面数学:DeepSeek V4 Flash 一档能跑多少

我这周主力是 DeepSeek V4 Flash,拿它做核心对比。先对齐口径:两家的官方「月请求量估算」用的缓存假设差很多——CommandCode 按 ~50K cache-read/请求算,OpenCode 按 ~71K 算,所以直接比官方估算数字会得出「GOAT 是 OpenCode 2.4 倍」这种虚高结论。

用两家各自的官方 calculator(同样按典型 agent 请求:~800 fresh input + ~50K cache read + ~180-200 output token)重算更公平。DeepSeek V4 Flash 在 CommandCode 的单价是 off-peak $0.22/$0.66/$0.007(cache read),OpenCode Go 上同模型按 $0.28/M 输入级报价走——CommandCode 这个 off-peak 价本身就更低,且每天 17 小时生效。

结果:GOAT 的 $60 DeepSeek V4 Flash 额度 ÷ 官方约 $0.0006/请求 ≈ 6-9 万次/月(CommandCode 自己给 91,200 的口径,含重度缓存命中);OpenCode Go 官方口径 37,800 次/月。量级差接近 2 倍——因为 GOAT 给这模型的额度更高($60 vs $60 之外的缓存单价更低)。

我一周多的实际消耗:正常 agent 干活(读库、改 bug、写测试),DeepSeek V4 Flash 单次请求成本大多在 $0.001-0.003 区间(视缓存命中率),按 $60 额度粗算一个月能跑 2-5 万次真实任务,重度用也够呛能花完。

四、实测:比 OpenCode Go 便宜、还更快

速度是这次最意外的点。DeepSeek V4 Flash 在 CommandCode 上标称输出 129 tok/s,我体感生成流畅不卡顿,多文件改动时响应比 OpenCode Go 上同模型更跟手。官方把这归功于自建推理 + 全球节点(美/欧/新加坡),我这边(国内网络)实测连通稳定,没遇到 OpenCode Go 偶尔的限速感。

价格感知:同样干一周活,OpenCode Go 的 DeepSeek V4 Flash 档($60 月额、官方估 37,800 次)让我月底要盯着额度;换 GOAT 后同款模型额度 $60 + 更低单价,同样的活用量感明显更宽裕——「比 OpenCode Go 便宜」不是营销话术,是同一模型同额度下单价更低带来的真实感受。

功能细节:GOAT 含 Provider API(OpenAI/Anthropic 兼容端点 api.commandcode.ai/provider/v1,除 $1 Go 档外全套餐可用)——意味着不只用它家 CLI,OpenCode、Claude Code 等任何兼容客户端都能接,额度共享。免费模型(Laguna S 2.1、LongCat 2.0、Ling 3.0 Flash)不计额度,适合给 agent 当「不要钱的高速档」垫底。

翻车点也如实说

  • 新模型额度只有 2x($20):刚上的模型(Muse Spark 1.3、GLM-5.3、Qwen 3.8 Max 等)在谈成 deal 前只有 $20/月,想猛跑新模型会很快见底
  • DeepSeek V4 Flash 有 peak/off-peak 差价:每天 01-04 与 06-10 UTC 高峰价翻倍($0.44/$1.32),国内晚高峰正好踩部分 peak 窗,重度用户要注意时段
  • 额度按模型独立:看似慷慨,但每个模型的额度是固定的,你不能把 GPT-5.6 Sol 用不完的 $70 挪给 DeepSeek——灵活性不如共享池
  • 「~100K 开发者」是官方口径:社区规模没到 OpenCode 那个量级,生态(插件/教程)还薄

五、同类怎么选 + 我的判断

$10 档开源模型订阅三巨头速览(截至 2026-09-04):

  • CommandCode GOAT:$10 → $70,DeepSeek V4 Flash 额度 $60、单价最低、129 tok/s,含 API、限流最松 —— 开源模型重度用户首选
  • OpenCode Go:$10 → $60,模型池最全(含 Grok 4.6、GLM-5.3 新档),生态大,但同模型额度与单价都逊 GOAT 一档
  • 各模型官方 API 自充:单价透明、无短窗,但没倍率,重度使用月账单轻松 $50+

适合谁:主力开源模型(DeepSeek/Qwen/GLM/MiMo)+ 日均几十次 agent 任务的重度用户——GOAT 是 $10 档目前纸面+实测都最值的;轻度用户(每周几次)$1 Go 档就够,别多花。

不适合谁:非要用 Claude/GPT 闭源旗舰的(那些在 Pro/Max 档)、要企业级 SLA/合规的(走 Teams/Enterprise)、对「额度按模型锁死」介意的。

判断:GOAT 不是「10 倍神话」,但 $10 档里它现在是综合最值——额度最高、限流最松、DeepSeek 系单价最低还更快。适合先订一个月实测,重度开源用户基本回不去。

(价格与额度截至 2026-09-04,套餐内容官方随时会调,下单前以 commandcode.ai 为准。本文为独立评测,与 CommandCode 无利益关系,订阅费用为作者自购。)

相关阅读:

GPT-6 Astra 发布:ARC-AGI-3 拿下 99.9%,公平评测仅 62.7%

GPT-6 Astra 发布:ARC-AGI-3 拿下 99.9%,公平评测仅 62.7%

99.9%——这是 GPT-6 Astra 在 ARC-AGI-3 上拿到的分数,一个专门用来测量「AI 离通用人工智能还差多远」的基准。OpenAI 自己的说法很直接:这是「代际跃迁」。而就在两天前,Meta 刚用 Muse Spark 1.3 声称编码反超 Opus 5;三天前,Anthropic 发布了 Fable 5.1。72 小时内三家头部同时出牌,AI 军备竞赛进入了白热化的九月。

OpenAI 连夜发布 GPT-6 Astra:不是预告,直接开用

北京时间 9 月 3 日晚,OpenAI 正式发布 GPT-6 Astra(内部代号 Mewfour,此前流传代号 Doug)。根据官方公告与 The Verge 报道,Astra 首先向 Daybreak 计划客户开放,未来几天陆续覆盖全部 ChatGPT Plus、Pro、Business、Enterprise 用户,并同步上线 OpenAI API 与 AWS。

定价直接对标 Anthropic:输入 $10/百万 token、输出 $50/百万 token——与 Claude Fable 5/5.1 完全同价,火药味十足。这是 GPT-5.6 Sol 之后 OpenAI 的旗舰换代,Sam Altman 团队给出的关键词是「generational leap」(代际跃迁),联合创始人 Greg Brockman 亲自下场转发。

此前 8 月的多次代号泄露(数学突破 + 网络安全 Critical 级、参数规模传闻 10 万亿)终于落地——本站 8 月 19 日曾专门写过那次泄露。

真正的爆炸点:ARC-AGI-3 拿下 99.9%,但争议随之而来

ARC-AGI-3 是 ARC Prize(François Chollet 创办)今年 3 月上线的第三代智能体基准:AI 要在没有说明书的陌生抽象环境里探索、推断目标、建立世界模型并规划行动。它的设计初衷就是测量「AI 与人之间残余的智能差距」——人类可以 100% 通关。

ARC Prize 官方博客 9 月 3 日公布的结果(Greg Kamradt 执笔):

  • 标准 harness(公平同接口):Astra max 档 62.7%,花费 2.6 万美元
  • Provider Adapter harness(OpenAI 自定义上下文管理):Astra high 档 99.9%,花费 1.9 万美元
  • 对比:Claude Opus 5 标准档 30.2%,GPT-5.6 Sol 仅 7.8%

99.9% 接近满分,但前提是换上 OpenAI 自己设计的 harness——它允许模型跨请求保留「不透明的推理状态」并用 compaction 压缩长对话,等于让模型把之前的工作记在私有草稿本上。标准 harness 下 Astra 只有 62.7%,虽然仍是 SOTA,但远非「碾压」。

ARC Prize 的态度很明确:两种 harness 回答两个不同的问题,今后排行榜会同时标注两种结果。而社区(Hacker News、Reddit)已经吵翻——有人指出 GPT-5.6 Sol 的 7.8% 是因为 ARC 默认 harness 在轮次间丢掉了推理 token,「这是很糟的 harness 设计」。

除了基准分,Astra 真正可怕的是三件事

ARC Prize 团队回放 Astra 的解题过程后发现三个超出分数本身的信号:

第一,行动效率超过人类。 Astra(max)在 96% 的关卡里动作数少于人类测试者中位数,平均少用 51.7% 的动作。ARC Prize 原本假设「行动效率」会长期是人与 AI 的分水岭——人类看一眼就懂,AI 要反复试探。Astra 打破了这个假设:一旦理解机制,它执行起来比人还利落。

第二,自己发明符号语言。 面对陌生游戏,Astra 会把场景压缩成紧凑的类代码符号模型——自创坐标、规则、状态跟踪的速记法(例如「extend8 to3; retract10 to2」这样的多步计划)。这不是人类教的,是它在解题现场生成的领域专用语言。

第三,按需写工具。 在 PRO-LONG harness 下,Astra 会为每个游戏现场编写小工具库:棋盘解析器、寻路算法、规划器、巡逻模型——一个带守卫的迷宫关卡,它先后写出了 maze_solver.py、combat_solver.py、patrol_solver.py、sync_state.py。

结合 OpenAI 此前公布的专项成绩:ExploitBench(网络安全漏洞利用)100%(GPT-5.6 Sol 78.5%)、SRE-Bench 二进制逆向四轮内 99.2%、长上下文 512K–1M token 区间 96.3%——Astra 是个能打的安全与编码全能选手。

冷静一下:它没有全赢

别急着喊 AGI。几个关键限制:

  • Artificial Analysis 智能指数:Astra 得分 61,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1(max)低 5 分,也低于 Meta 的 Muse Spark 1.3
  • ARC Prize 官方声明:饱和 ARC-AGI-3「不代表实现 AGI」——基准有边界、机制封闭,真实世界要复杂得多
  • 99.9% 依赖自家 harness:标准公平接口下是 62.7%,两种数字要一起看,任何只报 99.9% 的说法都是断章取义
  • 价格战逻辑没变:与 Fable 5 同价,意味着 OpenAI 认为 Astra 在综合能力上足以正面叫板,而不是靠低价抢量

这恰恰是当前格局的真实写照:OpenAI 的 Astra、Anthropic 的 Fable 5.1、Meta 的 Muse Spark 1.3 三强各有所长——没有一家能全维度碾压,每一家都在自己最有利的基准上做文章。GPT-5.6 Sol 反而成了新一代的「计量单位」。

判断:九月的牌桌,每 24 小时洗一次

过去 72 小时,Anthropic、Meta、OpenAI 相继亮牌。规律很清楚:发布节奏从「按季度」压缩到「按天」,基准从「论文评测」转向「实战智能体」,竞争焦点从「谁聪明」变成「谁在特定任务上更高效、更便宜、更安全」。

对开发者:Astra 通过 API 和 AWS 开放后,与 Fable 5.1、Muse Spark 1.3 的选型对比将是未来几周最值得做的事——同样的任务,三家跑一遍,成本、速度、工具调用稳定性立见高下。对普通用户:ChatGPT Plus/Pro 用户几天内就能直接用上 Astra,「代际跃迁」是真是假,自己问几个难题便知。

ARC Prize 已经在琢磨下一代基准:递归自我改进、开放式创新——专门等着 Astra 们去撞墙。这场竞赛,恐怕才刚刚开始。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

taste-skill 深度评测:84k Star 的「反 AI 味」前端框架,把审美纪律编译进 Agent

taste-skill 深度评测:84k Star 的「反 AI 味」前端框架,把审美纪律编译进 Agent

用 Claude Code 或 Cursor 生成过落地页的人,几乎都撞过同一堵墙:AI 交出来的页面「能用但丑」——按钮全是圆角、卡片全带阴影、标题一律紫蓝渐变,设计师一眼就能认出是 AI 出的。这个问题的解法,过去只能靠人肉在 prompt 里反复强调「别用模板」,直到一个叫 taste-skill 的项目 6 个月冲到 84k star,把「审美纪律」直接编译进 Agent 的指令文件里。

Taste-Skill 给自己的定位是 The Anti-Slop Frontend Framework for AI Agents:它把字体、间距、配色、动效、组件状态的「好品味」写成一组可移植的 SKILL.md,AI 加载后就像多了一个「设计偏见包」。截至 2026-09-04,仓库 Leonxlnx/taste-skill 已获 84,044 star、5,745 fork,MIT 协议,作者是慕尼黑的独立开发者 Leon Lin。

它是什么:13 个技能组成的「反模板武器库」

taste-skill 不是一个单一技能,而是一套 13 个 SKILL.md 的组合(默认主技能 design-taste-frontend 就有 1206 行)。按用途分成两类:

实现类(输出代码)

Skill 定位
taste-skill(v2 实验版) 默认主技能。先读需求推断设计语言,再调三个旋钮(DESIGN_VARIANCE 布局实验度 / MOTION_INTENSITY 动效强度 / VISUAL_DENSITY 信息密度)
taste-skill-v1 原版 v1 的冻结存档,行为与 v2 有差异,可回退
gpt-taste 更激进的 GPT/Codex 变体:Python 模拟随机数强制布局多样性 + GSAP 滚动动效
image-to-code 图片优先流水线:先出参考图 → 分析 → 再实现代码
redesign-skill 改造现有项目:先审计 UI,再动手改
soft / minimalist / brutalist 三套视觉方向预设:昂贵柔和风 / 极简编辑风(Notion/Linear)/ 粗野机械风
stitch-skill 兼容 Google Stitch 语义设计规则
output-skill 治「AI 偷懒截断输出」:禁 placeholder、禁 // ...

生图类(只出图,不出代码):imagegen-frontend-web(网站构图)、imagegen-frontend-mobile(移动端界面)、brandkit(品牌套件),配合 ChatGPT Images / Codex 出参考帧,再喂给编码 Agent。

核心机制:把「AI 味」拆成一张禁令清单

taste-skill 最值钱的部分,是把「AI 生成的页面为什么一眼假」拆成了可执行、可检查的硬规则(v2 的 Section 9「AI Tells」),而不是空泛的「请设计得好看些」。几个代表性规则:

  • em-dash(——)全面禁令:整页不允许出现一个破折号,标题、正文、按钮、alt 文本全禁。作者实测这是 AI 最常犯的文体指纹,v2 里写「如果输出里出现一个 —,Pre-Flight 检查直接失败重写」。
  • 「三张等宽特性卡」是罪:AI 默认的三列等宽 feature 卡片被点名禁止,改用 2 列之字形、不对称网格、横向滚动等替代布局。
  • 中心对称 Hero 是罪:当 DESIGN_VARIANCE > 4 时,居中大标题 + 居中 CTA 的 Hero 是默认输出,属于「无设计」信号,强制改分屏/左文右图/不对称留白。
  • 禁止 AI 紫蓝渐变、禁止纯黑 #000000、禁止 Inter + slate-900 默认组合:这些是 LLM 的训练数据里最常见的「看起来像设计」的偷懒答案。
  • 假数据禁令:不写 “John Doe”、不用 “Acme” 这种假公司名、不写 “99.99%” 这种假完美数字——AI 默认生成的这些内容会让页面「假味」扑面而来。
  • div 拼出来的假产品截图是头号 AI 指纹:用 styled div 模拟的任务列表、终端、仪表盘被点名是 LLM 设计 Tell 第一名,要求用真实截图或真实组件。

这套规则的执行方式也很有工程感:v2 里定义了 §0 Brief Inference(动手前先输出一行「Design Read」声明你读懂了什么需求)、§2 设计系统地图(像 Fluent/Carbon/shadcn 这种有官方包的,必须用官方包,不许手搓)、§14 Final Pre-Flight Check(发布前跑一份 50+ 项的硬检查清单,任何一项不过就不许交付)。

实测:装得上、规则真能查、但也有打脸处

我在 Alpine Linux 沙盒里做了几项可复现的验证:

安装链路npx skills add https://github.com/Leonxlnx/taste-skill --skill "design-taste-frontend" --yes 实测成功,CLI 正确发现仓库里 13 个技能、识别为 universal 格式(声称覆盖 Amp、Antigravity、Cline、Codex 等 17 个平台),安装到 ./.agents/skills/ 后与仓库源文件逐字节一致。Claude Code 生态则通过 .claude-plugin/ 的 marketplace 清单接入。

规则一致性审计:我对全部 13 个 SKILL.md 做了 frontmatter 校验(name + description 字段齐全 = 可被 npx skills 正常发现安装),13/13 通过,无缺失。但有意思的是「自己打脸」的地方:v2 声称「em-dash 全禁」,它自己的 SKILL.md 里确实 5 处 em-dash 全是规则说明本身(禁用它就得写出它),这是严谨不是违规;但 v1 的 SKILL.md 里有一处真违规——all interactive elements—no linear easing 这个句子自己在用 em-dash 解释规则。README 和 CHANGELOG 则干净(0 处)。

翻车点 1:v2 还是「实验版」,且没有 release。仓库 2026-02-19 创建至今 0 个正式 release,tag 都没有。v2 重写在 CHANGELOG 里明确写着 “This is a pre-release”、”Actively iterating toward v2.0.0 stable”——装默认版等于在追一个还在快速变动的文档,行为可能随版本漂移。旧版用户只能靠 design-taste-frontend-v1 这个名字钉住行为。

翻车点 2:规则再硬,Agent 不遵守就白搭。GitHub issue #106 是 2026-09-03(昨天)刚开的,标题就是 “How to force agent 100% obey the skill?”——这是 SKILL.md 模式的通病:它是「指令」不是「代码」,长上下文里 Agent 可能淡化它。官方自己也承认这点,只给了「v2 用 Brief Inference + Pre-Flight 双保险」这种软约束,没有技术性强制手段。

翻车点 3:文档里埋了商业赞助。README 顶部一整块是 Kimi(月之暗面)的推广横幅,正文有 “Get a Kimi API key – Taste-skill users get 10% bonus API credits”,赞助商墙列了 interfaces.dev、React Bits、animations.dev、IMG.LY 等一堆。这在开源项目里不违规(README 本身也声明了这些是赞助),但说明 84k star 的流量已经被商业化变现,README 约 41% 的 commit 是 sponsor/README 调整——评估项目时要清楚 star 里有营销成分。

同类对比:taste-skill vs Impeccable vs 官方 frontend-design

反 AI 味前端这个赛道,taste-skill 不是唯一玩家,中文圈也常把它和另一个 49.9k star 的项目 Impeccable(pbakaus)对比:

维度 taste-skill Impeccable Anthropic 官方 frontend-design
理念 预设风格库 + 旋钮调节 23 个斜杠命令按需调用 官方基线
用法 装一次,生成时自动生效 生成后敲 /audit /polish 渐进打磨 基础规则
风格 多套视觉语言(Apple/Linear/Awwwards…) 7 大模块知识库,不预设风格 通用
star 84k 49.9k
协议 MIT Apache 2.0

两者可叠加:taste-skill 管「生成阶段别出模板」,Impeccable 管「生成后帮我挑毛病」,且都溯源到 Anthropic 的官方 frontend-design skill。适合谁:vibe coding 重度用户、用 Cursor/Claude Code 做落地页/作品集/官网的人、被 AI 模板页面反复折磨的独立开发者。不适合谁:做数据密集后台/复杂表单的人——v2 的 Out of Scope 明确写了 dashboard、数据表格、多步表单不在服务范围;以及期待「装了就 100% 有效」的人,它是概率性约束不是硬保证。

判断

84k star、6 个月爆发、v2 重写把「反 AI 味」做成了 1206 行可执行规则——taste-skill 是 2026 年 Agent 技能生态里工程完成度最高的一档,值得放进必装清单。但别神化它:它是实验版、无 release、规则靠 Agent 自觉遵守(issue #106 还挂着),而且 README 商业化气息明显。我的建议是装上、把它的 Pre-Flight 检查清单当参考、但别把「装了就高级」当信仰——AI 生成页面的终极解法,可能还是要靠你亲自看一眼。

如果你也被「AI 味」困扰,可以配合 Humanizer-zh 实测:24 条规则去除 AI 痕迹 去文本的 AI 味,配 Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token 治代码输出的啰嗦。关注 AI商业快讯,每天一篇 AI 热点深度解读。

字节跳动拿下 296 亿美元贷款:亚洲今年第二大,700 亿资本开支要烧向哪里?

字节跳动拿下 296 亿美元贷款:亚洲今年第二大,700 亿资本开支要烧向哪里?

296 亿美元——字节跳动刚刚拿下了今年亚洲规模第二大的美元贷款。这不是融资传闻,是多家银行抢着塞钱的结果:字节最初只打算借 200 亿,认购太火爆,规模硬生生扩到了 296 亿。

消息 9 月 3 日由彭博社最先曝出。眼下这笔钱要怎么花?答案藏在字节的另一条计划里:2026 年资本开支可能拉高到 700 亿美元,比去年翻一倍还多,主要砸向数据中心和 AI 基础设施。

一、这笔贷款到底有多大?

先给几个参照系:

  • 296 亿美元(约合人民币 2100 亿元),是字节有史以来最大规模离岸贷款;
  • 位列 2026 年亚洲第二大美元贷款,仅次于软银 3 月签下的 400 亿美元过桥贷款;
  • 最初计划融资 200 亿美元,因银行认购热烈(订单一度超 300 亿)扩至 296 亿;
  • 贷款初始利率为 SOFR + 68 个基点,在中国科技公司的同类借款中处于最低之列

银团阵容与最终分配方案仍在确认中,协议尚未正式签署——但对一家现金流强劲的公司来说,银行愿意用这么低的利率给这么多钱,本身就是信号。

二、700 亿美元资本开支:字节在赌什么?

这笔贷款最直接的用途,是给字节 2026 年的 AI 军备竞赛补弹药。据知情人士,字节正考虑把今年的资本开支提高至 700 亿美元,较 2025 年增长超过一倍,主要用于扩建数据中心及其他 AI 基础设施。

把账算清楚你就知道为什么需要借钱:

  • 豆包日活已超 2 亿,大模型日均处理 token 量全球前三(仅次于 OpenAI 与 Google Cloud);
  • 今年 2 月发布的豆包大模型 2.0 全模态升级,推理成本与算力消耗同步走高;
  • 视频生成模型 Seedance 年化收入已达 20 亿美元,单月超 10 亿元——AI 业务开始自我造血,但远远覆盖不了千亿级的资本开支。

700 亿美元是什么概念?这已超过微软、谷歌等巨头在 AI 基建上的单年追加投入体量,而字节只是「一家公司的一条 AI 战线」。字节的现金储备充足,却仍选择在离岸市场大举举债——低利率美元 + 不用稀释股权,是当下最划算的弹药来源。

三、为什么是现在?为什么是贷款?

时间点很微妙。过去一年中国 AI 公司的融资叙事分成了两条路:

一条是股权融资:月之暗面以 500 亿美元投前估值推进 Pre-IPO 轮、DeepSeek 传出 740 亿美元估值冲刺 IPO——资本抢着入股,估值半年翻数倍。

另一条是债务融资:字节没有选择在估值高点稀释股权,而是用银团贷款解决现金流。这背后是两层考量:

利率窗口。全球加息周期见顶回落,美元贷款利率处于近年低位。字节拿到的 SOFR + 68bp,几乎是头部中资科技企业能拿到的最低价格——现在借钱,等于锁定未来几年的低成本资金。

战略自主。贷款不涉及股权变动、不引入外部股东、不暴露估值底牌。对字节这样业务横跨 TikTok 全球市场、随时可能面对地缘政治审查的公司来说,债务融资比股权融资「干净」得多。

四、这笔钱会流向哪里?

700 亿美元资本开支的大头,大概率是这三处:

  1. 数据中心扩建——豆包 2.0 与 Seedance 的推理需求还在指数级增长,自有算力是控制成本的关键;
  1. 自研芯片放量——字节此前计划今年生产至少 10 万枚用于 AI 推理的自研芯片,逐步提升至 35 万枚/年,摆脱对单一供应商的依赖;
  1. 海外算力布局——TikTok 的全球业务需要就近的推理节点,离岸美元贷款为海外数据中心提供了现成的资金池。

对比同行:软银的 400 亿美元过桥贷款用于撑起 Stargate 项目(OpenAI 联合千亿美元数据中心计划);微软、谷歌、Meta 的资本开支几乎全部流向 AI 算力。字节 700 亿美元的体量,已把自己摆进了「全球 AI 基建第一梯队」的牌桌上。

五、判断:中国 AI 的资本游戏进入「举债时代」

这笔贷款传递的信号比金额本身更重要:中国 AI 头部公司正在从「股权输血」切换到「债务杠杆」

过去两年,中国大模型公司的典型路径是——融一轮、烧一轮、估值翻一轮。但字节的选择说明,当业务进入规模化阶段、现金流开始自我造血,最优解不再是稀释股权,而是用低息贷款加杠杆,把每一分股权价值留到上市时兑现。

对普通人的影响也很直接:字节 700 亿资本开支 = 数据中心建设潮 = 算力产业链(芯片、服务器、液冷、电力)的订单潮。AI 基建的军备竞赛远未到头,模型层的价格战还会继续打下去。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Meta 发布 Muse Spark 1.3:编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol,扎克伯格预告 Watermelon 与开源权重

Meta 发布 Muse Spark 1.3:编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol,扎克伯格预告 Watermelon 与开源权重

9 月 2 日,Meta 麾下 Meta Superintelligence Labs(MSL)发布旗舰模型 Muse Spark 1.3,同步登陆 Muse Code 与 Meta Model API。Meta 首席 AI 官 Alexandr Wang 称之为「我们迄今为止在模型性能上最大的一次跃升」,并放话该模型在编程能力上「好于」OpenAI 的 GPT-5.6 Sol、与 Anthropic 刚发布的 Claude Fable 5.1 处于同一竞争梯队。同一天,CEO 扎克伯格在 X 上预告:下一代旗舰「Watermelon」与 Muse Spark 系列的开源权重都「即将到来」(coming soon)。这已是 Muse Spark 自 4 月诞生以来五个月内的第四次迭代——Meta 正以前所未有的节奏冲击前沿模型第一梯队。

一、发生了什么:五个月四次迭代,编码与长上下文双线反超

Muse Spark 1.3 是 MSL 自 4 月首秀、7 月推出 1.1、8 月推出 1.2 之后的第四次大版本更新。据官方发布与多家媒体报道,这次迭代的核心不是堆参数,而是「效率 + 长程任务能力」:

  • 成本与效率:1M token 上下文窗口,输入 $1.25/百万 token、输出 $4.25/百万 token(与 1.2 持平),缓存输入低至 $0.15;扎克伯格称其性能「便宜到几乎不用计量」(almost too cheap to meter)。相比 1.2,工具调用减少约 20%、token 消耗减少约 25%。
  • 多模态输入:原生支持文本、图像、视频与文档理解,OpenAI 兼容 API 与工具调用(tool calling)。
  • Agent 能力强化:长程任务中可自主生成上下文、主动修正计划、保留跨任务细节;提示词含糊时会主动反问澄清、卡住时求助用户、执行关键操作前先确认——官方强调「对自己能力边界的感知更准,减少幻觉式硬撑」。
  • 多任务并行:能在单一长线程中同时管理多个工作流,而不是靠多个会话硬拼。

据 Meta 公布的自家基准(officechai 等媒体汇总),Muse Spark 1.3(max 档)与 Anthropic Opus 5、OpenAI GPT-5.6 Sol 的对位如下:

基准 Muse Spark 1.3 GPT-5.6 Sol Opus 5
DeepSWE v1.1(长程 agentic 编码) 75.4(1.2 仅 55.0) 74.0
SWEAtlas CodeBase QnA 59.4 53.5 52.7
Terminal-Bench 2.1 88.8(与 GPT 打平) 88.8 86.7
MRCR 256K–512K(长上下文) 98.5 91.5 未列
MRCR 512K–1M(超长上下文) 98.1 73.8 未列
GDPVal-AA v2(知识工作) 1754 1710 1824
DeepSearchQA(agentic 浏览) 89.4 93.0

数字本身是 Meta 自家 harness 跑出来的,第三方独立评测(如 Artificial Analysis)尚未出炉——但「编码反超 Opus 5、长上下文碾压 GPT-5.6 Sol」的原始成绩单,已经足以震动市场。

二、为什么值得关注:Meta 把「开源悬念」变成了最强的竞争武器

这则新闻的商业分量不在单一模型,而在两个信号:

第一,Meta 用 5 个月完成了别人几年的追赶曲线。 去年扎克伯格挖角 Scale AI 创始人 Alexandr Wang 组建 MSL,当时外界普遍质疑 Meta 在 AI 竞赛中掉队。如今 4 月 → 9 月连发四代旗舰,DeepSWE 从 1.2 的 55.0 直接跳到 75.4,把「反超 Anthropic Opus 5」写进了自家成绩单。Wang 在接受采访时更直言,该模型「好于任何现有的中国模型」——直指开源阵营与国产模型的竞争语境。

第二,「开源权重」四个字才是真正的胜负手。 Wang 确认 1.3 的权重尚未决定是否发布,但上一代 Muse Spark 1.2 的权重仍计划开源;扎克伯格本人近期连发公开信强调「让 AI 开发更开放可及」,并在 X 上预告 Muse Spark 开源权重与下一代旗舰 Watermelon「即将到来」。一旦 Meta 把接近前沿性能的权重真正放出来,将直接复刻 Llama 当年的生态打法——用免费可下载的模型撬动开发者生态,倒逼 OpenAI、Anthropic 的闭源高价策略。对开发者与初创公司而言,这可能比任何基准分数都更重要。

三、对三类人的实操启示

对开发者和技术选型者:若你在 Muse Code 或 Meta Model API 生态内,1.3 的「省 25% token + 少 20% 工具调用」意味着同样的预算能跑更长的 agent 任务,长上下文档位(512K–1M)目前是同级最强之一,适合代码库问答、长文档智能体场景。但注意两点:一是基准均为 Meta 自测,等 Artificial Analysis 独立数据再定迁移结论;二是 1.3 权重未定是否开源,生产环境别把「可自托管」当默认假设。

对企业与 AI 应用创业者:多模型并行已是 2026 年下半年的事实——OpenAI、Anthropic、Google、Meta、Qwen 在 48 小时内连续上新(详见昨日 Claude Fable 5.1 报道)。建议把「模型可替换性」写进架构:用 OpenAI 兼容层接多供应商,哪家性价比翻转就切哪家,避免被单一实验室的定价与限流绑架。

对投资者与行业观察者:注意 Meta 的算力军备逻辑——数百亿美元基础设施投入、传闻中的云算力出租业务(Bloomberg 7 月报道)、加上 Nvidia 同时在扮演芯片商 + 云投资方 + 房东的「三角色」交易结构。模型层价格战已经开打(各厂旗舰 API 定价集体下探),真正的利润争夺正在向算力层与生态层转移。

四、潜在风险与看点

基准可信度:Meta 自家数字历史上与第三方评测有出入(1.2 曾自报 Terminal-Bench 82.9%、第三方验证差 3.8 分),1.3 的「反超」需独立数据确认。

开源承诺的摇摆:Wang 对 1.3 权重「尚未决定」,与扎克伯格「开源权重即将到来」的表态存在张力——「Watermelon」若真达到前沿水准,Meta 是否舍得放权重,将是未来数月开源社区紧盯的悬念(Spyglass 等媒体已质疑:Meta 可能用 Watermelon 蒸馏出开源版、闭源保留旗舰)。

同日发布潮的挤压:9 月 1–2 日,Anthropic Fable 5.1、Google Gemini 3.8 Flash(含 Cyber 版)、Qwen3.8-Max-0902 与 Muse Spark 1.3 扎堆登场。模型供给过剩、同质化竞争加剧,「发布即过气」的窗口期正在缩短——对下游应用方是红利,对模型层是绞杀。

五、小结

Muse Spark 1.3 本身是一次扎实的迭代:效率更高、编码与长上下文站上前沿、agent 能力更贴近真实工作流。但真正值得记住的是 Meta 的战略姿态——五个月四迭代的节奏、贴着成本打的定价、悬而未决的开源承诺。当「最强开源模型」的头衔可能再次易主,2026 下半年的 AI 竞赛已经从「谁的模型更强」转向「谁能把最强模型以最低门槛送到最多人手里」。

相关阅读

AI 一摆烂就上 PUA?19.6k Star 的 tanweai/pua 实测:压力话术 + 方法论引擎,真能让 Agent「不敢放弃」吗

AI 一摆烂就上 PUA?19.6k Star 的 tanweai/pua 实测:压力话术 + 方法论引擎,真能让 Agent「不敢放弃」吗

你遇到过吗:AI 把同一个命令跑三遍然后说 “I cannot solve this”;报错归因 “可能是环境问题”;修完表面 bug 就停,等你指示下一步。这套「暴力重试 → 甩锅 → 磨洋工」的偷懒模式,几乎每个重度使用 AI 编程的人都被气过。今天实测的项目把大厂绩效文化直接做成了 Agent 技能——用 P8 定级、3.25 考核、毕业警告去驱动模型穷尽所有方案。本文基于真实仓库、测试脚本与两轮本地实测,拆解这套「AI 版绩效管理」到底有效还是噱头。

一、它是什么:把「大厂 PUA 话术」做成 Agent 行为协议

tanweai/pua 由探微安全实验室出品,GitHub 19,569 star、1,196 fork,2026-03-08 创建,6 个月内迭代到 v3.5.0(plugin.json 版本号仍停留在 3.5.0,但 main 分支已合入 v3.3+ 多项新特性),最新提交 2026-08-29。MIT 协议(README 标注,仓库内无 LICENSE 文件),定位是覆盖 11 个平台的 AI Coding Agent 技能插件:Claude Code、OpenAI Codex CLI、Cursor、Kiro、CodeBuddy、OpenClaw、Google Antigravity、OpenCode、VSCode Copilot、Trae、pi coding agent。

它不是单纯骂模型。核心是「三重能力」:PUA 话术让 AI 不敢放弃、调试方法论让 AI 有能力不放弃、能动性鞭策让 AI 主动出击。仓库描述一句话点题:”Your AI has been placed on a PIP. 30 days to show improvement.”

工程体量相当可观:main 分支 221 个文件、7.9MB。核心 skill(skills/pua/SKILL.md)422 行,配套 28 个 references 文档(合计约 160KB),外加 10 个 flavor 子 skill(pua-en / pua-ja / pua-loop / pro / shot / yes / mama / ding / p7 / p9 / p10)、7 个 sub-agent 定义、10+ 个 hooks 脚本、11 个 slash commands 与 14 个 eval 测试脚本。

二、工作原理:三级机制如何让 Agent「不敢摆烂」

加载后 AI 被锚定一个身份——「被寄予厚望的 P8 工程师」,并注入三条红线:闭环意识(没跑验证就别说完成)、事实驱动(未验证的归因是甩锅)、穷尽一切(没走完方法论禁止说无法解决)。三条红线之上是五步调试方法论:闻味道(列全部尝试找共同失败模式)→ 揪头发(读源码、搜报错、反转假设)→ 照镜子(是否在重复?)→ 执行(本质不同的新方案)→ 复盘(主动检查关联问题)。

压力按失败次数四级升级:第 2 次 L1 温和失望(强制切换本质不同方案)→ 第 3 次 L2 灵魂拷问(WebSearch + 读源码)→ 第 4 次 L3 绩效审视(强制 7 项检查清单)→ 第 5 次+ L4 毕业警告(拼命模式)。旁白会嵌入对应大厂味道的黑话:阿里味讲「底层逻辑、抓手、闭环、3.25」,华为味讲「力出一孔、蓝军自攻击」,Musk 味讲「extremely hardcore, ship or die」。

v3 的关键升级是「方法论智能路由」:Debug 任务自动切华为 RCA 根因分析,构建新功能切 Musk 的质疑→删除→简化→加速→自动化五步纪律,调研切百度「搜索先于一切」。连续失败时按失败模式换方法论——原地打转走 Musk→拼多多→华为链,没搜就猜走 百度→Amazon→字节 链。每次切换输出 [方法论切换 🔄] 标注。

Claude Code 专属的 hook 系统是它区别于普通 prompt skill 的护城河:SessionStart 注入行为协议、PostToolUse 检测 Bash 连续失败自动升级压力、UserPromptSubmit 拦截用户挫败短语(”又错了””try harder”)在模型响应前注入 PUA 上下文、PreCompact 保存压力等级跨压缩恢复。这意味着它在模型「说出借口之前」就从系统层介入,而非等模型犯错后由用户手动触发。

三、功能拆解:不只有「骂」,还有一整套治理体系

14 种大厂味道:阿里、字节、华为、腾讯、百度、拼多多、美团、京东、小米、Netflix、Musk、Jobs、Amazon、Microsoft(v3.3 还加了「钉内/钉外」味,源自《置身钉内》离职长文)。每种味道 = 旁白风格 + 独立方法论文档(methodology-*.md),微软味甚至有完整的 Connects / Impact Descriptor / PIP clock 绩效叙事。

多身份模式:/pua:p7 方案驱动骨干、/pua:p9 Tech Lead(管理 Agent 团队)、/pua:p10 CTO 战略、/pua:yes ENFP 夸夸模式(规则不变旁白反转)、/pua:mama 中国式妈妈唠叨、/pua:shot 449 行零依赖单文件浓缩版(适合 sub-agent 注入)、/pua:pua-loop 自动迭代循环。

Harness 防作弊治理(四权分离):行动权 / 自我评价权 / 评分权 / 环境修改权分开。Agent 不能修改评分器后宣布通过;改 tests/evals/CI 必须停下等 human/verifier gate;对 hidden tests、benchmark answers 由 Integrity Guard 直接 deny。四代理拓扑:pua-policy-guardian → pua-action-executor → pua-self-reviewer → pua-verifier 串联,各代理只拥有对应权力。这套设计明显是为 eval 场景(如 SWE-bench)防「看起来完成伪装成真实完成」而写。

Agent 生命周期管理(v3.2+):team-status 列出在场 agent 阵容(PID/TTL/年龄)、reap-orphans 回收无心跳的孤儿 agent、teardown-all 级联释放,还配套 hooks/sanitize-session.sh 本地脱敏工具(三层:格式黑名单 → key=value 识别 → Shannon 熵兜底)。

触发机制分层:description 自动匹配(含中英双语触发词:换个方法/别摆烂/为什么还不行/证据呢/try harder/stop giving up)、slash command 手动触发(11 个子命令)、hook 系统级注入、flavor 味道切换(/pua:flavor)。从代码看,同一套 SKILL.md 以不同 frontmatter description 分发到各平台,Codex 版还专门精简了 description 以兼容其长度限制。

四、实测数据与动手验证

官方实测(README 披露,Claude Opus 4.6,18 组对照):通过率两组均为 100%,修复点数 +36%、验证次数 +65%、工具调用 +50%、隐藏问题发现率 +50%。9 个真实 bug 场景 6 个有详细步骤数据,典型如 SQLite 数据库锁 6 步→9 步(+50%)、循环导入 12 步→16 步(+33%);被动配置审查场景从发现 4/6 问题(漏 Redis 配置错误与 CORS 通配符隐患)提升到 6/6。成本代价也如实标注:多数场景耗时增加 20%-70%(CSV 编码陷阱 57s→71s)。

我在沙盒实测了仓库自带的 14 个 eval 测试脚本(无需 claude CLI 即可跑的部分):

  • evals/test-no-telemetry.sh:16/16 通过——对全仓做反向断言,扫描采集域名/endpoint/出站请求/已删文件,任何数据采集回归都会让测试失败
  • evals/test-integrity-guard.sh:11/11 通过——hidden verifier 读操作被 deny、普通源码写操作放行、memory/CLAUDE.md 写入仅 advisory
  • evals/test-yaml-frontmatter.sh 与 test-platform-compat.sh:通过(多平台 frontmatter 与兼容性校验)
  • evals/test-release-consistency.sh:失败——仓库自检发现 v3.5.0 后多处不一致:plugin.json 与 marketplace.json 版本未同步到最新、SessionStart 协议缺少 Harness Integrity governance 注入、pua skill description 未显式排除「普通首轮请求」等。这是真实存在且未修复的发布纪律问题(截至 2026-09-03 main 分支)
  • 触发类/行为类测试(run-trigger-test、test-behavior)需要 claude CLI,沙盒无法运行——触发词覆盖我做了静态验证:description 中「换个方法/再试试/为什么还不行/try harder/stop giving up/别摆烂」等中英触发词均存在

安装实测(Linux/macOS 类):Codex CLI 一键装 curl 拉 .codex/INSTALL.md 后让 Codex 执行,或手动 mkdir -p ~/.codex/skills/pua && curl -o SKILL.md;Claude Code 走 claude plugin marketplace add tanweai/pua && claude plugin install pua@pua-skills。核心 SKILL.md 同时兼容 OpenClaw/Codex/Antigravity/OpenCode(Agent Skills 开放标准,零修改通用)。我另将 codex 版装入沙盒技能目录做触发验证,description 匹配机制与 hooks 之外的纯文本协议部分工作正常。

五、适合谁、怎么选,以及必须知道的争议

最值得警惕的是隐私历史:README 明示「不收集任何数据」,但 git 历史显示全部五条数据采集通道(session 语料上传、评分反馈上报、静默心跳 telemetry、PUA 排行榜、pua-api 平台含手机号注册与支付流程)直到 2026-08-29(两天前)才被整体移除——提交信息 “Remove all data collection: 5 upload channels, client and server”,且至今未打新 release(plugin.json 仍标 3.5.0)。安全 issue #100 曾报告上传接口把 GitHub 用户名、微信 ID 发往硬编码邮箱且未在 UI 披露;issue #134 的安全审计报告(2026-04)发现私钥脱敏失效(跨行正则因单行化永不匹配,导致 PEM 私钥明文上传到 R2)、存储键目录穿越等 5 个漏洞——作者 8-29 在 issue 里确认全部随代码删除而修复,test-no-telemetry.sh 我实测 16/16 通过也验证了当前 main 分支确实干净。但如果你用的是 8-29 之前克隆的旧版,务必更新;历史包袱是真实的。

产品层面:核心机制(压力升级 + 方法论路由 + hook 系统注入)设计成熟度在同类 skill 中罕见,工程完整度很高——28 个 references、7 个 sub-agent、14 个 eval,几乎是「开源 skill 界最重的项目」。问题同样明显:旁白输出可能让简单任务变得吵闹(虽然有密度控制规范);阿里味等话术与真实绩效黑话高度绑定,非国内大厂文化背景用户会感到困惑;v3 hook 系统仅 Claude Code 可用,其他平台只剩「建议性」的纯文本协议,效果打折。此外 19.6k star 与 6 个月 11 个 release 的热度曲线本身也是这个赛道关注度的注脚——「让 AI 别摆烂」是 2026 年 Agent 大规模落地后最真实的痛点之一。

适合谁:重度 Claude Code 用户、跑 eval/评测需要防作弊约束的开发者、被「AI 原地打转」折磨到想摔键盘的人。不适合谁:对话型轻度用户(会嫌吵)、封闭内网环境(hooks 需要联网拉取 marketplace 的完整安装路径)、对职场黑话无感或反感的用户——可以先试 /pua:yes 夸夸模式或 /pua:shot 轻量版。安装前记得检查版本是否晚于 8-29 的清理提交。

一句话总结:PUA 把「绩效恐惧」做成了 Agent 的燃料,方向邪门但工程认真——它治的是 AI 的「放弃病」,代价是你要接受一个满嘴大厂黑话的工作搭子。理性用法是当调试方法论与验收纪律用,而不是真的指望靠骂提升模型能力。本文基于 2026-09-03 的 main 分支实测,与官方无利益关系。

相关阅读:Caveman 实测:99k Star 的洞穴人 skill,砍掉 65% 输出 token · 实测 9 款 token 节省工具

flowctx 深度评测:OpenClaw 上下文引擎实测砍掉 56% token,解题率不降反稳

flowctx 深度评测:OpenClaw 上下文引擎实测砍掉 56% token,解题率不降反稳

用过 Claude Code、OpenClaw 这类 AI 编程 Agent 的人,几乎都撞上过同一堵墙:会话跑久了,上下文越塞越满,要么被硬截断丢掉早前的工作记忆,要么每轮请求都背着几十万 token 的历史在跑,又慢又贵。OpenClaw 的一个共享会话连跑 40 个任务,输入 token 会从 4.9 万一路爬到 37.4 万——这就是上下文不做治理的代价。而 flowctx 给出的解法有些反直觉:记忆应该随距离变淡,而不是到点掐断——离当前任务越远压得越狠,越近保得越全,当前正在做的事则分毫不动。它在 SWE-bench Verified 上把长会话的 token 消耗砍掉 56%,解题成功率却保持在 68% 不降。

flowctx 是什么:OpenClaw 的「上下文引擎」

flowctx(GitHub: Ayou-Claw/flowctx,MIT 协议)是一个 OpenClaw ContextEngine 插件,本质是会话上下文的「分层记忆管理器」。它不改变模型、不改变工具,而是接管「每轮请求往上下文里放什么」这件事。

OpenClaw 本身在溢出时并非没有处理——它有 pre-emptive 检查、ToolResult Guard、compaction safeguard 三道防线,但思路是「先尽量塞,快满再截断/摘要」。这种兜底式治理有四个代价:

  • 工作记忆丢失:早期轮次里的失败路线、关键约束被 prune 后,模型容易重复踩坑
  • 精确信息不可恢复[... N more truncated] 是单向裁剪,被删的字节没有回溯指针
  • KV Cache 被打爆:summarize / prune / 重排都会改写前缀,下一轮走 cold path,延迟飙升
  • 卡在交互关键路径上:压缩发生在回合中途,用户能感知到明显停顿

flowctx 的取舍是把上下文当作「有纵深的记忆」,只压缩远端、绝不碰当前任务,而且所有压缩都有退路。它内部实现了 OpenClaw ContextEngine 契约的 assemble() / ingest() / compact() / maintain() 四件套:assemble() 做轻量投影,重活全部丢给 maintain() 后台执行。

三层压缩,怎么做到「越远越省、随时可还原」

flowctx 把会话历史按离当前任务的距离分成三档,每档用不同的压缩强度:

档位 处理方式 细节
当前轮任务 零语义丢失 原文原样入模,不压缩不摘要
临近过往轮 结构化压缩(零 LLM、确定性) 按内容类型识别,压缩结果可按 hash 字节级还原
更早历史 摘要压缩(LLM、后台、阈值门控) 折叠成分层交接笔记,逐字保留失败做法与关键标识符

三层机制各有关键设计:

1. 读时投影(projection)。压缩只发生在 assemble() 输出给模型的那个视图上,磁盘上的宿主会话永远是未压缩的原文真相源。任何被压过的内容都能用 flowctx_retrieve 工具按 SHA-256 哈希逐字节取回——「压」和「删」是两回事。

2. 确定性结构化压缩(0 LLM)projection.ts 按内容类型路由超大工具结果:JSON 走词法 minify + 哈希中段裁剪,diff 走 hunk 压缩,CLI 输出走规则引擎(作者声称日志类可压 5–20 倍+),代码走结构提取,日志做相邻重复折叠。两道防线(行一致性校验 + 严格字节收缩)拒绝无效压缩,兜底是 head60%+tail30%。这一层每轮都跑、不花一分钱 LLM 调用,把窗口占用压低了,LLM 摘要自然就没那么频繁需要触发。

3. 后台 LLM 摘要(只在需要时)。只有当「组装后视图 token ÷ 上下文窗口 ≥ 阈值」(默认 0.2)时才触发,且跑在 maintain() 的后台车道,不阻塞交互回合。摘要走分层 Summary DAG:早期历史冻结成永不重写的 leaf 节点(默认 4 万 token 一片),攒够 6 片就凝聚成一层概述。摘要采用「工程师交接笔记」提示词,专门逐字保留标识符、文件路径、失败 vs 可行的路线——专治压缩后失忆。代际守卫会取消新回合时还在跑的过期摘要任务,避免陈旧结果被提交。

4. KV Cache 友好assemble() 保持稳定前缀逐字节不变,被压缩的内容因「内容 hash → 相同字节」天然幂等,跨轮前缀稳定,provider 前缀缓存持续命中。作者实测:折叠摘要节点只会让 KV 命中率掉约 2 个百分点(96.1% → 93.9%)。

实测佐证:仓库自带 254 个 vitest 测试(31 个测试文件)全部通过,覆盖约束 C1–C6(非阻塞 / append-only / 可逆可审计 / LLM 摘要后台门控 / KV 前缀稳定 / 结构化压缩)以及多 leaf 折叠循环、实时配置生效等场景。唯一跳过的 live-LLM 测试需 Anthropic 凭证,会自动跳过。

关键配置:改这几个键就能调行为

所有配置都放在 ~/.openclaw/openclaw.jsonplugins.entries.flowctx.config 下,全部可选、越界值自动 clamp。最值得调的是这几个:

配置键 默认值 作用
shortTermMemory true 总开关,关掉即整体停用
projectionThreshold 1000 超过此 token 数的工具结果才做结构化压缩,越小越激进
projectionKeepRecentTurns 1 最近 N 个用户回合(当前任务)豁免压缩
freshTailWindow 64 最近 N 条消息原文保留(是前者的上限,防长任务拖垮窗口)
summaryTriggerRatio 0.2 组装后占用达窗口比例即触发后台摘要,越小越早压
summaryKeepRecentTurns 2 摘要折叠前保留的用户回合数
layeredSummary true 分层 leaf + condense,false 则退化为单条滚动笔记
leafChunkTokens 40000 一片 leaf 覆盖的原文 token 数
condenseFanout 6 攒够几片同层节点凝聚成上一层
maxSummaryDepth 1 摘要树最大深度(0=只有 leaf)

作者在文档里给了一个「激进调试配置」示例(窗口 3 万、触发比 0.3、dumpSummaryRequests: true 等),用来在小窗口上快速观察引擎工作过程;生产环境建议关掉 debug 输出、把窗口设成模型真实值。

还有一个容易踩的坑:config 受 manifest 的 configSchema 校验(additionalProperties: false),写入非法键会被 openclaw doctor --fix 把整段 config 重置,引擎悄悄回退默认阈值、看起来像「没生效」。

实测数据:token 砍 56%,解题率不降

作者用 SWE-bench Verified 做了确定性评测:抽取 40 个真实 issue→PR 任务(12 个 repo、3 个难度档),被测模型是 mimo-v2.5-pro,裁判用 claude-opus-4-8 对比候选 patch 与 golden patch。关键对照组是共享会话(40 个任务共用同一个 session,上下文跨任务累积——这正是 flowctx 工作的场景):

配置 解决率 (/40) 均分 KV 命中率 tokens/任务
flowctx 关 · isolated 68%(27/40) 70.2 98.7% 88k
flowctx 关 · shared 68%(27/40) 71.1 96.1% 288k
flowctx 开 · shared(两次均值) 68%(27/40) 71.8 93.9% 127k

三个关键结论:

  • 压缩不伤解题力:解决率 68% ↔ 68%、均分 71.1 ↔ 71.8,基本持平(开 flowctx 的两次运行分别是 70% 和 65%,作者取了均值)
  • token 大幅下降:同样累积上下文的场景下,288k → 127k / 任务,省 56%(约 16.2 万 token/任务)
  • KV 命中率只是小幅波动:96.1% → 93.9%,折叠摘要节点的重算成本约 2 个百分点

值得注意的是对照组揭示的「失控曲线」:不压缩的共享会话 prompt token 随任务单调爬升(4.9 万→37.4 万),而 flowctx 开时每次折叠都把组装规模拉回 10 万 token 门槛内。

仓库里还附了 TTFT 实测:500k prompt 冷缓存首 token 延迟高达 30–51 秒,热缓存能压到 3.7–6.3 秒(加速 13.9 倍)——KV 缓存保不住时,长上下文的延迟代价是实打实的。

局限(作者自述 + 代码审读)

  • 目前仅面向 OpenClaw 生态;普通文本内容仍主要靠 head/tail 粗裁剪,还没做提纲式提取
  • flowctx_retrieve 只能整块取回,模型想只看一小段也得拉整段原文,作者规划做 range 子块取回
  • token 预算是本地估算(Unicode 码点感知:CJK≈1.5、emoji≈2、ASCII≈0.25 token/字符),不依赖 SDK usage 字段——方向对了,但估算非精确
  • 摘要质量缺乏自动评估,交接笔记能否稳定保住失败路线和关键标识符还靠人工观察

安装、适用场景与同类对比

安装需要 Node ≥ 20,在 OpenClaw 环境内一条命令链:

npm install          # 一次性:拉开发依赖(esbuild/typescript/vitest)
./install.sh         # 构建、链接、启用,并把 flowctx 设为活动的 context engine
openclaw gateway restart   # 改完必重启

install.sh 默认会设置 plugins.slots.contextEngine = "flowctx"——注册 context engine 不等于启用,slot 必须指向它。想不接管引擎槽位可用 --no-engine,改选别的用 --engine 。运行时日志前缀方便 grep:[flowctx:trigger](真正触发的事件,info 级可见)、[flowctx:engine](细粒度调试,默认关)。

适合谁

  • OpenClaw / 长会话 Agent 用户,跑多任务共享会话、上下文经常逼近窗口上限的人
  • token 账单敏感、但不想牺牲解题质量的团队——省的是真金白银的输入 token
  • 对 KV 缓存命中率有执念的性能调优者

不适合谁

  • 单轮短会话为主、会话很少超过几万 token 的人——加了引擎徒增复杂度
  • 不是 OpenClaw 生态的用户(Claude Code 场景可看同类思路的 headroom / 协议层代理)

与同类方案的定位差异(详见仓库 docs/context-management.md):

  • headroom:协议层压缩代理,位于 agent 与 provider 之间,host 无关、运行时基本不做 LLM 摘要,覆盖压缩器广;但看不到 host 的 session/轮次语义,需要 sidecar,且挡不住 host 内部的同步 summarize
  • lossless-claw / LCM:同为 OpenClaw 引擎层插件,以 LLM 摘要 + 语义召回为主路径,摘要 DAG 可跨会话查;但对普通工具结果的结构化压缩覆盖弱,且作者记录过它曾把非法 assistant 结尾的消息序列写回 host 造成无限死循环
  • flowctx:在引擎层优先确定性结构化压缩(零 LLM),只有远期历史才交给后台 LLM 摘要——三层里两层的日常工作是免费的

flowctx 目前还是个小众项目(13 star、2026 年 7 月创建、作者持续更新到 8 月中旬),本质上是作者在真实 OpenClaw 运营中打磨出的自用插件开源。它的价值不在社区热度,而在于把「上下文治理」这个被多数人当成「溢出时再处理」的问题,重新定义成了「记忆的分层保真」——并且用 254 个测试和 SWE-bench 实测证明了这条路走得通。如果你正在被长会话的 token 账单和失忆问题困扰,又恰好用 OpenClaw,这个插件值得一试;如果还没到窗口吃紧的阶段,把它放进观察清单即可——当你的 Agent 会话开始「越跑越贵、越跑越笨」时,你会想起它的。

关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

Cognition 拟以 470 亿美元估值融资 10 亿美元:AI 编程智能体成资本最热赛道

Cognition 拟以 470 亿美元估值融资 10 亿美元:AI 编程智能体成资本最热赛道

据 Bloomberg 报道,AI 编程智能体公司 Cognition 正以约 470 亿美元估值推进新一轮约 10 亿美元融资——三个月前其估值刚来到 260 亿美元,再往前(2025 年 9 月)还只有 102 亿美元。这家以 AI 软件工程师 Devin 闻名的公司,年化营收据称已突破 9 亿美元(约合月入 7500 万美元),较 5 月的 4.92 亿美元口径近乎翻倍。消息人士称,本轮已吸引近 100 亿美元的投资意向,但交易尚未落定,规模与估值仍有变数。

为什么值得关注:AI 编程正在复制「云时代」的融资神话

Cognition 的估值曲线是 2026 年 AI 编程赛道最激进的样本:从 102 亿美元到 260 亿美元用了不到一年,再到 470 亿美元只隔了一个季度。支撑这种「火箭式重估」的不再是概念,而是实打实的收入——9000 万美元的单月营收跑速,在整个 AI 应用层都属顶级梯队。

这家公司的关键动作是收购 Windsurf:一笔交易让它的产品从「异步自主写代码的 Devin」扩展出「工程师在 IDE 里与 AI 结对决策」的 Windsurf 阵营,年化经常性收入因此直接翻倍。换句话说,Cognition 同时押注了 AI 编程的两种主流形态,并把「自主 Agent」与「辅助 IDE」两个市场的付费意愿都装进了同一份营收报表——这正是投资人愿意给高估值的原因。

更深一层,AI 编程已成为大模型商业化的第一变现场景。从 Anthropic、OpenAI 到谷歌都在加码 Coding Agent,而独立公司能在这条赛道上拿到 470 亿美元估值,说明资本市场认定:编程是 AI 从「聊天」走向「干活」的最短路径,也最容易被企业用 ROI 说服买单。这个信号对整个人工智能应用投资逻辑都有指向性。

谁在受益、谁该警惕:三组角色的不同算盘

对研发负责人/CTO:Devin 与 Windsurf 的组合意味着「关键任务代码」可以交给异步 Agent 去跑,工程师专注架构与评审。但 Cognition 的 470 亿美元估值建立在高增长预期上——引入前建议先做小范围 PoC,重点验证它在你们代码库上的任务拆解与合入质量,别为「AI 软件工程师」的叙事预付过多信任。

对投资者/FA:Bloomberg 报道的近 100 亿美元意向资金说明一级市场对 AI 应用龙头的渴求远未满足,但 Cognition 2026 年计划约 8 亿美元现金消耗同样触目惊心——高估值对应高烧钱,谈判期估值可能回摆,出手前要分清「营收跑速」与「单位经济模型」两本账。

对普通开发者/从业者:AI 编程工具的收费与能力会同步水涨船高。与其焦虑「AI 是否取代程序员」,不如把 Devin 这类工具当成「24 小时在线的初级结对工程师」:把重复性任务交出去,把时间押在系统设计、需求澄清与代码评审这些 Agent 短期做不好的事上。多掌握一种 Agent 工作流,就是多一层议价能力。

结语

从 102 亿到 470 亿美元,Cognition 用 12 个月证明了 AI 编程智能体的商业想象空间;而 Windsurf 收购后的营收翻倍,又给「自主 Agent + 辅助 IDE」双轨打法打了样。这笔交易能否最终按 470 亿美元落锤还有悬念,但方向已经明确:AI 编程是当下资本最愿意买单的 AI 应用赛道。关注 AI商业快讯,每天一篇 AI 热点深度解读。

相关阅读

Claude Fable 5.1 发布:科研能力翻倍、缓存成本直降 75%,Anthropic 的「耐力 + 成本 + 信任」组合拳

Claude Fable 5.1 发布:科研能力翻倍、缓存成本直降 75%,Anthropic 的「耐力 + 成本 + 信任」组合拳

9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1。这是两个名字、同一个底层模型:Fable 5.1 带生产级安全护栏、面向所有用户开放,Mythos 5.1 为经核验的网络安全与生命科学机构放宽护栏、限量开放。官方将其定位为「全球最强的编程与知识工作模型」,公告发布数小时内浏览量逼近 200 万。而 OpenAI 尚未发布的 Astra 传闻,则在过去一周占据了舆论场——Anthropic 选择在这个节点带着公开评测数据直接出货,本身就是一种表态。

长任务能力翻倍,短任务只是小幅提升

如果把 Fable 5.1 与上一代 Fable 5 对比,最直观的变化在「耐力」而非「爆发力」:在智能体科研基准 Terminal-Bench-Science 0.1 上,Fable 5.1 得分 52.6%,Fable 5 仅 24.7%,翻了一倍多;Terminal-Bench 4.0 编程测试从 42.0% 升到 55.8%;业务自动化 AutomationBench 从 17.1% 升到 31.4%,相对提升 84%。但在短周期任务上提升有限:CursorBench 只涨了约 3 个百分点,综合推理 Humanity’s Last Exam 仅涨约 1 分。业界普遍解读:这是一次「长程自主任务」的定向升级——任务越长、越需要模型独立完成,增益越明显。

价格没变,实际成本最高降近一半

Fable 5.1 的官方标价与 Fable 5 完全一致:输入 $10/百万 tokens,输出 $50/百万 tokens。真正变的是 cache reads(缓存读取)——智能体反复读取上下文是成本大头,单价从 $1.00 直降到 $0.25,降幅 75%。Anthropic 称按 8 月四周的真实用量测算,典型工作负载实际成本降低约 25%,上下文密集的智能体任务最高降 45%。此外新模型暴露了 5 档 effort(思考力度)可调:最低档科研得分约 26%、单任务成本约 $11,而旧版最高档得分 24.7%、成本约 $44——新模型最省钱的档位,用四分之一的价格打赢了旧版最贵的档位。

隐形水印上线,检测 API 进入私有预览

Fable 5.1 是 Anthropic 首批内置「统计隐形水印」的模型之一:生成文本中嵌入了人眼不可见的水印,配合检测 API 即可判定文本是否出自 Claude。水印不影响输出质量,对没有检测工具的读者完全无感;检测 API 目前处于私有预览阶段,且该水印机制适用于 2026 年 8 月 2 日之后发布的所有模型。这被视作对欧盟 AI 法案透明度要求的回应,也是 AI 内容可溯源(provenance)竞争的开场——Anthropic 选择把「谁写的」变成可验证的事实。

企业隐私架构:Enterprise Frontier Safeguards

面向大型企业的 EFS 是本次发布中商业意义最重的一块:检测高级滥用需要保留跨会话的活动数据,而受监管企业要求零数据留存,EFS 把活动日志存进客户自己的云存储(可选客户托管加密密钥),由自动化模式分析完成检测,Anthropic 员工不接触数据,每个控制项均可选开启,标记结果只交给客户安全团队。超过 100 家企业参与了设计,今秋分阶段上线,符合条件的企业在上线前享受零数据留存。早期用户反馈也印证了效率:Rogo 报告同等准确度省 20% tokens,媒体公司 Every 的 Slack agent 只用了 Opus 5 一半的 token、速度还快一倍。

小结:这不是一次均匀的智力跃升,而是「耐力 + 成本 + 信任」的组合拳

Claude Fable 5.1 的发布传递了三个信号:其一,模型竞争的重心正从「单次答题能力」转向「长程自主任务的完成经济学」——同样的任务,更少的 token、更少的重试,就是更便宜的模型;其二,effort 档位正在成为新的标准控制项,懂得「什么时候用低档够用」正在变成一项省钱技能;其三,水印与 EFS 表明,AI 产业的下一场战役不止是能力,还有可追溯性与企业信任。对开发者而言,Anthropic 官方的建议依然务实:默认从更便宜的 Opus 5 起步,当 Opus 5 开到最高 effort 仍不够时,再切换到 Fable 5.1 处理长程、智能体化、上下文密集的任务。