Cloudflare 免费 AI 服务升级全景拆解:Vectorize 与 Workers AI 免费额度算清账,「免费 500 万向量」误读纠正

白嫖党关心的问题永远只有一个:Cloudflare 的免费额度,到底够干什么?中文圈给出的答案相当诱人——掘金上流传最广的教程写着,Vectorize 免费额度”支持 500 万向量、每月 300 万次查询”。这个数字让很多人以为捡到了宝。但翻开 Cloudflare 官方定价文档一算,完全是另一回事:免费层只够存 6,500 条 768 维向量(约等于 5M 维度 ÷ 768),和”500 万”差了三个数量级。这篇不吹不黑,把 Vectorize 与 Workers AI 两个免费服务的真实额度算清账,顺便盘点它们最近一年到底”升级”了什么。

免费额度两年没动,动的是”上限”和”模型目录”

先说结论,可能和你的体感相反:两个核心免费额度,两年多没涨过一分钱

Vectorize 免费层(每月 3000 万查询维度 + 500 万存储维度)2024-09 定下至今未变;Workers AI 每天 10,000 Neurons(神经元,Cloudflare 的 AI 算力计费单位)更是 2024-04 上线时就是这个数,2026-08 的最新定价文档依旧如此。

真正的升级发生在别处(额度单位不变,但同样的钱能买到更多):

  • 索引容量上限:单索引最多 500 万向量 → 2026-01 翻倍到 1000 万 → 2026-08 的 limits 文档已显示 2000 万向量(架构上限,与免费存储额度是两码事,后面细说)
  • 模型目录:从早期几十个小模型扩到 50+,2026 年密集上新——Kimi K2.6/K2.7 Code(1 万亿参数级)、GLM-5.2/5.3、DeepSeek-V4、Gemma 4 26B、NVIDIA Nemotron-3、FLUX.2 生图全家桶
  • 工程体验:2026-02 起 OpenAI 兼容 API 的 tool calling 全面修 bug(多轮函数调用终于不抽风);2026-03 上线 prompt caching(缓存输入价格仅为原价 1/30-1/90)与异步批量 API
  • 周边额度:KV 免费层 2026-02 提升(读 10 万次/天 + 1GB);Workers 代码包体积 2026-09 从 3MB 放宽到 64MB——之前塞不进 Worker 的大依赖,现在可以了

一句话:Cloudflare 走的是”额度冻结、内容升值”路线——每天同样的 10,000 Neurons,2024 年只能玩 7B 小模型,2026 年能碰 1T 级开源前沿。但坏消息是,额度没涨的同时纪律在收紧(见第四节)。

Vectorize:额度按”维度”算,不是按”条数”算

Vectorize 免费额度难懂,是因为它的计量单位不是”向量条数”,而是向量维度数(stored dimensions / queried dimensions)。一个 768 维的向量,就消耗 768 个存储维度。

免费账本:5,000,000 存储维度/月 + 30,000,000 查询维度/月(官方定价文档,2026-04 更新,链接)。除以维度,真实容量如下:

嵌入模型(维度) 免费可存向量数 备注
bge-small(384 维) ≈ 13,000 条 英文轻量场景
bge-base / base-zh(768 维) ≈ 6,500 条 中文常用档
bge-m3 / qwen3-embedding(1024 维) ≈ 4,880 条 多语言/长文本
OpenAI text-embedding-3(1536 维) ≈ 3,255 条 外部模型需自调 API

查询侧公式是(月查询次数 + 存量向量数)× 维度 ≤ 3000 万。存 5,000 条 768 维向量的索引,每月约可查 3.4 万次,折合每天 1,100 次左右——个人博客语义搜索、几百页文档的私有知识库、MVP 验证,完全够用。这也是 Cloudflare 官方明说的定位:免费层永远支持”原型和实验”。

超了也不贵(这才是 Vectorize 真正的杀手锏):官方示例,5 万条 768 维向量 + 每月 20 万次查询,约 $1.94/月,前 10M 存储维度与前 50M 查询维度甚至直接包含在 $5/月的 Workers Paid 里。对比 Pinecone 最低 $50/月起步,差距是数量级的。

Workers AI:10,000 Neurons/天到底能干什么

Neurons 按 GPU 算力成本折算——模型越强,单价越贵,免费额度能跑的次数越少。这也是”有人说够用、有人说一小时烧光 12%”吵翻天的原因:两人用的是不同模型。按 2026-08 官方模型价格表换算:

模型/用途 单价(输出) 每天 10,000 Neurons ≈
Embedding(bge-m3 等) ~1,075 Neurons/M tokens 近千万 token,建库不是瓶颈
Whisper 语音转写 ~41-47 Neurons/分钟 约 4 小时音频
FLUX.1-schnell 生图 ~10 Neurons/步 200+ 张图
llama-3.2-1b(小模型) ~18,252 Neurons/M tokens 500-1,000 次对话(每次 500 输出 token)
gemma-4-26b / qwen3-30b ~27,000-30,000/M tokens 约 700 次
gpt-oss-20b ~27,273/M tokens 约 700 次
Kimi K2.6 / K2.7 Code / GLM-5.3 ~360,000-400,000/M tokens 只有 50-70 次

看懂这张表,就知道正确用法是分层:批量分类、改写、embedding 全部走小模型;Kimi K2.6 这类前沿模型只留给关键推理步;多轮 agent 会话加 x-session-affinity 头吃 prompt cache(缓存输入单价只有原来的 1/30-1/90,Neurons 直接省一个量级)。纯免费栈跑通一个带 AI 检索的个人应用,Reddit 上 2026-06 已有人验证可行。

三个真实的坑

① 模型目录滚动淘汰:2026-05-30 一次性下架 17 个旧模型——gemma-3-12b、llama-3.1-8b 全系、mistral-7b、phi-2 都在列;kimi-k2.5 被自动别名到价格更高的 k2.6。代码里写死的模型 ID 会直接 404,dashboard 用量也可能莫名上涨。

② 免费层超限即停:免费额度打满后请求直接失败(Free 无自动计费),要超用必须升 $5/月 Workers Paid。2026-09-01 起 D1(SQLite 数据库)免费层已改为超限直接失败——以前”超一点还能跑”的宽松时代结束了,Vectorize 同理。

③ 前沿模型限流很紧:Kimi K2.6/GLM-5.2 等只有 20 rpm(充值 AI Gateway credits 可到 50 rpm);另外免费额度 UTC 0 点重置后偶发 error 4006 误报超限(2026-09 社区仍有人中招),遇到重试即可。embedding 模型选型时也注意:索引维度定死后中途不能换模型,否则要重建索引重灌数据。

与同类对比:免费向量库中 Vectorize 的 5M 维度 ≈ 6,500 条(768 维)比 Pinecone 免费层(单索引 100 向量级)慷慨得多;但要存几十万条以上还是得上付费云或自建。Workers AI 免费额度做 demo 富余、做生产不足,定位是”Workers 生态的拼图”——它的真正价值不是省钱,而是向量库、embedding、推理、对象存储(R2 10GB 免流量费)全部在同一生态内,零 API key 管理,全球 300 城边缘分发。适合:个人站语义搜索、私有知识库 MVP、已在 Cloudflare 部署的全栈应用。不适合:亿级向量生产库、要求 10ms 级延迟的实时推荐、以及重度依赖前沿模型每日推理的业务。

总评:免费层是当下个人开发者做 AI 应用性价比最高的起点——额度对”几千条文档、每天千次查询、混合使用小模型”的量级绰绰有余,超出后的付费价格又便宜到可以忽略。真正的成本是维护:模型下架要跟进、额度上限要按维度盯着算。别信”免费 500 万向量”的教程,信自己的除法。

(额度与价格截至 2026-09-08,以 Cloudflare 官方定价文档为准。本文为独立评测,与 Cloudflare 无利益关系,未接受任何形式的赞助或免费额度;文中核算基于官方公开文档,未自购套餐跑真实负载。)

相关阅读:10 美元买 70 美元额度?CommandCode GOAT 订阅拆解 | 实测 9 款 Token 节省工具横评 | 谷歌 Gemini 视频开关:号称砍 88% token 实测翻车

关注 AI商业快讯,每天一篇 AI 热点深度解读。

发表评论