OpenRouter 上的「免费大模型」,价格是 0,但从来不是没有代价。今天官方模型接口返回 447 条记录,输入与输出价格同时为 0 的只有 25 条,占 5.6%。我把这 25 个逐条拉了下来——模型页、端点、延迟、吞吐、供应商数量、数据条款——结论是:免费池真正的成本,写在三张不在价格表上的账单里。(文中价格、额度与性能数据截至 2026-09-19,下单前请以官网为准)
免费额度怎么算:20 次/分钟、50 次/天,充值 10 美元换 1000 次/天
OpenRouter 做的是模型路由:一个 key、一份账单,覆盖 447 个模型、88 家供应商。2026 年 8 月它被 Stripe 以 70 亿美元收购,成为支付巨头押注的「模型路由入口」。
免费模型在这套体系里的位置,官方规则一共三档:
| 档位 | 每分钟 | 每天 | 条件 |
|---|---|---|---|
| 免费变体(累计充值少于 10 美元) | 20 次 | 50 次 | 注册即可 |
| 免费变体(累计充值至少 10 美元) | 20 次 | 1000 次 | 一次性充值 10 美元 |
| 付费变体 | 无平台级请求上限 | 不适用 | 按 token 计费 |
这 25 条免费记录里,22 个是带 :free 后缀的文本变体,2 个是 Google Lyria 音乐生成模型,1 个是随机路由。三个细节决定了这套规则的真实手感。第一,:free 不是一个开关,而是模型目录里单独的一行,有自己的定价、上下文长度和端点。第二,开小号没有意义——官方原文是「额外账号或 API key 不会改变限流,容量按全局治理」。第三,免费额度不花 OpenRouter 的钱,端点由供应商自己挂:NVIDIA 5 个、Google AI Studio 4 个、Novita 3 个,其余 9 家各 1 到 2 个,一共 24 个免费端点,外加一个随机路由的 openrouter/free。
换句话说,免费池是供应商拿算力换曝光、换数据、换榜位的地方。这直接决定了下面三张账单。
账单之一:8 个免费模型,由「可能拿你的数据训练」的供应商托管
OpenRouter 给 88 家供应商都标了数据条款。整张表里,承认可能用提示词训练模型的只有 4 家:DeepSeek、Liquid、Thinking Machines、NVIDIA。除 DeepSeek 之外的 3 家正是免费池主力,一共托管了 8 个免费模型,占免费池的三分之一。
另外 10 个免费端点属于「保留提示词但不训练」:Google AI Studio 保留 55 天、Nex AGI 保留 30 天、Cohere 保留 30 天,Poolside 与 AtlasCloud 没有给出天数。真正零保留的只有 6 个:Novita 的 3 个 Ling、ModelRun 托管的小参数 Qwen、OpenInference 托管的是 DeepSeek V4 Flash、以及 Decart 托管的 GLM-5.2。
这里有个容易被忽略的开关:账户设置里,付费模型与免费模型的「允许训练」是两套独立设置。你关掉它,那 8 个免费模型会直接从可用列表里消失——免费档的「免费」,一部分就是用数据条款换来的。
账单之二:免费版只有一个供应商,付费版最多 26 个
这是全量拉取后最扎眼的一组数字。24 个免费端点,每一个都只有单一供应商;同一个模型的付费版本却动辄十几二十个源:DeepSeek V4 Flash 有 26 个、GLM-5.2 有 23 个、Qwen3.8 27B 有 16 个、Gemma 4 31B 有 12 个。付费端点的多源意味着挂了会自动切到别家,免费端点没有 fallback,供应商一抖就整个不可用。
还有 7 个免费模型在 OpenRouter 上根本没有付费版本:Nex-N2.5 的大小两档、Ling 3.0 Flash Sante、Dots3-Note Preview、LFM 2.5、Cohere North Mini Code、Nemotron 3 Nano。对它们来说,免费是唯一入口。
规格也不是同一份。免费的 GLM-5.2 上下文只有 32768,付费版是 1048576,相差 32 倍;免费的 Qwen3.8 27B 是 262144,付费 1000000;反过来 Nemotron 3 Ultra 的免费端点上下文 100 万,比付费版的 262144 还大。免费端点不是付费端点的打折通道,而是另一套参数完全不同的部署。
可用率同样不均匀。24 个端点里有 3 个状态异常;过去三天,Nemotron 3 Nano 的日可用率是 80.1%、83.8%、83.8%,Inkling 最低 88.2%,DeepSeek V4 Flash 最低 94.0%。72 个「模型乘日期」的样本里,19 个低于 99%。
账单之三:免费最强只有旗舰的 64.6%,而且用量榜第一并不是分数第一
模型接口自带 Artificial Analysis 的智能指数,全部 447 个模型里有 145 个给出了分数。把这 25 个免费模型放进去排序是这样的:
| 免费模型 | 上下文 | 智能指数 | p50 往返延迟 | 吞吐 | 免费端点数据条款 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 1.05M | 34.5 | 2064 ms | 25 tok/s | 零保留 |
| GLM-5.2 | 32768 | 34.0 | 1164 ms | 37 tok/s | 零保留 |
| Qwen3.8 27B | 262K | 33.9 | 626 ms | 28 tok/s | 零保留 |
| Inkling | 1.05M | 25.5 | 1840 ms | 35 tok/s | 可能训练 |
| Ling 3.0 Flash VL | 262K | 25.0 | 2361 ms | 60 tok/s | 零保留 |
| Nemotron 3 Ultra | 1M | 23.4 | 3143 ms | 19 tok/s | 可能训练 |
| Ling 3.0 Flash Fin | 262K | 23.0 | 1342 ms | 136 tok/s | 零保留 |
| Gemma 4 31B | 262K | 15.4 | 1291 ms | 22 tok/s | 保留 55 天 |
| Nemotron 3.5 Lightning | 1M | 13.6 | 5134 ms | 16 tok/s | 可能训练 |
| Cohere North Mini Code | 256K | 9.9 | 601 ms | 80 tok/s | 保留 30 天 |
三个结论。免费最强 34.5 分,在 145 个有分模型里排第 40,只有付费旗舰 53.4 分的 64.6%——免费档够做事,但够不到第一梯队。用量榜第一不等于能力榜第一:官方按近 7 天真实 token 用量排的免费榜,第一是 Nemotron 3 Ultra(4.32T tokens),智能指数只有 23.4;分数第一的 DeepSeek V4 Flash 用量排第 4;分数第二的 GLM-5.2 连前 16 都没进。延迟与吞吐也和分数无关,最快的 LFM 2.5(2.6B 参数)吞吐 185 tok/s,最慢的 Lyria 只有 4 tok/s。
延迟高有一半要怪拥挤:官方 30 分钟统计窗口里,免费池一共处理了约 50.1 万次请求,其中 Nemotron 3 Ultra 一家 10.96 万次、DeepSeek V4 Flash 9.83 万次。这些请求共享 20 次/分钟的平台限流。
该不该用:三种用法可以,三种用法别碰
先说额度值多少钱。额度按请求数计,不按 token 计。以一次请求 800 输入加 300 输出 token 估算,同样是每天 1000 次,按各自最便宜的付费端点价折算:
| 免费模型 | 付费价(每百万 token 输入/输出) | 1000 次折算 | 一个月折算 |
|---|---|---|---|
| Inkling | 0.95 / 4.05 美元 | 1.98 美元 | 59.2 美元 |
| Nemotron 3 Ultra | 0.50 / 2.20 美元 | 1.06 美元 | 31.8 美元 |
| GLM-5.2 | 0.554 / 1.742 美元 | 0.97 美元 | 29.0 美元 |
| Qwen3.8 27B | 0.10 / 1.80 美元 | 0.62 美元 | 18.6 美元 |
| Gemma 4 31B | 0.09 / 0.34 美元 | 0.17 美元 | 5.2 美元 |
| DeepSeek V4 Flash 0731 | 0.04 / 0.08 美元 | 0.06 美元 | 1.7 美元 |
同样是一次性充 10 美元解锁每天 1000 次,选错模型,一个月的额度只值 1.7 美元;选对模型值 59.2 美元,差 34 倍。这个换算的口径是请求数不是 token 数,长上下文任务的实际价值会更高。
还要留意免费池的周转速度:这 25 个免费模型里,14 个是最近 90 天上线的,23 个在半年内上线,最早的一个也只到 2026 年 2 月。名单变得很快,今天能用不代表下个月还在——官方 FAQ 的原话是「这些模型限额低,通常不适合生产使用」。
横向看,Google AI Studio 的免费层是按项目、按模型分别限额,官方文档已经把逐模型的免费额度移出文档页;Groq 的免费层是另一套独立限流。OpenRouter 免费档的独特点在于覆盖面:一个 key 能试到 NVIDIA、Google、Cohere、DeepSeek、Qwen、GLM 全家共 24 个模型,代价就是上面那三张账单。
三种用法可以:一是原型验证与选型,一个 key 横评多个实验室的模型;二是非实时批处理,每天 50 到 1000 次足够跑小批量实验,慢一点不影响结果;三是学习与风格对比,openrouter/free 随机路由反而适合感受不同模型的差异。
三种用法别碰:一是生产环境,单源、20 次/分钟、可用率最低到 80%;二是隐私敏感内容,三分之一的免费端点来自可能保留训练权的供应商;三是需要一致性的 agent 长链,额度按请求数计,一次 agent 任务动辄几十次请求,而随机路由每次换模型,行为无法复现。
判断很明确:OpenRouter 免费档值得开,但要把定位从「省钱的生产方案」改成「低成本试模型加非敏感批处理」。它是目前最便宜的横评 24 个模型的方式;把它当生产环境用,或者把敏感代码贴进 NVIDIA、Thinking Machines、Liquid 托管的模型里,那就是在拿另一样东西付费。
相关阅读: