如果你每个月在 AI 模型 API 上花钱,AMD 最近这个东西值得看一眼:不用买显卡,不用先开云实例,登录网页复制一个 Key,就能调用跑在 AMD 自己服务器上的大模型,官方标注「免费」。
它叫 Token Factory,挂在 AMD Radeon Cloud 上,目前标着 BETA。里面并列摆着 DeepSeek 和 Qwen 的模型,都支持 OpenAI 接口格式——也就是说,Cherry Studio、openCode、Cline 这类工具改个 Base URL 就能用;它同时还提供 Anthropic 格式接口,Claude Code 也能直接指过去。
但「免费」两个字后面藏着两个数字:一个算不平的额度,和一条没人细看的条款。这篇把官方文档翻了一遍,把该说的都摆出来。
它是什么:AMD 把免费 API 挂在自己的云上
AMD Radeon Cloud 是 AMD 官方的云端算力平台,分两层:
免费共享端点(Public Free Model APIs) —— 常开、不消耗任何东西、不用开实例。模型由 AMD 挑,你只管调用。Base URL 是 https://developer.amd.com.cn/radeon/api/v1。
专属端点(Dedicated Model APIs) —— 你自己开一个 GPU 实例、用 vLLM 或 SGLang 部署想跑的模型,这部分要烧 credits,不算免费。
免费层提供四个接口:OpenAI 的 /v1/chat/completions 和 /v1/models,Anthropic 的 /v1/messages 和 /v1/messages/count_tokens。注意它不提供 embeddings、rerank、音频、图像生成和 /v1/responses,打到这些路径一律 404——想做 RAG 的人得另找向量化服务。
拿 Key 的路径极短:打开 Token Factory 页面首次登录,Key 会自动签发,格式是 rc- 加 48 位十六进制;同一个 Key 通吃所有免费模型,换模型只改请求里的 model 字段,不用重新申请。Key 可通过 POST /api/profile/api-token 轮换,旧 Key 立刻失效。
登录方式对中国用户比较友好:手机号、邮箱、以及 GitHub / CSDN / 魔搭社区快捷登录都行。但站点有区域限制——中国站是 developer.amd.com.cn,国际站是 radeon-global.anruicloud.com,两边账号不互通,而且我实测打开国际站只有一个启动实例的控制台,没有 Token Factory 入口。所以现阶段,这基本是一份中国站限定福利。
现在免费能拿到什么
这是今天的实际目录(模型会变,官方明说可以随时增减):
| 模型 | 上下文 | 图片输入 | 思考模式 |
|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 1,048,576 | 不支持 | 默认关闭,可手动开 |
| DeepSeek-V4-Flash-Vision-Exp | 1,048,576 | 支持 | 默认关闭 |
| Qwen3.8-Flash-Next | 262,144 | 支持 | 默认开启 |
| MiniCPM5-2B | 131,072 | 不支持 | 不思考 |
两个值得说的点。一是 Qwen3.8-Flash-Next 是 Qwen4 架构的开放权重预览版,125B 总参数、每 token 只激活 6B,官方宣称在编程与 Agent 任务上超过 Qwen3.7-Plus;二是 百万 token 上下文和图片理解都在免费层里,这个组合在免费 API 里很少见。
但模型页里那几行「使用限制」才是真正的坑,而且官方文档写得很细:
- Qwen3.8-Flash-Next 只接受一条 system 消息,且必须排在数组第一位,角色必须拼
system。 这不是网关规则,是它权重自带的 Jinja 模板强制的。新版 OpenAI SDK 会把system发成developer,直接违反它自己的模板——用官方 SDK 反而报错。DeepSeek 两个模型没这毛病,system 消息位置随意、可多条。
- 有一批参数会被静默丢弃,不报错、不提示。
stop、seed、logit_bias、logprobs、top_k、min_p、repetition_penalty全在丢弃名单里。你以为设了停止词,其实是没设。
- 思考模式的默认状态两个模型相反。 DeepSeek 不发
reasoning_effort就不思考;Qwen3.8-Flash-Next 不发也在思考,而且默认档是它最长的xhigh。要写一套跨模型代码,档位取low或medium才通用——顶层档位的名字不统一,Qwen 叫xhigh,DeepSeek 还额外接受max,两者不通用。
额度算不平:两个官方口径差了 74 倍
社区口径一致:每天约 10 美元的等值额度,每日重置、不过夜。这个 $10 在官方文档里能对上——GET /api/profile/model-usage 的示例响应里写着 daily_cost_limit_usd: 10。
问题在于,这 $10 到底能换多少 token,官方给了两套互相打架的口径。
口径一:模型卡上的积分换算。 展示价是输入 0.14 pts / 百万 token、输出 0.28 pts / 百万 token、缓存命中 0.0028 pts / 百万 token。这三个数字恰好等于 DeepSeek V4-Flash 涨价前的官方美元价。按这个算,$10 能换约 3570 万个输出 token。
口径二:官方 usage 接口的示例。 同一份文档里,示例响应写着「今天 142 次请求、88,214 token、花费 $1.8412」,last_30_days 是「2840 次请求、1,904,221 token、$39.77」。两条数据折算下来都是 每百万 token 约 20.9 美元。按这个算,$10 只能换约 48 万个 token。
两个口径差 74 倍。同一天花同样的钱,一个能跑三十多万字,一个只能跑几千字。
官方对这个问题的回答是:「上面的数字只是示例,你的真实限额以接口返回的为准——账号之间不一样,而且会变。」换句话说,注册完第一件事应该是调一次 GET /api/profile/model-usage,看自己账号到底记的是什么价,再决定要不要把它当主力通道。
作为参照系:DeepSeek 官方 API 现在的价格是 V4-Flash 输出 4.5 元/百万 token(空闲时段)到 9 元(高峰),折合 0.63 到 1.27 美元。如果 AMD 走的是口径一,那确实白拿;如果走口径二,那它按的是「原价」,只是不向你收钱。
额外提一句,AMD 的免费共享 API 和 Radeon Cloud 的 credits 是两套完全独立的账:免费模型不吃 credits,credits 只在跑 GPU 实例时消耗,而且实例闲置照样烧,一个账号同时只能开一个实例。别把「领了 100 美元云信用额」和「每天 10 美元模型额度」当成一回事。
限流和条款:真正卡住你的是这两样
额度之外还有两道独立的闸门,任一道都能把你拦下来:
- 平台准入层:每个 Key 30 请求/分钟、每 IP 120 请求/分钟、每 Key 8 个并发,另有按模型、按服务进程、按平台全局三档并发限制。
- 网关计量层:每个账号 20 请求/分钟(60 秒滑动窗口),外加每日消费上限。
账号级 20 RPM 比 Key 级 30 RPM 更严,这点很容易被忽略——只盯着 30 配限流的人会莫名撞 429。好在限流状态不用猜,每个成功响应都带余量头:X-RateLimit-Remaining-User-RPM 看分钟余量,X-RateLimit-Remaining-User-Daily-USD 看当天还剩多少额度。被限时返回 429 加 Retry-After(分钟限制给 60 秒,并发限制给 1 秒)。
需要提醒的是,文档里对「每日额度什么时候重置」有两处矛盾表述:一处说是「从你第一个计费请求起算的滚动周期,不是固定午夜边界」,另一处说是「按 Asia/Shanghai 每日重置」,示例又给了零点。以自己账号返回的 daily_reset_at 为准——这直接影响你的批处理任务会不会跑一半断在半夜。
真正需要逐字读的是服务条款,官方这次写得很直白,几条红线:
- 一人一个 Key。 同一个人开多个账号持 Key,包括用邮箱加点、
+tag别名绕过,会导致 Key 被停用;共用、转让、出售 Key 同样停用。
- 禁止任何形式的转售,包括藏在代理、网关、聚合器后面。 官方原话是:任何人都可以自己注册免费使用,没有任何第三方被授权转卖这项服务;把服务或模型包装成自己的产品、指示模型谎报自己是哪家的、池化账号提升团队容量,都在禁止之列。市面上那些「AMD 免费 API 中转站」,接入即违规。
- 它记录你的 prompt 和模型输出。 官方明说会记录 API 请求内容,对话内容保留约 2 天滚动窗口后删除,元数据保留更久;不用于训练、不出售、不共享第三方。文档里那句写得很实在:「我们告诉你这件事是因为它属实,不是因为舒服——如果某段 prompt 你不希望被存下来,就别发。」
- 禁止处理个人、健康、金融等敏感数据。 这是试用服务,机密内容一律不要发。
- 它不是生产服务。 无 SLA、无可用性承诺、无支持义务;模型可随时增删,端点和 Key 可因运维原因重启或吊销。
和 NVIDIA、商汤、魔搭放在一起比
同量级的免费 API 通道不多,横向摆一下:
| 服务 | 免费形式 | 主要短板 |
|---|---|---|
| AMD Token Factory | 每日额度上限,OpenAI + Anthropic 双协议 | 中国站限定,账号级 20 RPM,记录 prompt |
| NVIDIA NIM | 40 RPM,无每日上限,模型 100+ | 全站共享 40 RPM,社区反馈经常超时 |
| 商汤 SenseNova | 公测免费,滚动 5 小时 60k 积分 | 限时公测,付费档已在路上 |
| 魔搭 ModelScope | 约 200 次/日 | 需阿里云实名,仅限个人非商用 |
| 火山方舟 | 每日 200 万 token | 需注册实名 |
AMD 的差异点很清楚:唯一同时提供 OpenAI 和 Anthropic 两种接口格式的免费通道,意味着 Claude Code 这类只认 Anthropic 协议的客户端不用装任何转换中间件就能直连;再加上百万上下文和图片理解都在免费层,这个组合目前独一份。
输的地方也清楚:模型只有四个、目录随时变、账号级 20 RPM 比 NVIDIA 的 40 RPM 更紧、中国站限定。
适合谁:想免费跑 DeepSeek-V4-Flash 或 Qwen3.8-Flash-Next 写代码、搭 Agent、做长文档实验的个人开发者;手上有 Claude Code 想换个便宜后端的人。
不适合谁:要上生产的(无 SLA)、要发敏感数据的(记录 prompt)、要分享给团队或对外转发的(条款直接封)、要依赖 embeddings 做 RAG 的(免费层不提供)。
我的判断
值得注册,但别当主力。
它免费、官方托管、协议标准、接入成本几乎为零——对中国开发者来说,这是当前最容易白拿到 DeepSeek 旗舰和 Qwen4 预览版模型的途径之一,光这一点就值得花十分钟把 Key 拿到手。
但三个前提必须摆清楚:额度口径没算平(两个官方数字差 74 倍,注册后第一件事是查自己的实际计价);它记录 prompt(约 2 天滚动窗口,方便调试,但任何机密内容别发);它明说不是生产服务(模型今天有明天可能没,别硬编码模型名,用 GET /v1/models 现查)。
观望信号也很明确:等官方把计价口径写清楚,或者等它走出中国站。
顺便说一句,AMD 这几年在「开发者免费额度」上给得比硬件大方——AI 开发者计划里还有 100 美元 AMD Developer Cloud 信用额(约合单卡 MI300X 跑 50 小时)、50 美元 Fireworks AI 额度,不过云信用额激活后 30 天过期,领了不用的记得别放过期。
价格与额度截至 2026-09-10,以官网为准(官方文档多处标注 Last updated: 2026-09-10)。本文为独立评测,与 AMD 无利益关系,未接受任何形式的赞助或免费额度;本次未注册账号、未自购任何档位,以上为官方文档(含官方端点实测记录)与公开社区信息解析,非本人实测体验。
延伸阅读:
关注 AI 商业快讯,每天一篇 AI 热点深度解读。