CommandCode 上的 MiMo-V2.6 实测:GOAT 订阅下每百万 token 约 6 美分,但 Flash 并不快

如果你每个月在 AI 编程上要花掉 10 美元以上,今天这条值得看完:CommandCode 把小米今天凌晨发布的 MiMo-V2.6 三个档位全部上架了,而且费率跟小米官网一分不差——Pro 输入每百万 token 0.435 美元、输出 0.87 美元,Flash 是 0.14 与 0.28。放在 GOAT 计划里,$10 换 $70 额度,折扣率 7 倍。

「7 倍额度」是数学还是话术,两周半前写过一次。这次换个问法:同一个活,交给四个模型做,谁把活干完、谁花得更少。我用账号里的 Provider API 跑了六组全自动判定的任务——没有一项靠人打分,对错由 pytest、JSON 解析和字符串匹配决定——把 MiMo V2.6 Pro、MiMo V2.6 Flash,和同平台上的 DeepSeek V4.1 Flash、GLM-5.3 Flash 放在同一张题卷上。

结论先说:MiMo V2.6 两档都能干活,端到端成本比直连小米官网便宜约 7 倍;但「Flash」这名字没带来速度,而最大的坑不在价格表上,在三个平台细节里。

它是什么,档位怎么选

CommandCode 是一套以开源模型为优先的编码 agent(CLI 加网页工作室),同时提供 OpenAI 与 Anthropic 双兼容的 Provider API,端点 https://api.commandcode.ai/provider/v1。MiMo V2.6 的三档今天上架,模型 ID 是 xiaomi/mimo-v2.6-proxiaomi/mimo-v2.6-flashxiaomi/mimo-v2.6-pro-ultraspeed,都标 1M 上下文。

档位地图(价格截至 2026-09-22,另收支付手续费):

套餐 月费 额度 适合谁
Go $1 $10 只想试一下,约 1.5 万次请求
GOAT $10 $70 个人主力,约 7.5 万次请求
Pro $20 $80 需要闭源旗舰模型(Claude、GPT、Gemini)
Max 10× / 20× $100 / $200 $150 / $300 重度用户,额度上限更高
Provider $15 起 按量付费 自建脚本调 API,零加价、不限流

倍率从哪来,官方没有藏着:一是额度按模型独立分配($70 不是一个大池子,而是每个模型一份),二是缓存命中工程的差价,三是厂商 deal 补贴。第三条对 MiMo 用户特别现实——mimo-v2.6-flash 有个上架 deal,GOAT 上这个模型的额度临时提到 $67(平时 $30),9 月 24 日截止;上一代 V2.5 系列则挂着 -98% 与 -99% 的折扣。

对照一下直连:小米官方海外定价与 CommandCode 完全一致(Pro $0.435 / $0.87,缓存读 $0.0036),所以这里的「便宜 7 倍」纯粹来自订阅额度,不是平台压价。

先做纸面数学,再谈体验。官方给的「约 7.5 万次请求」是个容易误读的数字——它指的是轻量 agent 请求。按我下面实测里最便宜的动作(修一个 bug,账单 $0.00013)算,$70 足够跑 50 万次以上;换成最贵的动作(一次 12.9 万 token 的长上下文,账单 $0.0564),$70 只够 1,240 次。同样一笔钱,容量差 400 倍,取决于你每次让它读多少东西。所以「够不够一个月」这个问题,答案不在套餐页上,在你的使用姿势里:把复用前缀固定住、让缓存吃满,比换模型省钱得多。

实测:六组任务,四个模型

方法说明白:走 Provider API 直连,/chat/completions,温度与输出上限按任务固定;六个任务全部可机器判定——T1 是给一个预埋了 3 个 bug 的小仓库(6 个 pytest 用例,初始 3 失败 3 通过),模型交回完整文件,我应用后跑测试;T2 是两轮真实工具循环,看它会不会用 read_file 读完两个文件、再用 run_tests-v 跑测试;T3 是把 23.7 万字符(实测 129,521 token)的合成代码库塞进去找一句藏起来的话;T4 是严格 JSON 指令遵循;T5 是一道可判定的多步概率题;T6 量时延与吞吐。

任务 MiMo V2.6 Pro MiMo V2.6 Flash DeepSeek V4.1 Flash GLM-5.3 Flash
T1 修 3 个 bug(6 用例) 通过 6/6 通过 6/6 通过 6/6 通过 6/6
T2 两轮工具调用 通过 通过 未跑完(网关超时) 未跑完(网关超时)
T3 12.9 万 token 藏针 答对 答对 未答出 未测
T4 严格 JSON + 枚举 通过 通过 通过 通过
T5 多步推理(0.65) 通过 通过 通过 通过
T6 时延中位 / 吞吐 7.60 秒 / 9.1 tok/s 6.29 秒 / 12.9 tok/s 7.84 秒 / 16.3 tok/s 9.51 秒 / 13.5 tok/s

三个可以直接用的观察。第一,能力层面四个模型打平——修 bug、工具调用、JSON、推理这四关谁都没掉队,MiMo V2.6 的「agentic coding」定位不是虚的,Pro 与 Flash 在这几关没有可见差距。第二,长上下文分开了档次:12.9 万 token 的检索,MiMo 两档都一次答对(Pro 20.0 秒、Flash 15.1 秒),DeepSeek V4.1 Flash 在同样的题上没能给出答案(它先把预算烧在思考上,触发长度截断)。第三,「Flash」不等于快:Flash 的 12.9 tok/s 反而低于 DeepSeek V4.1 Flash 的 16.3 tok/s,Pro 更慢(9.1 tok/s)。名字里的 Flash 说的是价格档位,不是速度承诺。

然后是钱。同样一道 T1 修 bug,四个模型的账单差 4.8 倍:

场景 输入 token 输出 token 账单(美元) GOAT 实付(约)
修 bug · MiMo Flash 548 191 $0.00013 $0.00002
修 bug · MiMo Pro 548(缓存 512) 235 $0.00022 $0.00003
修 bug · DeepSeek V4.1 Flash 598 471 $0.00037 $0.00005
修 bug · GLM-5.3 Flash 536 1,079 $0.00062 $0.00009
12.9 万 token 长上下文 · MiMo Pro 129,521 80 $0.0564 $0.0081
12.9 万 token 长上下文 · MiMo Flash 129,521 27 $0.0181 $0.0026

折算成单价,GOAT 订阅下的 MiMo V2.6 Pro 相当于输入每百万 token 约 6 美分、输出约 12 美分;Flash 是 2 美分与 4 美分。这个量级已经比国内大部分 API 直采都低。

缓存是这套算术里最被低估的一项。我拿同一段 23,293 token 的前缀连发两次:第一次全价、7.65 秒;第二次 23,168 token 命中缓存(命中率 99.5%),只按 $0.0036/M 计费——缓存读取价是标准输入价的 1/120,延迟也降到 4.49 秒。也就是说 agent 场景里反复复用的系统提示与代码上下文,几乎不花钱。CommandCode 官方口径是「约 98% 缓存命中率」,我在单个场景复现到的比它更高。

额度不等于能花完。GOAT 的两道滚动窗口是 5 小时 $14、每周 $35。按实测里最贵的动作(一次 12.9 万 token 长上下文,账单 $0.0564)算,5 小时窗口大约能跑 248 次,一周约 620 次,月度 $70 够跑 1,240 次——对日常编码够用,但如果你拿它灌整个仓库做批量分析,卡住的会是 5 小时窗口而不是月度额度。额外买的按量额度不计入限额,超窗时会优先消耗它们。

三个价格表上没有的坑

第一,非浏览器 UA 会被 Cloudflare 拦。我用 Python 的 urllib 直连时一律返回 HTTP 403 error code: 1010,换成 curl 或给请求加一个浏览器 User-Agent 就正常。1010 是 Cloudflare 的浏览器签名判定,不是模型权限问题——自己写脚本接这个 API 的人,第一分钟就会撞上。

第二,推理默认开着,预算给少了会拿到空回答。一个「只回复两个字」的请求,账单是 13 输入、18 输出,其中 15 个 token 花在思考上。我第一版长上下文测试把输出上限设成 64,模型把 64 个 token 全用来思考,最终 finish_reason=length、正文为空——看起来像模型没答出来,实际是预算太紧。给到 1024 之后 DeepSeek 也能正常作答。用这个平台写脚本,输出上限要按「思考加正文」的总量来配,习惯性写 256 的人会误判模型能力。

第三,平台自己还没给 MiMo V2.6 打过分。四个 V2.6 相关条目在 CommandCode 的模型页上,智能指数与吞吐两栏都写着 not yet scored。这不是缺陷,但意味着你在选择档位时没有任何第三方参考,只能像本文这样自己跑题。

超速档 mimo-v2.6-pro-ultraspeed 也是 10 倍价(输入 $4.35、输出 $8.70),GOAT 同样能调用(我实测返回 200)。它存在的意义只有延迟敏感的交互场景,以我测到的 Pro 延迟水平看,不值得默认开启。

判断:谁该用哪一档

主力用 Flash,难任务切 Pro。两者在本次六组任务里能力打平,而 Flash 的输出价只有 Pro 的 32%($0.28 对 $0.87),还更快一点;再加上 9 月 24 日前额度提到 $67 的上架 deal,当下性价比最高的是它。Pro 该出场的地方是长链路 agent 任务与方案设计——12.9 万 token 藏针这一关,它和 Flash 都答对了,但账单是 Flash 的 3.1 倍,所以除非真遇到 Flash 答错的场景,长上下文也建议先用 Flash。

如果你的用法是「一次性把整个仓库喂进去」,要注意 MiMo 的输入侧单价(Pro $0.435/M)在 1M 上下文下并不便宜:单次 12.9 万 token 就是 5.6 美分,一天跑几十次就吃掉 5 小时窗口的大半;这种用法更该配合缓存,把复用前缀固定住。

如果你只是偶尔写点代码,$1 的 Go 档也能用 MiMo——但 Go 档没有 API 权限,只能在 CLI 里用。

如果你的用法是跑脚本而不是敲代码,$15 的 Provider 档更对路:按量付费、零加价、没有滚动限流,只是额度不会像订阅那样被放大 7 倍。反过来,$1 的 Go 档虽然也能用 MiMo,但没有 API 权限,只能待在 CLI 里。

别指望它替代闭源旗舰。小米自己的报告里,Pro 在 ProgramBench 上得 26.5,而 Claude Opus 5 是 37.0;ExploitBench 47.9 对 78.5。它在开源权重阵营里是第一梯队,但跨到闭源旗舰那一档仍有肉眼可见的差距,这也是 CommandCode 把 Claude、GPT、Gemini 放在 Pro 与 Max 套餐的原因。

最后是利益与口径声明:本文作者是 CommandCode GOAT 的付费订阅用户,自购自用,与 CommandCode、小米均无商业合作;文中全部价格为 2026 年 9 月 22 日抓取的官方页面口径,费率与 deal 随时可能变动;实测数据来自本机 Python 脚本直连 Provider API,每一组的判定逻辑(pytest 退出码、JSON 解析、字符串匹配)都可复现,任务集与原始结果已存档。

相关阅读:

发表评论