下表为 2026-09-13 从模型广场采集的价格快照(单位:¥/百万 token),实际可用模型以你的密钥通过 GET /v1/models 返回为准。
| 模型 ID | 供应商 | 输入 | 输出 | 缓存读 | 备注 |
|---|---|---|---|---|---|
glm-5.3 | 智谱 AI | ¥8 | ¥28 | ¥2 | 旗舰,编码/推理(推荐主模型) |
glm-5.3-flash | 智谱 AI | ¥0.8 | ¥2.8 | ¥0.23 | 快速轻量(推荐小模型) |
kimi-k2.7 | 月之暗面 | ¥6.5 | ¥27 | ¥1.3 | 长上下文 |
qwen3.7-max | 阿里通义 | ¥12 | ¥36 | ¥2.4 | 通义旗舰 |
deepseek-v4-flash-0731 | DeepSeek | ¥3 | ¥9 | ¥0.1 | 快速,无独立推理流 |
deepseek-v4-flash-free | DeepSeek | ¥2 | ¥4 | ¥0.1 | 无限火力可用 |
qwen3.8-flash-free | 阿里通义 | ¥1 | ¥3 | ¥0.15 | 无限火力可用 |
计费说明
- 按量计费,无最低消费;注册即送体验额度,账单实时可查。
- 支持缓存计价:命中缓存读的部分按"缓存读"单价计算,成本大幅降低。
- 推理模型(glm-5.3、glm-5.3-flash、kimi-k2.7、qwen3.7-max)的思考 token 会计入输出用量——实测一次简单请求可见 completion_tokens 中约 2/3 为推理内容,评估成本时不要只看最终文本长度。
- 支持开具增值税发票;资源包与"无限火力"套餐见控制台。
怎么选
- 编码工具主模型:
glm-5.3(能力优先)或deepseek-v4-flash-0731(成本优先,无推理开销)。 - 编码工具小模型:
glm-5.3-flash。 - 长文档 / 大上下文:
kimi-k2.7。 - 跑量任务:无限火力套餐下的
-free模型(注意偶发抖动,见 API 总览)。
以实时列表为准
模型列表随套餐和上游变化。yunzhi-maas-helper 的"刷新模型列表"会自动同步最新目录,且不会改动你已选的主/小模型。