GLM 文本请求按三个不重叠的数量结算:未缓存输入、缓存命中输入和输出。三者分别乘以对应的每百万 Tokens 单价,再相加得到本次费用。
01
GLM 实时价格表
| 模型 | 上下文 | 输入 / 百万 Tokens | 输出 / 百万 Tokens | 缓存 / 百万 Tokens |
|---|---|---|---|---|
| GLM 5.1智谱 AI | 205K | ¥5.46 | ¥17.16 | ¥1.02 |
| glm 5.2智谱 AI | 1M | ¥3.97 | ¥12.47 | ¥0.743 |
| glm 5.3智谱 AI | 1.3M | ¥6.36 | ¥19.98 | ¥1.18 |
| glm 5.3 flash智谱 AI | 1.3M | ¥0.620 | ¥2.07 | ¥0.124 |
| Z.ai: GLM 4.5智谱 AI | 131K | ¥4.96 | ¥18.17 | ¥0.909 |
| Z.ai: GLM 4.5 Air智谱 AI | 131K | ¥1.07 | ¥7.02 | ¥0.207 |
| Z.ai: GLM 4.5V智谱 AI | 66K | ¥4.96 | ¥14.87 | ¥0.909 |
| Z.ai: GLM 4.6智谱 AI | 205K | ¥3.55 | ¥14.46 | ¥0.661 |
表格读取 Kin 最近一次同步后的实时展示价;最终费用以实际 Token 用量与结算结果为准。
02
Token 费用怎么计算
INPUT未缓存输入 Tokens
系统指令、历史消息、用户内容和工具结果中未命中提示词缓存的部分。
OUTPUT输出 Tokens
模型生成的文本、推理内容和工具调用参数。
CACHE缓存命中输入
只有实际兼容端点报告的缓存命中量才按缓存单价计算;其余输入仍按输入单价计算。
费用 =(输入 Tokens − 缓存命中 Tokens)÷ 1,000,000 × 输入单价 + 缓存命中 Tokens ÷ 1,000,000 × 缓存单价 + 输出 Tokens ÷ 1,000,000 × 输出单价03
哪些因素会影响最终费用
- 对话历史越长,每轮重复发送的输入 Tokens 越多。
- 把输出上限设置得更高不会直接收费,最终只结算实际生成量。
- 当实际端点支持缓存时,保持重复前缀稳定有利于提高缓存复用。
- 在产生任何有效输出前最终失败的请求,不会按成功输出收费;如果中断前已经交付了有效输出,则已交付的实际用量仍可能结算。
04