首页/GLM API Token 价格

GLM API · TOKEN PRICING

GLM API Token 价格

查看 Kin 同步目录中的 GLM 实时价格,并理解输入、输出、缓存 Tokens 与最终结算方式。
直接回答

GLM 文本请求按三个不重叠的数量结算:未缓存输入、缓存命中输入和输出。三者分别乘以对应的每百万 Tokens 单价,再相加得到本次费用。

GLM 实时价格表

模型上下文输入 / 百万 Tokens输出 / 百万 Tokens缓存 / 百万 Tokens
GLM 5.1智谱 AI205K¥5.46¥17.16¥1.02
glm 5.2智谱 AI1M¥3.97¥12.47¥0.743
glm 5.3智谱 AI1.3M¥6.36¥19.98¥1.18
glm 5.3 flash智谱 AI1.3M¥0.620¥2.07¥0.124
Z.ai: GLM 4.5智谱 AI131K¥4.96¥18.17¥0.909
Z.ai: GLM 4.5 Air智谱 AI131K¥1.07¥7.02¥0.207
Z.ai: GLM 4.5V智谱 AI66K¥4.96¥14.87¥0.909
Z.ai: GLM 4.6智谱 AI205K¥3.55¥14.46¥0.661

表格读取 Kin 最近一次同步后的实时展示价;最终费用以实际 Token 用量与结算结果为准。

Token 费用怎么计算

INPUT未缓存输入 Tokens

系统指令、历史消息、用户内容和工具结果中未命中提示词缓存的部分。

OUTPUT输出 Tokens

模型生成的文本、推理内容和工具调用参数。

CACHE缓存命中输入

只有实际兼容端点报告的缓存命中量才按缓存单价计算;其余输入仍按输入单价计算。

费用 =(输入 Tokens − 缓存命中 Tokens)÷ 1,000,000 × 输入单价 + 缓存命中 Tokens ÷ 1,000,000 × 缓存单价 + 输出 Tokens ÷ 1,000,000 × 输出单价

哪些因素会影响最终费用

  • 对话历史越长,每轮重复发送的输入 Tokens 越多。
  • 把输出上限设置得更高不会直接收费,最终只结算实际生成量。
  • 当实际端点支持缓存时,保持重复前缀稳定有利于提高缓存复用。
  • 在产生任何有效输出前最终失败的请求,不会按成功输出收费;如果中断前已经交付了有效输出,则已交付的实际用量仍可能结算。

下一步

FAQ

常见问题

GLM API 是按请求次数还是 Tokens 计费?

文本模型按实际 Tokens 用量计费。输入中未命中缓存的部分按输入价计算,命中缓存的部分按缓存价计算;输出 Tokens 另按输出价计算。

为什么输出 Token 通常比输入 Token 贵?

模型服务会分别制定输入与输出单价,输出价格通常更高,但具体差异因模型而异,请以本页实时表格为准。

预留金额会全部扣除吗?

不会。请求开始时的占用只用于准入和并发保护;完成后按实际用量结算,未使用部分不会作为消费扣除。