定价

更低、更透明的价格

按什么计费
输入你发出去的一切 —— system prompt、对话历史、检索上下文、工具定义。
输出生成的一切,含推理 token。贵的那一侧。思考默认关闭;可在单次请求中用 chat_template_kwargs.enable_thinking=true 开启。
缓存命中命中缓存的重复前缀,单价远低于输入价。
按 token 计费只读元数据无席位费、无最低消费价格带版本号
上线首月上线首月 · 全场用量3折,截止 2026年10月1日(UTC)活动详情

即将上线

Qwen3.8 Flash

inferway/qwen3.8-flash
即将上线

Qwen's efficiency-focused Flash model.

文本
价格即将上线

MiniMax H3

inferway/minimax-h3
即将上线

MiniMax's general-purpose H3 generation model.

价格即将上线

DeepSeek V4 Flash 0731

inferway/deepseek-v4-flash-0731
即将上线

DeepSeek's efficiency-focused V4 Flash release.

文本
价格即将上线

GLM-5.3 Flash

inferway/glm-5.3-flash
即将上线

Z.ai's Flash model for coding and agentic workloads.

价格即将上线

可能让账单出意外的几条规则

01
推理 token 按输出计费模型若产生推理 token,这部分按输出价计入输出 token。控制台的用量明细里会单独列出。思考默认关闭;可在单次请求中用 chat_template_kwargs.enable_thinking=true 开启。
02
中断的流式请求仍按已生成部分计费断开连接之前已产生的 token 会被计量。提前取消长生成能减少账单,但不会归零。
03
缓存不保证命中缓存价只在前缀真的命中时生效。冷启动或已被淘汰的前缀按普通输入价计费,所以按高命中率做出的估算容易偏低。
04
失败请求不计费,被拒请求免费5xx 错误与网关拒绝不产生费用。已返回部分 token 后才报错的请求,按已返回的部分计费。
05
价格带版本号每个价格都在某个 pricing_version 下发布。调价会作为新版本发布并公告,月中绝不静默变价。

常见问题

注册免费账户:单次输入预算 131,072 tokens(128K),输出最多 32,768 tokens(32K);60 次/分钟,并发 2。不设每分钟 token 限制。 每日输入 5,000,000、输出 500,000、合计 5,500,000 tokens,UTC 00:00 重置。同一账户的 API Key 共享每个模型的额度。

这一页上的每个数字都是公开的,去跑一个请求吧