上线首月上线首月 · 全场用量3折,截止 2026年10月1日(UTC)活动详情
数据零保留

隐私优先的推理服务 成本更低

零数据保留(ZDR)-- 你的数据,不是我们的数据

或查看快速开始
POST /v1/chat/completionsbase_urlhttps://api.inferway.ai/v1stream true
01隐私

私密,源自架构

这条路径上没有一个环节会持久化储存你的数据。

01

发出请求

经 TLS 加密,直达专属端点

02

路由

路径中没有共享队列

03

GPU 显存中推理

分页 KV,永不写盘

04

销毁

完成即擦除,仅存元数据

02模型与定价

精挑细选的模型

取自 catalog

Qwen3.8 27B

已上线
262K ctxNVFP4max out 32,768零保留

按 token 计费,只按元数据计量。没有席位费,没有最低消费。

即将上线

Qwen3.8 Flash

inferway/qwen3.8-flash
即将上线

Qwen's efficiency-focused Flash model.

文本

MiniMax H3

inferway/minimax-h3
即将上线

MiniMax's general-purpose H3 generation model.

DeepSeek V4 Flash 0731

inferway/deepseek-v4-flash-0731
即将上线

DeepSeek's efficiency-focused V4 Flash release.

文本

GLM-5.3 Flash

inferway/glm-5.3-flash
即将上线

Z.ai's Flash model for coding and agentic workloads.

03性能数据

数字正在重新实测

实测中
首 token 延迟待实测固定并发下实测
输出吞吐待实测单流 token/s
90 天可用率待实测逐服务,来自状态页

吞吐与延迟正在当前硬件与模型上重新实测。测完之前这里保持空白 -- 我们只发布标注了硬件型号、并发与时间戳的实测值,否则就不发布。

04接入

SDK 不用换

注册账号注册
免信用卡
把 base_url 指向 Inferway
https://api.inferway.ai/v1
跑通流式 smoke test
stream=true
免费使用:突发 8/秒 · 60/分钟 · 300/小时 · 1000/天
长输出必须用 stream=true
流式
curl https://api.inferway.ai/v1/chat/completions \
  -H "Authorization: Bearer $INFERWAY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inferway/qwen3.8-27b",
    "stream": true,
    "messages": [{"role": "user", "content": "Say hello in one short sentence."}]
  }'
复制给你的 AI 助手
粘贴到 Claude Code 或 Cursor。Key 留在你的 .env 里,不进 prompt。
复制
05演练场
当前没有可用的访客模型
当前没有可用的访客模型
IW
问问数据保留、定价、流式或限额 -- 或随便聊聊。

正在检查实时模型可用性…

常见问题

不会。内容永不写入磁盘 -- 推理全程在 GPU 显存中进行,完成即销毁。仅保留请求元数据(token 数、时间戳、延迟、路由、HTTP 状态),最长 90 天,用于计费与可靠性。
命中缓存的输入 token 按缓存价计费,而非普通输入价,长共享 system prompt 与检索上下文受益最明显。三档价格即上方展示的价格,按你所在市场发布。
非流式请求经 CDN 有约 100 秒的首字节超时。长输出在生成完之前不会返回首字节,因此会撞上这个超时。stream=true 从第一个 token 就开始返回,不受此约束。短补全用非流式没问题。
按 token 付费,依据请求元数据计量,绝不读取请求内容。价格与上下文上限公布在模型目录,由 catalog 单一来源生成。

更完整的回答:文档 · 隐私政策 · 透明度中心