模型Qwen3.8 27B

Qwen3.8 27B

已上线
inferway/qwen3.8-27b

以 NVFP4 精度跑在我们运营的硬件上,262K 上下文窗口,OpenAI 兼容端点。

NVFP4262K ctx131,072 max output流式输出零保留

价格

取自 catalog
完整定价与账单规则

上下文与输出

上下文窗口262,144每次请求的 token 上限
最大输出131,072每次响应的 token 上限

你发出去的一切都计入上下文窗口 -- system prompt、对话历史、检索上下文、工具定义。这两个数字都读自 catalog,不会和网关实际执行的值有偏差。

限速与配额

匿名试玩突发 8 / 秒 · 60 / 分钟 · 300 / 小时 · 1,000 / 天注册免费账户:单次输入预算 131,072 tokens(128K),输出最多 32,768 tokens(32K);60 次/分钟,并发 2。不设每分钟 token 限制。
账户有余额后按账户自身限额付费请求按账户限额执行,可在控制台查看。
非流式超时首字节约 100 秒非流式请求经 CDN 转发,长输出必须设 stream=true。
访客演练场无需密钥下方输入框调用的是同一个网关,受免费限额约束。不用注册,也不用绑卡。
并发上限64 / Key(默认)并发以 API Key 为单位按租约执行,默认 64;账户和单个 Key 的限额可在控制台调整。免费与无密钥请求不受这条限制。

跑分

实测中
首 token 延迟将标注 GPU 型号、并发、时间戳
输出吞吐单流每秒 token 数
90 天可用率逐服务统计,计划内窗口单独标注

压测报告公布的数字会带上什么

直接问

随便问点什么 -- 回复从同一个网关逐 token 流式返回,你的代码调的也是它。
复制给你的 AI 助手
装 SDK、设 base_url 和模型 ID、从环境变量读密钥,再写一个流式冒烟测试。
快速开始

数据与硬件

数据处理内容永不落盘

推理在 GPU 显存里进行,跑完即擦除。只保留请求元数据 -- token 数、时间戳、延迟、路由 -- 最长 90 天,用于计费与可靠性。

透明度中心
硬件我们运营的硬件

这个模型以 NVFP4 跑在我们运营的硬件上,负载下不会静默降级。执行只发生在一个公布的区域(美国),每条请求在哪个区域执行,都会记在这条请求上。

透明度中心

关于这个模型的一切都在这一页。去跑一个请求吧。