Qwen3.8 27B
已上线inferway/qwen3.8-27b
以 NVFP4 精度跑在我们运营的硬件上,262K 上下文窗口,OpenAI 兼容端点。
NVFP4262K ctx131,072 max output流式输出零保留
价格
取自 catalog上下文与输出
上下文窗口262,144每次请求的 token 上限
最大输出131,072每次响应的 token 上限
你发出去的一切都计入上下文窗口 -- system prompt、对话历史、检索上下文、工具定义。这两个数字都读自 catalog,不会和网关实际执行的值有偏差。
限速与配额
匿名试玩突发 8 / 秒 · 60 / 分钟 · 300 / 小时 · 1,000 / 天注册免费账户:单次输入预算 131,072 tokens(128K),输出最多 32,768 tokens(32K);60 次/分钟,并发 2。不设每分钟 token 限制。
账户有余额后按账户自身限额付费请求按账户限额执行,可在控制台查看。
非流式超时首字节约 100 秒非流式请求经 CDN 转发,长输出必须设 stream=true。
访客演练场无需密钥下方输入框调用的是同一个网关,受免费限额约束。不用注册,也不用绑卡。
并发上限64 / Key(默认)并发以 API Key 为单位按租约执行,默认 64;账户和单个 Key 的限额可在控制台调整。免费与无密钥请求不受这条限制。
直接问
随便问点什么 -- 回复从同一个网关逐 token 流式返回,你的代码调的也是它。
复制给你的 AI 助手
装 SDK、设 base_url 和模型 ID、从环境变量读密钥,再写一个流式冒烟测试。