MiMo-V2.6 Flash
已上线inferway/mimo-v2.6-flash
以原生 FP8 精度跑在自营硬件上,262K 上下文窗口,完全兼容 OpenAI 接口。
FP8262K ctx131,072 max output流式输出零数据保留
计费价格
服务目录配置上下文与输出
上下文窗口262,144单次请求的 Token 总上限
最大输出131,072单次响应的 Token 最大生成数
您发送的所有内容都计入上下文窗口 —— system prompt、对话历史、检索上下文、工具定义。这两个数字都读自 catalog,与网关实际执行的值不会有偏差。
速率与配额
匿名试玩突发 8 / 秒 · 60 / 分钟 · 300 / 小时 · 1,000 / 天注册免费账户:突发 8 次/秒、每分钟 90 次、每小时 300 次、每天 1,000 次,并发 2。不限制单次输入或输出 token,也不设每分钟或每日 token 额度。
账户有余额后按账户自身限额付费请求按账户限额执行,可在控制台查看。
非流式超时保护首字节约 100 秒非流式请求经由 CDN 网关代理,长文本生成建议启用 stream=true 以避免首字节超时。
在线体验区无需密钥下方交互窗口直连生产网关,受基础体验频次保护;无需注册或绑定支付方式即可直接体验。
并发上限64 / Key(默认)并发以 API Key 为单位按租约执行,默认 64;账户与单个 Key 的限额均可在控制台调整。免费与无密钥请求不占用此配额。
性能评测
性能实测中首 Token 延迟 (TTFT)—将标注服务精度、并发、提示词长度与时间戳
生成吞吐 (TPS)—单流每秒输出 Token 数
90 天可用率—逐项服务统计,计划内维护窗口单独标注
压测报告公布的数字会带上什么
在线体验
欢迎在线体验 —— 回复由同一个生产网关逐 Token 流式返回,与您代码里调用的完全一致。
复制接入配置给 AI 助手
包含安装 SDK、配置 base_url 与模型标识、自环境变量安全读取密钥,以及运行流式冒烟测试的完整指引。