New model MiMo-V2.6 Flash is launching 
模型MiMo-V2.6 Flash

MiMo-V2.6 Flash

已上线
inferway/mimo-v2.6-flash

以原生 FP8 精度跑在自营硬件上,262K 上下文窗口,完全兼容 OpenAI 接口。

FP8262K ctx131,072 max output流式输出零数据保留

计费价格

服务目录配置
完整定价与计费说明

上下文与输出

上下文窗口262,144单次请求的 Token 总上限
最大输出131,072单次响应的 Token 最大生成数

您发送的所有内容都计入上下文窗口 —— system prompt、对话历史、检索上下文、工具定义。这两个数字都读自 catalog,与网关实际执行的值不会有偏差。

速率与配额

匿名试玩突发 8 / 秒 · 60 / 分钟 · 300 / 小时 · 1,000 / 天注册免费账户:突发 8 次/秒、每分钟 90 次、每小时 300 次、每天 1,000 次,并发 2。不限制单次输入或输出 token,也不设每分钟或每日 token 额度。
账户有余额后按账户自身限额付费请求按账户限额执行,可在控制台查看。
非流式超时保护首字节约 100 秒非流式请求经由 CDN 网关代理,长文本生成建议启用 stream=true 以避免首字节超时。
在线体验区无需密钥下方交互窗口直连生产网关,受基础体验频次保护;无需注册或绑定支付方式即可直接体验。
并发上限64 / Key(默认)并发以 API Key 为单位按租约执行,默认 64;账户与单个 Key 的限额均可在控制台调整。免费与无密钥请求不占用此配额。

性能评测

性能实测中
首 Token 延迟 (TTFT)将标注服务精度、并发、提示词长度与时间戳
生成吞吐 (TPS)单流每秒输出 Token 数
90 天可用率逐项服务统计,计划内维护窗口单独标注

压测报告公布的数字会带上什么

在线体验

欢迎在线体验 —— 回复由同一个生产网关逐 Token 流式返回,与您代码里调用的完全一致。
复制接入配置给 AI 助手
包含安装 SDK、配置 base_url 与模型标识、自环境变量安全读取密钥,以及运行流式冒烟测试的完整指引。
快速起步

数据安全与硬件

数据安全内容永不落盘

推理只在内存中进行,跑完即擦除。仅保留请求元数据 —— token 数、时间戳、延迟、路由 —— 最长 90 天,用于计费与可靠性。

透明度中心
硬件架构自营硬件集群

该模型采用原生 FP8 精度部署于自营算力集群,高负载场景下绝不静默降级。推理任务均在公开披露的机房节点(美国)执行,且每笔请求都会在元数据中明确标注入库区域。

透明度中心

当前模型的全部参数与定价均已如实公开,随时欢迎发起调用验证。