Kimi Code
为 Kimi Code(CLI、Web 与桌面应用)配置 Inferway 的 OpenAI 服务商。
在 Kimi Code 中将 Inferway 添加为自定义服务商。接入前,请确认账户已开通模型访问。
当前 Inferway 模型配置参数
inferway/mimo-v2.6-flash393,216131,072已在 2026-09-25 于 macOS 26.6.2 arm64(版本 2.1.1)验证:基础对话,以及读取文件、编辑文件、执行 Shell 命令三类工具往返(模型 inferway/mimo-v2.6-flash)。
开始之前
先按官方说明安装客户端。本文的 Pi 指 pi-mono coding agent;Hermes 指 Nous Research 的 Hermes Agent。
Inferway 账户激活后,从控制台 → API keys 获取 Key。建议为该客户端使用独立 Key,并确认允许的模型和消费上限。live、test 前缀共用推理与计费流程;test 是环境标签,不代表免费或模拟推理。
Inferway 地址需要 Inferway Key;OpenRouter Key 用于 OpenRouter,不能直接用于此地址。
将 Key 保存在客户端凭证存储或本机环境中,不要粘贴到提示词、截图或提交到仓库的配置文件。终端示例适用于 macOS / Linux 的 bash、zsh。
在当前终端设置 Key
下面的交互输入会隐藏 Key,并避免将其写入命令历史。请从同一个终端启动客户端;另外打开的应用可能无法继承该变量。
printf 'Inferway API key: ' IFS= read -r -s INFERWAY_API_KEY printf '\n' export INFERWAY_API_KEY
添加 Inferway 服务商
将以下配置合并到 ~/.kimi-code/config.toml——Kimi Code CLI、kimi web 与桌面应用三者共用这一份配置。
default_model = "inferway/mimo-v2.6-flash" [providers.inferway] type = "openai" base_url = "https://api.inferway.ai/v1" api_key_env = "INFERWAY_API_KEY" [models."inferway/mimo-v2.6-flash"] provider = "inferway" model = "inferway/mimo-v2.6-flash" max_context_size = 393216 display_name = "inferway/mimo-v2.6-flash" capabilities = ["thinking", "image_in", "tool_use"] support_efforts = ["high"] default_effort = "high" off_effort = "none"
Key 读取方式与思考档位
Kimi Code 从 api_key_env 指定的环境变量读取 Key:在启动 kimi 的 shell 里 export INFERWAY_API_KEY。只在 shell 里 export 不够——api_key_env 不指向该变量名时,配置不会读取它。
off_effort = "none" 不能省:关闭思考时客户端要发送 none 档。缺少该字段时,只要对话里已有思考内容,客户端就会回落到其他档位。
抓包可见:请求带 reasoning_effort: "high",回复回传 reasoning_content——来自 2026-09-25 对下方模型的实测。
启动 Kimi Code
在项目目录内运行 kimi。一次性运行用 -p 传入提示词,--output-format stream-json 输出结构化事件;-p 不能与 --auto 同用。
kimi # one-shot, non-interactive; -p cannot be combined with --auto: kimi -p 'Reply with exactly: connected' --output-format stream-json
确认接入成功
- 使用配置的服务商和模型开启新会话,发送“只回复:连接成功”,确认收到文本且没有 API 错误。
- 打开控制台 → Requests,查看请求状态与 token 用量。
- 处理代码任务时,让客户端读取一个非敏感文件。应用修改前,请先检查它提出的改动。
费用与用量
实际用量由 Inferway 记录:打开控制台 → Requests 查看每次请求的状态与 token 用量,在控制台 → 用量查看汇总。客户端本地显示的数字只是其自身估算,不是计费金额;请以控制台为准。
验证状态
已在 2026-09-25 于 macOS 26.6.2 arm64(版本 2.1.1)验证:基础对话,以及读取文件、编辑文件、执行 Shell 命令三类工具往返(模型 inferway/mimo-v2.6-flash)。
该验证不覆盖图片、会话恢复、推理控制。客户端内部的费用估算不是计费金额;实际用量以控制台 → Requests 与用量为准。
请求失败时
认证失败:检查 Key 是否存在、有效且获准使用该模型,并从设置变量的终端重新打开客户端。排错时不要输出完整 Key。
地址或模型错误:检查是否重复添加 /v1,使用公布的完整模型 ID,并确认客户端选择 Chat Completions。请求发往 /responses 或 /completions 时,换 Key 无法解决。
额度或超时:检查钱包余额和 Key 限额,按 Retry-After 等待,并缩短输入或降低输出上限。长输出保持流式传输,排错期间避免 Agent 连续重试。
联系支持时提供客户端版本、模型 ID、请求时间和可用的 request ID;请遮盖凭证和源码。