模型配置
本页介绍 Kimi Code 提供的模型,以及如何在各客户端之间切换。
模型总览
Kimi Code 目前提供 K3、K2.8 Preview 与 K2.7 Code HighSpeed 三类模型、共 4 个模型 ID,可在客户端或第三方工具中按模型 ID 选择。各模型规格对比如下:
模型上新推荐
K2.8 Preview 现已全量上线 Kimi Code,kimi-for-coding 直接升级、无需修改配置:综合性能接近 K3,支持 low / high / max 三档思考程度与最高 1M 上下文。详见 最新动态。
| Model ID | k3 | k3-256k | kimi-for-coding | kimi-for-coding-highspeed |
|---|---|---|---|---|
| 模型版本 | K3 | K3 | K2.8 Preview | K2.7 Code HighSpeed |
| 说明 | 最强旗舰编程模型,2.8T 参数规模,1M 上下文窗口 | K3 的 256K 上下文版本,k3(1M)消耗约为 k3-256k 两倍 | 综合性能接近 K3,思考效率更高,擅长代码补全与常规开发任务 | K2.7 Code 的高速版,编码能力一致,输出速度约为普通版 5–6 倍 |
| 速度 | 常规速度 | 常规速度 | 常规速度 | 高速版(6 倍速 3 倍消耗) |
| 上下文窗口 | 1048576(面向高档位会员) | 仅 262144 | 1048576 | 262144 |
| 思考程度 | reasoning_effort:low / high / max(默认 high) | reasoning_effort:low / high / max(默认 high) | reasoning_effort:low / high / max(默认 max) | Thinking:ON |
| 调用限制 | Moderato 及以上可调用,Allegretto 及以上支持 1M 上下文 | Moderato 及以上会员均可调用 | 所有会员可用 | Allegretto 及以上 |
| 多模态输入支持 | 图片、视频 | 仅图片 | 图片、视频 | 图片、视频 |
需要更高档位的会员套餐?
不同会员套餐解锁不同的模型、上下文与速度能力,可 前往升级订阅 →。
为什么新模型上线后消耗变多了?
切换模型后,之前建立的上下文缓存 (cache) 在新模型上不再命中,这部分上下文需要重新预填充 (prefill)。因此刚切到新模型时消耗会偏高。建议操作:
- 新开 session 再使用新模型:能让效果更好、消耗更少。
为什么模型 ID 写对了还是报 401?
当请求的能力超出当前套餐权限时,服务端会返回 401,常见三种情况:
- 无 K3 调用权限:套餐低于 Moderato 时无法调用
k3、k3-256k,需升级至 Moderato 及以上。 - 无 1M 权限:Moderato 套餐用户调用
k3时支持最高 256K 上下文;Allegretto 及更高档位支持最高 1M 上下文。调用k3-256k时上下文上限固定为 256K。 - 无高速版权限:部分套餐不含高速版,升级至 Allegretto 及更高档位套餐即可调用
kimi-for-coding-highspeed。
完整报错文案与处理方式详见 错误参考。
为什么高速版提速不明显?
两个常见原因:
- 模型 ID 填错:高速版 ID 必须是
kimi-for-coding-highspeed,填错会兜底到标准版kimi-for-coding,不报错也不加速。 - 工具与脚本占了大头:高速版只加快模型输出;一次任务里工具调用(读写文件、执行命令等)与脚本执行的耗时不受影响,这部分占比大时整体提速就不明显。
如何减少因思考程度切换带来的消耗?
切换思考程度(effort)会让已建立的上下文缓存(cache)失效,原本能命中缓存的上下文需要重新预填充(prefill)。为避免频繁触发重新预填充:
- 根据任务复杂度选定思考程度后,在同一会话内尽量保持一致;
- 确需改用不同思考程度时,新建会话再切换,而不是在长会话里反复切换。
K3(1M)与 K3-256k 切换注意事项
K3(1M)切换至 K3-256k:如果当前会话的上下文已超过 256k,部分 coding 工具(如 Kimi Code CLI、Claude Code)会在工具侧直接执行 compact。建议:
- 切换前先手动执行一次 compact,将上下文压缩至 256k 以内,既能保留任务要点、会话不断档,切换后额度也更耐用。
- 若历史上下文中包含视频文件,由于 K3-256k 不支持视频输入,直接切换会报错,请先 compact 再切换。
K3-256k 切换至 K3(1M):如果 K3-256k 已接近 256k 上限且不希望 compact 丢失信息,可以直接切换到 1M;当前版本从 256k 切换到 1M 不会影响缓存。
如何切换模型
使用注意
- 切换 model id 时建议开启新对话:切换模型会使已建立的缓存失效。建议开启新会话,避免产生额外 token 消耗的同时获得更好体验。
- 填写 Model ID,不是模型版本名:调用模型时需要填写上表中的 Model ID(如
k3、k3-256k、kimi-for-coding、kimi-for-coding-highspeed),如果填写成模型版本名(如K3、K2.8 Preview),会调用失败。 - 关闭 thinking 后路由到 K2.8 Preview 无思考版:K3 系列与 K2.8 Preview 关闭 thinking 后,请求均由 K2.8 Preview(无思考)处理。
切换到目标模型的方式:
官方客户端
- 官方 Kimi Code CLI:输入
/model即可切换模型,无需修改配置;列表里暂未出现最新模型时,/logout后重新/login即可。 - Kimi Code for VS Code:在输入栏下拉菜单中选择目标模型;若目标模型还没出现,重启 VS Code 或重新安装插件即可。
第三方工具
把工具里的 Model ID 配置为目标模型即可。详细步骤如下:
- 在 Kimi Code 控制台 创建 API Key。
- 在工具中填入 Base URL 和相应模型 ID。
Kimi Code API 同时兼容 OpenAI 和 Anthropic 两种协议,Base URL 如下:
| 协议 | Base URL |
|---|---|
| OpenAI 兼容 | https://api.kimi.com/coding/v1 |
| Anthropic 兼容 | https://api.kimi.com/coding/ |
详细配置步骤请参考对应工具的接入文档:
第三方工具中的 effort 映射
K3 与 K2.8 Preview 均支持 low / high / max 三档思考程度(effort);工具传入的 effort 会按下表映射:
# 默认
null / undefined → 模型默认值(K3 为 high,K2.8 Preview 为 max)
其它未知取值 → HTTP 400 请求报错
# → max
ultra / max / xhigh → max
# → high(推荐)
high / medium → high
# → low
low / minimum / light → low
# → 关闭思考
none → thinking.type disabled