9月11日,月之暗面宣布Kimi K2.8 Preview在Kimi Code与Kimi Work全量上线。这次更新最特别的地方在于模型ID没有变,仍然是kimi-for-coding,Kimi Code客户端以及接入这个ID的第三方工具都不需要修改配置,请求会直接落到新模型上。官方给出的定位有两句话:综合性能接近旗舰K3,编码与智能体能力全面提升,思考效率较K2.7 Code显著改善。同时,K2.8 Preview把100万token上下文窗口开放给全部会员档位,而上一代K2.7 Code的上限只有256K,且只能开启思考模式。在此之前,K3的百万上下文需要较高档位会员才能使用。
固定别名背后指向哪个模型由厂商决定,这在工程上意味着一次静默升级。对个人开发者来说,省掉了改配置这一步,收益是直接的。对把Kimi Code接入持续集成流水线、自动化脚本或团队统一编程工具的用户,情况就不太一样了:同一份配置从当天起跑的是另一个模型,输出风格、耗时和token用量都可能跟着变化。官方更新说明里没有提到是否还能继续指定K2.7 Code,也没有给出回退方案。
这类依赖关系的脆弱性在过去两个月里已经被反复验证。模型ID在配置里是承重结构,一旦厂商调整路由规则,调用方的行为就会被动改变。更早之前行业内也出现过旧模型名在某个时间点集中退役、仍在调用旧名称的服务在同一分钟开始报错的情况。对生产系统而言,把模型调用收敛到一个可替换的适配层,比直接写死模型名更能抵御这类变化。
从厂商角度看,静默升级是一种降低迁移摩擦的策略。用户不需要学习新的模型名,也不需要重新配置工具链,体验上更接近一次无缝的能力更新。但这种便利建立在信任之上:调用方把模型选择权交给了厂商,也就意味着输出风格、成本结构与稳定性都可能在自己不知情的情况下改变。对依赖模型输出做自动化决策的系统,把版本变更纳入监控与回归测试流程,是应对这类升级的必要动作。
K2.8 Preview支持思考强度调节,档位与K3一致,分为low、high、max三档,默认使用max。更新说明同时写明了一条路由规则:关闭思考之后,K3系列与K2.8 Preview的请求都会路由到不带思考的K2.8 Preview。也就是说,在Kimi Code里选了K3但关掉思考的用户,实际拿到的是K2.8 Preview。这条规则让不同档位之间的能力边界变得模糊,也让默认体验更统一。
上下文从256K扩到100万token,是这次更新里对工作流影响最直接的一项。长上下文在编程场景的价值不在于一次塞进更多代码,而在于让模型在做跨文件修改、阅读依赖链与回溯历史提交时不必频繁截断。代价是单次会话的资源消耗会明显上升,尤其在使用高档位思考强度时。对以订阅为现金流的厂商来说,把长上下文设为默认底座,等于主动抬高了每次请求的算力账单。
对照时间线会更清楚这次更新的分量。K3在7月中旬发布,总参数2.8万亿,激活约1040亿,上下文100万token,定位是各项基准上对标海外旗舰,代价是贵、慢、吃资源。K2.7 Code在6月中旬上线时,官方给出的两个数字是编程基准提升10.4%、推理token用量降低30%,上下文停在256K。如今1M上下文与思考强度调节两项K3的核心能力,被下放到默认代码模型,旗舰与专用模型之间的能力代差被压缩到不足两个月。
这种节奏透露出算力约束正在松动。此前业内曾有传闻称百万上下文的瓶颈在算力而非技术,而K2.8把原本需要高档位才能用的能力变成默认,说明厂商对推理成本的预期已经发生变化。竞争重心也从能否做到转向默认给不给。对用户来说这是好事,但也意味着不同档位之间的差异化会更多体现在额度、速度与服务保障上,而不是能力上限。
把长上下文设为默认底座,还会改变用户的使用习惯。当百万token成为标配,用户会更倾向于一次性提交完整的代码仓库、日志与文档,而不是先做筛选再提问。这会推高单次请求的输入规模,也让缓存命中率成为影响成本的关键变量。厂商后续大概率会围绕缓存与批处理做更多工程优化,因为在这类负载下,节省一次重复读取比提升一点模型分数更划算。
这次预览更新没有公布任何基准数据,接近K3到底接近到什么程度,目前无法从公开信息判断。已经有开发者反馈,K2.8虽然不能一次就完成任务,但速度确实快了很多。在没有跑分表的情况下,评估只能依赖自己的任务集:用同一批真实需求分别在K2.7 Code与K2.8 Preview上跑一遍,比较一次通过率、返工次数与总token消耗,而不是只看单次响应时间。
对团队用户,还有两点需要提前确认。一是同一份提示词在新模型上的输出风格可能变化,代码规范检查与自动评审规则需要重新校准;二是思考强度默认调到max,成本结构与之前不同,需要观察一段时间再决定是否调整默认档位。官方也没有说明Preview什么时候转正式版,以及会员价格和额度是否随之调整。在这些信息明确之前,把新模型先在非关键路径上试用,是更稳妥的做法。