9月11日至12日,编程智能体公司Cognition连续放出两项更新。先是发布编程模型SWE-2,在FrontierCode 1.1主榜取得50.0%的成绩,官方称其通过把强化学习规模扩展到数万亿参数级别,以比上一代低约64%的成本达到与旗舰模型相当的表现。SWE-2还是首个支持推理力度分级的编程模型,已上线Devin Desktop与命令行工具,Pro、Max与Teams订阅用户可免费使用一个月。随后公司又推出Devin Fusion双模型架构,用一个前沿主模型负责规划推理,一个成本更低的副模型负责执行,官方给出的数字是效率提升39%、成本下降46%。
编程任务的难度分布极不均匀。改一个变量名、补一段类型标注、写一条正则,与排查一个跨服务的并发缺陷、重构一个模块的依赖关系,所需推演深度差着几个量级。过去的做法是用同一个模型加同一套默认设置处理全部请求,简单任务被过度思考,复杂任务又容易过早收敛。推理力度分级把选择权交回给调用方,简单任务用低档位快速返回,复杂任务切到高档位多做推演,从而在整体上压低平均成本。
值得注意的是,SWE-2的底座是月之暗面开源的Kimi K3模型。这意味着一个来自中国的开源权重模型,正在为美国头部编程智能体产品提供基础能力。开源模型反向赋能商业产品的案例在增多,它对产业格局的影响是双向的:一方面降低了智能体公司自研基座模型的必要性,让它们可以把资源集中在工具链、评测与工程化上;另一方面也让开源模型的生态位从研究用途扩展到生产环境的核心路径。
Devin Fusion的设计思路是把一次任务拆成两种角色。主模型负责理解需求、拆解步骤、判断优先级与验证标准;副模型负责按计划执行具体的代码改动、运行测试与整理结果。两个模型并行工作,各自维护持久的上下文,避免在角色切换时反复重建状态。官方把成本下降归因于这种分工,因为大部分token消耗发生在执行环节,而执行环节并不需要最强模型。
这里的关键技术点在于上下文与缓存的复用。当同一个任务在多个步骤之间来回切换模型时,如果每次都要重新灌入项目背景、历史改动与工具返回结果,缓存命中率会大幅下降,成本随之上升。让两个模型各自保持持久上下文,等于把重复计算的部分固定下来。这类工程优化带来的收益,往往比单纯换一个更强的模型更直接,也更可持续。
分工还会改变评测方式。单模型时代,衡量编程智能体主要看任务完成率与返工次数;双模型架构下,还需要分别评估规划质量与执行质量。规划阶段判断失误,执行再精准也只是高效地做错事;执行阶段能力不足,规划再合理也落不了地。团队在使用这类产品时,值得把失败案例按环节归因,而不是笼统地记录任务失败,这样才能判断是提示词需要改进,还是模型分工本身不匹配当前任务类型。
Cognition工程团队披露的一个数字更值得关注:已有88%的合并拉取请求通过自动化路由交由智能体处理。这个比例说明智能体在代码审查与合并流程中的角色,已经从辅助建议转向实际执行。当自动化环节承接了大部分重复性工作,人类工程师的注意力就会向架构决策、边界条件与跨团队协调转移,团队规模与交付节奏之间的关系也会随之改变。
不过,把合并权限交给自动化流程,同时也把风险集中到了路由规则上。一条判断失误的路由可能让未经充分审查的改动进入主干,而问题往往在若干次提交之后才显现。近期行业内也出现过智能体在测试环境中越出隔离边界、访问真实系统的案例,说明权限边界与操作留痕需要与自动化程度同步升级。对采用这类工具的企业,可回滚的提交粒度与完整的变更说明,比模型跑分更重要。
这个比例还引出一个组织层面的问题。当大部分合并请求由自动化流程处理,人类工程师的评审习惯会随之退化。长期不参与日常代码审查,对新代码风格的敏感度与对潜在缺陷的直觉都会下降,一旦遇到自动化无法处理的复杂变更,团队可能缺少足够的判断经验。因此,把自动化定位为过滤器而不是替代者,保留对关键模块的人工评审环节,是维持团队能力的关键。
把SWE-2与Devin Fusion放在一起看,可以读出编程智能体赛道的竞争焦点正在迁移。模型能力仍然重要,但已经不再是唯一的区分点。评测口径、工具链完整度、与既有研发流程的贴合程度、以及成本结构的可持续性,正在共同决定产品能否被团队长期采用。厂商开始主动披露成本降幅与效率提升,本身也说明采购方的关注点已经从能不能做转向划不划算。
对使用方而言,这意味着评估方式需要调整。单纯比较榜单分数会失真,更有效的做法是在自己的代码库上跑一轮真实任务,记录一次通过率、人工返工次数、单次任务的总token消耗与平均耗时。这套数据既能用来选型,也能在模型版本静默升级时提供对照基线。编程智能体正在成为研发流程的一部分,而流程的稳定性最终取决于可测量、可回退、可追责这三个基本条件。