9月15日,Salesforce在旧金山Dreamforce大会上发布了公司历史上第一个自研推理模型Koa。这个模型由Salesforce与英伟达联合后训练,基座是英伟达的开源权重模型Nemotron 3 Super,参数量1200亿。它要解决的问题很具体:此前任何在Agentforce平台上需要多步推理的智能体任务,都要经由Salesforce的AI网关转交给Claude或ChatGPT这类前沿模型处理,现在Koa成了这些高频任务的默认内部选项。
Salesforce首席平台与工程官罗汉·库马尔在发布会上把这件事的起点讲得很直白。他说公司在过去二十七年里积累了关于客户关系管理的大量知识,而领域专用模型的思路是,把模型已有的通用智能保留下来,再针对某一类具体工作做后训练,补上特定行业的信息。Koa的定位正是如此,它不是要做一个更聪明的通用模型,而是要让一个中等规模的模型在销售、营销与客服任务上做到足够准、足够便宜、足够可控。
训练数据的构造方式是这套逻辑的核心。Salesforce没有使用任何真实客户数据,而是基于近三十年CRM部署经验构建了一个大规模合成数据集,模拟超过十四个行业的真实企业工作流,覆盖制造、金融服务、医疗、旅游等场景。合成语料刻意模拟了完整业务环境,包括情绪激动的客户打进客服热线、销售代表推进成单这类具体情境,让模型在从未接触真实客户记录的前提下学会这项工作的形状。
后训练流程采用监督微调加强化学习,强化学习部分使用组相对策略优化,并借助英伟达的NeMo RL、NeMo Gym与NeMo AutoModel工具链。更值得注意的是Salesforce提出的一条模拟到奖励流水线:工作流规格用构建Agentforce智能体时的同一种声明式语言Agent Script编写,再被扩展成大量带人格设定的多轮对话,而奖励信号判断的是智能体有没有用正确的工具调用真正解决了任务,不是它的话说得像不像人。
这个设计直指企业智能体最容易失手的地方。多步工具调用一旦在中间某一环走偏,整条链路就会失败,而失败的代价往往不是答错一句话,而是把工单派给了错误的团队或者把商机记录改错。Salesforce公布的对比数据也落在这项能力上:在Tau2Bench上Koa得分69.41,高于基座Nemotron 3 Super的68.64;在公司自建的CRM Bench上加权平均为0.86,基座为0.84。需要说明的是,在公开榜单上Koa仍落后于GPT-5.5的83.99与Claude Opus 4.8的74.00,在CRM Bench上则以0.86对0.90和0.87咬得很近。这是一份专用化的成绩单,不是前沿能力的宣言。
Koa的卖点组合很清楚地对着闭源前沿模型的短板。它是开放权重而非闭源;训练过程没有摄入真实客户数据,去掉了一整类数据泄露风险;完成同样的任务消耗的Token更少,直接压低单次推理账单;推理运行在Salesforce自己的信任边界内,沿用既有的数据驻留与安全控制,客户数据不离开受控环境。对已经跑过试点、正在算总账的企业客户来说,这四条比榜单排名更有说服力。
来源可查被Salesforce当成了最锋利的论点。库马尔在谈到为什么此前不自己训模型时说,在Nemotron出现之前,市面上没有一个既是美国自主可控、又代表当前先进水平、而且数据来源清晰可查的预训练基座,并直接点名质疑开放权重模型的训练数据不透明。这段话既是技术判断,也是商业话术:它把采购决策从谁更强引向了谁更可控。目前Koa处于扩展试点阶段,已披露的试点客户包括1-800Accountant、Baxter Credit Union、Formula 1、UChicago Medicine与Xero等,正式商用定在2026年冬季,先在美国区开放。
Koa出现的位置,恰好是过去两年企业AI投入中最贵也最不确定的一段。企业在Agentforce这类平台上搭建智能体时,凡是涉及长周期或多步骤推理的任务,提示词都要经由AI网关被路由到外部前沿模型,按Token付费,数据要出门,价格和条款由供应商决定。Salesforce此次给出的替代方案把这段成本与依赖同时收回自己手里,网关仍然保留,客户依旧可以路由到Claude或ChatGPT,但默认路径变了。
这件事的意义超出Salesforce本身。它说明应用层厂商开始用开放权重基座加后训练的方式,把原本要交给模型公司的价值截留一部分。当软件厂商能用一个中等规模模型在特定岗位上做到错误率更低、成本更可控,前沿模型的议价能力就会被压缩到真正需要通用推理的那部分任务上。真正的悬念在于Koa的成绩能不能在杂乱的真实生产数据上成立,毕竟CRM Bench是Salesforce自己的测试集、自己的任务,而通用开放时间还在几个月之后。