Anthropic在9月28日推出Claude Sonnet 5.5,这是Claude 5.5家族中定位中档的一员。官方给出的定价与上一代Sonnet 5相同:每百万输入token两美元,每百万输出token十美元,缓存读取每百万token零点二美元。公司称新模型生成速度提升超过30%,由于完成任务所需的token更少,单个任务的综合成本最高可下降约三成。更值得注意的是评测结果:在Terminal-Bench 4.0这一项上,Sonnet 5.5的得分高于自家旗舰Opus 5.5,不同榜单给出的具体数值在63%到71%之间,但排序一致。而Opus 5.5的发布时间,距离这款中档模型上线还不到一周。
在传统认知里,同一家公司的产品线通常按价格分层:旗舰最强也最贵,中档便宜但能力打折。Sonnet 5.5打破了这套直觉,它在部分智能体编码任务上超过了更贵的Opus 5.5,同时在Chartography等单项测试上出现了从15.6%到61.6%这样的大幅跃升。它还成为首个仅凭截图就能通关《宝可梦 红》的Sonnet系列模型,这类测试考察的是模型在视觉界面下的连续操作能力。
这种反超并不是全面碾压。在长程复杂分析、大型代码仓库的安全审查等任务上,Opus 5.5仍然保持优势。但从产品策略看,Anthropic显然把Sonnet 5.5当作走量主力:它同时成为Claude免费档的默认模型,覆盖了大量普通用户。用一款中档模型承接最广的调用量,再让旗舰专注最难的任务,这是一条更务实的路线。它传递的信号是,模型厂商的竞争重心正在从单项跑分转向整体性价比。
过去企业选模型,习惯直接比每百万token的单价,谁便宜用谁。这套算法在智能体场景里越来越不成立,因为一个任务往往要调用几十次模型、读写多个文件、反复执行命令。单价低的模型如果啰嗦、爱反复确认、需要更多轮次才能收敛,总账反而更贵。行业里已经有研究指出,用每token成本衡量模型效率具有误导性,更合理的指标是完成单个任务需要花多少钱、花多少时间。
Sonnet 5.5把卖点放在这一层,官方口径是更少的token、更多的并行工具调用、更少的无谓搜索和追问。对正在搭建智能体流水线的团队来说,这意味着评估方式要更新:先跑一组有代表性的真实任务,记录完成率、总token消耗、端到端时延与失败重试次数,再算单任务成本。只有在同一套任务上横向比较,价格标签才有意义。对预算敏感、任务量大但难度中等的团队,中档模型的性价比拐点往往出现在这里。
从公开信息看,Sonnet 5.5的改进集中在智能体工作流上。它能更早判断任务是否已经完成,减少无效的验证循环;在需要多步骤操作时,倾向于并行调用工具而不是串行等待;在信息不足时,也更倾向于用已有线索先推进,而不是频繁打断用户确认。这些行为层面的调整,单个看都不算惊艳,叠加起来却能显著压缩一条任务的往返次数。
对模型厂商来说,这是一种更接近工程优化的进步路径:主干能力提升有限,但通过训练目标与后训练策略的调整,把同样的能力用在更少的token上。这类改进的商业价值很直接,因为它直接降低了客户的实际支出,而客户的支出意愿又会反过来影响调用量。当模型能力进入相对拥挤的阶段,谁能把单位任务成本压下来,谁就更容易被集成进生产系统,而不是停留在试用清单里。
这次发布还有一个耐人寻味的背景。Anthropic此前公开呼吁放慢最前沿模型的开发节奏,主张引入独立评估机构为技术安全把关。但在同一周内,公司接连推出两款模型,一款是旗舰Opus 5.5,一款是中档Sonnet 5.5。这种表态与动作之间的落差,被不少观察者视为当前这条赛道的真实状态:所有人都知道需要刹车,但没有人愿意先松开油门。
横向看,头部实验室的发布节奏都没有放慢。OpenAI在同一时间窗口推出新模型并调整订阅体系,谷歌持续推进多模态与语音产品线。对采购方来说,这意味着模型能力的更新周期仍在以周为单位,任何一次选型都可能在几周后被更优解覆盖。务实的做法是把模型接入做成可替换的一层,把提示词、工具定义与评测集沉淀成自己的资产,而不是把业务流程与某一家模型绑死。这样当下一代模型出现时,切换成本才可控。
对国内企业来说,Sonnet 5.5这类中档模型的价值,取决于它能否在具体业务上稳定复现官方宣称的效率优势。比较务实的做法是挑一组有代表性的真实任务,例如客服工单分类、代码审查、报表生成,让候选模型跑完整流程,记录完成率、总token消耗与端到端时延,再折算成单任务成本。只有在同一套任务上横向比较,价格标签才有参考价值。
另一个容易被忽略的动作是把接入层做成可替换的。把提示词模板、工具定义与评测集沉淀成团队自己的资产,而不是写死在某个模型的调用格式里,这样当下一代模型出现时,切换成本才可控。模型能力还在以周为单位更新,把业务绑死在单一供应商上,风险会随时间累积。