美团把LongCat-2.5-Preview放了出来。参数规模1.6万亿,激活约480亿,上下文窗口直接拉到100万词元。三个数字摆在一起,最扎眼的是最后那个,百万级上下文意味着一次能吞下的内容量,与过去完全不是一个量级。更值得留意的是定价:与之前持平。参数涨了、窗口大了,价格没动。对开发者来说,这种加量不加价的节奏,比单纯的参数数字更有实际意义。目前模型已经上线,API和对话入口都已开放。
LongCat-2.5-Preview采用混合专家(MoE)稀疏架构,总参数1.6万亿而每次推理仅激活约480亿。这种设计的直接好处是把模型容量与推理成本拆开:容量决定它能装下多少知识与技能,激活量决定跑一次要花多少算力。官方公布的限时定价为每百万输入词元0.30美元、每百万输出词元1.20美元,缓存输入为0.006美元。对正在评估迁移成本的团队来说,定价与上一代持平这一点,可能是最先被算进账里的那笔。
从迭代路径看,美团这一代模型走的是稳步加码而非跳跃式换架构。此前的LongCat-2.0已经打出万亿参数与100万长上下文的组合,并支持原生工具调用与多步推理;2.5代在参数规模上从万亿量级推到1.6万亿,同时把激活量控制在相对克制的水平,说明团队更在意单位成本下的可用性,而不是单纯冲榜。
100万词元的窗口,配合长周期任务的定位,逻辑是通的:任务越长,中间产生的上下文越多,窗口不够就得反复截断、重来。窗口够大,才谈得上长周期。对需要连续操作、跨界面切换的任务来说,上下文容量不是加分项而是前置条件,一次读入整套代码仓库、一份完整财报或一份设计规范,都不必再切成分片反复拼接。
官方给这代模型的定位是原生多模态,目标是长周期任务。场景清单列得很具体:从终端、浏览器,到图形界面、电子表格,再到设计工具。这些不是问答场景,而是需要连续操作、跨界面切换的活儿。换句话说,它瞄准的是替你把一串步骤跑完,而不是回答你一个问题。终端和浏览器是入口,图形界面和表格是操作对象,设计工具是产出环节,这条链路串起来,指向的是能自己动手的执行型模型。
与上一代相比,2.5代最实质的能力补强是新增图像理解。官方更新说明显示,新模型能够解析图像内容,支持跨模态问答、内容摘要与复杂视觉推理。对要读表格、看界面、理解设计稿的任务来说,这是前置条件而非加分项。过去不少智能体流程卡在第一步:界面截图要先用另一个模型转成文字,才能交给主模型判断,多一道转换就多一层信息损耗。
图像理解带来的变化在自动化链路里更明显。过去截图识别、表格读数往往要外挂一个专用模型,再把结果转成文本喂给主模型,中间的信息损耗与失败点都不可控。把这一步收进主模型后,工具链更短,出错时也更容易定位。
在编程与开发环境适配方面,官方强调该模型在代码生成、代码理解与自动化编程任务上表现突出,并深度兼容Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code等主流开发环境。对国内开发者来说,这意味着在既有智能体工作流里替换底层模型的成本相对可控,不必重写整套工具调用逻辑。
值得注意的是,LongCat-2.5-Preview发布时并未附带性能基准数据,这与上一代的做法形成明显反差。上一代LongCat-2.0训练于昇腾910B芯片,并宣称性能对标当时的最先进水平,但此后有独立开发者在测试中对该模型的实际效能提出质疑。在缺少官方基准的情况下,社区只能靠自测来判断这一代的真实水位,评估周期会被拉长。
不报基准也可能是一种策略选择。当竞争焦点从单点榜单分数转向单位成本下的长任务完成率时,通用基准的参考价值本身在下降,官方更愿意让开发者用真实工作流去验证。配合此前向已有用户发放的500万免费词元,美团显然希望用实际调用量而不是分数来建立口碑。这条路更难走,但一旦走通,黏性也更强。
对企业采购方来说,缺少基准意味着比选环节少了一个参考项,只能把评测重心放到私有数据集与真实工作流上。这会让验证周期变长,但也更容易筛出适配自身场景的模型。
把这一代模型放回更大的坐标里看,国产开源阵营今年的主战场已经从能不能打转向每美元能打多少。参数规模进入万亿区间、上下文进入百万量级之后,单纯堆参数的边际收益在收窄,价格与工程可用性重新成为决策变量。美团选择在参数与窗口双双上浮的同时维持定价,等于把竞争压力直接传导给同价位区间的其他模型。
对使用者而言,最实际的判断标准是三个:一是百万上下文在真实长任务中能保住多少有效信息,二是图像理解能否直接支撑界面操作类任务,三是缓存与输出定价组合在长期高频调用下是否真的更省。这三点都需要在自有场景里实测,任何官方口径都只是起点。
判断一个开源模型是否值得迁移,还要看社区工具链的跟进速度。框架适配、量化版本与部署文档是否及时,直接决定团队从试用到上线的周期。