国产大模型在连续两个月的低调之后,第一次清晰亮出了下一代的牌面。10月8日前后,快科技、站长之家等多家媒体报道,智谱创始人唐杰在新加坡的一次演讲中披露了GLM下一代旗舰的研发路线:预训练的规模与数据继续扩张,GLM-5.4与GLM-5.5的参数量将从目前在售的7400多亿级别迈入万亿以上;后训练继续强化强化学习路线;应用方向则押注两条新路,一个是更长更自主的智能体,一个是模型自主迭代升级。值得注意的是,这仍是一次路线披露而非产品发布,两款模型尚未亮相,参数细节与时间表都留有悬念,但方向已经足够清晰。
唐杰给出的第一个信号是规模。GLM现役旗舰5.3系列的总参数量在7400多亿量级,下一代直接把目标提到至少1万亿,并明确预训练数据要向几个T的量级扩展。这个数字放在全球坐标系里并不突兀:深度求索的V4 Pro已经做到1.6万亿参数,开源阵营的旗舰普遍在数千亿到万亿之间徘徊。但对智谱而言,这是一次姿态性的表态,在效率叙事席卷行业之后,头部国产厂商仍然相信规模是智能上限的必要条件。
规模扩张的另一面是算力与成本的压力。参数翻倍意味着训练集群、数据管线与推理调度的全面升级,而行业当前的共识是,单纯堆参数的边际收益递减,必须配合数据质量与训练方法的同步进化。智谱把数据规模与参数规模并列提出,正是这个逻辑的体现:更大的模型吃更多的数据,两者共同抬高智能上限,而不是重复上一代模型靠放大参数换取榜单分数的路径。
与规模路线并行的是生态适配的现实问题。开源旗舰发布之后,能否在国产算力平台与主流推理框架上顺利跑起来,往往决定它的实际渗透速度,前代模型发布后算力厂商的快速适配就是例证。下一代模型参数直接翻倍,部署门槛水涨船高,推理成本能否控制在企业可接受的区间,取决于架构里的激活策略与量化方案。对智谱来说,发布只是上半场,让万亿参数模型真正跑进客户的机房,才是这场豪赌的下半场。
国内开发者给智谱起过一个外号,后训练仙人,指其在监督微调、人类反馈强化学习、可验证奖励强化学习等后训练环节的持续投入。这次路线披露中,后训练依然是重点章节:唐杰明确表示会在GLM-5.4与GLM-5.5上继续强化这部分训练,加强各条强化学习路线的协同。在预训练数据红利逐渐见顶的行业背景下,后训练已经成为各家拉开差距的主战场,谁能在可验证奖励与人类偏好之间找到更稳的配比,谁就能把同等参数的模型做出更高的实际效用。
值得注意的是,强化学习路线与规模路线并不矛盾,反而互为前提。万亿参数的基座模型为强化学习提供了更强的先验,让奖励信号的优化有更大的发挥空间;而高效的后训练又能把基座能力压缩到更低的激活成本里。智谱在5.3系列上已经验证了小激活量配合强后训练的可行性,下一代把两条线同时拉满,意图显然是在同一代产品里同时占住效果与成本两个身位。
应用方向上,唐杰的判断颇为直白:今天的AI基本不需要再卷对话和写代码了,GLM下一代要走的是两条还没有被充分开垦的路。第一条是更长、更自主的智能体,环境更复杂、任务更难、周期更长,给模型更大的思考与操作空间。这与行业趋势高度一致,从编程智能体到通用执行代理,长程任务的可靠性正在取代单轮问答质量成为新的分水岭。
第二条路更激进,即模型自主迭代升级。唐杰在8月底的财报会议上就提出过完全自训练的概念,指模型从预训练到中训练再到后训练都能自己训练自己、实现自我进化,美国同行把这称为递归自我改进。他同时坦承这是很大的挑战,最大的难点在于模型能否自己判断什么时候停止、什么时候纠正自己,而不是简单地把模型训大再往下做。市场普遍预计,GLM-5.4与5.5会部分吸收自主迭代的成果,完全体则要等更下一代的产品。
这两条新路相互咬合。长程智能体在真实任务里产生的高质量轨迹数据,恰好是自主迭代最稀缺的训练养料;而自我进化能力反过来又能提升智能体在陌生环境里的适应性。行业研究者普遍认为,谁能先让这两条路线互相喂养,谁就有机会跳出堆数据堆算力的存量竞争,进入能力自增殖的新阶段。
智谱敢在此时亮牌,与国产大模型的竞争节奏有关。过去两个月,头部厂商的公开发布明显放缓,各家的下一代模型都处在蓄力阶段:阿里确认下一代千问在训、深度求索的下一代产品悬而未决、月之暗面与MiniMax各自推进。在这个窗口期,谁先把路线讲清楚,谁就能在开发者与企业客户的心智里提前占位。路线披露本身就是竞争动作,它把即将到来的发布变成了一个可以被跟踪和比较的公开承诺。
对观察者而言,接下来要盯的指标很具体:万亿参数模型的真实激活量与推理成本、长程智能体在多步任务上的完成率、以及自主迭代能在多大程度上减少人工干预。如果GLM-5.4或5.5能在这些维度上给出可复现的结果,国产大模型与全球第一梯队的差距会进一步收窄;如果只是参数规模的例行膨胀,这场豪赌的成色就会被打上问号。答案要等模型真正发布那天才能揭晓,但牌桌上的位置,智谱已经先占下了。