国产大模型在国际权威评测中迎来历史性时刻。8月11日更新的SuperCLUE智能指数七月榜单显示,前五名全部被国产模型包揽:阿里Qwen3.8-Max以71.48分的总成绩登顶榜首,月之暗面Kimi K3以70.68分紧随其后,字节豆包、DeepSeek-V4-Flash、DeepSeek-V4-Pro分列第三至第五名。这是该榜单发布以来,国产模型首次实现前五名的全包揽,过去长期霸榜的海外闭源模型集体跌出第一梯队。SuperCLUE智能指数围绕数学推理、科学推理、智能体编程、精确指令遵循、幻觉控制、智能体任务规划六大维度展开,全部基于702道全新原创开放题,对模型能力进行多角度压力测试。
Qwen3.8-Max的登顶并非偶然。从六维得分看,它在数学推理、科学推理、幻觉控制三个维度表现尤为突出,分别拿到77.19分、86.08分和71.93分,其中科学推理维度在全部参测模型中排名第一。值得注意的是,作为一款开源模型,Qwen3.8-Max在多项能力上超越了同批参测的闭源旗舰,这印证了阿里通义团队在基座模型训练上的持续投入,也说明开源路线完全有能力站上全球顶尖水平。
智能体任务规划维度是拉开差距的关键战场。Qwen3.8-Max在这一项拿到90.94分,远超其他参测模型,体现出对复杂任务拆解、工具调用与多步执行的扎实理解。这与大模型从"对话"走向"干活"的行业趋势高度契合:企业客户在选择模型时,越来越看重模型在真实工作流中的执行能力,而非单纯的问答表现。阿里云此前已围绕Qwen系列构建了完整的智能体生态,模型与工具的协同打磨,为其在智能体维度的领先奠定了基础。
更值得玩味的是,Qwen3.8-Max保持开源属性的同时拿下综合第一,打破了"最强模型必须闭源"的惯性认知。开源意味着权重公开、可本地部署、可二次开发,企业无需受制于单一供应商,这让它的登顶含金量更高,也加速了企业从闭源API向开源模型的迁移潮。
月之暗面Kimi K3以70.68分位居第二,与榜首差距不足1分,展现出极强的竞争力。Kimi K3在智能体编程维度拿到75.79分,位居全部参测模型第一,延续了月之暗面在代码与智能体方向的传统优势;数学推理71.93分、幻觉控制83.85分同样表现亮眼。作为2.8万亿参数的旗舰模型,Kimi K3在长上下文、复杂任务执行上的能力已经得到行业广泛认可,多家券商研报将其列为国产模型第一梯队。
从评测细节看,Kimi K3与Qwen3.8-Max的竞争已经进入"毫厘之争"阶段:一个在科学推理上领先,一个在智能体编程上反超,双方各守优势阵地。这种贴身肉搏对整个行业是好事,它倒逼厂商在细分维度上持续打磨,而不是满足于笼统的"性能相当"。对用户而言,选择范围扩大且能力差距缩小,意味着可以根据自身场景精准选型,成本与效果的匹配度更高。
榜单之外,Kimi K3的商业进展同样值得关注。月之暗面近期完成新一轮融资,投前估值达到500亿美元,并传出备战港股IPO的消息。评测领先叠加资本加持,这家被视为"技术派"的AI公司,正在加速从实验室走向资本市场,而它在榜单上的表现,将成为投资者评估其技术壁垒的重要参考。
榜单第三至第五名同样看点十足。字节豆包(Doubao-Seed-2.1-pro)以65.94分位居第三,在幻觉控制维度拿到77.19分排名第一,体现了字节在模型安全与可靠性上的打磨;DeepSeek-V4-Flash与DeepSeek-V4-Pro分列第四、第五名,分别拿下65.60分与64.40分。两款DeepSeek模型同时入榜,且Flash版本总分反超Pro版本,这一反直觉的结果引发了社区热议。
DeepSeek-V4-Flash在数学推理维度拿到78.95分,仅次于Qwen3.8-Max,却以更小的模型规模、更低的推理成本实现了对自家Pro版本的反超,让"性价比"成为DeepSeek最鲜明的标签。有开发者测算,在同等预算下,调用Flash版本可以覆盖更大量的业务场景,综合收益反而更高。这种"以量取胜"的策略,正在改变大模型商业化的定价逻辑,也解释了为何DeepSeek的API涨价消息会引发如此广泛的关注。
豆包与DeepSeek的入榜,代表了国产模型的两条典型路线:字节走"产品与场景驱动",依托抖音生态将模型能力快速转化为用户量;DeepSeek走"技术与成本驱动",以开源和极致性价比吸引开发者。两条路线殊途同归,都在评测中交出了硬核成绩,也说明国产模型并非单一打法,而是形成了多元化的竞争生态。
国产大模型包揽SuperCLUE前五强,是行业里程碑,更是多年积累的集中兑现。过去两年,国产模型经历了从追赶、并跑到局部反超的完整周期,这一进程的速度远超业内预期。究其原因,一方面是中国拥有全球最大的应用场景与数据生态,模型在真实业务中不断迭代,能力提升有坚实的实践支撑;另一方面,开源生态的繁荣让技术扩散加速,Qwen、DeepSeek、GLM等开源模型成为全球开发者共同的"底座",反哺了整体技术水平的提升。
从评测机构的角度看,SuperCLUE智能指数强调"原创题+开放题"的评测方式,避免了模型对公开题库的过度拟合,更能反映真实能力。国产模型在这种严苛评测下的集体突围,说明其领先并非昙花一现,而是具备可持续的技术纵深。当然,榜单成绩只是参考坐标之一,模型在真实业务场景中的稳定性、可控性与成本效率,才是企业最终买单的依据。
回望两年前的榜单,海外闭源模型还占据绝对优势,国产模型往往只能在榜单尾部寻找存在感,如今前五强全包揽,追赶周期之短超出绝大多数人的预期。业内人士总结,这背后是中国丰富应用场景带来的高频迭代、开源生态繁荣带来的技术扩散,以及人才资本密集涌入带来的研发加速,三者叠加才换来了今天霸榜的成绩单。
榜单霸榜带来的不只是荣誉,更是新一轮竞争的压力。前五名内部差距已经缩小到个位数,任何一次版本迭代都可能重排名次,厂商之间的"军备竞赛"将从参数规模转向更细颗粒度的能力打磨。与此同时,海外厂商不会坐视不理,OpenAI、Anthropic、谷歌等近期都在加速模型迭代,甚至通过降价策略争夺市场,国产模型想要守住优势,必须在技术、成本、生态三条战线同步发力。
对于行业而言,国产模型集体登顶的意义,在于证明了"中国团队完全有能力做出世界级模型"。接下来,竞争的重点将从"能不能做"转向"能不能用得好":企业部署是否足够简单,推理成本是否足够低,行业解决方案是否足够成熟。当模型能力本身不再是瓶颈,谁能率先打通从技术到商业的最后一公里,谁就能在下一阶段的竞争中占得先机。SuperCLUE七月榜单,为这场新竞赛写下了国产模型的宣言书。