全球大模型进入万亿参数时代,Agent原生能力与推理时计算成为下一竞争焦点

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

2026年7月全球大模型竞争格局迎来关键转折点。从月之暗面2.8万亿参数Kimi K3开源到OpenAI前CTO米拉穆拉蒂创办的Thinking Machines发布9750亿参数Inkling开放权重模型,再到GPT-5.6 Sol的Ultra多智能体模式,大模型竞争正从单纯的参数规模竞赛转向Agent原生能力与推理时计算的综合较量。Kimi K3以2.8万亿参数创下全球开源模型之最,采用KDA混合线性注意力机制和Stable LatentMoE框架,在896个专家中高效激活16个,整体扩展效率相比K2提升约2.5倍。

2.8万亿参数只是起点,大模型下一步在哪

K3的发布标志着国产大模型在系统化工程能力上实现了质的飞跃。与此同时Thinking Machines的Inkling借鉴了DeepSeek-V3的MoE架构设计,9750亿总参数中激活410亿参数,支持最高100万token上下文。然而真正引人注目的变化是竞争焦点的转移,当几乎所有主要玩家都迈入万亿参数俱乐部后,如何将规模优势转化为实际能力成为新的竞赛主题。本届WAIC释放出的最明确信号是大模型正在从对话工具向数字员工进化。GPT-5.6 Sol的Ultra模式可同时调度4个AI代理并行处理复杂任务,一小时证明50年未解的循环双覆盖猜想。Kimi K3具备长程编码能力,可持续完成长时间工程任务并协调使用终端工具。

商汤SenseNova U1 Pro则从内容生成走向系统级交付,自主规划了包含22个逻辑一致连续分镜的视频创作。这些能力的背后是模型从理解指令并回应到理解目标并执行的根本性跨越。另一个重要的技术趋势是推理时计算的兴起。Meta最新发布的Muse Image模型展示了一个关键发现:在推理阶段给予模型更多的计算资源,让它有时间先想后画,输出质量呈现接近对数线性的提升。与其一次生成多张再挑选,不如把相同算力花在认真推理上。这一发现的影响远超图像生成领 域,意味着大模型的推理能力和思维链质量正在成为比原始参数规模更重要的竞争维度。GPT-5.6 Sol的Ultra模式配置64个并行子智能体和专门的对抗智能体,就是推理时计算的极致运用。

当大模型学会做事而不只是说话

随着大模型能力边界不断扩展,模型层面的互联互通标准正在成为行业热门议题。谷歌主导的模型上下文协议MCP正在被广泛采用,该协议定义了Agent如何与外部工具和服务进行交互。阿里巴巴、百度等中国企业也在积极推进各自的Agent互联协议。谁能够在Agent互联标准上取得主导权,谁就可能在下一个AI时代占据生态位优势。工信部今年发布的行动计划也明确支持Agent互联标准的研发和推广,下一个阶段的竞争重点将从谁的模型更强转向谁的模型生态更完善。2026年上半年的开源模型大爆发进一步重塑了行业格局。Kimi K3以Apache 2.0协议开源、Inkling以开放权重形式发布、谷歌Gemma 4系列全面开源,开源生态的活力达到前所未有的高度。

开源力量的崛起正在改变大模型行业的商业模式,从单纯的API卖Token转向开源模型加企业服务加定制微调的多元模式。大模型行业的竞争已经进入多维度的综合较量阶段,参数量、架构创新、Agent能力、推理效率和开源生态五个维度缺一不可。万亿参数时代的大模型竞争正在回答一个根本性问题:通往AGI的路径到底是什么?目前业界存在两条主要的技术路线。一条以OpenAI和Anthropic为代表的闭源路线,主张通过不断扩展模型规模和数据量来逼近 AGI。另一条以Meta和众多开源社区为代表的开源路线,主张通过开放协作来加速AI技术创新。

想得越多画得越好,推理时计算的逆袭

中国企业的选择则更加多元化,既有像DeepSeek和月之暗面这样的开源派,也有保持商业模式灵活性的企业。这场关于开源与闭源的辩论本质上是对AI发展速度和风险控制之间平衡点的寻找。从实际效果来看开源路线在推动AI技术普及和降低使用门槛方面发挥了不可替代的作用。Kimi K3以Apache 2.0协议开源后,一周内在Hugging Face上的下载量突破了50万次,被全球数千个开发者项目所采用。这种传播速度是任何闭源模型都无法企及的。但闭源路线在安全性可控性和商业化方面有其独特优势。OpenAI的GPT-5.6 Sol通过限制模型权重访问来控制使用风险,同时通过API计费模式实现了稳定的商业收入。两种路线各有优势,未来的竞争格局很可能是在开源和闭源之间找到一种动态平衡,既保持技术的开放性又确保安全可控。

Agent原生能力的崛起也为大模型的评估体系带来了变革。传统的基准测试主要评测模型的知识储备和推理能力,如MMLU和GSM8K等。但这些测试无法衡量模型在真实工作流中的表现。新的评估标准正在从知道什么转向能做什么。SWE-Bench衡量模型在软件工程任务中的表现,GAIA衡量通用AI助手的能力,AgentBench衡量Agent任务完成能力。这种评估体系的转变将从评价标准层面推动大模型从对话助手向数字邻域进化。当模型的能力不再由知识储备而是由任务完成率来定义时,训练的优化目标也将相应改变。

来源:极目新闻、掘金社区、澎湃新闻 发布时间:2026-07-21