在竞相追逐万亿参数的大模型竞赛中蚂蚁百灵选择了截然不同的路。7月24日百灵大模型正式发布Ling-3.0-Flash。总参数量124B单Token激活参数仅5.1B,在基础推理、指令遵循等核心指标上对标甚至超越参数规模达其两到三倍的旗舰模型。企业可用约十二分之一的激活算力获得接近旗舰模型的体验。
Ling-3.0-Flash定位是担任AI工作流中的高速执行节点。在Agent典型工作流中执行环节需要快速准确低成本。5.1B激活参数量意味着极低的延迟和极小显存占用。模型支持思考与非思考两种推理形态,可根据任务复杂度自主判断是否需要深度思考。
蚂蚁团队在路由算法上进行针对性优化确保专家间负载高度均衡。在长文本处理方面采用优化注意力机制显著降低KV缓存显存占用。模型在高并发业务场景中响应延迟比同级别开源模型低约40%。这种从参数竞赛到效率竞赛的转向是AI商业化的积极信号。
Ling-3.0-Flash的发布揭示了一个新方向:差异化竞争正从参数竞赛转向效率竞赛。能用更少算力做更多事的企业将在长期竞争中占据优势。蚂蚁百灵这条以小博大的技术路线为行业健康发展提供了重要参照。