微软在自研图像生成赛道上的追赶节奏明显加快。当地时间8月10日,微软正式发布新一代文生图模型MAI-Image-2.6,在第三方盲测平台Arena的文生图排行榜上从上一代的第十位一举跃升至第二位,Elo评分达到1336分,仅次于OpenAI的GPT Image 2。微软AI部门负责人穆斯塔法·苏莱曼在社交媒体上确认了这一排名,并称模型已超越谷歌、Meta与xAI等多家竞争对手的主力图像模型。从第十到第二,微软只用了约两个月,自研图像生成不再是"追赶者"的叙事,而是真正挤进了第一梯队。
MAI-Image-2.6的排名跃升并非偶然。官方数据与第三方评测共同指向两个核心升级点:其一,图像内文字渲染能力大幅提升,该单项相比上一代提升91个Elo分,在Arena文字渲染专项榜单中以1374分登顶第一,长句与复杂排版的还原度显著改善;其二,3D成像与建模类别从第六位升至第一位,空间结构与材质表现更为扎实,为产品展示和电影级画面场景提供了支撑。
除这两项外,模型在卡通动漫、商业设计、艺术等类别也全面进步,人像生成在面部细节、光影与皮肤质感上更加自然。微软官方表示,新模型还支持多参考图像融合,即用户可基于多张样例图片进行风格化生成,同时强化了语义理解能力,能将文本描述与图像区域准确关联,并提供对推理逻辑、输出格式及分辨率的更强控制。从评测数据看,这已不是小幅迭代,而是覆盖多维度能力的系统性升级。
回顾MAI-Image系列的时间线,能清晰看到微软的提速轨迹:2025年10月首款自研模型MAI-Image-1发布即进入Arena前十,2026年3月MAI-Image-2升至第三,6月的2.5版本保持第三,如今2.6版直接冲到第二。不到一年时间,从"入场者"变成"第一梯队守门员",迭代频率几乎与OpenAI的GPT Image系列同步。
推动这一节奏的深层动力来自微软自身的场景需求。Office、Copilot、Windows生态中都内嵌了图像生成入口,生产力场景对文字渲染的精准度要求远高于娱乐场景,MAI-Image-2.6在文本渲染单项登顶,恰好命中这一需求。苏莱曼此前曾多次强调微软将押注自研模型而非依赖外部供应商,图像生成正是这一战略的试金石。随着模型能力补强,Copilot与Office中的图像功能有望摆脱"第三方依赖"的标签,形成软硬件一体的闭环。
MAI-Image-2.6的发布,与微软在计费模式上的激进探索同步进行。此前的MAI-Image-2.5-Pro已采用按Token计价而非按张收费的模式,这一计量方式正在被行业效仿:GPT Image 2同样采用Token计费,MAI系列跟进后,图像生成成本正从"张"向"token"迁移。对开发者而言,这意味着成本模型从"固定单价"变成"按分辨率、输入图像数与编辑复杂度浮动"的动态结构,预算规划需要新的工具。
这种计费革命的深层影响在于,图像生成的开销开始像大语言模型一样可预测、可审计。一张4K带三张参考图的编辑,与一张512像素的纯生成,在Token账单上的差异巨大,企业级用户因此获得了更精细的成本控制手段,也推动了"图像用量"进入企业级观测体系。当MAI-Image-2.6的性能优势与Token计费结合,微软正在把图像生成从"按张买断"的消费逻辑,带入"按量计价"的企业基础设施逻辑。落地渠道方面,微软已宣布MAI-Image-2.6将在一周内部署至MAI Playground,并陆续在Microsoft Foundry及其他产品中上线,Arena平台也已开放体验,设计师与品牌团队可以第一时间在文字海报、产品图与3D预演等高频场景用上新模型。
MAI-Image-2.6的登场,让本就拥挤的文生图赛道格局再度生变。当前头部阵营中,OpenAI的GPT Image 2凭借复杂指令遵循与图内文字能力占据榜首,谷歌Nano Banana系列在图像编辑领域领先,Midjourney继续统治审美与艺术方向,如今微软以"生产力场景专精"的姿态挤进第一梯队,各家的差异化标签愈发清晰。
值得注意的是,模型选择的天平已从"谁画得好看"转向"谁更好控制、更便宜、更贴合工作流"。微软2.6版的多参考融合与格式控制能力,正是冲着这一趋势而来。可以预见,文生图市场的下一轮竞争,将从单纯的效果比拼,转向效果、可控性与成本的三维较量,而微软同时握有模型性能、生态入口与计费创新三张牌,这场战局的走向也因此多了几分悬念。Token计费模式下,按量采购也更符合企业预算习惯,MAI-Image-2.6的排名优势能否转化为Copilot与Office生态内的高频使用,将是接下来观察这家公司图像战略兑现度的最佳窗口。