当GPT Image 2的按Token计费让不少企业算账头疼时,微软也加入了这场定价模式变革。微软近日宣布推出两款新的自研AI模型:MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均已进入公开预览阶段。其中MAI-Image-2.5-Pro是微软目前精度最高的图像模型,面向主视觉图片生成、细节编辑以及图像内文字渲染等高质量场景,并已落地Bing Image Creator、PowerPoint和OneDrive等微软产品。
比模型本身更值得关注的是它的计价方式。MAI-Image-2.5-Pro按Token收费:文本输入每100万个Token收费5美元,图像输入每100万个Token收费8美元,图像输出每100万个Token收费106美元,约合人民币718.8元。这意味着图像生成行业沿用多年的按张计价模式,正在被Token计费体系加速替代,企业的AI图像支出预测方法论面临重构,预算表上的算法需要从头改写。
MAI-Image系列是微软AI团队自研模型体系的重要组成部分,目标是使用经过清理、可追踪、企业级的数据进行训练,不依赖第三方模型蒸馏,并从底层设计以服务微软产品用户。微软官方强调,过去一年公司开始开发基于内部训练流程的专用模型,用干净的、可追溯的企业级数据训练,把命运掌握在自己手里,而不是依赖外部供应商。
整个MAI-Image家族分为Flash、2.5标准版和2.5-Pro三个层级,Flash主打速度和低成本,2.5标准版兼顾质量与价格,2.5-Pro则面向高清人像和精细场景,追求最高保真度。MAI-Image-2.5于6月2日首次发布,上线即在Arena文生图榜单排名第三、图像编辑榜单排名第二,领先Nano Banana 2.1等竞品,对自家上一代模型整体提升了75分。此次公开预览的2.5-Pro是7月23日推出的最高端版本,微软官方将其描述为迄今精度最高的自研图像模型,整个产品线已经端到端驱动Bing Image Creator,并为PowerPoint和OneDrive的图像功能提供支持。
MAI-Image-2.5-Pro的核心竞争力体现在两个方面。第一是文字渲染能力,据第三方评测数据,其在Arena文字渲染维度比上一代MAI-Image 2提升了约107分,招牌、产品标签、海报和多语言字幕都能保持清晰可读,这在电商设计和营销物料场景中价值巨大,直接击中了此前AI生图最薄弱的环节,让AI生成的图片第一次真正可以用在商业海报上。
第二是精准的局部编辑能力。模型支持外科手术式的定向编辑,移除物体、替换元素、修改属性、修复伪影等操作只改变用户指定的区域,画面其他部分保持原样,同时在人脸、发型、服装等身份特征上跨风格、跨姿态保持高度一致,生成的角色换一套造型还是同一个人。它还能根据自然语言指令迭代修改图像,支持文档和图表生成,这也是它能深度嵌入PowerPoint的原因所在,文档工作者可以一边写PPT一边让AI出图。
Token计费模式正在改变AI图像行业的定价逻辑。过去按张计价看似简单透明,但实际消耗取决于分辨率、参考图数量和编辑复杂度,一张4K编辑图与一张512像素生成图的实际算力消耗天差地别。微软将图像输出定价为每百万Token 106美元,就是把算力成本摊进了每个Token里,让价格更精确地反映资源消耗,也让成本透明变成了一件需要工具才能做到的事。
这种变化带来两个直接后果:一方面,图像乘单价的价格卡正在变成叠加在Token计费表上的近似值,企业预测账单的难度上升,预算负责人需要新的计量工具;另一方面,图像支出开始像大模型支出一样变量化,每次调用的费用取决于提示词复杂度和分辨率,只有事后才能真正知道花了多少钱。GPT Image 2早已采用Token计费,微软MAI跟进后,按张计价的模式在头部模型中将越来越少见,图像生成的开支管理正在全面向大模型看齐。
对企业开发者来说,MAI-Image-2.5-Pro通过Azure AI Foundry、MAI Playground和OpenRouter等渠道开放,接入门槛并不高,企业可以把高质量图像生成和精准编辑能力直接嵌入自己的产品流程。微软强调模型面向商业级工作流设计,从商品图、品牌视觉到海报物料,都能在统一的API下完成生成和迭代,特别是需要大量文字渲染的电商场景,这个模型的优势会非常明显。
值得注意的是,中文文字渲染仍是国产模型的优势区,阿里Qwen-Image-3.0以0.18元/张起的定价和4.5K超长提示词支持,在国际榜单上排名国内第一。微软Token计费模式的引入,将进一步加剧图像生成市场的定价分化:高端场景愿意为保真度和编辑能力支付Token溢价,而批量化和本土化需求则更青睐按张计费的国产方案,两种模式将在不同市场区间并行生长,企业按需选择即可。