图像编辑榜前两名被同一家公司包揽,生成与编辑两大榜首首次出现明显分化

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

第三方盲测平台在9月12日同步的榜单数据显示,图像编辑榜前两名被OpenAI的GPT Image 2.5两个版本占据,Sunburst以1520分居首,Flare以1491分紧随其后,两者累计票数分别为6704与5676;上一代GPT Image 2以1461分位列第三,票数超过23.5万。同一家公司的三个模型版本连续占据编辑榜前三,这种集中度在图像模型榜单上并不常见,出现在编辑这个细分维度上更是第一次。与之形成对照的是,文生图榜的第一名是上一代GPT Image 2,编辑榜第一名却是它的后继版本,生成与编辑两个维度的榜首首次出现明显分化。对正在把图像模型接入生产流程的团队来说,这种错位直接影响选型逻辑。

编辑榜前三被同一家包揽意味着什么

编辑榜的评分来自盲测对战,用户在不知道模型名称的前提下比较两张修改结果并投票,再换算成对战积分,头部模型的分数区间通常在两百分以内,因此十几分的差距已经具有参考意义。Sunburst与Flare之间相差29分,与第三名的上一代GPT Image 2相差59分,说明新版本在编辑任务上的提升不是微调,而是明显的代际差。同一厂商占据前三,说明当前图像编辑的能力上限仍由少数团队掌握,后来者要挤进第一梯队,需要的不只是更大的模型,还需要针对编辑任务重新设计训练目标。

更值得注意的是Sunburst与Flare之间的分工。Flare面向日常高质量生成与编辑,吞吐量较上一代提升二到四倍,被官方设为多数接口应用的默认选择;Sunburst面向需要连续多轮精确修改的生产级场景,官方称其最低不安全生成率为1.09%,两个版本采用相同定价,用户按任务分流而不是按预算分流。合作方对Sunburst的评价集中在一点,它知道什么不该改。在连续编辑中保持未修改区域稳定,比单次生成一张好图更难,这也是编辑榜长期由少数模型把守的原因。

生成榜与编辑榜为什么会错位

两项任务的目标并不相同。文生图比拼的是从零构建画面的能力,考验模型对提示词的还原度、美学倾向以及画面内的文字渲染;图像编辑比拼的是在已有画面上做局部改动,考验模型能否区分哪些区域属于必须保持的约束、哪些区域允许变化。前者追求发散,允许每次生成都给出不同的构图;后者追求收敛,要求除了指定区域之外的一切保持原样。当前文生图榜前列依次是GPT Image 2、微软的MAI-Image-2.6、Reve 2.1、谷歌的Nano Banana 2与Meta的Muse Image,而在编辑榜上,MAI-Image-2.6落到第五位,Reve 2.1落到第十四位,名次落差相当明显。

另一个反直觉的现象是,上一代GPT Image 2在生成榜居首,在编辑榜只排到第三,被自家两个新版本反超。这说明生成能力的领先并不会自动转化为编辑能力的领先。对商业工作流而言,编辑的使用频率远高于从零生成,电商改价、替换背景、统一系列视觉、调整模特姿势都属于编辑范畴,而生成往往只发生在项目最初的概念阶段。因此按综合排名或生成榜名次选型容易踩坑,更合理的做法是先明确核心需求是创造新画面还是修改现有画面,再去看对应的榜单。

名次与价格不相关,选型该看什么

文生图榜第一的模型单张高质量图像成本约为0.21美元,同时是榜单上速度最慢的一档;位列第四的Nano Banana 2单张约0.067美元,成本约为前者的三分之一,编辑能力却进入前二。需要4K输出或更强的图像内文字渲染时,可以升级到每张2K图约0.13美元的高阶版本。开源路线的成本结构又是另一套逻辑:FLUX.2的接口价格区间约为每张0.014到0.07美元,自行部署则没有单次调用成本,代价是承担显存与运维投入。价格与名次之间没有稳定关系,这是选型时最容易忽略的事实。

因此评估单位成本时,应该按照每千张可用图的实际花费计算,把重试率与人工返修时间一起算进去。如果某个模型的单张价格便宜三成,却需要多改两轮才能定稿,实际成本反而更高。除了价格,还需要评估三件事:一是主体与品牌元素在多轮编辑后的保持度,可以用同一张主视觉连续修改五轮,逐轮比对产品标识是否漂移;二是图像内文字的准确率,包含价格与日期的促销物料错一个字就会造成事故;三是授权与合规条款,包括训练数据来源说明与生成内容的商用范围。把图像调用收敛到一个可替换的适配层,让更换模型变成一次配置调整而不是一次重构。

国产模型的坐标与开源许可分层

国产模型在编辑榜的位置集中在第八到第二十四名区间。字节的Seedream 5.0 Pro以1394分排在第八,票数接近十八万,领先谷歌的Nano Banana Pro约四分;阿里的Qwen Image 2.0 Pro以1304分排在第二十一,腾讯的混元Image 3.0 Instruct以1302分排在第二十二,阿里的Wan 2.7 Image Pro与字节的Seedream 4.5同分紧随其后。差距主要体现在票数规模与高分段的稳定性上,而不是某一项能力的绝对缺失。票数规模同样值得关注,前排模型的累计票数普遍在数十万级别,样本量越大,分数的置信区间越窄。

开源许可的分层也在影响选型。FLUX.2的klein-4B版本采用Apache 2.0许可,官方文档标注约13GB显存即可在消费级显卡上运行,可以商用;klein-9B与旗舰32B开发版则采用非商用许可,阿里的Qwen-Image同样采用Apache 2.0。同一系列的不同参数版本可能适用完全不同的条款,把4B的许可误用到9B上会带来合规风险。对需要把模型嵌进产品并对外交付的团队,先确认具体变体的许可条款,比先比较榜单分数更重要。榜单每个月都在变化,而许可与架构一旦确定,往往会长期约束产品的部署方式。

素材来源:Arena盲测榜单、Artificial Analysis、dev.to、AGI Hunt 发布时间:2026-09-13