GPT图像2.5版本弹窗提前曝光,匿名模型登顶竞技场,伪造文字图片零破绽引热议

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

OpenAI的图像生成产品线可能正在酝酿一次大升级。9月3日,研究员Chetaslua在社交平台晒出一张截图,显示OpenAI代码工具Codex内部出现一个隐藏弹窗,标题写着"图像创作迎来重大升级",内容承诺"更高质量的结果、更快的生成速度与更智能的创意工具"。弹窗中的"试用"按钮与引导界面均已就绪,素材上传日期为9月1日。尽管OpenAI官方文档目前仍将ChatGPT Images 2.0列为当前模型,但多个迹象表明,代号GPT Image 2.5的新版本已经进入发布筹备阶段。

匿名模型luna-lisa-alpha,竞技场上被指认的新面孔

比隐藏弹窗更早引发关注的是LMArena竞技场上一个匿名模型。代号luna-lisa-alpha的参赛选手近段时间表现抢眼,被众多测试者怀疑正是新版GPT图像生成模型。综合各方实测反馈,这个匿名模型呈现出几个鲜明特点。其一是生成速度极快,等待时间显著短于当前主流模型;其二是照片质感更逼真,光影与景深处理更接近真实拍摄;其三是生成同一角色的多张图片时脸部不易变形,人物一致性明显提升;其四是图像中嵌入的文字不易扭曲,复杂排版还原度更高,同时改进了GPT Image 2时代被人诟病的噪点问题。

以匿名代号参加竞技场是头部厂商的惯用做法,目的是让测试者不带品牌滤镜打分。luna-lisa-alpha的Elo分数近期在文生图与图像编辑等多个赛道持续爬升并进入头部区间,有测试者专门用相同提示词对比它与GPT Image 2的输出,认为两者在构图习惯与文字渲染风格上高度接近,这进一步坐实了外界的猜测。无论最终品牌名是否为2.5,一个能力明显跃升的新模型已经呼之欲出。

这些能力指向一个明确的方向,图像生成正在从"画得好看"走向"画得可控、画得可靠"。人物一致性长期是AI生图的痛点,多图生成时同一张脸经常"漂移"变形,如今匿名模型在这方面的进步若属实,将直接利好动漫分镜、广告物料、电商模特图等需要角色连贯的生产场景。嵌入文字的稳定性同样关键,海报、菜单、产品包装上的文字一旦变形就只能返工,这正是设计工作流最耗时的环节之一。竞技场上的匿名测试者还发现,该模型能够生成包含大量长文字的复杂版面,文字内容几乎可以以假乱真。

伪造GPT-6发布会走红,文字渲染能力是双刃剑

让GPT Image 2.5迅速破圈的,是一组带有"挑衅"意味的测试样例。有创作者用新版模型生成了一段"GPT-6发布会"的伪造画面,画面中虚构的主持人形象与发布会风格高度还原,连奥特曼发布全员信式的文字排版都几乎看不出破绽,相关测试在社交平台被大量转发。量子位等媒体实测后感叹,除头像细节外,伪造图片中的文字已经达到"零破绽"水准,甚至有人用其生成爱因斯坦笔迹的手写稿照片,字迹变化被还原得惟妙惟肖。

文字渲染能力大幅跃升无疑是一把双刃剑。正面看,广告、出版、办公场景对"图文合一"的需求长期被技术短板压制,如今模型能直接把长文字精确排进图像,设计生产力将获得质的提升;负面看,伪造官方公告、假新闻截图、仿冒品牌海报的成本被同步拉低,图片真实性验证的难度进一步上升。值得注意的是,OpenAI在8月30日刚刚让DALL-E GPT正式退役,把图像创作统一收拢到ChatGPT Images产品线,紧接着筹备2.5版本升级,明显是要在完成产品整合后迅速打出新牌。新版模型究竟何时全量上线、定价如何、是否会内置更强的溯源水印,目前仍是未知数,但图像生成竞争的下一轮技术军备竞赛,显然已经提前打响。

图像伪造门槛的降低,也让反制工具同步升温。谷歌SynthID等水印技术已嵌入主流图像模型输出,Meta的Content Seal水印宣称在裁剪、压缩与截图后依然可追溯,欧盟也在推进AI内容强制标识规则。对普通用户而言,未来辨别图片真伪将越来越依赖平台侧的溯源标识而非肉眼判断,这对新闻、电商与社交平台的内容审核机制提出了全新要求,也给版权确权与深度伪造治理提供了新的技术抓手。

研发阵容罕见曝光,图像生成或借鉴Sora技术

这次升级的研发阵容同样透露出重要信号。据媒体报道,新版图像功能由Gabriel Goh担任研发负责人,Adele Li担任产品负责人,而公开名单中出现了两个尤为引人注目的名字,主导Sora视频模型的Bill Peebles,以及DALL-E系列缔造者之一、现负责世界模拟方向的Aditya Ramesh。两位顶级专家共同参与图像项目,强烈暗示新版图像功能可能在底层架构上借鉴Sora的世界模拟技术,或是在为图像与视频生成的无缝切换做技术铺垫。

如果图像模型引入世界模拟能力,意味着模型不再只是理解如何画,而是理解物体在真实世界中如何运动、光线如何变化,生成静态图时能预判正确的物理状态,编辑图像时能保持一致的几何与材质逻辑。从4月发布ChatGPT Images 2.0到如今酝酿2.5,迭代周期不足五个月,图像生成已经成为OpenAI面向大众用户更新最频繁的产品前线,多模态领域的下一次能力跃迁,很可能就从这次图像升级开始。

从研发资源的组织信号看,图像生成已经被OpenAI摆到与视频模型同等的战略位置。过去图像能力往往被视为文本大模型的附属输出,如今独立产品线加上顶尖研究团队的双线配置,说明多模态原生模型的竞争已进入深水区,各家厂商比拼的不再是单一模态的参数规模,而是跨模态理解与生成的一体化能力。对创作者与开发者而言,真正决定新工具能否进入专业工作流的,是图像一致性、编辑可控性与版权溯源机制的成熟度,这些答案要等新版本正式向公众开放后才会逐渐清晰,而围绕生成式图像的生产关系变革,已经在这轮曝光中被提前预订。

素材来源:量子位、网易科技、Web Pulse 发布时间:2026-09-04