影像AI赛道的技术竞赛,正在从"卷参数"转向"卷论文"。8月18日,美图影像研究院公布2026年AI影像领域最新科研进展:今年以来已有11篇论文被ICLR、CVPR、ICML、ECCV、ACM MM等国际顶级会议接收,覆盖视频编辑、人像编辑、智能交互、视觉理解等方向。这批成果并非停留在纸面的学术研究,而是直接与美图的产品线深度绑定:参考帧引导的视频编辑统一框架MiVE,可以实现发型、服装、妆容、打光、背景、天气等通用视频编辑;一致特征传输重打光方案CFT已上线超过50种复杂光效;面向原生2K的多服饰试衣新框架,可端到端生成多种服饰并保持材质真实质感。从修图工具起家的美图,正在用顶会论文构筑影像AI的技术护城河。
一年11篇顶会论文,对于任何一家公司的研究机构都是可观的产出。美图影像研究院这批成果的分布很有讲究:视频编辑方向有参考帧引导的统一编辑框架MiVE,以及用于提升AI视频消除精准度与时序一致性的BridgeRemoval;人像编辑方向有保持人物一致性的一致特征传输重打光方案CFT;视觉理解方向有通过对齐画面对象与语言指令、更准确判断编辑目标的FlowSeg。这些方向并非随机选题,而是与美图旗下美图秀秀、Wink等产品的功能需求一一对应。
从技术路线看,美图研究院的成果呈现出鲜明的工程导向。以MiVE为例,它解决的是视频编辑中"改一处牵全身"的痛点:传统方案修改发型或服装后,人物身份与画面风格往往出现漂移,MiVE通过参考帧引导让编辑结果在整个视频序列中保持一致。CFT重打光方案则聚焦影视级打光效果,在保持人物一致性的前提下实现不同光效切换,目前已在产品中落地超过50种复杂光效,从科研到上线的转化速度,在影像AI公司中并不多见。
这批论文的含金量还体现在顶会覆盖面上。ICLR与ICML代表机器学习基础研究的认可,CVPR与ECCV是计算机视觉两大旗舰会议,ACM MM则是多媒体领域的顶级舞台。11篇论文横跨五个顶级会议,说明美图研究院在生成、编辑、理解多个技术栈上均有建树,而非在某一个细分方向上的单点突破。对于一家以消费级影像产品为核心的公司,这种均衡的技术积累,是支撑产品持续创新的底层燃料。
视频编辑是AI影像竞争最激烈的赛道,也是美图此次科研发布的重头戏。MiVE参考帧引导视频编辑统一框架,将发型、服装、妆容、打光、背景、天气等常见编辑需求收敛到一条技术链路中,用户给出参考帧与编辑指令,模型即可在保持时序一致性的前提下完成全局编辑。与逐帧处理或逐属性建模的传统方案相比,MiVE的"统一框架"思路显著降低了多属性叠加编辑时的冲突概率,让"既要换衣服又要换背景"这类组合需求一次成型。
与MiVE配套的BridgeRemoval,解决的是AI视频消除的精准度问题。视频中的物体移除如果只做逐帧抠除,容易出现闪烁与残影,BridgeRemoval通过跨帧建模提升消除结果的时序一致性,让被移除物体周围的内容在帧与帧之间自然衔接。这一能力直接服务于短视频创作者与电商商家,例如清除画面中临时出现的路人、商标或杂物,而不破坏视频主体。
美图在视频编辑上的布局,与产品商业化形成了闭环。旗下视频剪辑产品Wink接入这些能力后,用户可以用一句话完成复杂的视频修改;面向电商场景,批量化的视频背景替换与商品精修,则为商家提供了降低制作成本的工具。从论文到产品,美图研究院的成果转化路径清晰,这也是其与纯学术机构的最大区别:科研的选题来自产品痛点,成果又回流反哺产品体验。
电商是AI影像技术变现最快的场景,美图此次发布的几项成果直击电商痛点。面向原生2K的多服饰试衣新框架,可实现端到端多服饰生成,并保持不同服饰材质的真实质感。与以往"一键换装"常出现的衣服纹理糊成一片不同,新框架在2K分辨率下保留了皮革、丝绸、针织等材质的细节差异,让模特试衣图的商用价值大幅提升。对于服装电商而言,这意味着可以用AI批量生成高质量试衣素材,替代昂贵的实拍成本。
文字编辑能力同样是电商刚需。美图研究院提出的基于Self-Prompting的图像文本编辑方法,可处理繁体中文、泰语、日语及特殊符号等复杂文字,解决了AI图像编辑中文字渲染"一改就糊、一写就乱"的顽疾。电商海报中的促销文案、多语言商品标签、特殊符号装饰,都能在编辑后保持清晰锐利。这一能力与美图设计室的AI商品图、AI模特等功能结合,正在重构电商素材的生产流程。
从行业视角看,美图的科研布局折射出影像AI竞争逻辑的变化。当基础的"文生图"能力趋于同质化,真正拉开差距的是"编辑精度"与"场景适配"。能否精准地改一处、能否保持身份一致、能否满足电商级分辨率要求,这些细节决定了AI影像工具能否从"尝鲜玩具"升级为"生产力工具"。美图用11篇顶会论文回答的,正是这些问题。随着这批技术陆续产品化,国产影像AI在视频编辑与电商场景的竞争力,有望再上一个台阶。