9月1日,上海人工智能实验室书生团队在GitHub与Hugging Face同步发布InternLumina-U2项目,这是一款定位"全视觉理解、图像生成与编辑"的16B-A1B稀疏MoE扩散大模型,采用全离散多码本架构,试图让语言与视觉共享同一套token接口。仓库以Apache-2.0协议开源了推理代码与项目说明,模型权重与完整技术报告标注为即将发布。虽然尚未开放权重,但项目页披露的架构设计与基准预览,已经勾勒出一条与主流文生图模型截然不同的技术路线。
InternLumina-U2的野心在于把文本、文生图、图像理解、图像编辑、视频理解与3D理解六类任务塞进同一个模型。推理代码覆盖从纯文本生成到1024分辨率文生图,从自然图像与图表理解到支持双CFG模式的指令编辑,从64帧视频采样理解到将GLB与GLTF三维资产经Blender渲染为64个视角后完成3D理解,一个驱动脚本统一调度。这种广度源自团队对技术方向的判断:语言与视觉应当共享离散token接口,而不是各自维护理解与生成两套栈。
架构上,模型走的是完全离散的多码本路线。视觉侧采用Apple的AToken分词器,每个视觉位置由八个互补码本共同描述,分别承载局部纹理、嵌入文字、几何结构与高频细节,避免单一码本的信息容量瓶颈。输入侧八个码本的嵌入拼接投影为单个骨干token;输出侧采用空间并行、码本深度自回归的策略,扩散骨干先并行去噪多个被掩码的空间位置,再由多头码本自回归头逐个位置顺序预测八个码。
这一设计直接回应了统一模型的两难:单码本容量有限,离散连续混合又被迫维护两套表征。多码本方案既保留了离散token在推理与编辑上的可控性,又通过八个互补视角补足了单码本丢失的高频信息。模型总参数16B、激活仅1B,稀疏MoE结构让单任务推理开销保持在较低水平,为后续端侧与实时场景留出空间。
InternLumina-U2并非横空出世。团队在WAIC 2025展示的Lumina-DiMOO已经验证了统一离散扩散模型的基本盘,此次U2在三个方向上做了升级:视觉词表从单码本换成AToken八码本,把"信息密度不足"这一统一模型的通病作为主攻点;任务面从生成扩展到理解与编辑,补齐图像、视频、3D三条输入链路;架构上明确以扩散骨干加码本自回归头替代此前的纯扩散框架。参考系中也列入了LLaDA2.0-Uni、Show-o2与MMaDA等同期代表工作,U2的定位是在它们之上验证多码本方案能否同时守住生成质量与理解精度。
与市面主流路线相比,差异是结构性的。当前商用文生图模型大多采用"文本编码器加扩散U-Net或DiT"的架构,理解与生成分离;InternLumina-U2则把图像生成、编辑与多模态理解压缩到单一离散空间,理论上能在编辑场景天然复用理解语义,在理解场景反向获得生成先验。代价同样明显:多码本自回归头的训练收敛更复杂,跨任务联合预训练对数据配比与计算资源的要求极高,这或许是团队选择先公开项目骨架、再分批开放权重的现实原因。另一方面,多码本统一模型的评测体系尚未成型,现有基准多沿用单任务口径,能否建立覆盖理解、编辑与生成全链路的综合评估框架,也将影响后续版本迭代的方向选择。
权重一旦落地,最直接的受益者是开源社区的二次开发。Apache-2.0协议允许商用与修改,16B-A1B的激活规模意味着单卡或消费级工作站具备运行可能,配合AGX与Llama.cpp式的量化适配,有望把统一视觉能力带进本地工作流。对图像生成工具链而言,一个模型同时完成文生图与精准指令编辑,可以减少多模型拼装的成本;对智能体场景而言,视觉理解与生成的统一,让Agent在"看图改图"的循环中不再需要跨模型搬运中间结果。
更值得关注的是它对3D与视频任务的覆盖。当前视频生成模型普遍缺乏对三维几何的显式理解,U2用64视角渲染把3D资产接入token序列,为"空间理解与生成联动"提供了新范式样本。若后续版本能把理解能力迁移到生成侧,实现由语义驱动的多视角一致生成,将直接冲击3D资产生成与空间计算的内容管线。
当然,从项目预告到生产可用仍有距离。基准表标注为初步结果,权重尚未开放,社区评测与真实工作流验证仍是空白。书生团队此前在DiMOO与InternVL系列上的开源节奏相对稳定,若U2能延续这一传统,国产开源阵营将首次拥有与闭源旗舰同台竞技的统一视觉生成底座,这对图像模型的技术路线多元化与开发者生态都是实质性利好。不过,从项目骨架到生产级工具链仍有距离,量化推理、国产算力适配与多卡并行方案都依赖社区共建,书生系的统一视觉路线能否在真实工作流中站稳脚跟,最终要看开发者用脚投票的结果。