二次元AI绘画模型大更新,22个角色同屏不串脸,整页漫画一次直出

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

二次元AI绘画赛道的竞争,正在从"单张画质"转向"整页工作流"。8月21日,深耕动漫垂直领域的AI绘画平台NovelAI发布最新图像生成模型Diffusion V5,V5 Curated与V5 Full两个版本均同步开放。官方称这是迄今最精炼、能力最强的模型:自然语言理解更细腻,官方支持英日双语提示,角色定位测试中最多允许22个独立角色同屏,漫画生成从单格拼接升级为单次生成完整分镜页。在图像质量层面,新模型使用32通道自定义VAE,眼睛细线、珠宝、文字与配饰等小细节的渲染精度相比V4.5明显提升,背景与复杂环境的表现也随之改善。模型体积超过V4.5的两倍,训练消耗高达26.8万B200 GPU小时,这组数字背后,是NovelAI在垂直赛道上押下的重注。

26.8万GPU小时训练,V5的画质底气在哪里

图像质量的提升首先来自架构层面的升级。Diffusion V5建立在自有架构之上,是V4.5的改进版本,核心变化在于VAE:V5采用32通道自定义VAE,而V4.5为16通道,通道数的翻倍让模型能够保留更多高频细节信息,官方称眼睛的细线、珠宝、文字与配饰等小物件的渲染精度更高。对于二次元插画而言,这些细节往往是评判画师功力的关键,也是此前AI生成最容易"翻车"的环节。除了静态细节,V5还改善了背景与复杂环境的生成质量,场景不再只是角色的简单衬底,而是具备氛围感和空间感的完整画面。

另一个实用功能是原生alpha透明通道支持。创作者在提示中加入"transparent background"或"has alpha",即可把角色放到透明背景上,甚至生成半透明效果,这为后续合成、排版提供了极大便利。文本渲染方面,V5支持英、日、中多种语言的文字生成,在提示中直接引用文字即可自动生成文本块,海报、Logo、漫画对话框等含字场景的可用性大幅提升。这些能力叠加在一起,让V5不仅是"画得更好",更是"更能直接用于生产"。

22个角色同屏零渗漏,多角色控制怎么实现

多角色控制是V5的主打方向,也是漫画与插画创作中最棘手的难题之一。以往的图像模型生成多人场景时,常常出现角色特征互相"串味":A的头发染到了B头上,C的衣服混进了D的配色,人物之间缺乏明确的身份边界。NovelAI在V5中重做了角色定位功能:不再使用小网格,角色提示可以在画布上自由放置,模型会贴近设定位置构图,并显著减少不同角色特征之间的渗漏。官方测试中,通过角色定位功能最多能让22个独立角色同时出现在画面里且保持各自特征,这一数字在AI绘画模型中处于领先水平。

多角色能力的提升,直接解锁了更复杂的创作场景。群像插画、多人同框的漫画分镜、角色阵容展示图,这些过去需要反复抽卡或后期合成的需求,现在可以一次生成。官方还强化了自然语言理解能力,用户可以用长句描述画面布局与角色关系,也可以继续使用标签式提示词,两种输入方式并行。值得注意的是,V5官方支持英语与日语提示,中文、德语、西班牙语等语言也可以用于提示,但并非训练重点,效果会有所差异,创作者在使用非官方语言时需要适当降低预期。

单次生成整页分镜,漫画工作流被重新定义

整页漫画生成,是V5带给漫画创作者最直接的工作流变革。在V5之前,AI漫画创作的标准流程是"一格一格生成,再手动裁剪拼接",官方此前的漫画训练数据也仅限于两格范围,多格页面需要创作者自行拼版,既耗时又容易出现格与格之间风格、构图不统一的问题。V5的漫画训练数据扩展到完整多格页面,用户只需用自然语言描述版面,或在界面中拖放角色位置,模型就能单次生成一张完整的漫画分镜页,无需再手动拼接单格。这意味着漫画创作从"单格生产"跃升为"整页生产"。

从产业视角看,这一变化的意义在于把创作者从重复劳动中解放出来。漫画分镜页的排版、格间留白、对话气泡位置,这些过去需要专业排版知识的工作,如今由模型直接完成。当然,V5并非所有功能一步到位:Precise Reference、Curated Inpainting与Vibe Transfer未随本次发布上线,官方表示会在后续继续训练和推出;Inpainting目前只在V5 Full上可用,V5 Curated暂时沿用V4.5 Curated的inpainting功能。这种"分批上线"的策略说明NovelAI在产品节奏上保持审慎,先把核心能力打磨稳定,再逐步补齐周边功能。

垂直赛道的差异化,NovelAI为何押注创作流程

在通用图像模型竞争白热化的当下,NovelAI选择了一条差异化的路径:不追逐写实风格的最强表现,而是深耕二次元与漫画这个垂直领域,把"构图控制"和"版面生成"做到极致。22角色同屏、单次整页分镜、长提示与自然语言构图,这些能力都指向漫画与插画的实际生产流程,目标是把创作者从"单格生成后手动拼接"的繁琐工作中解放出来。官方把22角色同屏作为测试成绩公布,说明其判断差异化不在于单张画质的微调,而在于场景复杂度与版面能力这些"生产力维度"的突破。

这种押注方向的背后,是对垂直市场价值的判断。二次元插画与漫画创作群体规模庞大,对工具的专业化需求强烈,且愿意为提升生产效率付费。V5的订阅方案与使用额度同步调整,图像生成界面也进行了全面改版,产品整体围绕"职业创作者"进行打磨。当然,22角色是官方测试口径,部分功能未随发布上线,模型实际表现仍需在真实创作中验证。对于二次元和漫画创作者来说,V5的价值在于工作流层面的变化,而这一变化的成色,最终要由一线创作体验来检验。垂直模型押注生产流程,或许是AI绘画行业从"拼参数"走向"拼效率"的又一个信号。

素材来源:AI速览、IT之家、动点科技、量子位 发布时间:2026-08-24