一家以图像生成起家的德国初创公司,正在用一款多模态视频模型搅动整个AI视频赛道。8月5日,Black Forest Labs正式宣布开放FLUX 3 Video模型的通用访问权限,用户现在可以通过BFL API及指定合作伙伴渠道使用该模型。与此前市面上的视频生成工具不同,FLUX 3直接整合了原生音频生成能力,生成的视频不再是没有声音的哑剧,而是自动包含对白、音效和环境声。
FLUX 3最早于7月23日以早期访问方式上线,采用统一架构联合学习图像、视频和音频,被业内视为Black Forest Labs从只做图像转向多模态平台的关键节点。此次全面开放,意味着这款自诩性能超越Seedance 2.0和MiniMax H3的模型正式进入商用阶段,其20秒生成时长、1080p分辨率和按秒计费的定价模式,也为市场提供了新的参照系。
在输出规格上,FLUX 3支持生成最长20秒的高清和全高清视频片段,功能覆盖文字转视频、图片转视频、关键帧生成、视频延续等多个维度。比较特别的是,官方声称该模型能在单个片段内处理多场景切换和多角度镜头变化,无需用户在后期进行手动拼接,这对依赖分镜叙事的创作者而言是实打实的效率提升。
原生音频是FLUX 3最鲜明的差异化标签。绝大多数视频生成模型只输出画面,声音需要另行配音或配乐;FLUX 3则在生成画面的同时输出与内容匹配的对白、音效和环境声,避免了音画分离带来的后期成本。对于纪录片、广告、短视频等内容形态,音画同步生成意味着从提示词到成片的链路大幅缩短。
在语言能力方面,FLUX 3支持超过14种语言的对话生成,并且能够实现唇形同步,为跨语言内容的规模化生产提供了一种新方案。用户无需再为不同语种版本分别进行配音和调整口型,一个模型即可完成多语言版本的内容制作,这在出海营销和全球化内容生产中具有明确价值。
FLUX 3的意义,不止于又一款更强的视频模型。Black Forest Labs在发布材料中反复强调的,是把图像、视频、音频和机器人动作整合进同一套生成系统的设计方向,其自研的Self-Flow架构在同一骨干网络上挂载多种专用编解码器,让模型对物理世界和数字内容形成统一的概率理解与生成能力。这种架构选择,被业内解读为从短视频生成器走向世界模型的中间站。
世界模型是当前AI领域最热的方向之一,其目标是让模型学习物理世界的运行规律,能够预测和模拟真实场景的变化。视频生成模型恰好是通往世界模型的天然路径,因为视频包含丰富的时空信息,训练视频模型的过程本质上就是在学习世界的动态规律。Black Forest Labs将视频、音频、机器人动作放在同一架构下训练,正是试图让模型不仅会生成画面,还能理解画面背后的物理逻辑,为机器人运动预测等应用打下基础。
从商业化节奏看,FLUX 3的推出也承载着Black Forest Labs从开源社区宠儿向商业公司的转型。这家公司此前凭借FLUX图像模型系列在开源社区积累了极高声望,此次以API方式开放视频能力,标志着其商业模式重心转向企业服务,未来图像模型和开源权重也将分阶段推出,形成开源引流、API变现的双轨结构。
根据BFL官方公布的内部Elo评分测试,FLUX 3在文字转视频项目上以1135分位居榜首,在图片转视频项目上取得1051分,将其排在Gemini Omni Flash、MiniMax H3以及Seedance 2.0等同类产品之前。BFL在发布公告中直接表示,FLUX 3在这些测试中超越了字节跳动的Seedance 2.0。
不过,这份榜单的数据属性需要冷静看待。目前BFL公布的都是内部测试结果,缺少可复现的第三方基准和更广泛的使用反馈。Elo排名固然直观,但不同任务分布、提示词设计以及评估维度都可能影响最终排序。FLUX 3的真实水平,仍有待开发者和用户在实际场景中验证,尤其是多主体交互稳定性、复杂物理演算等视频生成的老大难问题。
从技术路线看,FLUX 3采用Black Forest Labs自研的Self-Flow架构,在同一骨干网络上挂载图像、视频、音频和机器人动作等专用编解码器,旨在让模型对物理世界和数字内容形成统一的概率理解与生成能力。这种把视频、音频、运动控制整合进一个生成系统的设计方向,被业内视为从短视频生成器走向世界模型的中间站,也是Black Forest Labs未来押注机器人应用的技术伏笔。
定价策略上,BFL采取了按视频输出秒数计费的模式,所有计价均包含音频生成费用。在草稿模式下,生成高清视频的限制性较强,文字转视频或图片转视频的价格为每秒0.06美元,视频转视频则为每秒0.12美元;切换到标准质量模式,高清视频价格提升至每秒0.17美元和0.41美元;全高清规格下的对应费用则分别为每秒0.29美元和0.53美元。
按当前汇率折算,草稿模式下生成一条20秒视频的成本约在8元人民币出头,这个价格与国产主流视频模型的定价区间形成正面竞争。对预算敏感的个人创作者而言,草稿模式提供了一个低成本试错的入口;对专业制作团队而言,标准模式和全高清模式则提供了更高质量的选择。这种分档定价的思路,正在成为AI视频商业化落地的主流做法。
当然,价格只是竞争力的一个维度。Black Forest Labs还需要证明FLUX 3在长时段一致性、复杂场景稳定性和批量生产能力上的表现。对于一个商业化时间不长的模型来说,如何平衡质量、成本和可靠性,将决定它能否从评测榜单的领先者成长为真正被生产环境广泛采用的产品。
尽管FLUX 3在官方评测中表现抢眼,但一个客观事实是,目前BFL公布的数据均来自内部测试,缺少可复现的第三方基准和更广泛的使用反馈。行业普遍期待独立评测机构尽快给出第三方验证,因为公司自测数据的说服力终究有限,评测的任务分布、提示词设计以及评估维度都可能影响最终排序,真实水平只有通过中立机构的复现测试才能被确认。
从过往经验看,视频生成模型从发布到被生产环境接纳,通常要经历数轮实测反馈。角色一致性、复杂动作的物理合理性、长时段的场景稳定性,这些在演示视频中难以暴露的问题,只有在真实项目中才会显现。FLUX 3能否在开发者的批量使用中保持稳定的生成质量,将决定其商业化的成色,首轮用户反馈会比任何榜单都更有参考价值。
此外,安全与合规也是FLUX 3需要面对的考题。Black Forest Labs表示已与安全评估机构Cinder合作,针对非自愿亲密影像和儿童性虐待材料等风险进行了评估,但这只是缓解流程的证据,并不能保证所有滥用场景都被消除。视频模型的内容安全治理是行业共同难题,FLUX 3需要在开放与管控之间找到平衡,才能赢得更广泛的企业信任。