谷歌视频模型直出4K续写40秒,Gemini Omni Flash按秒计费上线

首页 / AI资讯 / AI视频

0:00
0:00
1x
定时

AI视频生成正在从抽卡式创作走向可控的生产管线。8月27日,谷歌发布Gemini Omni 1.1 Flash视频生成模型,最高支持4K输出,首次把视频续写、首尾帧控制、角色一致性等专业剪辑能力整合进单一模型。新模型可分析最多10秒的前置视频上下文,按10秒步长无缝续写场景,累计最长生成40秒视频,并支持指定首尾帧生成平滑转场与运镜。定价按秒阶梯计算,360p预览模式生成速度快60%、成本仅为三分之一,Adobe、Figma、Runway已接入其工作流。

10秒上下文加40秒续写,视频生成变成可控管线

Gemini Omni 1.1 Flash最核心的突破在于上下文理解能力。此前的视频模型通常只能分析生成前的最后1秒画面,导致续写时场景、角色、光线容易出现跳变。新模型把前置上下文扩展到10秒,意味着模型能理解更完整的场景状态和动作逻辑,续写时能够保持视觉连贯性。配合10秒步长的无缝续写机制,用户可以像剪辑一样逐步推进叙事,每次生成前一段视频,再让模型基于前文延续下一段,累计最长可达40秒,远超此前单次生成的时长限制。

角色一致性是另一个关键升级。新模型支持引入最长3秒的参考视频,用于锁定角色的外观特征、服装细节与动作风格,在跨场景、跨镜头生成时维持角色形象稳定。这对广告、短视频、影视预演等专业场景意义重大,过去AI视频最被诟病的角色漂移问题,在这一代模型上得到显著缓解。模型还支持指定首尾帧,用户给定开头和结尾画面,模型自动生成中间的过渡与运镜,实现精准的叙事控制,这已经接近于专业视频编辑软件的创作逻辑。

从技术实现看,这种可控性建立在多模态理解与生成一体化的架构之上。Gemini Omni 1.1 Flash能够同时处理文本指令、图像参考与视频上下文,理解用户的创作意图后统一输出视频内容。谷歌方面强调,模型的训练数据覆盖了电影语言、镜头运动与叙事节奏等专业维度,使其生成的视频不只是画面连贯,还具备基本的镜头感与叙事结构,这正是专业创作者愿意把AI视频纳入工作流的关键前提。

按秒计费四档价格,专业工作流定价逻辑

Gemini Omni 1.1 Flash的定价模式透露出明确的商业化意图。模型按生成时长阶梯计费,360p每秒0.03美元、720p每秒0.1美元、1080p每秒0.15美元、4K每秒0.3美元,四个档位分别对应从快速预览到成品交付的不同阶段。360p预览模式生成速度快60%、成本仅为4K档位的十分之一,这个设计鼓励创作者先用低分辨率快速迭代创意,确定方案后再用高分辨率生成成片,把试错成本降到最低。这种分档定价与影视制作的粗剪、精剪流程高度契合。

Adobe、Figma、Runway的接入,进一步印证了谷歌对专业工作流的定位。Adobe的创意软件生态覆盖设计、视频、特效全流程,Figma是UI设计的主流工具,Runway则是AI视频赛道的头部玩家,这三家机构的接入意味着Gemini Omni 1.1 Flash的能力可以直接嵌入专业创作者的既有工具链,而非要求用户迁移到新平台。谷歌同时开放了AI Studio、Gemini Enterprise Agent Platform和Google Flow三个入口,开发者既可以在网页端快速体验,也可以通过API把视频生成能力集成到自有产品中。

按秒计费的模式也预示着AI视频行业的定价逻辑正在从按次转向按量。可灵、Wan等国产模型此前多以单次生成时长或会员套餐计费,谷歌的按秒计费更接近云计算的资源计价方式,透明度更高,也为不同规模的创作者提供了灵活的成本控制手段。随着API生态成熟,AI视频的生成成本有望进一步走低,专业创作的门槛将被系统性拉低。

从生成到编辑,AI视频竞争维度转向控制力

Gemini Omni 1.1 Flash的发布,标志着AI视频竞争进入了新阶段。过去一年,各家厂商的比拼焦点在画质、分辨率和单次生成时长,如今这些指标已经趋于同质化,竞争维度正在转向控制力与成本结构。能不能续写、能不能锁定角色、能不能指定首尾帧、按秒计费划不划算,这些曾经属于专业剪辑软件的能力,正在成为AI视频模型的分水岭。谷歌把视频生成从生成进化成编辑,正是对这一趋势的准确回应。

对内容创作者而言,这种转变意味着AI视频的可用性大幅提升。过去用AI生成一段符合要求的视频,往往需要多次抽卡碰运气,如今通过上下文续写、参考视频、首尾帧控制,创作者可以在创作过程中逐步引导模型,把随机性转化为可控性。虽然单次最长40秒的时长仍有限,但配合续写机制,已经可以支撑短视频、广告片、产品演示等大量商业场景。当生成变成编辑,AI视频的工具属性越来越强,距离成为专业创作的基础设施,又近了一步。

竞争格局的连锁反应已经显现。谷歌以控制力为卖点切入市场,意味着可灵、Wan、Sora等竞品必须加快补齐编辑能力,单靠画质与时长已经难以建立差异化优势。对视频创作者生态而言,多款具备编辑能力的模型同台竞争,将推动整体创作体验的升级,也加速AI视频从尝鲜工具向生产力工具的转化。

三大入口开放API,开发者生态全面铺开

Gemini Omni 1.1 Flash的落地渠道相当广泛。谷歌在AI Studio、Gemini Enterprise Agent Platform和Google Flow三个平台同步开放了新模型,覆盖从个人开发者到企业级应用的完整链路。AI Studio提供网页端的快速体验与原型验证,开发者可以在几分钟内测试模型的续写、首尾帧与角色一致性能力;Gemini Enterprise Agent Platform面向企业客户,支持将视频生成能力嵌入业务流程自动化;Google Flow则面向内容工作流,帮助团队把AI视频纳入标准化生产管线。三个入口各司其职,构成了从尝试到规模化的完整通道。

对开发者而言,按秒计费的API意味着视频生成成本可以精确测算。一次10秒的720p生成只需1美元,360p预览更是低至0.3美元,这种透明的计费结构让开发者可以根据业务场景灵活选择画质与成本组合。谷歌方面透露,API已开放给通过审批的开发者使用,并将根据反馈持续优化模型能力与定价策略。随着视频生成API的成熟,AI视频有望像文本API一样成为应用开发的基础组件,催生一批围绕视频生成的新应用形态,广告素材批量化、商品展示动态化、个性化内容定制等场景都将迎来新的想象空间。

素材来源:Google官方博客、IT之家、新智元、机器之心 发布时间:2026-08-29