阿里上线Qwen3.8-Omni-Flash,百万上下文把音视频成本砍掉93%

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

9月18日,阿里千问团队上线Qwen3.8-Omni-Flash,把全模态能力从能看能听推进到能干活。这是一个原生全模态模型,文本、图像、音频、视频四类输入走同一套表征,上下文窗口拉到100万token,并支持智能体式工具调用。官方给出的对比数据是,在30项评测上相对上一代平均提升约26%。更值得关注的是价格:音视频输入的调用成本降幅超过93%,把长音视频理解从演示级能力拉到了可批量调用的位置。

原生全模态不是拼装:一套表征吃下四种输入

全模态这个词被用得太多,多数产品其实是把语音识别、图像编码和语言模型串成流水线,模态之间的信息在转换环节被反复压缩。Qwen3.8-Omni-Flash的做法是原生统一:文本、图像、音频、视频在进入主干网络前就映射到共享表征空间,由同一个模型完成理解与生成,不再依赖外挂的专用模块。这样做的直接好处是跨模态推理不需要经过文本中转,视频里的画面变化和同期声可以被放在同一段上下文里对齐。

100万token的上下文窗口是这套架构的放大器。一段两小时的会议录像、一份带图表的百页报告、一段多语言访谈,都可以一次性投喂,模型在同一上下文里完成检索、比对和归纳。官方披露的WildClawBench-MM得分71.0,DER指标从88.11降到3.35,后者衡量的是音视频任务中的错误累积。指标改善的背后,是长序列里信息不再需要反复切片和拼接,早期出现的判断错误不会一路传导到最后。

原生统一的另一层含义是训练目标的一致性。文本理解、图像生成与音频处理共用同一套主干参数,梯度在多任务之间共享,模型不需要在编码器特征与生成潜变量之间反复转换。这在工程上减少了模块拼接带来的信息损耗,也让跨模态能力的迁移更自然。

成本降93%意味着什么:长音视频从试点变成日常

音视频输入成本下降超过93%,是这次发布里最具产业含义的一项。在此之前,长音视频理解的瓶颈不在模型能力,而在调用账单:一段一小时的素材按token折算下来,成本足以让绝大多数团队放弃批量处理。成本降一个数量级之后,内容审核、会议纪要、课程切片、客服质检、影视素材归档这些高频场景,才第一次具备了用全模态模型跑全量的经济性。

阿里同时给出了配套的开源插件与运行框架,让模型能直接接入已有的智能体工作流。这个动作的指向很明确:不满足于做一个可以对话的全模态模型,而是要把音视频能力塞进自动化流程里。对开发者来说,真正稀缺的从来不是单次对话的效果,而是能稳定跑在生产线上的调用方式和可预测的成本结构。价格下探和框架开源同时到位,才算把这条路铺通。

配套的评测也覆盖了工具调用类任务。官方公布的WildClawBench-MM得分与DER指标,衡量的都是长序列下多步操作的稳定性,而不是单轮问答的准确率。这说明它的设计目标从一开始就偏向智能体场景,而不是做一个更强的聊天模型。

同一天的另一条线:FBI指控与美国联邦公报下架集成

Qwen3.8-Omni-Flash上线的时间点,恰好撞上一场风波。据报道,美国联邦调查局指控阿里以不当方式复制Anthropic的模型,随后美国联邦公报网站悄然移除了其Qwen搜索集成。指控的具体内容与证据并未完整公开,阿里方面也没有给出逐条回应,但这已经不是国产开源模型第一次在海外遭遇合规层面的阻力。

把技术发布和政治争议分开看,会更清楚当下的格局。9月这一个月里,国产模型的发版密度明显抬升:中电信开源星辰Xing4.0-29B-A4B,智谱上线GLM-5.3-FlashX,上海人工智能实验室发布Atria Dawn Preview。多家机构的产品节奏从季度压缩到月甚至周,开源权重成为默认选项。对海外开发者而言,用不用某个模型,最终取决于性价比和许可证条款,而不是指控本身。这也解释了为什么争议声越大,下载量反而越难被压住。

争议对下载量的实际影响有限。开发者选择模型时,判断依据主要是能力、价格与许可证条款,政治层面的指控很难直接改变技术选型。阿里选择在争议同一天发布产品,本身也说明它把重心放在能力与成本这两个可量化的维度上。

百万上下文之后:竞争焦点转向单位任务成本

上下文长度在过去两年是硬指标,从8K到128K再到1M,数字增长带来的体验改善肉眼可见。但当百万上下文成为第一梯队的标配,这个指标本身的区分度就在下降。真正拉开差距的,是完成同一个任务需要调用多少次、消耗多少token、失败后重试的成本有多高。官方给出的成本下探幅度,本质上是在回答这个问题,而不是在炫耀窗口长度。

对国内厂商来说,这条路径还有一个额外价值。全模态能力与长上下文结合后,最直接受益的是中文语境的音视频场景:方言访谈、带字幕的短剧、会议录像、直播回放,这些素材的体量远大于英文公开数据集,此前因为成本问题长期躺在硬盘里。当处理单价降下来,这批沉睡数据的价值才会被释放出来。下一个阶段比的不是谁的模型更大,而是谁能把单位任务成本压得更低、把长尾场景吃得更干净。

另一个被低估的变化在数据侧。当处理单价下降到原来的十几分之一,此前因为成本过高而无人问津的长尾素材会重新进入视野:地方方言访谈、垂直行业的内部培训录像、带字幕的短剧全集。这批素材的体量远大于公开数据集,谁先跑通处理流程,谁就能积累起别人没有的领域语料。

素材来源:千问云官方发布记录、DAMO开发者矩阵、AI/TLDR、AI Briefing 发布时间:2026-09-20