阿里千问开源Flash模型训练成本降九成,价格不到DeepSeek三分之一

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

国产大模型的价格战又添新弹药。8月26日晚,阿里云发布并同步开源千问最新模型Qwen3.8-Flash,这款总参数1250亿、仅激活60亿参数的MoE模型,性能超越Claude Opus 4.6、接近Opus 4.8,训练成本却较上一代Qwen3.7-Plus骤降近九成。首发定价每百万Token输入仅1元、输出3元,比DeepSeek-V4-Flash的报价再低三分之一,一夜之间把性价比战火烧到了新的高度。

激活仅60亿参数,性能反超Opus 4.6

Qwen3.8-Flash最颠覆认知的地方在于效率。传统观念里,模型性能与参数量成正比,而这款模型用1250亿总参数、60亿激活参数,就打出了超越Claude Opus 4.6、逼近Opus 4.8的前沿性能。这种悬殊的激活比意味着,模型虽然体量庞大,但每次推理只需要动用极小部分的计算资源,推理速度与成本都得到极大优化。阿里方面表示,这创下了模型效率的全球新基准。

架构层面,Qwen3.8-Flash采用了与此前所有千问模型完全不同的设计方案。注意力机制上,它引入自研的QSA稀疏注意力,与Gated DeltaNet高效融合成混合注意力架构,可显著降低计算开销,在高缓存命中的100万Token长上下文实际场景中提速超过8倍。模型内部信息传递方面,自研的Gated Residual方法把传统Transformer的一条信息主通道拆分为四条并行通道,让模型可根据需求动态决定读写,训练更稳定、信息传递更高效。

参数扩展方面同样有新思路。模型外挂了510亿参数的N-gram Embedding,为Transformer参数提供更高效的查表寻址,每次Token计算时无需参与,相当于以极少资源挂载了一个大规模记忆手册,参数扩展效率显著提升。优化器也改为Muon并重新拟合了Scaling Law,单位算力承载的智能密度被推到了新位置。官方数据显示,Qwen3.8-Flash性能与上一代Qwen3.7-Plus接近,但仅用九分之一的资源便完成了训练。

输入1元输出3元,价格战再下一城

比起架构参数,定价对开发者的冲击更直接。Qwen3.8-Flash上线千问AI平台后,每百万Token输入1元、输出3元,比DeepSeek-V4-Flash闲时报价再低三分之一,相比Claude Opus 4.8更是只有四十分之一左右。在国产大模型集体降价的浪潮中,这个价格几乎把前沿模型的调用成本打到了地板价。界面新闻报道称,国产模型正在把比DeepSeek更便宜当成新的前沿竞争赛道。

8月26日晚,这款模型已首发上线千问办公应用,开发者和企业可通过千问AI平台获取API服务。次日,阿里千问办公国际版QwenWork开启公测,海外用户可通过国际官网体验,意味着这款高性价比模型将直接参与全球市场的争夺。生态数据同样亮眼,截至目前Qwen模型全球下载量已突破30亿次,衍生模型数超30万个,全尺寸全模态的全面开源正掀起新一轮中国模型浪潮。

在价格之外,性能的含金量也经得起推敲。Artificial Analysis等第三方评测平台上,Qwen3.8系列的多项指标已进入全球第一梯队。对中小开发者而言,输入1元输出3元的定价意味着过去需要昂贵API预算的复杂应用,如今可以用极低成本跑通;对云厂商而言,单Token成本的大幅下降也为大规模商业化打开了空间。有分析指出,当国产模型把性价比做到这个程度,全球开发者迁移的门槛已经低到几乎没有。

开源即生态,新一代架构为Qwen4探路

Qwen3.8-Flash的发布还有一个隐藏看点,它是新一代千问大模型Qwen4的架构先导。阿里明确表示,Next新架构将是Qwen4的雏形,模型权重已在Hugging Face和魔搭社区全面开源,交由全球开发者检验。这延续了千问一贯的开源路线,从Qwen3.8-Max到27B再到Flash,不同尺寸覆盖不同场景,全尺寸全模态的开源矩阵已经成形。

开源策略带来的生态红利正在显现。Qwen模型全球下载量突破30亿次,衍生模型超过30万个,社区贡献了大量微调版本与行业应用。在Hugging Face等平台,千问系列长期位居下载榜前列,与Llama、DeepSeek等开源阵营正面竞争。此次Flash模型以极低成本实现前沿性能,进一步拉高了开源模型的能力上限,也让全球开发者多了一个高性价比的选择。

对于整个国产大模型行业来说,Qwen3.8-Flash的发布具有示范意义。它证明了一条新路径,不依赖盲目堆参数,而是通过架构创新把单位算力的智能密度做到极致,再用价格优势抢占市场。当训练成本降九成、推理价格打到三分之一成为现实,国产模型的竞争逻辑正在从拼参数规模转向拼工程效率,这对整个产业链的成本结构都会产生深远影响。

千问办公首发上线,AI办公应用加速落地

Qwen3.8-Flash的首发场景选择颇有深意,它没有先上开发者平台,而是率先上线千问办公应用。8月26日晚,千问办公成为首个接入Flash模型的消费级产品,次日阿里千问办公国际版QwenWork开启公测,海外用户可通过国际官网直接体验。这意味着阿里不只是发布一个模型,而是直接把新模型的能力转化为生产力工具,办公场景成为检验Flash模型性价比的第一块试验田。

办公场景与高性价比模型的结合,恰好切中当下企业AI应用的痛点。过去企业对AI办公工具的顾虑主要是成本,调用一次大模型的费用往往高于人工处理,而Flash模型输入1元、输出3元的定价,让大批量文档处理、数据分析、方案生成成为可能。千问办公基于Flash模型推出的智能文档、智能表格等功能,把模型能力嵌入日常工作流,用户无需理解复杂参数,就能享受到低价大模型带来的效率提升。

从生态布局看,千问办公是阿里AI应用矩阵的重要拼图。阿里此前已推出通义千问App、钉钉AI等产品,千问办公聚焦文档与协作场景,与钉钉形成互补。国际版QwenWork的公测,则把这一能力推向海外市场,与Notion AI、Microsoft 365 Copilot等产品正面竞争。低价策略在海外同样具有杀伤力,Flash模型的全球首发定价,可能引发海外AI办公市场的连锁反应。

大模型降价潮下,国产模型的竞争逻辑之变

Qwen3.8-Flash的发布,正值大模型降价潮席卷全球。近一个月内,OpenAI两次降价,最新一款模型输出价格降至每百万Token 20美元;谷歌发布Gemini 3.7 Flash时以前代一半价格作为首发价;Anthropic取消原定涨价计划,把首发优惠价作为永久价格。国产阵营更是把价格战推向极致,智谱GLM-5.3-Flash与千问Flash几乎同时把每百万Token输入价格打到1元。当价格不再是门槛,模型的性价比之争进入白热化。

这种竞争格局对开发者是重大利好。API调用成本的大幅下降,让过去受限于预算的创业团队能够尝试更复杂的AI应用,智能体、多轮对话、长文档处理等场景的落地成本被系统性降低。对于云厂商而言,单Token成本下降打开了规模商业化的空间,低价策略虽然压缩了单次利润,但换来的是更大的调用量和生态粘性,这是典型的以价换量打法。

值得关注的是,降价并未以牺牲性能为代价。Qwen3.8-Flash在性价比之外,性能同样进入全球第一梯队,开源生态的全球下载量、衍生模型数量持续增长。当国产模型在性能、价格、开源三个维度同时发力,全球开发者用脚投票的趋势已经显现。中国大模型的竞争力,正从单点突破走向体系化优势,而这一切的起点,正是像Qwen3.8-Flash这样敢于在架构上彻底革新的新一代模型。

素材来源:新京报、澎湃新闻、天极网、界面新闻 发布时间:2026-08-28