阿里发布Happy Shrimp 1.1,音乐生成开始比谁唱得更像真人

首页 / AI资讯 / AI音乐

0:00
0:00
1x
定时

AI音乐在过去两年完成了从能唱到能听的基本跨越,一句话生成一首结构完整的歌已经不难。真正的差距出现在细节上:换气的位置、情绪的起伏、副歌推上去那一下的力度。9月22日的云栖大会上,阿里发布音乐生成模型Happy Shrimp 1.1,把升级重点放在了这些不易量化的地方。

四个专业维度,指向的是主观听感

按官方披露,Happy Shrimp 1.1在音乐表现、人声质量、多语种演唱与指令理解四个专业维度进一步提升。这四个维度恰好对应AI音乐长期被诟病的四个问题:编曲平均、人声发闷、外语唱不准、听不懂复杂要求。

音乐表现指向的是整体审美。很多音乐生成模型能输出旋律完整、节奏规整的作品,但听起来像一份合格的作业,缺少停顿、留白与情绪起伏。人声质量指向的是音色与气息的真实度,这是AI歌曲最容易被听出来的破绽,尤其在慢歌与清唱段落。

多语种演唱与指令理解则关系到可用性。支持十余种主流语言,意味着模型需要处理不同语言的音素体系与韵律习惯,而不只是把歌词音译过去。指令理解决定创作者能不能用自然语言描述想要的效果,例如指定某一段的情绪走向或某种乐器在前奏中突出。

覆盖范围上,模型支持百余种曲风与十余种主流语言,同时覆盖人声歌曲与纯音乐两大生成场景。曲风数量的意义在于覆盖面,纯音乐场景的意义在于实用性:短视频配乐、广告背景、播客片头这类需求并不需要人声,但对情绪匹配度的要求很高。

两个技术方向:审美建模与知识融合

官方给出的技术路径有两个重点。一是音乐审美建模与强化学习,二是世界知识与音乐领域知识的融合。前者解决的是机器怎么判断一首歌好不好听,后者解决的是模型懂不懂音乐之外的内容。

审美建模是AI音乐里最难量化的一环。自动评测指标能测旋律是否规整、和声是否合规,却测不出作品是否有记忆点。把人的主观判断转化为可优化的奖励信号,需要构建可靠的评价体系,并把它接入强化学习的训练循环。这条路与图像生成领域近一年流行的审美对齐思路一致,难点都在评价器的稳定性。

知识融合则对应内容层面的准确性。歌词里涉及地名、历史、乐器名称或专业术语时,模型需要调用音乐领域之外的知识;反过来,音乐领域知识能让模型理解某种曲风的典型编配方式,而不是把风格标签简单理解为音色滤镜。两套知识结合,才可能让生成的歌曲在内容与形式上都站得住。

这类升级很难用单一分数证明。与图像或视频模型不同,音乐的评价高度依赖听感,不同听众的偏好差异也更大。厂商通常会用盲测对比作为证据,但公开可查的第三方评测仍然稀少,这也是判断实际水平时需要留意的地方。

同一天发布的,还有一整条多模态产线

把这次发布放回当天的整体动作里,会看到更清晰的意图。同场亮相的还有面向电商、创意与设计场景优化升级的图像生成模型Qwen-Image-3.1,官方称把原本数小时的视觉设计压缩到秒级交付;世界模型最新版本HappyOyster 2.0 Preview提升了实时交互、记忆、实时响应与物理规律遵循等能力;语音模型家族Qwen-Audio-3.1全面升级,新增音频理解与音频创作两个版本。

此外,同声传译模型Qwen3.8-LiveTranslate首次登场,官方称字均延迟从2.8秒降到2.3秒,而人类同传平均时延在4秒以上。下一代视频生成模型则预告将于11月发布,方向是更长、更可控、更完整、更智能。音乐、图像、视频、语音、世界模型五条线在同一天更新,指向的是同一个目标:把生成能力做成一套可组合的工具集。

阿里技术副总裁郑波在演讲中给出一个更远的判断:三年之内,行业可能出现原生的全模态统一生成模型,能同时生成图像、视频与音乐,也能理解空间与世界。这个判断的隐含前提是,各模态的生成能力已经接近可对齐的程度,剩下的工作是把它们装进同一套表征里。

从生态数据看,这套策略已有一定基础。阿里已开源460余个Qwen系列模型,下载量突破30亿次,衍生模型超过30万个;其中Qwen3.8-27B在Hugging Face上成为该平台历史上最受欢迎的开源大模型。

AI音乐真正的门槛在版权与分发

技术之外,AI音乐的落地更受另外两件事制约。第一件是训练数据的合法性。过去一年,多起版权诉讼让主流平台转向与唱片公司签署授权协议,用授权曲库重建训练集。没有清晰的授权链条,音乐生成产品很难进入商业发行渠道,因为品牌方与平台方都不愿意承接法律风险。

第二件是分发环节的规则。国内平台已经要求上传AI歌曲时勾选相应标识,并叠加音频指纹水印,形成显性与机器可读的双重标识;收益分配上,AI歌曲与真人原创之间也存在明显差距。这些规则决定了AI音乐能否成为一条可持续的收入来源,而不只是创作工具。

回到模型本身,Happy Shrimp 1.1的升级方向说明竞争焦点已经从能不能生成转向生成得像不像。这个转向对创作者更友好,因为工具的质量差异会体现在最终作品的完成度上,而不只是演示视频里。但要真正进入主流音乐产业的制作与发行流程,模型能力只是其中一环,授权链条与分发规则的成熟度同样关键。

素材来源:新浪科技、科创板日报、浙商杂志、网易科技 发布时间:2026-09-23