腾讯混元发布Hunyuan3D-Buffalo,一个模型统一3D理解生成与编辑

首页 / AI资讯 / AI建模

0:00
0:00
1x
定时

3D内容生产长期被"多模态数据稀缺"卡住脖子,尤其缺乏几何一致的编辑数据,导致生成、理解、编辑各环节各自为战。8月20日,腾讯混元发布Hunyuan3D-Buffalo 1.0,给出了一套"统一"的解法:在单一架构中同时支持三维物体理解、文本生成三维模型、指令引导的三维编辑与文本锚定的部件提取四项任务,不再需要为每个任务单独搭建系统。为了支撑训练,团队构建了8700万规模的3D多模态语料库,其中包含2500万理解样本。在Edit3D-Bench评测中,Hunyuan3D-Buffalo的平均几何误差较此前最优方法下降86.7%;在文本到三维的人类偏好评测中,模型以56.6%的总体偏好率大幅领先,是排名第二的Omni123的三倍还多。设计师用自然语言直接修改3D模型的时代,正在加速到来。

四项任务一套架构,3D世界迎来统一模型

过去的3D AI,本质上是一个任务一个模型:文本生成3D有专门的生成模型,3D理解有专门的识别模型,3D编辑又有另一套系统,任务之间数据不互通、能力不复用,工程整合成本极高。Hunyuan3D-Buffalo的突破在于"统一":把三维理解、文本生成三维、指令编辑三维、部件提取四类任务放进同一个架构,共享同一套三维语义空间。用户既可以用文字生成一个3D模型,也可以指着模型说"把头换成鸡头",还能按文字提取模型的某个部件,全程无需切换工具。

统一架构带来的直接收益,是能力之间的相互增强。论文中最有意思的发现是:编辑能力某种程度上是"借"出来的。团队做了一个朴素实验,只往文本生成任务的训练数据里增加1000条"鸡"的样本,完全没有增加任何编辑数据,结果模型原本做不好的"把头换成鸡头"指令突然就能用了。这说明编辑模型并非独立学会了画鸡头,而是直接挪用了生成模型已掌握的知识。这一发现给工程决策带来重要启示:编辑数据的构建成本远高于生成数据,与其死磕昂贵的编辑数据,不如先把便宜的生成数据做全。

在理解侧,团队还对比了CLIP与3D-VLM两种视觉理解方案。实验显示,采用3D-VLM版本后,平均CD(倒角距离)从0.0158降至0.0091,F1从0.6336提升至0.6515,说明专门为三维设计的理解模型,确实比通用的图文理解模型更懂得如何定位编辑区域、如何解读指令。这种"三维专属理解"的价值,在复杂编辑指令下体现得尤为明显,也为统一模型的后续迭代指明了方向。

8700万样本语料库,训练数据的规模效应

Hunyuan3D-Buffalo的另一个关键变量,是数据规模。团队构建了8700万规模的3D多模态语料库,包含2500万理解样本,这一规模在3D领域属于顶级水准。论文中的消融实验清晰展示了数据规模的效果:用300万样本预训练的模型,人类评测总体偏好率仅8.4%;提升到1500万样本后,偏好率升至28.6%;当训练样本达到5000万时,偏好率飙升至57.5%,接近随机基线33.3%的两倍。数据规模的每一次跃升,都带来能力的阶跃式增长,这印证了3D模型同样遵循"规模法则"。

在编辑数据生产上,团队推出了自动化流水线Nano3D-v2,解决了此前编辑数据难以规模化生产、质量参差不齐的问题。该流水线通过锚点视角选择、编辑区域精确定位、体素编辑、精细几何纹理修补、基于视觉语言模型的质量过滤五个阶段,最终生产出1200万条编辑数据对。这一环节的突破意义重大:3D编辑数据的人工标注成本极高,自动化流水线的成熟,让"高质量编辑数据"从稀缺资源变成可批量生产的资产,为模型能力的持续提升提供了燃料。

人类评测的结果进一步验证了模型的实际体验。团队找来100条覆盖各种物体类别与描述长度的提示词,让四个模型匿名对比,参与者从文本对齐度、几何质量、总体偏好三个维度评分。Hunyuan3D-Buffalo在三个维度上分别拿到55.2%、57.1%、56.6%的偏好率,远超TRELLIS、Universe3D、Omni123等竞品。更关键的是,这一优势在每个参与者身上都保持一致,同时适用于短标签式提示词与长篇细致描述,说明模型的领先并非靠特定子集支撑,而是普适的。

从3D资产到工业设计,统一模型的价值落点

统一模型对3D内容生产流程的重构,是Hunyuan3D-Buffalo最直接的产业价值。游戏、影视、工业设计是3D资产消耗大户,传统工作流中,建模、贴图、修改、拆分各环节依赖不同的专业软件与人力,一个模型资产从创建到定稿往往需要数周。Hunyuan3D-Buffalo让设计师可以用自然语言直接编辑3D模型,无需手动操作建模软件,"生成、修改、拆件"一条链路完成,3D资产制作的门槛与成本大幅降低,为中小团队与个人创作者打开了3D创作的大门。

在工业场景,指令编辑与部件提取能力尤为实用。产品设计中的局部修改,例如调整某个零件的形状、更换外壳材质、提取特定结构件,都可以通过自然语言指令完成;结合文本锚定的部件提取,设计师可以从一个复杂装配体中快速分离出需要的组件,用于后续的制造与仿真。腾讯混元3D系列此前已在工业设计、潮玩、文物复原、实体制造等场景落地,Hunyuan3D-Buffalo的发布,进一步补齐了"理解与编辑"这一关键环节,让3D AI从"能生成"走向"能干活"。

从行业格局看,Hunyuan3D-Buffalo让国产3D大模型的竞争进入新阶段。此前,VAST、影眸科技、Meshy等厂商在3D生成上各有所长,而腾讯选择了一条更重、更难的路:统一理解、生成、编辑与部件提取,构建全栈能力。论文与模型的开源(项目已公开技术报告),也让学界与开发者能够复现与改进这一路线。当3D世界迎来"统一模型时刻",生成式3D技术的商业化进程,有望像大语言模型一样迎来加速拐点。

素材来源:腾讯云、至顶科技、量子位、机器之心 发布时间:2026-08-21