VR技术有潜力带来引人入胜的沉浸式体验,但其内容的创建,尤其是3D资产的设计和制作,通常需要专业的建模技能。这使得绝大多数普通用户无法参与到3D内容的创作过程中,VR内容的丰富性和个性化也因此受到限制。现有的AI生成工具虽然能够根据文字或图片生成3D模型,但它们通常采用一次性指令模式,缺乏与用户深入沟通、理解其意图并进行迭代设计的交互过程。针对这一痛点,一支研究团队开发了一个名为CoGen3D的系统。这是一套人机协同设计管道,旨在让没有专业背景的普通用户也能通过自然对话,为VR场景设计并部署3D资产。其核心设计理念是将对话作为创作过程的核心,引导用户逐步明确想法,而不是仅仅依赖一次性的指令输入。系统的最终目标是要打破3D内容创作的专业壁垒,让更多不具备技术技能的人也能参与到元宇宙和VR世界的内容建设中。
CoGen3D的核心交互模式是与AI代理的对话。当用户第一次启动系统时面对的是一个空白界面和一段友好的问候语。AI代理会主动提问:你想为怎样的场景创作物体?应该是暖色调还是冷色调?你希望物体的风格偏向现代简约还是复古精致?这种主动引导式的对话设计解决了普通人在面对空白创作页面时不知道从何开始的困境。研究团队在用户实验中观察到,多数没有3D建模经验的参与者在没有引导的情况下会陷入不知道该做什么的迷茫状态,但在CoGen3D的对话模式下平均只需要3到4轮问答就能明确自己的设计方向。这种交互方式大幅降低了创作的心理门槛。对话结束后AI代理会自动生成一份结构化的设计需求文档,包含物体类型、风格、尺寸、颜色等多个维度的参数,作为后续生成步骤的输入。
CoGen3D的工作流程分为三个主要阶段,每个阶段都有明确的目标和输出。第一个阶段是对话引导。用户首先与一个由大语言模型驱动的智能代理进行对话。代理会主动提出一系列关于物体类型、风格、颜色、以及与VR环境协调性的问题,帮助用户梳理和明确自己的设计意图。比如用户说想要一个放在客厅里的桌子,代理会追问想要什么风格的桌子、什么颜色的桌面、木质的还是金属的等细节。这种主动引导式的对话设计,解决了普通人面对空白创作页面时的"不知道从何开始"的困境。第二个阶段是概念确认。根据对话中收集到的信息,系统会生成一张2D概念图让用户预览并确认。用户如果不满意,可以继续与代理交流修改,直到满意为止。这个环节的优点在于速度很快,允许用户快速迭代想法。从研究团队的测试数据来看,用户平均需要3到4轮对话修改就能得到满意的概念图。第三个阶段是3D生成与部署。在用户确认概念图后,系统才会启动计算量更大的图像转3D过程,最终生成一个带纹理的3D模型并直接放入基于Unity引擎的VR场景中供用户查看和操作。这种分阶段的设计策略非常巧妙,它将最耗计算资源的3D生成步骤放在最后,避免了反复生成带来的计算浪费。
为了验证CoGen3D的实际效果,研究团队组织了一项有120人参与的大规模用户研究。研究团队使用了六个情感氛围各不相同的VR场景进行实验,包括温馨的小狗房间、压抑的单独监禁牢房、开阔的大象草原等。其中60名参与者使用CoGen3D为这些场景设计资产,另外60名参与者则在VR中体验和评估这些生成的资产。研究结果揭示了一系列有价值的发现。从系统有效性来看,CoGen3D能有效帮助非专业用户将想法转化为可用的VR资产。用户反馈显示,与代理的对话确实有助于他们理清思路、激发灵感。许多参与者在实验后的访谈中表示,这种对话式的创作方式比自己凭空想更有方向感。在质量方面,用户普遍对2D概念图的质量表示满意,但对最终生成的3D模型质量评价相对较低。这表明图像转3D阶段仍然是当前技术的一个主要瓶颈。从2D概念图到3D模型的转换过程中,模型的纹理细节会有不同程度的丢失,几何结构有时也会出现失真。另一个有趣的发现是,不同情感氛围的场景对用户的创作偏好产生了影响。在温馨场景中,用户倾向于选择暖色调和圆润的物体造型。在压抑场景中,用户则更多选择冷色调和尖锐线条的设计。这表明用户的设计意图确实受到了场景氛围的影响,也验证了对话引导对于捕捉用户微妙设计意图的必要性。
CoGen3D的研究成果为AI 3D内容的民主化开辟了一条新的技术路径。此前行业对AI 3D的关注主要集中在生成质量本身,如何让AI生成的模型更精致、更逼真。但CoGen3D提出了另一个重要的维度:如何让AI理解用户的设计意图,并通过交互式对话辅助用户完成创作。这是从工具到伙伴的角色转变。从行业应用前景来看,CoGen3D的技术思路对于游戏开发、虚拟社交、在线教育、建筑设计等领域都具有潜在的应用价值。在游戏中,玩家可以用自然语言为自己创建个性化的虚拟形象和道具。在虚拟社交中,用户可以轻松装饰自己的虚拟空间。在在线教育中,教师可以为课程快速创建教学用的3D模型。但CoGen3D从学术成果走向工业化应用还需要克服几个挑战。首先是3D生成质量的问题,当前的图像转3D模型在纹理细节和几何精度上还有提升空间。其次是实时性问题,完整的3D生成流程目前还需要数分钟的处理时间,对于需要即时反馈的交互场景来说还有延迟。最后是规模化部署的问题,大语言模型驱动的对话代理和3D生成模型都需要较大的计算资源。研究团队表示将继续优化3D生成模型的质量和速度,并将探索更高效的推理策略来降低部署成本。