2026年7月,多模态AI企业智象未来宣布完成15亿元C轮融资。算上此前两轮,这家公司在短短三个月内累计融资突破21亿元,估值超过10亿美元,正式跻身独角兽行列。这轮融资的资方名单引起了业界的广泛关注:不仅有社保基金和工银资本的首次入场,还有合肥地方产投的持续加码,以及华策影视、上影集团等影视产业资本的身影。三类资本,国家背景资金、地方政府平台和产业资本,同时押注同一家企业,在AI赛道上并不多见。
智象未来的快速崛起,折射出AI视觉赛道投融资格局正在发生深刻的变化。
过去一年,资本市场对AI的投资逻辑发生了显著转向。此前,资金重心集中在大语言模型领域,企业靠参数规模和榜单成绩获取估值溢价。但随着开源文本模型的大量涌现和性能趋同,单纯堆叠参数的天花板开始显现,资本预期持续降温。与此同时,AI视觉赛道在2026年迎来了资本的集中爆发期,全年融资规模已逼近300亿元。
智象未来能够在众多视觉AI企业中脱颖而出,关键在于其选择了与众不同的技术路线。当大多数同行采用"LLM主干+外挂视觉模块"的缝合式方案时,智象未来从底层自研了原生全模态UiT架构。像素、文本、音频、动作、空间信号共用一套Transformer网络,统一分词编码,无需中间转换介质。这种路线的优势在于:模态之间不存在信息损耗,每一次从文字到图像或视频的转换,都是在统一的语义空间中完成的。
从投资机构的视角来看,这种架构选择对应的判断是:多模态AI的未来不是把多个单模态模型拼在一起,而是在架构层面实现模态的原生融合。后者虽然在研发投入上更大、周期更长,但构建的技术壁垒也更高。
理解UiT架构的价值,需要先看一个"合生式多模态"方案常见的痛点。在传统的多模态模型中,各个模态的处理是分开的,图像由视觉编码器处理,文本由语言模型处理,音频由声学模型处理,最终通过一个"融合层"将不同模态的信息拼接在一起。这种方案的问题在于,每一次拼接都会造成信息损失:视觉Token和文本Token的对齐依赖于一个轻量级的注意力模块,当模态数量增加时,融合的复杂度呈指数级上升。
UiT架构的不同之处在于,所有模态的数据从一开始就共用同一套Token化体系和Transformer网络。模型学习的是像素、字符、声波、动作背后的统一语义表征,而非不同模态数据的"翻译"。智象未来的开源8B模型HiDream-O1-Peanut在海外文生图开源榜单登顶,商用版本在全球排名前三,在光影渲染、中英文字渲染和复杂构图等指标上具备明显优势。
技术能力的落地最终体现在产品层面。智象未来的核心产品Vivago R1被行业称为"视频领域的Claude Code",它采用了一个与众不同的策略:先整体规划镜头脚本,再分段生成视频内容。这种"先想清楚再执行"的架构,使得单个任务中的局部失败可以独立重试,而不需要重新生成整段视频。
在实际商用中,Vivago R1的有效生成率达到了85%,这意味着用户发起的大部分视频创作任务都能一次成功,而非反复抽卡。智象未来构建了"底座-中台-垂直产品"的三级商业化体系,底层是HiDream全模态大模型,中层是HiHarness企业中台,顶层是Vivago R1多模态创作智能体。这种分层架构使得不同规模的企业客户可以根据自身需求选择不同的接入深度,从直接使用产品到在底座模型上进行定制开发均可。
Vivago R1的海外版本已经覆盖超过100个国家,累计用户超过5000万,并登顶Product Hunt榜单。这个数据证明,在AI视频生成这样一个被普遍认为"中国尚未超越海外"的赛道上,中国企业的技术产品同样可以在全球范围内获得认可。
智象未来的案例将AI视频赛道的竞争态势清晰地摆在了桌面上:这不再是一个"几家初创公司比拼技术参数"的早期市场,而是进入了一个资本密集、技术分化的新阶段。2026年上半年,可灵AI拿下30亿美元融资,爱诗科技融资29.8亿元,八点八数字近亿元……资金正在向头部企业加速聚集。对于尚未完成规模化收入验证的AI视频企业来说,融资能力与产品能力同样重要。
与此同时,技术路线的分化也在加速。智象未来走的是原生全模态路线,Runway走的是世界模型路线,Flux走的是扩散模型统一路线。不同的技术选择决定了不同的能力边界和商业化路径。在资本和技术的双重驱动下,AI视频赛道的竞争格局正在快速成型,2026年下半年将是决定头部座次的关键窗口期。
从行业影响来看,智象未来的快速崛起验证了一个重要的投资逻辑:在AI赛道的资本密集期,拥有独特技术路线选择和清晰商业化路径的企业将在融资竞争中占据显著优势。UiT架构选择了一个"难而正确"的方向,从底层重构多模态架构。这种选择短期内增加了研发投入,但长期构建了竞争对手难以复制的技术壁垒。对于其他AI视频赛道的创业公司来说,这是一个重要的参考。