15亿元融资押注原生全模态,智象未来向世界模型再进一步

七颜百科 °C 栏目:行业百科
15亿元融资押注原生全模态,智象未来向世界模型再进一步

  7月23日,智象未来(HiDream.ai)宣布完成15亿元人民币的C轮融资。本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投。老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。

  至此,智象未来近三个月内已完成三轮密集融资,累计融资额超21亿元,正式跻身全球AI视觉生成独角兽行列。值得注意的是,公司治理结构进一步完善。从资本的快速集结到治理结构的系统升级,市场对其率先叩响“多模态大模型第一股”大门的预期,正从猜想转为共识。

  融资背后顶级投资阵容显现,世界模型“独角兽”不是终点

  本次智象未来的C轮融资亮点颇多,除估值外,国家队基金、地方国资、影视产业资本、银行系AIC与市场化创投机构等多方力量同时参与相同主体同一轮融资,这种多元化的资本结构在多模态大模型赛道中极为罕见,充分体现了各方对智象未来技术实力与商业前景的共同认可。

  首先,国家队基金参与本次融资尤为难得。社保基金四川振兴科创基金作为国有长期耐心资本,参与领投智象未来,可以认为体现出国家级基金对人工智能关键核心技术自主创新的持续支持。

  其次,银行系资金的集体入场也值得注意。工银资本是工商银行旗下金融资产投资公司(AIC)体系重要投资平台,在中国基金业协会备案的基金认缴规模超3000亿元,投资策略上坚持“投早、投小、投长期、投硬科技”,公开信息显示,智象未来是工银资本投资的首家大模型企业。加上本轮跟投的交银资本,全国八家金融资产投资公司中已有两家旗下的投资主体出现在智象未来的股东名单上,在大模型赛道的一级市场融资中,这样的AIC投资阵容并不多见。

  在地方资本此次布局中,合肥背景机构表现抢眼,本轮融资中的创云海资本与航源资本,均为注册于安徽合肥的私募股权投资机构。值得注意的是,自2024年智象未来A轮由合肥产投领投、安徽省人工智能母基金入局以来,合肥地方国资背景的产业资本成为支持智象未来发展壮大的重要力量。外界普遍赞同,合肥国资不追求短期财务回报,而是着眼于产业长期发展,培育战略性新兴产业集群——长鑫存储、京东方、蔚来均是这一模式下的标志性成果。科大讯飞之外,智象未来已经成为合肥国资在大模型领域的又一重要布局。

  多家影视产业资本的入局,则反映出内容生产侧对AI基础设施价值的判断。华策影视此前已设立首期5亿元的AIGC专项基金和4亿元的AI视频投资基金,先后投资智谱华章与快手可灵。据了解,华策影视此次战略投资智象未来后,双方将围绕高质量影视语料共建、素材工厂与短剧工厂等新型创制平台、AI影视创作智能体“帧赞”的全流程应用,以及AI影视人才培育四个方向展开深度协同。

  上影股份于今年6月宣布对智象未来进行战略性投资,合作聚焦院线场景创新营销、IP联合开发、技术共建等方向;湖北长江电影集团则早在A轮即已入股,双方已于2025年12月共建“长江电影智象未来影视AI联合实验室”。

  在密集资本加注推动下,仅3个月内,智象未来就完成总额超21亿元的多轮融资,节奏持续提速,资本认可度可见一斑。从其融资路径来看,智象未来A轮至C轮估值阶梯式抬升,C轮仍为二级市场预留充足想象空间。对智象未来而言,此次估值迈入独角兽行列,其资本结构、估值体系与产业协同已全面就绪,具备冲击IPO的全部核心要素,有望冲击“多模态大模型第一股”。

  资本的逻辑是建立在对技术趋势的精准判断之上。

  在当前世界模型(World Models)技术热潮下,智象未来已获得了一张进入下一阶段竞争的门票,成为走向更长远赛道的起点。

  世界模型升温,智象未来从“原生全模态”视觉生成切入

  如果说过去几年人工智能最大的突破来自对文本的理解,那么下一轮突破将来自对现实世界的理解。

  在2026年世界人工智能大会(WAIC)期间,图灵奖得主理查德·萨顿表达了对大语言模型路线的担忧,今天的AI主要是在“使用人类已有的知识,再交还给我们”,而“无法自己发现新知识”。他直言,当前AI“还比较弱且不可靠”。

  与主要依赖文本学习的大语言模型不同,世界模型核心是让AI自主学习、推演真实物理世界的运行逻辑,被业内视作下一代通用人工智能的核心底座。

  全球资本早已提前押注这条前沿赛道,图灵奖得主、前Meta首席科学家杨立昆(Yann LeCun)宣布为世界模型初创公司AMI Labs成功筹集10.3亿美元,“AI教母”李飞飞创立的World Labs融资规模已超过10亿美元。此外,背靠谷歌的Gemini同样在积极押注世界模型领域。

  分析各方世界模型技术探索路线,杨立昆主张AI应在抽象的表征空间中预测输入的缺失或未来部分,而非在像素级重建完整画面,因为人类理解世界的方式靠的是把握概念与动态规律,而非复现画面的每一个像素,相比之下,高维空间逐点生成的模型虽然直观,却计算低效,也难以很好地处理预测中的不确定性。

  李飞飞则认为,仅有语言不足以让AI完整地理解物理世界,AI还需要“空间智能”(Spatial Intelligence),即在三维空间中感知、推理并行动的能力。在她创办的World Labs的构想中,这一方向的落地形态是:以文本、图像、视频乃至360度全景等多模态内容为输入,生成空间一致、高保真且可持续存在的3D建模世界,然而,3D数据获取与高质量标注成本较高,实时生成与大规模动态物理模拟仍需突破。

  尽管全球技术路线多元分化,世界模型的核心在于对环境状态、空间关系、物理规律和行为结果的建模、预测与反馈。但就目前而言,这些投入兑现出的成果,仍主要集中在更逼真的视频和3D生成上。

  智象未来创始人兼CEO梅涛对此有一个“三要素”判断,即表达世界、推演世界、构造世界的能力。在他看来,真正的世界模型必须是全模态,能够任意输入、任意输出,并与物理世界打通。下一代模型架构竞争的关键,不是单一模态能力的叠加,而是要从多模态走向全模态,以原生统一架构,对物理世界进行原生、全模态的统一建模。

  这一判断落到技术路线上,就是智象未来押注的“原生全模态UiT”架构。

  传统图像生成模型通常由多个独立模块拼接而成:图像经VAE(变分自编码器)压缩,文本由独立的文本编码器处理,再交由生成模型完成生成,不同模态之间需要额外的对齐与转换。这带来两个问题:VAE压缩造成高频细节损失,文本与图像分别编码使语义对齐存在固有障碍,制约了跨模态理解的深度与生成一致性。

  智象未来自研的UiT(Unified Transformer)架构则取消了VAE和独立文本编码器,将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号映射进同一个共享Token空间,直接与同一套UiT——像素级统一的Unified Transformer交互,在统一表征系统中完成理解、生成和推理。这一架构有效规避了前述模块化架构的固有局限,可以稳定迭代的同时,在多个真实应用场景中展现出稳定可靠、高效运行且易于落地的综合优势。

  回顾智象未来的模型发展迭代路径:2023年9月,智象未来发布60亿参数的视觉多模态生成大模型;2026年4月,HiDream-O1-Image(8B参数开源版本)以‘Peanut’匿名上榜全球知名独立 AI 模型评测平台 Artificial Analysis、并登顶文生图榜单开源模型第一,成为榜单前20名模型中参数最小的版本。随后,商用版 HiDream-O1-Image-1.5 再次成为该榜单排名最高的中国图像模型,位列全球前三,在光影、复杂构图、指令跟随和中英文字渲染上表现突出。这也是原生全模态架构第一次从‘技术验证’走到‘生产验证’。 

  榜单截图时间为2026年6月22日

  从视觉生成走向世界模型,梅涛认为,其内在逻辑在于,图像是世界建模的空间基底,定格了现实世界某一瞬时时刻的完整状态信息,视频呈现状态随时间发生的变化,动作数据则进一步描述智能体如何介入和改变环境。三者结合之后,模型才有可能从复现世界进一步走向预测世界。因此,图像并非独立于视频之外的单点能力,而是通向原生全模态世界模型的关键入口。

  最终,将智象未来的技术选择置于全球世界模型架构演进背景下,更有助于理解资本此时的布局逻辑。随着图像和视频生成模型的能力逐渐趋同,仅靠扩大参数、堆叠数据和延长视频时长,已难以持续形成差异化优势。下一阶段的竞争重心,已转向文本、图像、视频与动作的统一理解与建模,以智象未来为代表的“原生全模态”视觉生成架构,正是资本当前重点押注并看好的核心方向。

  更现实的商业化图景

  世界模型的长期叙事外,智象未来的商业化图景,是其同时获得多类产业资本认可的更现实原因。

  目前,智象未来已构建起“1+1+3”的商业化架构:以HiDream系列大模型为技术底座,通过Token Hub平台对外输出标准化模型能力,并在此基础上切入商业营销、影视创作、内容创作三大核心场景。

  在AIGC商业营销领域,打造了线上跨境电商短视频营销平台——HiBurst,解决商家营销创意不足、素材生产效率低、跨平台适配成本高等难题,目前,HiBurst已成为TikTok前五大AI合作伙伴。

  在AIGC影视创作领域,智象未来推出专业级AI影视创作协作智能体“帧赞”,以电影级画质生成能力和“创意—分镜—成片”的全流程打通为核心特点。目前智象已累计制作短漫剧超过5000分钟,平台入驻专业团队与生态合作伙伴近千家,并与湖北长江电影集团、慈文传媒、华视网聚等头部影视机构达成战略合作。

  在AIGC内容创作领域,智象未来面向专业创作者推出一站式AI Agent工具vivago。今年5月,vivago在全球顶级科技产品首发平台、美国硅谷产品风向标Product Hunt上,位列日榜第一。在刚刚结束的WAIC 2026大会上,智象发布了新一代产品vivago R1。与仅能生成单一素材的AI工具不同,vivago R1能够自主规划、调度并执行长链路创作任务,支持不限时长的视频生成与编辑,并通过长任务推理保持内容逻辑与叙事连贯,以更高的生成稳定性满足商业化、规模化交付需求。

  据悉,智象的产品服务范围已经覆盖全球100多个国家和地区,拥有超过4万家企业客户以及超过5000万OPC用户。

  完成股改后,市场开始关注智象未来登陆资本市场的可能性,相较于短期 IPO 预期,一个更为核心的观察标尺,是企业能否依托新增资本,构建起技术迭代、产品落地与营收增长三位一体的可持续增长飞轮。

  对于智象未来而言,从视觉内容生成进阶至世界模型前沿探索,企业的生存逻辑将随之重构:竞争已不再局限于模型参数和生成效果,面对其他公司在资金、人才、产品和生态方面的投入,智象未来必须坚守核心技术主线,同时证明自身具备差异化优势,以更高落地效率打通垂直行业场景。

  C轮融资是智象未来冲击新阶段竞争的底气,也意味着企业将迎来更严格的市场检验:技术路线能否持续领先、商业化能否形成闭环、组织能力能否跟上业务扩张,将决定其能否从独角兽,蜕变为原生全模态世界模型的标杆性企业。

  本文内容仅供参考,不作为投资建议。