深度|三个月连融21亿,智象未来凭何闯入AI独角兽俱乐部?
01 三个月连融21亿:智象未来跻身全球AI独角兽
Z Potentials获悉,多模态模型公司智象未来(HiDream.ai)宣布完成 15亿元人民币C轮融资。
本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投。老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。
近三个月内,智象未来已连续完成三轮融资,累计融资金额超过21亿元,投后估值突破10亿美元,正式迈入全球AI独角兽行列 。
作为国有长期耐心资本,社保基金四川振兴科创基金参与领投智象未来,体现了长期资本对人工智能关键核心技术自主创新的持续支持。借助其资源与生态协同优势,智象未来将进一步推进原生全模态世界模型的技术攻关,加快前沿技术向产业应用转化。
同时,上影股份、华策影视等产业资本的加入,智象未来的生成式 AI 技术正加速走向影视制作、商业营销与内容创作等真实生产场景,打通从模型研发到商业订单的关键商业化闭环。
新一轮融资对智象未来的意义,不只是补充资金,更在于为其后续的模型研发、产品迭代、商业化落地和产业协同提供更系统的资源支撑。在技术底层,长期资本的注入将直接转化成原生全模态大模型研发与顶尖人才竞争力的加码,为图像与视频生成技术的持续迭代奠定坚实底座。
我们从企查查了解到,智象未来已经完成了股改,正式更名为智象未来(合肥)科技股份有限公司,本次股改完成为进一步对接资本市场做好充分准备,进一步完善了公司治理结构。
从连续融资、产业资本布局,到持续提升的估值体系,智象未来正在完成从多模态大模型到世界模型的跃迁,其IPO路径也逐渐清晰。
02 从榜单第一到无限时长,技术如何拉开代差
资本与产业资源为智象未来下一阶段的发展提供了支撑,但决定一家大模型公司长期竞争力的,归根结底仍是底层技术能力。随着多模态模型竞争不断深入,行业关注点正从单一的图像生成效果,转向对文本、图像、视频等多模态信息的统一理解与生成,以及对空间关系和真实世界规律的进一步建模。
智象未来推出的 HiDream-O1-Image-Pro 参数规模超过 200B,在复杂空间关系理解、指令遵循和高质量图像生成等方面表现突出。
在 Artificial Analysis 榜单中,智象未来的开源图像模型HiDream-O1-Image-1.5位列全球第一;闭源模型排名全球第三、中国第一,超过字节跳动 Seedream 4.0,证明其不仅具备模型研发能力,也已在全球顶尖模型竞争中占据一席之地。
此外,依托多智能体协同与AgentOS核心技术积累,智象未来在WAIC 2026现场正式发布全球首个无限时长创作智能体——vivago R1。针对行业长期存在的时长受限、逻辑混乱与成片率低三大痛点,vivago R1凭藉“无限时长适配、长任务逻辑思考、高稳定商业交付”三大核心优势,彻底打破了主流产品 15-30 秒的局限,它将“理解任务、构思故事线、生成分镜到长视频输出”的复杂链路进行原子化封装与专业调度,实现了成片可用率高达 85% 的突破,真正将 AI 从单一的工具升级为可商业化交付的闭环产品。
vivago R1生成的视频
智象未来对技术路线的探索,是一场长达数年的预判与深耕。早在2017年,团队便已切入文生视频的前沿研究,并在2024年,智象未来完成了 DiT(Diffusion Transformer)技术路线的产品化验证,时间早于 Sora 正式向公众开放使用。
此外,智象未来很早就意识到,未来的多模态模型不能长期依赖多个单模态模型的拼接。因此,公司选择了一条更具挑战性的技术路线——原生全模态统一架构 UiT(Unified Transformer)。
智象未来创始人梅涛认为,当前多数所谓“多模态大模型”,本质上仍是不同单模态模型的组合:图像、文本、视频和音频分别由不同编码器处理,再在高层进行特征对齐或能力拼接。“这种方式能够较快扩展模态,但不同模态之间仍存在表征壁垒,难以形成对真实世界统一而连续的理解。”UiT 的核心思路,正是从底层打破这种模态割裂。它弱化 VAE、独立文本编码器等模块之间的边界,将图像像素、文本 Token、视频体素,以及音频、动作和空间关系等原始信号统一映射到同一个共享 Token 空间,再交由同一套像素级统一 Transformer 进行处理。
这一技术路线背后的判断是:真正的多模态大模型,不应只是多个能力模块的集合,而应在统一表征中学习不同模态之间的关联,以及真实世界中连续的空间、时间与因果规律。
从早期文生视频研究,到图像基础模型,再到视频模型与原生全模态架构,智象未来形成了一条相对连贯的技术演进路径:图像解决静态空间建模,视频进一步学习动态过程,而统一全模态架构最终指向对真实世界运行规律的理解与模拟。这也构成了智象未来区别于单一视觉生成公司的核心技术判断。
03 技术前瞻布局:以“原生全模态”重构物理世界的底层架构
在视觉 AI 的技术演进路径上,智象未来始终保持着清晰的终局思维:图像是静态空间的起点,视频是动态过程的演进,而能够理解并模拟物理法则的世界模型才是最终的归宿。以此为基点,智象未来的技术重心正顺理成章地从单纯的视觉内容生成,进一步向世界模型延伸。
这不仅是研发维度的拓展,更是智象未来对 AI 终局形态的技术预判——探索能够表达、模拟乃至干预真实物理世界的底层架构,完成从“生成世界”到“重构世界(Mold the World)”的本质跨越。
之所以选择从视觉生成切入世界模型,源于对物理世界建模逻辑的深度判断: 梅涛认为,“真实世界的结构、规律与因果关系,可以通过对大规模视觉数据的学习逐渐获得,而不必先人为构建复杂的隐式状态空间。”
在他看来,在 UiT(Unified Transformer)原生统一架构下,两者可以在同一套底层系统中协同训练。图像模型积累的空间感知能力,将成为视频模型和全模态世界模型的重要基础;视频所提供的时间连续性和动态反馈,也会反过来增强模型对空间和物理关系的理解。
这个思考贯穿了他们对世界模型的思考和选择,梅涛认为世界模型的竞争核心不在于模态的简单堆叠,而在于底层架构的逻辑统一:“ 仅仅扩大视频模型规模或接入机器人数据,并不会自然产生世界模型。真正的壁垒在于架构能否在同一系统中完成对不同时间尺度、空间关系及交互反馈的统一表达。”
所以, 智象未来坚持“原生全模态”路径,即在模型底层将文本、图像、视频、物理规则乃至动作指令进行一体化建模。这不仅是视觉生成模型的升级,也是 AI 从数字世界走向物理世界、建立统一世界模型的一次架构演进。
04 团队与资本:顶尖人才与产业资源共同构筑竞争壁垒
从图像生成走向视频模型,再进一步探索原生全模态世界模型,不只是一次技术路线的升级,也对团队的科研能力、工程经验和持续投入提出了更高要求。对于智象未来而言,支撑这条长期路线的基础,一方面来自其在 AI 视觉领域积累多年的核心团队,另一方面来自长期资本与地方产业资源的持续支持。
智象未来是国内少数由院士领衔,在AI视觉生成领域兼具前沿科研能力与大规模产业化经验的创业公司。核心团队汇聚了来自微软亚洲研究院、腾讯、字节跳动等科技企业,以及国内外顶尖高校的研究与管理人才,在AIGC领域拥有超过十年的持续技术积累。
其中,创始人梅涛曾任原微软亚洲研究院资深研究员、京东集团副总裁,长期深耕计算机视觉、人工智能及产业化落地,是国内AI视觉领域最早一批技术领军者之一。 这使智象未来从成立之初就不只关注模型指标,也重视工程化、产品化与商业落地。
CTO姚霆长期专注视频生成、多模态模型及世界模型方向,在视频模型架构、技术演进路径及前沿趋势判断方面拥有丰富积累,是智象未来视频技术体系的重要负责人。
在 AI 视觉生成领域,真正稀缺的并不只是某一代模型,而是能够长期迭代底层能力的团队。从早期文生视频研究,到图像基础模型、视频模型和原生全模态架构,智象未来已经形成覆盖底层算法、模型训练、工程部署和产品落地的完整能力链条。
此外,但无论是大规模模型训练,还是底层架构创新,都需要持续的资金、算力和产业资源投入。智象未来多轮融资形成的资本结构,为其长期技术路线提供了相对稳定的支持。
本轮融资中,国家级资本的参与同样值得关注。作为长期耐心资本的重要代表,其入场不仅体现了对智象未来技术能力和商业化前景的认可,也释放出政策性、长期性资金持续加码人工智能核心赛道的信号。
除国家级长期资本外,合肥地方国资一直是智象未来发展过程中的重要支持力量。2024年,公司完成由合肥产投领投的 A 轮融资,安徽省人工智能母基金参与投资;此后,合肥产投和安徽省人工智能母基金继续跟投,安徽省投资集团旗下省产业投资公司、兴泰集团、合肥高投等机构也陆续进入。
在最新一轮融资中,来自合肥的创云海资本、航源资本继续参与,进一步强化了公司与当地产业资本之间的联系。继科大讯飞之后,智象未来正在成为合肥国资在大模型和生成式 AI 领域的又一项重要布局。
由此来看,智象未来的竞争基础并非单一模型或某一轮融资,而是由长期技术团队、连续的模型体系以及多层次产业资源共同构成。随着 AI 视觉竞争从产品比拼进入底层架构和产业化能力的竞争,这些积累将直接影响公司能否持续留在头部序列。
当前AI视频生成赛道已逐步形成"大厂+创业公司"并行发展的竞争格局。智象未来正与字节 Seedance、快手可灵等大厂模型,以及 Runway、Luma AI等海外创业公司共同进入第一梯队竞争。
05 不止于排行榜:让多模态能力在真实业务中落地生根
相较于单纯追求模型排行榜成绩,智象未来更加关注模型能力如何进入真实业务场景,在内容生产、创意协作和产业应用中持续创造价值。
在商业化层面,智象未来已经形成较为清晰的“1+1+3”体系:以 HiDream 系列大模型为技术底座,通过 Token Hub 对外输出标准化模型能力,并重点进入商业营销、影视创作和内容创作三类场景。
商业营销是目前落地较快的方向之一。围绕国内外中小商家的内容需求,智象未来通过 HiBurst 覆盖跨境电商、媒体运营和应用出海等场景,并适配 TikTok、Meta、抖音、小红书等主流平台。其商业模式也从提供生成工具,进一步延伸至按结果交付素材的 RaaS 服务。
在影视与专业内容创作领域,目前公司已累计制作超过5000分钟短漫剧,并与多家影视机构展开合作。面向个人创作者,vivago.ai 通过一站式 Agent 能力降低视频和特效创作门槛,目前已覆盖5000万用户,并形成百万级付费用户规模。公司最新的多模态创作智能体vivago R1真正实现了从单点工具到全链路创作系统的跨越,有望进一步创造可规模化的商业闭环。
从整体布局来看,智象未来形成从底层模型到行业应用的完整体系:以统一模型体系支撑图像、视频及世界模型的发展,通过平台降低开发与部署门槛,再以智能体和具体产品切入营销、影视及内容创作场景。
对于当下的 AI 赛道而言,底层技术迭代只是入场券,真正决定胜负的,是产品能否真正扎进生产生活场景,换来可持续的规模化营收。
从这个角度看,智象未来在多个场景的探索并不只是商业化落点,也是世界模型走向现实的训练场。当下行业距离真正理解和模拟物理世界仍有很长的路要走,谁能更前瞻性地布局统一架构、数据体系与关键技术能力,谁就更有可能在下一阶段的世界模型竞争中占据先机。