一家AI初创公司,凭什么跻身全球视频模型第一梯队?

15 小时前4.2k
与巨头们齐头并进

图片1.png作者/庆福

编辑/嘉嘉

近日,美国围绕大语言模型管控掀起了争论;国内多模态大模型则高歌猛进。短短三个月,四款旗舰模型密集问世,视频生成赛道迎来爆发:

7月31日,Seedance2.5与MiniMax H3同日发布,隔空对垒。时隔一月,阿里Wan3.0重磅入局。进入9月,智象(HiDream.ai)最新发布原生全模态视频生成模型HiDream-O1-Video-1.0(以下简称HiDream V1)。

据了解,HiDream V1支持文本、图片、视频等多模态输入,可生成5至20秒1080p高保真视频。首次参评,这款模型即在Arena.ai图生视频盲测榜单位列全球第八、在Artificial Analysis图生视频(含音频)榜单位列全球前四。

对于智象(HiDream.ai)而言,HiDream V1的发布补齐了智象(HiDream.ai)的世界模型产品矩阵,至此智象(HiDream.ai)形成了“图像模型—交互式世界模型—具身模型—视频模型”四大模型的闭环矩阵。

要知道,目前国内外很多一线大厂,他们的世界模型以单模态产品或拼接式多模态为主,独立走通统一底座矩阵的团队更少。看到这里很多人都会有疑问,作为独立厂商的智象(HiDream.ai)凭什么在竞争最激烈的AI视频行业能够有如此成绩?

【1】双榜验证:站稳全球视频生成第一阵营

模型性能究竟如何,不能只看企业自报的实验室数据,还需要接受权威公开平台的第三方检验。

Arena.ai与Artificial Analysis的价值在于评测视角互补:前者通过匿名对比与用户投票,反映真实使用偏好;后者通过公开榜单和统一维度,考察模型的综合表现。一个更接近用户体验,一个提供专业评估参照,两者共同构成对模型能力的交叉验证。

HiDream V1首次参评,即在Artificial Analysis榜单位列全球前四,紧随MiniMax H3、Seedance等头部模型;在Arena.ai盲测榜单中位列全球第八。对于一款首次参与国际主流评测的视频模型而言,这意味着HiDream V1已拿到了全球头部牌桌的入场券。

从更大的行业格局看,字节Seedance、MiniMax H3、阿里Wan 3.0与智象HiDream V1,正在成为中国视频生成模型的四支代表力量,并在国际模型第一梯队形成集群。中国视频模型由此不再只是依靠单个产品偶然突围,而是呈现出大厂、上市公司、AI独角兽多家并进的“集团军”优势。其中,智象跻身头部阵营,也进一步印证了其在视觉生成与原生全模态模型上的长期积累。

图片2.png(来源:Artificial Analysis)

图片3.png(来源:Arena.ai)

要知道,AI视频赛道是整个AI行业中最卷、竞争最激烈的赛道,那么相较于其他AI视频大模型,HiDream V1究竟有哪些亮点?在笔者看来,主要有两方面:

一是结构层面的意图理解。视频生成的难点不在渲染,而在理解意图:C端用户的指令往往口语化、碎片化,很多模型难以还原用户的真实意图,造成意图漏解、镜头跳戏。

HiDream V1将多模态意图理解模块前置,按照“先理解、再规划、后生成”的路径,先对自然语言指令做结构化规划,翻译成模型可执行的专业分镜表达,再进入生成。

二是视频生成基本功层面的生成质量。针对“内容被迫适应时长”“音画不同步”“叙事不连贯、人物不一致”等常见问题。

HiDream V1把时长决策交还给内容本身——事件发展逻辑、动作完成周期与内容节奏决定生成多长,而不是让内容去适应预设的时长窗口;

同时放弃“先生成画面、再后期配音”的拼接路线,对文本、视频、音频信号联合建模——人物开口时,口型、气口与情绪同频;物理动作发生时,拟音与撞击反馈贴合真实因果。

两处优化的效果,在实测案例中可以直接感知。

生成F1赛车高速驶过镜头的画面时,HiDream V1不但完整流畅地呈现了赛车行驶,还将F1赛场上轮胎与地面高速摩擦造成烟雾呈现出来,更是把赛车引擎从高音滑向低音的多普勒效应,也就是“声音随距离变化的物理规律”被一并呈现。

图片4.png(来源:视频由HiDream V1生成)

再如夜晚的户外烧烤摊,HiDream V1不仅渲染出了夜市的烟火气,更是在细节把握上极具质感,五花肉放在炭火上炙烤,脂肪熔化成油脂,掉落在炭火上,油脂汽化声,紧接着伴随炭火微弱的“噼啪”炸裂声,直接激发了人们的食欲。

图片5.png(来源:视频由HiDream V1生成)

再比如,泥泞战壕中,士兵遭受炮击的惊恐表情,神情疲惫地打电话请求援助,但随着炮弹的落下,HiDream V1将士兵下意识地躲避、“小心炮袭!”的大吼以及炮击过后的恐惧感,刻画得很生动,HiDream V1通过原生全模态架构,对文本、视频与音频信号进行联合建模。镜头切换时,环境声与配乐随之过渡;人物开口时,口型、气口与情绪同频。

图片6.png(来源:视频由HiDream V1生成)

【2】世界模型不再只是路线图:单点领先易得,矩阵闭环难求

其实对于AI视频行业来说,HiDream V1真正让人震撼的不是单一单品的性能领先,而是HiDream V1发布后,智象(HiDream.ai)具备了独特的结构性优势。

从2026年4月至今,智象(HiDream.ai)相继发布了图像生成模型HiDream-O1-Image、交互式世界模型HiDream-O1-World、具身世界模型HiDream-O1-Embodied和本次发布的视频生成模型 HiDream-O1-Video-1.0。

而且这四大模型统一在UiT(Unified Transformer)底座上,分别承担世界模型闭环中的空间理解、时间叙事、三维交互与具身反馈。至此,我们可以认为,智象(HiDream.ai)已经形成了一个从理解世界、生成世界,到模拟世界、作用于世界的闭环产品矩阵。

要知道,在国内,世界模型也已成为大模型厂商、具身智能企业、自动驾驶公司和3D内容平台共同布局的新赛道。不同团队分别从视频生成、3D场景、环境模拟和机器人感知与行动等方向切入。

不过,现阶段多数探索仍集中于单一环节:视频模型擅长动态生成,3D模型侧重空间构建,具身模型聚焦任务规划与动作反馈,不同能力之间仍存在模型分立和架构不统一的问题。

智象的差异在于,它并非从单一入口构建世界模型,而是基于统一的UiT架构,推动图像、视频、3D交互与具身智能四大模型同源演进:

图像模型负责空间表征,视频模型建模时间、运动与叙事,交互式世界模型连接三维环境与实时反馈,具身模型进一步将理解与模拟转化为规划和行动。

可以说,矩阵的意义还不止于“多”。智象(HiDream.ai)的四类模型并非彼此独立的能力模块,而是在统一架构下同源演进;矩阵中每一块拼图的能力沉淀,都在为其他拼图积累复利。这种结构性成长,是单一任务型模型不具备的。

【3】全球视频生成第一梯队里的独立样本

产品与生态之外,资本的动作可以作为一个外部参照。

今年以来,智象(HiDream.ai)在4月、5月、7月三个月内完成三轮融资,规模超21亿元;9月,又完成C+轮融资,投资方包括新微资本、交子资本与工银资本。

累计看,其股东阵容中已集结东方富海、深创投、峰华资本、社保基金四川振兴科创基金、工银资本、弘颐资管等头部机构和产业资本。资本的连续加注,本质上是对技术路线的长期投票。

图片7.png(来源:上海证券报)

作为一家独立厂商,智象(HiDreamai)凭什么能够与巨头们齐头并进?答案还是要回到路线选择。

梅涛博士及智象(HiDream.ai)团队在AIGC领域已持续研发超过10年,也是国内首批完成模型与算法“双备案”的多模态大模型企业之一。

智象(HiDream.ai)从成立之初,就没有把自己局限为一家图片或视频生成工具公司,而是选择从底层模型架构切入,沿着视觉生成、原生全模态世界模型逐步推进。这是一条投入更重、技术周期更长的路线,也构成了理解智象(HiDream.ai)今年密集发布产品的背景。

这条路线首先建立在长期的视觉生成技术积累之上。此前,智象(HiDream.ai)开源图像生成模型HiDream-I1上线后24小时内登顶Artificial Analysis,成为首个在该榜单取得领先位置的中国自研生成式视觉模型;图像编辑模型HiDream-E1.1也进入该平台图像编辑智能体第一梯队,并在多项指标上超过Flux.1 Kontext等主流模型。

相关开源模型在全球社区下载量已超过200万次,外界一度将其称为图片模型领域的“DeepSeek”。这些成绩不仅提供了榜单意义上的坐标,也让智象(HiDream.ai)积累了视觉理解、内容生成、多模态对齐和训练工程等基础能力。

视频模型并非智象(HiDream.ai)面对行业热潮的一次突然转向。早在2024年5月,公司便上线了面向公众开放使用的视频生成DiT架构模型,并推出基于DiT架构的产品vivago.ai。此后,团队进一步探索“扩散自回归”(Diffusion+AR)模型架构,试图在生成质量、时序一致性、可控性与计算效率之间取得更好的平衡。

如今,HiDream V1进一步将文本、图像、声音与时间变化纳入原生全模态体系,既补上智象(HiDream.ai)原生全模态世界模型版图中的视频环节,也是其多年技术积累的一次集中兑现。

正如梅涛所概括的创业关键词——“逆水行舟”。选择一条“重而难”的路并不天然意味着成功,模型上榜也不等于技术与商业闭环已经形成。

但从图像生成到视频,再到可交互的世界模型与具身智能,智象(HiDream.ai)正在尝试证明:长期的底层投入,能够成为下一轮迭代的起点,而不是需要反复重建的成本。HiDream V1不是这条路线的终点,而是一次阶段性成果验收。


END


格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。

App内直接打开
商务、渠道、广告合作/招聘立即咨询

相关文章

2026年全球光纤温度传感器市场规模达到5.07亿美元

细分市场报告智库 · 6分钟前

cover_pic

2026年全球食品托盘密封机市场销售额规模达到44.66亿元

细分市场报告智库 · 12分钟前

cover_pic

2026年全球数位板市场规模达到16.71亿美元

细分市场报告智库 · 14分钟前

cover_pic
我也说两句