扫描二维码
手机浏览

对话世界模型黑马团队:登顶WBench榜单,三个月累计融资超21亿,他们到底做了什么?

AI新榜
新榜独家
AIGC

作者 | 博雯
编辑 | 赖捷


近半年来,世界模型不断升温。


根据Forbes统计,仅2026年上半年,风险投资流向世界模型创业公司的资金已超200亿元,而国内的相关产品更是如同雨后春笋:蚂蚁在2月开源LingBot-World,腾讯阿里在4月16日同天分别发布混元3D世界模型2.0(HY-World 2.0)和“快乐生蚝”,还有此后高德的ABot-Earth0.5、智源的悟界·Physis-v0.1……一时间,所有人都在争相“构建世界”。


而就在8月17日,一个名叫HiDream-O1-World的世界模型突然冒了出来。


在美团LongCat联合复旦大学发布的交互式世界模型权威评测基准WBench上,HiDream-O1-World一举登顶,平均表现超越阿里快乐生蚝、蚂蚁LingBot-World等多个知名产品,而且在物理维度上的表现,更是做到了行业第一。



而其背后的公司智象未来(HiDream.ai),7月15日刚刚完成15亿元的C轮融资,近三个月更是已完成三轮密集融资,累计融资超过21亿元。


那么,海量人才与资金涌入的“世界模型”,到底是怎么样的一个领域?在这个资本大量押注的新战场上,HiDream-O1-World又有什么不同?智象未来对于世界模型,还有着哪些全新的思考?


为此,我们与智象未来团队进行了一次深度交流,以期得到这些问题的答案。



不仅是可交互,

这个世界模型还有两大突破


世界模型到底是什么?一句话来说,如果大语言模型预测的是句子的下一个词,那么世界模型预测的就是世界的下一个真实状态。


这里的“状态”,是对某一时刻世界中正在发生的一切事物的完整描述,包括每一个物体的位置、速度、属性,甚至是因果逻辑和物理规律。


而“世界模型”这个概念最早起源于认知科学领域,由一位心理学家提出;而在2018年,谷歌大脑发布了一篇论文,使得大家看到了“世界模型”通过深度学习方法实现的可能;再到2024年到2025年,伴随着生成式AI的快速发展,“世界模型”终于开始进入产业界和资本市场。


从产品层面来看,目前的世界模型大致可以分为三种类别:


第一,以生成可实时交互的视频为核心的“视频派”;


由Adobe Research团队发布的交互式视频世界模型RELIC


第二,主要生成可交互、可编辑,且可无缝导入Blender等引擎中的原生3D资产,应用于建筑可视化、互动娱乐等传统3D内容创作领域;


李飞飞创业公司World Labs的3D世界生成平台Marble


第三,面向具身智能、自动驾驶等垂直领域,通过构建精确仿真的数字孪生世界,来训练机器理解推演物理界世界;


英伟达的世界基础模型平台Cosmos


而就在8月17日,智象未来正式发布了原生全模态交互式世界模型HiDream-O1-World,它支持用户在漫游模式下,在场景内自由探索,也能让用户通过编辑模式文字、语音或图片发出指令,实时操控动态变化。


HiDream-O1-World模型的“编辑模式”


智象未来团队告诉我们,如果从具体的应用场景来看,世界模型三种类型的后两类内容他们都有所涉及,因为HiDream-O1-World模型既能输出可交互、可编辑的3D资产,公司也正在和具身智能公司合作,帮助他们构建高质量、规模化的具身智能视频数据。


不过智象未来的技术合伙人&算法科学家潘滢炜博士也强调,在世界模型整体的实现路径上,他们并不属于传统的技术流派


传统模型会为文本、图像、视频等各模态配备一套独立的编解码,各管一种模态,最后再把这些单模态输出“拼接”融合起来;而HiDream-O1-World最大的突破,就是能通过其自研的原生全模态(UiT)架构,把文本、图片、视频、空间等所有信号全都“一锅炖”,直接喂进同一个模型管路。


相关技术论文已被计算机视觉顶级会议ECCV 2026接收


这种底层技术架构上的创新,为HiDream-O1-World模型带来了两个维度上的突破。


第一,物理规律


现在很多视频模型以及世界模型在画面生成质量上有进步,但在理解物理规律、因果关系上还有很大缺失,比如前段时间各平台上兴起的#当我试图驯服AI 话题下,就有诸多令人啼笑皆非的案例。


有些AI理解的“瓢泼大雨”和“坐飞机”


而HiDream-O1-World模型之所以能在WBench榜单上,做到物理维度的行业第一,就在于生成画面上的细节。


比如它生成的一个骑自行车沿山路而下的案例,不管是周围树木的摇动,还是地上光影的折射和变化,都无比真实。



而这样的细节在HiDream-O1-World模型生成的其他案例中,比比皆是。


比如这个第一视角乘坐降落伞下降的Demo,我们可以看到气球的鼓风状态,以及双手持握处细小绳结的飘荡。



比如一片幽静池塘的Demo,可以看到数条鱼在池水中游荡的轨迹,以及水面激起的涟漪。



第二个维度的突破,则是时空一致性


许多传统视频模型输出时,常常是视角一转,刚刚还存在的事物就不见了,这就是模型的时空一致性不强所导致的记忆层面缺失。


但看HiDream-O1-World模型生成的案例,在这样一个地形复杂的世界中,不管是急速转向、上仰俯冲,都能得到灵敏顺滑的响应,毫无延迟与割裂感,哪怕频繁变换视角,也能够保持整体画面一致,不会丢失细节。



而基于物理规律和时空一致性这两大优势,智象未来提出了对世界模型的一种新的解读,他们认为,真正的世界模型不是“model the world”(建模世界),而是“mold the world”(塑造世界)


“这里的‘mold’不是说生成可交互的内容,因为可交互本质上就是多添加一些控制条件,现在的视频模型都可以做到”,潘滢炜说,“我们追求的不仅是视觉上的真实性,或是内容上的可交互性,而是要将真实的物理规律,因果逻辑、时空一致性都融入进去,这样的生成才能称之为是‘塑造世界’。”



自动驾驶、具身智能、互动影游……

世界模型还能用来干什么?


尽管近半年以来,世界模型已经成为了AI产业的新焦点,但坦率讲,其应用场景仍处在探索阶段。


放眼现在市场上以“世界模型”为标签的团队时,会发现他们有的在做视频生成,有的在做3D场景,有的在训练机器人,有的在服务自动驾驶,还有的试图从底层重构AI对于物理世界的理解。


而整体来看,自动驾驶具身智能可以说是当前的世界模型较为成熟的两个应用领域。


比如全球自动驾驶龙头Waymo就在今年2月与谷歌DeepMind合作,基于Genie 3模型的能力,构建了一个高逼真度虚拟世界模型,能够模仿那些现实中难以大规模捕捉的罕见场景,如模拟龙卷风、大象穿行等等。



今年7月底,李飞飞的世界模型创业公司World Labs还宣布收购顶级机器人仿真公司SceniX,随后联合推出机器人训练闭环引擎,基于世界模型技术,可以让五种同类型真机在执行任务时连续运行一小时都不出错。



而根据智象未来团队透露,HiDream-O1-World模型也已在具身智能领域开展了业务合作。


不同于大语言模型可以低成本获取海量文本数据,具身智能领域所需要的数据需要融合视觉、动作、触觉等多模态信息,数据结构复杂,获取成本高,因此,如何获取更高精度、大规模、多样化的数据,就成了具身智能行业长期面临的一个问题。


就在今年3月,智象未来与诺亦腾机器人达成合作,诺亦腾机器人提供源自物理世界真实交互的人类动作数据,而智象未来则基于HiDream-O1-World模型,对这些原生动作数据进行百倍以上的精细化放大、扩展与泛化,最终生成更多在不同场景、光照、视角下的变体场景数据。


目前,两方合作生成的具身智能视频数据已经达到了数万小时以上,而这些新生的数据既保留了真实世界的物理反馈,又突破了场景与规模的限制,为具身智能训练开辟了一条可规模化的数据新路。


图源智象未来公众号,基于诺亦腾机器人的动捕数据生成的高精度视频数据


而值得注意的是,在智象未来7月15日的C轮融资中,上影新视野基金、华策影视同时入局,还有此前已经合作过的湖北长江电影集团,显然,影视娱乐或许也会成为智象未来布局的方向之一。


在这次交流采访中,智象未来团队也提到了现在相当火热的AI互动影游赛道。这是一种以影视级视听叙事为外壳、用户交互为内核的新兴内容形态,传统影视内容在拍摄完成后就已固定,而互动影游则加入了分支选项,玩家的每一个选择都会带来完全不同的剧情和环境。


互动影游最重要的,就是要保证玩家始终待在一个可交互的,连贯的,足够真实的世界里游玩:墙上有一幅画,玩家视角移动以后再回来,那个画得还在;用户开窗推翻了桌上的杯子,杯子里的水要真的泼洒出去,环境的光影也要发生相应的改变。


要实现这样的效果,如果仅靠AI视频去“猜像素”,可能只能保证前后几秒的连贯,时间再长就会崩掉;但如果基于世界模型能力,就可以搭建一个有记忆、有空间感、有物理规则的世界。


AI互动影游《诡舍》


当然,尽管已经有不少应用场景,但现阶段的世界模型仍属于AI领域的前沿探索方向,带有浓重的“科研”属性。对于商业化问题,整个行业也都仍在探索。


智象未来团队也在交流中坦言,目前对于新模型发布后到底是面向B端还是C端,以及更多的商业化设计,还没有做太多考虑,他们也期待着在产品和模型成熟之后,能够打开更多的想象空间。


在现代商业世界中,一家公司的目标是为股东创造利润,但对置身前沿,核心团队都是科研人员的科技公司而言,技术上的愿景同样构成公司的重要动力。


交流中智象未来团队多次提到,他们最终极的愿景,就是那个能够理解并执行一切智力任务的AGI。


“我们希望能一开始就把‘世界的规则’刻进模型里——它知道物理定律、空间关系、因果逻辑,所以它才能真正理解世界、推理世界,重构世界。”


智象未来团队在最后这么告诉我们:


新发布的HiDream-O1-World模型,就是前往这个终点的一个重要节点。


           

图片
图片


欢迎分享、点赞、推荐
 一起研究AI

分享文章链接