「高 IQ 不代表全能。」
这是智象未来创始人梅涛博士最近反复讲的一句话。顶级大模型 IQ 从年初的 130 长到现在的 140,相当于中科大少年班天才水平。但成绩好的孩子,不代表综合能力强。一个考试拿高分的模型,不等于能在真实物理世界里长期、稳定、可靠地完成任务。
这个判断催生了智象未来最近的一项发布:HiDream-O1-World,8 月 17 日正式上线,据称是全球首个原生全模态交互式世界模型。
世界模型三条路,今天汇到了一起
在聊这个模型之前,先把背景说清楚。
过去几年,AI 领域实际上是三条技术路线分开跑的:大语言模型那条线,啃文本、理解知识、做推理;多模态那条线,做图像、视频、声音的理解和生成;具身智能那条线,控制机器人、在物理世界里行动。这三条线各自有自己的研究圈子、会议、团队。
但问题来了:真实世界不是这样运转的。
真实世界里,你看见一个杯子、想把它拿起来倒水、大脑要同时处理它的外观、材质、大小、重量、和你手臂的距离、倒水时水流的角度——这些信息不是分科目考试的,是同时整合在一起工作的。
所以行业里越来越形成一个共识:三条路最终要汇到同一条河里。这条河,就是世界模型。
而智象未来这次的切入点,是「原生全模态」这条支流。
什么叫「原生全模态」
很多模型说自己支持多模态,但实际上是「拼装」的:文本用一套编码器,图像用另一套,视频再来一套,到最后才把各种特征拼到一起。
HiDream-O1-World 用的 UiT 架构(Unified Transformer),是把文字、图像、视频、空间关系全部映射到同一个向量空间里处理的。一个统一的 Transformer,文本 token 和图像 token 混在一起训练,没有模态之间的「翻译层」。
这样做的好处是什么?不同模态之间的边界被打破了。模型学到的不只是「这张图里有什么」,而是文字和图像在同一个语义空间里可以互相索引、交叉推理。
三个能力:漫游、编辑、交互
具体能做什么,官方给了三个核心功能。
漫游,指的是在生成的世界里自由移动,视角可以推拉摇移,世界保持时空一致——你从一个房间走到另一个房间,家具不会莫名其妙换掉。这是长时程空间一致性的体现。
编辑,指的是对已有世界里的物体、材质,光照做局部调整,说人话就是「把墙从蓝色换成绿色,但不影响其他东西」,模型要理解局部修改对整体的影响。这是物理一致性的一部分。
交互,是指用户可以通过文本或直接操作改变世界状态,模型实时推演接下来会发生什么。比如你把一个杯子从桌上推下去,模型要能推演出它掉到地上的完整过程——不是动画预设,是真的物理推演。
技术上怎么做到的,官方没有完全公开。但从论文引用格式已经在 Hugging Face 挂出来看,正式论文应该快了。
跑分登顶,但 Benchmark 不是重点
HiDream-O1-World 首次参评,在权威榜单 WBench 的 Navi 分榜里拿到了第一。
不过,这个消息的重要程度被低估了——不是跑分本身有多震撼,而是这件事本身说明世界模型这个赛道开始有了标准化的评测体系。之前行业里讨论世界模型的时候,经常是各说各的,因为没有统一的衡量标准。WBench 登顶,意味着这个领域的基准正在建立。
至于具体分数和对比,考虑到世界模型本身还是个新类别,不同系统的评测维度可能差异很大,看排名比看分数更有参考价值。
对产业意味着什么
智象未来在发布时列了三个应用方向:AI 互动影游、具身智能仿真训练、3D 场景生成。
互动影游这块最容易理解——游戏里玩家不只是选选项,而是真的在世界「里」行动,NPC 和环境都要能根据你的行为实时反应。目前游戏行业对这个方向的兴趣很明显,UE、Unity 都在往这个方向靠。
具身仿真这块对机器人训练很有价值。真实世界里采集机器人数据成本高、速度慢,但在仿真环境里可以批量生成。智象未来和诺亦腾合作的一个案例是用模型把真实采集的人体动作数据做增强,生成大量不同背景、不同场景、不同光照条件下的合规动作——成本比纯真实采集低很多。
3D 场景生成对建筑设计、虚拟制片等创作类工作有直接帮助。传统的 3D 建模需要一块一块搭,现在可以用自然语言描述后直接生成基本框架,设计师在生成结果上修改,迭代速度比从零开始快不少。
值得关注的地方
这个东西现在在什么成熟度?个人开发者和中小企业能用来做什么?
官方没有公开具体的参数规模、算力需求、API 定价。首批用户大概率是 B 端客户和企业合作伙伴。
但有一点可以关注——智象未来是 2024 年就上过几次新闻的公司,做视频生成模型起家,HiDream 系列在视频生成圈子里是有存在感的。这次的定位是「原生全模态世界模型」,比单纯视频生成往前走了一步。
三条路汇到一起的判断是不是真的,时间会给出答案。但至少现在,有一个模型在试着把它们放在同一个架构里了。
