影眸发布 Hyper3D WorldGen:一张图生成可交互3D世界,物体不再是背景的一部分

过去 AI 生成 3D 场景,有个根本问题没解决:生成出来的东西看起来像世界,但里面的桌子是背景的一部分,机器人碰不了,游戏引擎也难直接用。

影眸 Hyper3D 想把这件事扳过来。

9月1日,影眸 Hyper3D 正式发布世界生成模型 WorldGen,核心功能是:上传一张场景图片,生成一个由多个独立、可编辑、可交互资产组成的完整 3D 场景。

前景独立 Mesh,背景 3DGS,各司其职

WorldGen 的处理逻辑分两层。

前景里需要编辑和交互的物体——桌子、椅子、柜子这些——由 Hyper3D 自研的 Rodin 模型生成独立的 Mesh 资产,每件物体是真正可以移动、替换和编辑的 3D 资产,不是贴在背景上的图案。

背景环境则使用 3D Gaussian Splatting 保留原图的空间感和光影细节,不为了追求「物体感」而牺牲环境整体的视觉质量。

这个分工方式挺务实:真正要交互的东西是独立的 3D 资产,可以进 Blender、Unity、Unreal Engine;背景负责好看,不需要交互就不必浪费建模成本。

物理关系:桌子不只是放在那里,还要知道为什么放在在那里

WorldGen 背后是影眸自研的 CAST 架构,全称《CAST:基于单张 RGB 图像的组件对齐式 3D 场景重建》。这篇论文拿了 SIGGRAPH 2025 最佳论文,同期在该领域拿到最佳论文的商业公司只有谷歌、Meta 和影眸三家。

CAST 要解决的不只是视觉重建,而是理解场景里物体之间的关系。模型从存在遮挡、透视畸变和信息缺失的二维图片中逐物体补全几何,建立物体关系图,识别接触、支撑、悬挂等物理关系,并预测各个物体在统一三维空间中的位置、尺度、朝向与摆放状态。

用影眸创始人吴迪的话说:传统做法如果直接把整个会议室作为一个模型生成,「所有内容容易被合并为不可拆解的整体,场景很难继续使用」。WorldGen 把场景拆解为可单独操作的资产,同时保持它们之间的空间与物理关系。

哪些场景真正用得上

具身智能训练是其中一个方向。影眸联合地瓜机器人和谋先飞发布了具身智能可训练仿真闭环联合解决方案,WorldGen 根据单张照片重建出带物理属性的 3D 场景,谋先飞基于自研物理引擎 MotrixSim 完成仿真适配,地瓜机器人负责算力和工具链。同一任务下的多种环境变体可以批量生成,用于训练机器人的泛化能力。

影视和游戏也适用。导演想把画面左侧的苹果移到右侧,纯视频生成很难稳定控制,但在 3D 场景里移动物体直接得多。影眸的判断是:视频模型擅长最终视觉呈现,3D 擅长记录空间状态和可控操作,「Hybrid 一定会发生」。

XR 内容方面,用户可以走进一张图生成的空间,从不同位置和视角观察场景里的物体和环境细节。

为什么这个方向值得注意

影眸 CTO 张启煊说过一句话,概括得挺准:「竞争点正在从能否生成一个看起来不错的模型,转向能否控制、编辑、拆分、进入工作流并稳定交付。」

3D 生成赛道过去一年的进步速度很快,但大多数进展集中在单物体质量上。WorldGen 的意义在于把生成的基本单位从单个资产推进到资产之间的关系和物理约束,这一步跨过去之后,游戏引擎、仿真平台、影视工作流才真正能用上 AI 生成的内容,而不只是「展示一下挺炫」。

一句话:以前 AI 生成的世界看起来像世界,但物体还是背景的一部分;WorldGen 让场景里的每个物体都开始变成可以动手操作的真实资产。