结论先行:阿里通义团队开源的 LHM,把 3D 数字人的制作门槛压到了前所未有的低度——只需一张正面照片,数秒内端到端生成完整且可直接驱动的 3D 数字人,无需多角度拍摄、无需标注数据、无需后处理。它基于多模态 Transformer 与高斯球体建模,在外观重建、动作绑定与细节还原上表现突出,尤其在人脸区域保真度极高,可直接投向虚拟人、游戏角色与 XR 场景。
传统 3D 数字人为什么贵
要理解 LHM 的意义,得先看它替代了什么。一条常规的 3D 人物制作流程,大致包括建模、拓扑、展 UV、贴图、骨骼绑定、蒙皮权重调试、再到动作驱动——中间还有大量返工。
常见的两条技术路线各有明显短板:
- 多视角采集:需要相机阵列或环绕拍摄,对环境、光照、同步都有严格要求,个人与小团队几乎无法自建。
- 视频重建:需要主体按指令转身、摆位,且对不同体型、衣物的泛化能力有限,复杂着装容易崩。
两者的共同点是:成本高、周期长、且高度依赖专业操作人员。这正是 3D 数字人长期停留在大型项目里,没能像文生图那样走向普惠的原因。
LHM 的技术路径
单张正面照片输入
LHM 的输入要求被压缩到最低限度:一张正面照片。这一点看似简单,实际是整个方案里最难的部分——从单视角恢复三维结构在数学上是欠约束问题,被遮挡的背部、头顶、侧面都需要模型”猜”出来。它能成立,靠的是训练阶段学到的人体先验:骨骼比例、体型分布、衣物与人体的相对关系,都被压缩在权重里,用来补全观察不到的那部分几何。
多模态 Transformer 架构
LHM 以多模态 Transformer 为骨干。Transformer 的优势在于统一建模不同来源的信息:图像的外观特征、三维空间的几何约束、以及动作或视角相关的条件信号,可以在同一个注意力框架里对齐与融合,而不是像传统管线那样被切成若干彼此独立的模块。
这种端到端设计带来的直接好处,就是官方强调的生成过程无需后处理——中间不再依赖人工修补、拆 UV 或手动贴图。
高斯球体建模
LHM 采用高斯球体建模技术。与传统的三角网格相比,它的表达方式更接近“一团带属性的点云”:每个 3D 高斯点携带位置、大小、方向与颜色信息,渲染时通过投影叠加成画面。
这套表示的两个好处在此处尤其关键:一是细节密度可以按需求分布,人脸、发丝、衣物褶皱这类高频区域自然会长出更密集的细节;二是渲染速度快,因此才能在数秒内完成生成并直接预览驱动效果。这也是为什么它在人脸区域能达到极高保真度——模型的表达预算被优先花在了观众注意力最集中的地方。
关键能力一览
| 维度 | LHM 说明 |
|---|---|
| 输入要求 | 单张正面照片 |
| 生成速度 | 数秒内完成 |
| 技术架构 | 多模态 Transformer + 高斯球体建模 |
| 输出形态 | 完整可驱动的 3D 数字人 |
| 支持动作 | 跳舞、运动等多类动作驱动 |
| 流程特点 | 端到端生成,无复杂环境、无标注数据、无后处理 |
| 开放方式 | GitHub 与魔搭社区开源,支持本地部署与在线体验 |
| 典型场景 | 虚拟人、游戏角色、XR 场景 |
“可驱动”才是分水岭
很多项目能生成漂亮的 3D 模型,却停在”雕像”阶段——静态好看,一动就崩。真正的难点在骨骼绑定:需要确定骨骼结构,并把每个表面点按权重分配给相应骨骼,再让动作数据正确地带动表面形变。这一步传统上由美术人员手工反复调试。
LHM 的输出被明确描述为完整可驱动,支持跳舞、运动等动作驱动,意味着绑定环节已被模型内部消化。对使用者来说,这是从”需要一支美术团队”到”上传一张照片”的差别。
适用场景与实践建议
结合官方给出的方向,LHM 最直接的落点是三类:
- 虚拟人与直播:低成本快速生成主播形象,配合已有动作库即可驱动。
- 游戏与 XR:快速产出 NPC 或 avatar 原型,先验证玩法再决定是否精修。
- 内容创作:短视频、社交平台上的虚拟分身,降低持续出镜成本。
使用时有两点值得注意:第一,输入照片质量决定输出上限,正面、光照均匀、面部无遮挡的素材效果最好;第二,它替代的是从零到原型这一段的成本,影视级的精修流程仍有其价值——LHM 把门槛拉低了,但没有改变”越精的内容越贵”这个基本规律。
常见问题(FAQ)
Q1:只有一张生活照能生成吗?
LHM 的输入要求是一张正面照片,官方强调无需复杂环境或标注数据即可端到端生成。实际效果仍受照片质量影响,建议使用正面、光照均匀、面部清晰无遮挡的素材。
Q2:生成的角色可以直接做动作吗?
可以。官方明确输出为”完整可驱动的 3D 数字人”,支持跳舞、运动等多种动作驱动,意味着骨骼绑定等工作已由模型完成,无需人工做绑定调试。
Q3:可以本地部署吗?
可以。LHM 已在 GitHub 与魔搭社区开源,同时支持本地部署与在线体验。建议先在线体验确认效果,再评估本地运行的显存与算力需求。
小结
把 LHM 放回时间线上看,它代表的是 3D 内容生产正在重演 2D 图像走过的路:从专业工具 + 专业人员,走向单次输入 + 即时产出。单张照片、数秒生成、端到端无后处理,让虚拟人从立项预算里的一项开支,变成可以在原型阶段随手验证的选项。对绝大多数团队而言,真正的收益不是省下建模费,而是把”试试看”的代价降到了可以忽略的程度。
