阿里通义 LHM 3D 数字人解析:一张正面照片数秒生成可驱动角色,人脸保真度最高
结论先行:阿里通义团队开源的 LHM,把 3D 数字人的制作门槛压到了前所未有的低度——只需一张正面照片,数秒内端到端生成完整且可直接驱动的 3D 数字人,无需多角度拍摄、无需标注数据、无需后处理。它基于多模态 Transformer 与高…
结论先行:阿里通义团队开源的 LHM,把 3D 数字人的制作门槛压到了前所未有的低度——只需一张正面照片,数秒内端到端生成完整且可直接驱动的 3D 数字人,无需多角度拍摄、无需标注数据、无需后处理。它基于多模态 Transformer 与高…
结论先行:2025 年 7 月 28 日,阿里巴巴通义实验室正式开源了视频生成模型 Wan2.2。它的差异化不在”画质又好了一些”,而在把混合专家(MoE)架构引入注意力模型,用来理解并还原电影镜头语言——光影、色彩…
结论先行:2025 年 4 月 16 日,OpenAI 发布了 o 系列的两款新推理模型——o3 与 o4-mini。真正值得关注的不是”又涨了几个点”,而是 o3 做出了一个此前没有过的动作:把图像直接放進思维链,…
结论先说:SpaceXAI(xAI)已于 2026 年 9 月 21 日正式发布 Grok 4.7,参数从 Grok 4.6 的 1.5 万亿涨到 2.1 万亿(+40%),但 API 价格一分未涨——输入 2 美元 / 百万 token、…
结论先说:Laya 是 2026 年 9 月 18 日由 Convai Innovations 发布的开源「System 1 决策模型」,Apache 2.0 授权、权重可下载、单卡 T4 上单次推理 32.8 毫秒,约为 TypeSafe…
结论先行:Qwen VLo 是阿里达摩院通义千问团队在 2025 年 6 月 26 日发布的多模态模型,主打”从感知到生成“的统一——同一个模型既能理解图像内容,也能根据自然语言指令完成高质量的图像生成与编辑。它的两…
结论先行:蚂蚁集团在 2025 年 6 月 26 日发布的 AI 健康应用 AQ,核心并不是”又一个聊天机器人”,而是把大模型能力接到真实医疗资源上。官方公布的数据显示,它已接入全国超 5000 家医院、近百万医生资…
结论先行:腾讯在 2025 年 5 月 20 日发布的”混元游戏”视觉生成平台,主打首个面向游戏工业级内容生产的 AIGC 引擎。官方给出最具冲击力的一组对比是:部分传统流程中需要耗时 12 小时的建模准备工作,在该…
结论先行:微软在 2025 年 4 月发布的 UFO²(Desktop AgentOS),把桌面智能代理从”自动化脚本”升级为一套操作系统级方案。官方测试数据显示,在两组不同的自动化任务场景中,UFO² 的成功率分别…
结论先行:MiniMax(稀宇科技)在 2025 年 6 月 17 日发布的 MiniMax-M1,是一枚主打开源的大规模混合架构推理模型。它把参数量做到 4560 亿(456B),上下文输入上限拉到 100 万 Token,推理输出长度做…