8 月 24 日,阿里云把视频生成模型 Wan3.0 从公测转正了。距离 8 月 6 日开放公测只隔了十几天,官方说这阵子模型几乎是以天为单位在进化,指令遵循、跨镜头一致性、音频质感、视频编辑这些方面都有明显进步。用户现在可以在阿里云百炼、万相官网、万镜一刻、千问 AI 平台、千问创作 PC 端、千问 App、堆友和 IF STUDIO 直接体验。
Wan3.0 最直观的变化是单次生成时长拉到了 30 秒。这个数字在行业里是道分水岭,字节的 Seedance 2.5 同样是单次 30 秒无拼接输出。30 秒意味着能完整讲一段小故事,连续运镜、一镜到底这些复杂镜头语言有了发挥空间,角色、对白、动作可以在一条连续时间里自然推进,从生成一个镜头走向讲述一段完整故事。它还有个智能时长功能,会根据提示词自动推荐合适的视频长度,配合视频延长功能,能把故事走向继续延展下去。
这次最特别的地方在输入格式。Wan3.0 在文本、图片、音频、视频四种模态之外,第一次支持 doc、xls、ppt、pdf、md 这些文档格式输入,txt、key、pages、numbers 也认,最多传一个文件或链接,文件不超过 100MB,页数不超过 50 页。这意味着教学课件、产品演示、动态图表、业务汇报这些办公素材可以直接丢给模型变成视频,不用再人工把内容扒出来改提示词。对做 Agent 的人来说这个能力尤其顺手,PPT 和表格直接扔给模型就好。
参考能力方面,Wan3.0 支持文本、图像、音频、视频四模态输入,最高可以放 20 个素材参考。角色、道具、声音、空间关系、风格这些关键维度都要保持一致,比如角色的五官、发型发色、形体、服饰配饰这类细粒度特征能稳定保持,道具的多角度外观、硬件结构、Logo、材质细节也不容易跑偏。人像生成追求千人千面,五官和皮肤细节刻画得更细,群像场景里不同人物的复杂情绪也能区分开,算是冲着告别 AI 人物的油腻感去的。
价格同步公布,480P、720P、1080P 三档分别是每秒 0.3 元、0.6 元、1.2 元,按生成视频时长计费。8 月 24 日到 9 月 23 日,阿里云百炼和千问 AI 平台有 API 限时 7 折优惠,按 1080P 算,生成一条 30 秒视频原价 36 元,7 折后 25.2 元。
生态这边动静也不小,麦芽旗下的跳跃视界、Deevid、剧火,还有京东灵境平台、美图、井萌都已经接入 Wan3.0。官方给出的落地场景包括短剧与影视制作、创作者平台、广告营销、文旅宣传、音乐 MV,看来是奔着真实生产链路去的。阿里自家的视频模型之前还有一匹黑马 HappyHorse-1.0 登顶过全球视频模型榜(此前报道),Wan 系列这次算是主力部队正式入场。
国内视频生成这条赛道今年打得火热,字节有 Seedance 和 Seedream,阿里这边 Wan 系列一路迭代到 3.0。接下来就看谁家的片子能真正进到剧组和广告公司的日常流程里了。
