谷歌推出 Gemini Omni 1.1 Flash 视频生成模型。据公开信息,该模型最高支持 4K 分辨率输出,可基于已有视频以 10 秒为步长逐步扩展、单条最长达到 40 秒,支持指定首尾帧实现平滑转场与运镜,覆盖从 360p 快速预览到 4K 超高清的多档位输出;官方口径称生成速度提升 60%、成本降至三分之一,并支持引入最长 3 秒参考视频以维持角色与场景一致性。
结论先行:这次改的是“可控性”,不只是清晰度
视频生成模型的评测很容易被分辨率和时长牵着走,但对真正要用它做内容的人来说,痛点在别处:能不能接着上一段继续生成、能不能让镜头按设想的方式运动、能不能保证角色不换脸。Gemini Omni 1.1 Flash 给出的四项能力——分步扩展、首尾帧指定、多档位输出、参考视频约束——恰好都指向这三点。把速度提 60%、成本降到三分之一,则是把这些控制手段从“值得试”变成“用得起”。
四项核心能力拆解
| 能力 | 公开口径 | 解决什么问题 |
|---|---|---|
| 分步扩展 | 基于现有视频每次以 10 秒为步长扩展,单条最长 40 秒 | 摆脱“一次性抽卡”,让长内容可以逐段推进与修正 |
| 首尾帧控制 | 可指定首尾帧,实现平滑转场与运镜 | 把镜头语言从随机结果变成可指定参数 |
| 多档位输出 | 从 360p 快速预览到 4K 超高清 | 低分辨率试构图,确认后再烧高分辨率的算力 |
| 参考视频约束 | 可引入最长 3 秒参考视频维持角色与场景一致性 | 缓解跨镜头角色变形、场景漂移 |
分步扩展:从“抽卡”到“续写”
一次性生成整段视频的模式有个结构性缺陷:任何一处不满意都要整段重来,成本随长度线性甚至超线性上升。以 10 秒为步长扩展,意味着创作过程更接近续写——先确认前 10 秒成立,再往下接。这也让“边看边改”成为可能,对叙事类内容尤其重要。
首尾帧指定:把运镜变成输入,而不是运气
可指定首尾帧实现平滑转场与运镜,是把镜头设计权交回创作者。没有这个能力时,用户只能靠提示词描述“镜头缓缓推进”,实际结果随机性很大;有了首尾帧约束,起止画面被锚定,中间帧的插值目标明确,转场与推拉摇移的可预期性显著提升。
360p 预览到 4K 输出:把算力花在确定的构图上
支持从 360p 快速预览到 4K 超高清的多档位输出,配合生成速度提升 60% 与成本降至三分之一,实际上给出了一条经济的工作流:用低分辨率和高速度把创意试错做完,只在最终确认的版本上支付 4K 的成本。对需要批量产出素材的团队,这条路径比“每次都直接生成最高规格”划算得多。
3 秒参考视频:一致性的最小可行约束
支持引入最长 3 秒参考视频以维持角色与场景一致性。3 秒是个耐人寻味的长度——它短到不足以承载完整叙事,却足够让模型捕捉角色的面部结构、服装细节、光照氛围与场景材质。用一小段参考把后续生成的视觉基调锁住,是业内应对“角色变脸”的常用思路,此次被直接做进产品能力中。
与其他视频生成路线的对照
| 维度 | 一次性整段生成 | Gemini Omni 1.1 Flash 的分步路线 |
|---|---|---|
| 修改成本 | 任一段不满意需整段重生成 | 可从某一 10 秒片段处续接与调整 |
| 镜头控制 | 靠提示词描述,随机性高 | 首尾帧锚定,转场与运镜可指定 |
| 分辨率策略 | 通常固定档位 | 360p 预览至 4K 多档位切换 |
| 一致性手段 | 多靠反复抽卡筛选 | 以最长 3 秒参考视频约束角色与场景 |
| 成本结构 | 每次试错都按最高规格计费 | 低分辨率试错 + 终版高规格,配合速度提升 60%、成本降至三分之一 |
需要说明的是,上表右侧的能力项均来自此次公开披露的产品口径,左侧为对常见做法的一般性归纳,并非针对某一具体产品的实测对比。关于“速度提升 60%”与“成本降至三分之一”,公开信息未明确给出对比基线,实际提升幅度可能因任务类型与输出档位而异,建议以官方后续文档与实测为准。
适配场景与上手建议
| 场景 | 适配度 | 使用要点 |
|---|---|---|
| 广告与营销短片 | 高 | 先用 360p 跑多版创意,选定后再出 4K 终版 |
| 叙事型短视频 | 高 | 按 10 秒分段推进,逐段确认情节连贯性 |
| 角色 IP 连续内容 | 中高 | 固定一段 3 秒参考视频,跨条内容维持同一形象 |
| 产品展示与运镜演示 | 中高 | 用首尾帧指定推进方向与终点构图 |
| 长片与复杂叙事 | 低 | 单条 40 秒上限决定了它仍是片段级工具 |
一条实用的工作流建议:先用 360p 快速预览确定构图与运镜,再用首尾帧锁死关键转场,确认后用参考视频固定角色形象,最后只对通过评审的片段出 4K 版本。把高规格输出留到最后一步,是在这类按次计费的模型上控制成本最有效的办法。
常见问题
Q1:Gemini Omni 1.1 Flash 单条视频最长能生成多久?
据公开信息,模型支持基于现有视频每次以 10 秒为步长逐步扩展,单条视频最长可达 40 秒。也就是说,长内容需要分段续写,而非一次性生成 40 秒。
Q2:如何保证不同镜头里角色保持不变?
模型支持引入最长 3 秒的参考视频,用于维持角色与场景一致性。做法是先用一段确认好形象、服装与光照的素材作为参考,再据此生成后续镜头,可缓解跨镜头变脸与场景漂移。
Q3:4K 输出会不会很贵?
模型提供从 360p 快速预览到 4K 超高清的多档位输出,官方口径称生成速度提升 60%、成本降至三分之一。经济做法是在低分辨率档位完成创意试错,只把最终确认的版本渲染为 4K;不过公开信息未明确速度提升与成本下降的对比基线,实际效果建议以实测为准。
写在最后
Gemini Omni 1.1 Flash 释放的信号很清晰:视频生成模型的竞争正在从“能不能生成一段好看的画面”转向“能不能按创作者的想法稳定地产出”。分步扩展解决长度,首尾帧解决镜头,多档位解决成本,参考视频解决一致性——四项能力合起来,才让 AI 视频从演示品靠近可交付物。当然,40 秒的单条上限提醒我们它仍是片段级工具,真正的长片工作流还得靠分段拼接与人工剪辑来兜底。对内容团队来说,眼下最务实的动作是把“低分辨率试错、高规格终版”这条工作流先固化下来。
