AI 视频生成这两年的瓶颈,早已不是「能不能生成几秒好看的画面」,而是能不能交付一段可以直接用的成片。智象未来(HiDream)给出的答案是 vivago R1:定位全球首个无限时长内容创作智能体,国内版「够搭」同步升级,采用 Chat-First 对话优先模式,依托「基础模型 + 智能体」双轮驱动,由 Agent 自动拆解脚本、分镜、角色、场景与音效,一次性稳定输出 5 分钟高质量视频并支持多轮延长,内容有效可用率达 85%。
从「生成片段」到「交付成片」,差的是什么
多数视频生成模型的产品形态是:输入提示词,输出 5 到 10 秒片段。要做一条三分钟的内容,用户得自己拆脚本、跑十几二十次生成、再把片段拼起来,还要手动解决角色变脸、场景跳变、音画对不上这些问题。
这个过程中真正消耗时间的不是生成本身,而是工程化的部分:
- 把创意拆成可执行的镜头列表;
- 保证同一个角色在不同镜头里长得一致;
- 让场景、光线、色调在镜头之间连续;
- 把音效、配乐、口型对齐到时间轴上。
vivago R1 的产品思路,就是让 Agent 接管这一层,把用户从「操作生成工具」变成「描述想要什么」。
Chat-First:把创作入口改成对话
所谓 Chat-First(对话优先),指产品的主交互界面不是参数面板,而是一段对话。用户用自然语言描述需求,Agent 负责把模糊意图翻译成具体的制作计划。
为什么对话比参数面板更适合长内容
短片段生成时,参数面板很好用——你清楚自己要什么画面,调几个滑块就够了。但一旦内容长度上到几分钟,需求本身就变成了结构性问题:开头怎么抓人、中段怎么展开、结尾怎么收束,这些用参数表达不出来,用对话却很自然。对话还允许中途修改——「把第三段的节奏放慢」「换一个更冷静的旁白」,Agent 可以在已有结构上局部调整,而不是推倒重来。
「基础模型 + 智能体」双轮驱动怎么理解
基础模型负责画面与音频的生成质量,是能力的下限;智能体负责任务拆解、流程编排与一致性控制,决定成品的可用率。两者缺一不可:只有强基础模型,生成的片段好看但拼不成片;只有智能体,流程跑得顺但画面质量撑不住。vivago R1 把这两层同时作为产品核心来打磨,这也是它敢把「有效可用率 85%」当作指标公开的前提。
关键指标拆解:5 分钟与 85%
| 指标 | 数值 | 实际含义 |
|---|---|---|
| 单次稳定输出时长 | 5 分钟高质量视频 | 一次生成即可覆盖短视频到中长内容的常见长度 |
| 时长扩展 | 支持多轮延长 | 在已有内容基础上继续生成,而非重新起片 |
| 内容有效可用率 | 85% | 生成结果中无需大量返工即可使用的比例 |
| 自动化环节 | 脚本、分镜、角色、场景、音效 | 五个制作环节由 Agent 自动拆解 |
85% 的可用率是这组指标里最关键的一个。它承认了一个现实:AI 生成不可能一次全对,但把可用比例做到八成以上,意味着用户的工作模式从「逐帧修」变成「挑着改」,这是生产流程能否真正跑通的分水岭。同时「多轮延长」对应无限时长的定位——不是一次性算出十分钟,而是在已有基础上持续生长,这样更容易保持前后一致。
适合什么样的内容生产者
vivago R1 的能力结构决定了它更契合以下几类需求:
- 需要连续叙事的内容:品牌故事、产品讲解、知识科普,这类内容有清晰结构,Agent 拆解后收益明显;
- 高频更新的账号:日更或周更的短视频账号,对产能的敏感度高于对单条极致质量的敏感度;
- 没有专业剪辑能力的团队:市场、运营、教育等岗位,用对话替代时间轴操作,门槛下降最明显;
- 需要多版本测试的场景:同一脚本跑不同风格,快速做 A/B 验证。
反过来,对画面精度有极致要求、需要逐帧控制的影视级项目,仍然更适合传统制作流程与专业工具链,AI 在其中的角色是预演与素材生成,而非最终交付。
使用建议:如何把可用率真正用起来
即便可用率达到 85%,实际使用时仍有几个能显著提升成品质量的做法:
- 把需求写成结构而非感觉:给出目标受众、核心信息、期望情绪,比只说「做一个科技感的视频」更容易得到稳定结果;
- 先锁角色与场景再铺内容:一致性问题越早确定越省事,中途换角色会导致大量镜头返工;
- 分段生成、分段验收:利用多轮延长的能力,每生成一段就检查一次,避免错误累积到结尾才发现;
- 把 15% 留给人:可用率不是 100%,预留人工微调的时间,比期待一次成型更现实。
FAQ
vivago R1 和「够搭」是同一个产品吗?
是同一产品的不同版本。vivago R1 面向全球市场正式上线,国内版本名为「够搭」,两者同步升级,能力保持一致。
「无限时长」是指可以一次生成任意长度的视频吗?
不是一次性生成,而是通过多轮延长实现:模型可一次性稳定输出 5 分钟高质量视频,之后用户可在已有内容基础上继续延长,从而在保持前后一致的前提下扩展总时长。
85% 的有效可用率是怎么衡量的?
它描述的是生成结果中无需大量返工即可直接使用的比例,属于产品侧给出的整体质量口径。具体评测方法、样本构成与判定标准以官方当期披露为准,实际使用时建议在自有内容类型上做一次小批量验证。
小结
vivago R1「够搭」的发布,反映的是 AI 视频赛道重心的迁移:竞争点从「单片段画质」转向「成片可用率」。Chat-First 降低了表达门槛,基础模型 + 智能体双轮驱动解决了一致性与流程问题,5 分钟单次输出与多轮延长把长度瓶颈往前推了一步,85% 的可用率则给出了一个可验证的承诺。对内容生产者来说,真正值得关注的不是它能生成多长的视频,而是它把「从想法到成片」中间那道工序压缩了多少。
相关阅读
这条线上还有几篇站内文章可以接着看:
- 智象未来 HiDream-O1-Video-1.0 发布:全模态输入一键直出 5-20 秒 1080p,图生视频榜全球第四
- 智象未来发布 HiDream-O1-World:全球首个原生全模态交互式世界模型
- OpenClaw 2.0 正式发布:史上最大更新,933人贡献16000个PR,龙虾全面进化
延伸阅读
- 文心大模型 4.5 原生多模态解析:API 输入 0.004 元/千 tokens,幻觉显著降低1 天前
- MiniMax H3 正式发布:首款开源全模态生成模型,2K 15秒音画一键搞定2 月前
- 千问 Qwen3.8-Omni-Flash 全模态上线:音频输入降价 98%,1M 上下文与评测提升 26%3 天前
- 腾讯 Miora 正式开放使用:Google/GitHub 账号直登,一句话 Brief 生成全套视觉方案2 天前
