Black Forest Labs 发布 FLUX 3:首个能生成带音效视频的多模态模型,支持20秒片段

2026年7月23日,德国AI实验室Black Forest Labs(BFL)正式发布FLUX 3,这是该公司继FLUX.2之后推出的全新多模态基础模型。与此前只能生成图像的FLUX.1和FLUX.2不同,FLUX 3是真正意义上”联合训练”的多模态模型——能够同时理解和生成图像、视频和音频三种模态的内容,并且还能扩展到机器人动作预测领域。一句话概括:这是一款既能拍电影、又能教机器人的视觉智能模型。

FLUX 3是Black Forest Labs推出的第三代FLUX系列模型,也是该公司首次跨出纯图像生成领域的重要标志。从技术架构上说,FLUX 3基于BFL于2026年3月发布的Self-Flow研究方法构建——这是一种将多模态理解与生成统一在单一架构中的方法。与此前业界常见的”在通用接口后面拼接图像模型、视频模型、音频模型”的做法不同,FLUX 3从一开始就以一种统一的 multimodal transformer 架构同时学习图像、视频和音频,让三种模态互相约束、互相印证,从而学习到更深层的世界表示。

用BFL官方博客的话说:”从一种模态中学习,你只能得到该模态的良好投影。从三种模态同时学习,它们的相互约束会告诉你更多——声音必须与冲击匹配,运动必须符合质量,未来必须从前一刻延续。”这种”联合训练”的思路,是FLUX 3与此前所有文生视频模型最核心的区别。

FLUX 3目前最令人惊艳的能力,是能够一次性生成最长20秒、带有原生音效的视频。这里的”原生音效”(Native Audio)是一个关键技术点:传统上,即便AI视频模型能够生成画面,声音也通常是在生成后再通过单独的TTS或音效模型后期合成的。FLUX 3则在生成视频画面的同时,一并生成配乐、环境音、音效,甚至可以生成人物对话(支持多语言)。

具体功能包括:

文生视频(Text-to-Video):输入文字描述,直接生成视频片段
图生视频(Image-to-Video):以一张图片作为第一帧,生成后续内容
视频转视频(Video-to-Video):对已有视频进行风格或内容转换
关键帧过渡(Keyframe-based transitions):通过关键帧控制视频走向
多镜头序列(Multi-shot sequences):通过 Agent 驱动连接多个片段,生成更长叙事
人物表情和音效匹配:对人脸面部表情和声音与物理事件的匹配有专门优化

除了内容创作,FLUX 3的另一大方向是动作预测(Action Prediction)。BFL同步发布了基于FLUX 3的机器人动作模型Flux-mimic,其核心思路是:视频内容和物理动作本质上都遵循相同的物理规律,同一个架构学会理解”一个球从高处落下”之后,也更有可能学会预测”机械臂应该如何移动”。

目前,Flux-mimic正在奥迪(Audi)的生产线上进行测试,主要用于解决柔性物体操作等传统机器人难以应对的任务。动作预测能力初期仅通过选定的研究和商业合作伙伴提供,暂不公开开放。

BFL表示将在未来数周和数月内分阶段开放FLUX 3的各项能力。目前视频+原生音频生成已开放Early Access,图像生成与编辑数周内上线,快速变体和开放权重版本(Flux 3 Dev)后续开放。

FLUX 3的意义远不止”又一款文生视频模型”。它的发布标志着AI视觉领域出现了”一个模型、多种能力”的技术趋势——与其在图像、视频、音频、机器人控制上各自训练专门的模型,不如让一个模型同时学会所有这些能力,然后用同一个”世界观”去理解不同任务。BFL还透露,下一代模型的目标是将感知、动作和语言预测统一在同一个模型中。

Black Forest Labs总部位于德国弗莱堡,由Stable Diffusion的原班研究团队创办,估值达32.5亿美元,已累计融资超过4.5亿美元。2026年6月,著名电影导演马丁·斯科塞斯(Martin Scorsese)宣布加入BFL担任顾问。

FLUX 3是Black Forest Labs从”文生图模型厂商”向”多模态视觉智能公司”转型的标志性产品。20秒原生音视频生成、动作预测机器人能力、以及统一多模态架构的技术路线,让它在当前的AI视频生成竞争中占据了独特位置。接下来最值得关注的是:开放权重版本何时放出、实际生成质量与Sora/Kling/Runway的对比、以及Flux-mimic在更多工业场景中的表现。

相关链接:
FLUX 3官方介绍:https://bfl.ai/blog/flux-3
FLUX 3技术论文:https://bfl.ai/blog/flux-3-mimic