FLUX 3 Video 是 Black Forest Labs 面向电影感多模态创作的新一代 AI 视频模型。 它把原生音频、文字、图片和视频输入、关键帧、场景续写,以及最长 20 秒单次生成整合进同一系统。
这套工作流可以同时完成镜头构建、声音设计、首尾帧控制、来源视频转换和场景延展,让创作者不必每次都从零开始。
FLUX 3 Video 核心能力
| 创作能力 | FLUX 3 Video |
|---|---|
| 单次生成时长 | 最长 20 秒 |
| 原生音频 | 对白、环境声、音效与音乐 |
| 创作输入 | 文字、图片与视频 |
| 关键帧控制 | 首帧与尾帧 |
| 视频转换 | 来源镜头引导运动与风格 |
| 视频与音频续写 | 延展完整视听场景 |
| 对白能力 | 多语言 |
这些能力适合电影预演、产品广告、短视频、视觉开发、品牌叙事和多镜头内容制作。
FLUX 3 是什么?
FLUX 3 是 Black Forest Labs 的视觉智能模型家族。相比只做单一图片生成,这一代模型把图像与视频放进一个统一的多模态方向中。
视频系统已公布的工作流包括:
- 文字、图片和视频输入
- 原生音频生成
- 首帧和尾帧控制
- 视频转换
- 视频与音频续写
- 多语言对白
- 画面文字与字体表现
- 多步骤智能创作链路
它更像一个面向电影团队、品牌、产品、游戏、广告和内容创作者的完整场景构建系统,而不是只有一个提示词输入框的短片工具。
单次最长能生成多长视频?
Black Forest Labs 公布这款视频模型单次生成最长 20 秒。
这里的关键词是“单次生成”。通过片段续写和创作链路,未来可能连接成更长序列,但这不等于一次直接生成几分钟视频。
20 秒已经足够容纳:
- 有开场和落点的完整镜头
- 一小段人物对白
- 带镜头运动的产品展示
- 一条社交广告的核心节拍
- 同时带环境声和音效的电影预演镜头
模型支持原生音频吗?
支持。原生音频是这套系统的核心能力,可让对白、环境声、音效和音乐方向与画面一起生成。
声音从镜头设计阶段就参与创作,不再只是生成画面后的补充步骤。提示词可以描述观众应该听到什么、声音何时出现,以及声音如何推动情绪和节奏。
文生视频提示词
一条更适合这款模型的文生视频提示词,应同时写清:
- 主体和环境
- 动作和节奏
- 镜头运动与构图
- 光线与视觉风格
- 对白、环境声、音效或音乐方向
- 目标时长和画幅
可以在文生视频工作台中完整描述主体、运动、镜头、光线、节奏、对白和声音。
图生视频与关键帧
当人物、产品、插画、角色或构图必须保持可识别时,图生视频比纯文字更合适。模型还支持首帧和尾帧控制,可以更清楚地约束镜头从哪里开始、到哪里结束。
一个实用的关键帧工作流包括:
- 用干净的首帧确定主体和构图
- 用兼容的尾帧描述目标状态
- 提示词只聚焦中间的运动、镜头和节奏
- 加入与镜头时间一致的对白和声音方向
可以在图生视频工作台提前整理这些参考素材。
视频转换与续写
这套视频系统同时面向两种不同任务:
- 视频转换:让来源视频提供运动、节奏、构图或视觉处理参考。
- 视频与音频续写:延续已有视听场景,把上下文带进下一段生成。
这对多镜头故事很重要,因为创作者不必每次都从零重建人物、场景和声音。
本站是 FLUX 3 官方网站吗?
不是。flux3video.app 是独立 AI 视频创作工作台,并非 Black Forest Labs 官方网站。官方公告和申请请以 bfl.ai 为准。
生成的视频可以商用吗?
商业项目应使用原创或已获授权的输入素材,并遵守所选生成方案的使用条款。发布广告、客户项目或变现内容前,请检查:
- 当前渠道的商用条款
- 上传素材是否有合法授权
- 可识别人物是否已同意
- Logo、音乐、角色和产品素材权利
- 是否需要来源或 AI 内容标识
常见问题
支持多语言对白吗?
支持。多语言对白让模型可以处理人物场景、解释视频、广告和以口语表演为核心的叙事镜头。
能生成可读文字吗?
支持。文字与字体表现可以用于标题、包装、界面、招牌和品牌文字参与画面构图的创意场景。

