FLUX 3 Video:原生音频、20 秒视频与创作工作流

2026/07/24

FLUX 3 Video 是 Black Forest Labs 面向电影感多模态创作的新一代 AI 视频模型。 它把原生音频、文字、图片和视频输入、关键帧、场景续写,以及最长 20 秒单次生成整合进同一系统。

这套工作流可以同时完成镜头构建、声音设计、首尾帧控制、来源视频转换和场景延展,让创作者不必每次都从零开始。

FLUX 3 Video 核心能力

创作能力FLUX 3 Video
单次生成时长最长 20 秒
原生音频对白、环境声、音效与音乐
创作输入文字、图片与视频
关键帧控制首帧与尾帧
视频转换来源镜头引导运动与风格
视频与音频续写延展完整视听场景
对白能力多语言

这些能力适合电影预演、产品广告、短视频、视觉开发、品牌叙事和多镜头内容制作。

FLUX 3 是什么?

FLUX 3 是 Black Forest Labs 的视觉智能模型家族。相比只做单一图片生成,这一代模型把图像与视频放进一个统一的多模态方向中。

视频系统已公布的工作流包括:

  • 文字、图片和视频输入
  • 原生音频生成
  • 首帧和尾帧控制
  • 视频转换
  • 视频与音频续写
  • 多语言对白
  • 画面文字与字体表现
  • 多步骤智能创作链路

它更像一个面向电影团队、品牌、产品、游戏、广告和内容创作者的完整场景构建系统,而不是只有一个提示词输入框的短片工具。

单次最长能生成多长视频?

Black Forest Labs 公布这款视频模型单次生成最长 20 秒

这里的关键词是“单次生成”。通过片段续写和创作链路,未来可能连接成更长序列,但这不等于一次直接生成几分钟视频。

20 秒已经足够容纳:

  • 有开场和落点的完整镜头
  • 一小段人物对白
  • 带镜头运动的产品展示
  • 一条社交广告的核心节拍
  • 同时带环境声和音效的电影预演镜头

模型支持原生音频吗?

支持。原生音频是这套系统的核心能力,可让对白、环境声、音效和音乐方向与画面一起生成。

声音从镜头设计阶段就参与创作,不再只是生成画面后的补充步骤。提示词可以描述观众应该听到什么、声音何时出现,以及声音如何推动情绪和节奏。

文生视频提示词

一条更适合这款模型的文生视频提示词,应同时写清:

  1. 主体和环境
  2. 动作和节奏
  3. 镜头运动与构图
  4. 光线与视觉风格
  5. 对白、环境声、音效或音乐方向
  6. 目标时长和画幅

可以在文生视频工作台中完整描述主体、运动、镜头、光线、节奏、对白和声音。

图生视频与关键帧

当人物、产品、插画、角色或构图必须保持可识别时,图生视频比纯文字更合适。模型还支持首帧和尾帧控制,可以更清楚地约束镜头从哪里开始、到哪里结束。

一个实用的关键帧工作流包括:

  • 用干净的首帧确定主体和构图
  • 用兼容的尾帧描述目标状态
  • 提示词只聚焦中间的运动、镜头和节奏
  • 加入与镜头时间一致的对白和声音方向

可以在图生视频工作台提前整理这些参考素材。

视频转换与续写

这套视频系统同时面向两种不同任务:

  • 视频转换:让来源视频提供运动、节奏、构图或视觉处理参考。
  • 视频与音频续写:延续已有视听场景,把上下文带进下一段生成。

这对多镜头故事很重要,因为创作者不必每次都从零重建人物、场景和声音。

本站是 FLUX 3 官方网站吗?

不是。flux3video.app 是独立 AI 视频创作工作台,并非 Black Forest Labs 官方网站。官方公告和申请请以 bfl.ai 为准。

生成的视频可以商用吗?

商业项目应使用原创或已获授权的输入素材,并遵守所选生成方案的使用条款。发布广告、客户项目或变现内容前,请检查:

  • 当前渠道的商用条款
  • 上传素材是否有合法授权
  • 可识别人物是否已同意
  • Logo、音乐、角色和产品素材权利
  • 是否需要来源或 AI 内容标识

常见问题

支持多语言对白吗?

支持。多语言对白让模型可以处理人物场景、解释视频、广告和以口语表演为核心的叙事镜头。

能生成可读文字吗?

支持。文字与字体表现可以用于标题、包装、界面、招牌和品牌文字参与画面构图的创意场景。

FLUX 3 团队

FLUX 3 团队

FLUX 3 Video:原生音频、20 秒视频与创作工作流 | FLUX 3