Black Forest Labs 多模态视频

FLUX 3

Black Forest Labs 多模态视频模型,可从文本生成同步音频。

适合做什么

用 FLUX 3 导演完整视听场景

从文字、连续图片或现有片段出发,生成连贯的 720p 或 1080p 视频,并同步对话、环境声与音效。

使用 FLUX 3 创作

叙事预览

在正式制作前,用画面与同步声音搭完整场景。

分镜动画

把已批准的分镜帧串成连贯的视觉序列。

镜头延展

在保持视觉方向的前提下,延续一次成功的生成。

核心能力

创作者为何选择 FLUX 3

01

画面与声音一次生成

在一条提示词里描述动作、镜头运动、对话、环境声与特效。FLUX 3 在同一次生成中合成动态画面与同步音轨。

A home video of a futuristic San Francisco with people riding hoverboards.
02

镜头内运动保持连贯

在 5 到 20 秒的片段中构建有氛围的场景——镜头运动、主体动作与环境细节都更稳定。

03

分镜或续拍已有镜头

用一张图作开场帧、两张作首尾帧、最多十张作定时分镜,或以 MP4 为起点续拍后续内容。

如何获得更好的效果

提升效果的技巧

先写清主体,再补充光影、风格,以及必须保持不变的内容。需要更可控的编辑时,上传参考图。

  1. 1

    把声音写进提示词

    当音频很重要时,请明确写出对话、房间底噪、音乐与音效。

  2. 2

    3 张以上图片需设时长

    分镜输入必须指定时长,帧才能可预期地分配。

  3. 3

    1080p 前先 Draft

    用 Draft 验证节奏与构图,再以全质量渲染成片。

用 FLUX 3 把下一个创意变成视频

返回上方的工作区,或浏览完整模型目录后再开始。