FLUX 3 AI 视频生成器
用 FLUX 3——Black Forest Labs 的多模态基础模型,生成带原生音频的电影级 AI 视频。在 Topview 上,从文本、图片或视频参考创作最长 20 秒的片段。

什么是 FLUX 3?

FLUX 3 是 Black Forest Labs 的多模态基础模型。它在统一的 Self-Flow 架构中联合学习图像、视频与音频,使运动、声音与视觉结构保持一致。在 Topview 上,你可以在线体验 FLUX 3 视频生成:文生视频、图生视频,以及带原生音频的参考驱动片段。
为什么多模态 Self-Flow 很重要
- 一个模型覆盖图像、视频与音频——而非割裂的管线
- 原生音频与视频同一次生成完成
- 最长 20 秒片段,时间连贯性强
- 文本、图片与视频参考,可控生成
- 多语言对白与丰富风格多样性
- 智能体式多镜头串联,支持更长序列
FLUX 3 核心亮点
最长 20 秒视频,声音内建
一次生成最长 20 秒、风格多样的片段,音频同步产出——撞击、对白与环境音与画面锁定,无需单独配乐步骤。
最长 20 秒 | 原生音频 | 一次生成
文本、图片与视频参考
从提示词起步、让静帧动起来,或把参考片段中的角色带入新场景——无需拼接多个模态工具才能完成工作流。
文生视频 | 图生视频 | 视频参考

多镜头保持同一角色
视频到视频与智能体式多镜头串联,帮助你在由短片段拼出更长序列时,保持面部身份、服饰与出场感连贯。
V2V 延续 | 多镜头 | 身份锁定
多语言对白与富有表现力的面孔
早期评测显示面部表情强、多语言对白出色、风格跨度大——从摄像机纪实到动画与电影质感。
面部表演 | 多语言 | 风格广度
See what creators make with FLUX 3
Real clips shared on X—watch the posts below, then try FLUX 3 yourself on Topview.
FLUX 3 模型要点
创作者在 Topview 体验 FLUX 3 视频生成时的关键参数与能力一览。
Self-Flow
在图像、视频与音频上统一的多模态流匹配。
图像 + 视频 + 音频
联合学习,使声音、运动与结构保持对齐。
最长 20 秒
单次生成片段,自带原生音频(Early Access)。
内建
音频与视频联合生成——不是后期单独步骤。
文本 / 图片 / 视频
T2V、I2V 动画或参考,以及 V2V 角色延续。
关键帧与连贯性
关键帧到视频、视频-音频续写、多镜头串联。
多语言
强大的多语言对白,适合全球叙事。
高度多样
从家用摄像机素材到动画与电影质感。
动态文字
出色的字体生成与动态设计输出。
视频 EA 现已开放
通过 Topview 在线体验 FLUX 3 视频;图像 EA 即将推出。
10s · 720p
早期偏好测试使用带音频的 10 秒 720p T2V 片段。
基础模型
内容创作与物理 AI(动作)的骨干模型。
FLUX 3 有何新变化
相较早期 FLUX 图像模型与常见单模态视频生成器,FLUX 3 在 Self-Flow 下统一图像、视频与音频——原生音频视频,多模态控制更强。
| 能力 | 以往 FLUX / 典型视频模型 | FLUX 3 | 意义何在 |
|---|---|---|---|
| 模型范围 | 偏图像,或视频栈彼此分离 | 统一多模态基础模型 | 一套骨干覆盖图像、视频、音频 |
| 架构 | 按模态的标准流匹配 | Self-Flow 多模态对齐 | 跨模态一致性更好 |
| 视频 + 音频 | 静音视频或后期硬挂音频 | 一次生成原生音频 | 声音与物理事件匹配 |
| 片段长度 | 更短,或需多轮流程 | 最长 20 秒单次生成 | 更长且连贯的场景 |
| 图生视频 | 基础首帧动画 | 动画或视觉参考模式 | I2V 控制更灵活 |
| 角色连贯 | 跨镜头身份偏弱 | V2V 角色延续 | 同一角色,新场景 |
| 连贯工具 | 续写能力有限 | 视频-音频续写 + 关键帧 | 过渡更可控 |
| 更长叙事 | 手动拼接片段 | 智能体式多镜头串联 | 分钟级序列 |
| 对白 | 有限或以英语为主 | 多语言对白 | 全球叙事 |
| 字体排版 | 动态文字偏弱 | 强字体与动态设计 | 标题与品牌动效 |
| 图像质量 | 早期 FLUX 代际 | 复杂提示词与文字更强 | 中期训练初步提升 |
| 动作 / 机器人 | 非主要路径 | 动作预测 + FLUX-mimic | 内容 + 物理 AI |
早期偏好评测
Black Forest Labs 发布了 FLUX 3 Video 的初步偏好结果(10 秒文生视频、720p、带音频)。这些是早期评测——模型与评测框架仍在演进,Early Access 期间结果可能继续提升。
| 对比模型 | 偏好 FLUX 3 |
|---|---|
| Grok Imagine Video | 最高达 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
| Runway Gen-4.5 | 77% |
| Luma Ray 3.2 | 93% |
仅供初步参考。偏好率来自 BFL 报告的早期人工对比,不应视为最终基准。
BFL 点出的早期优势
- 人物面部表情
- 声音与物理事件关联
- 多语言能力
- 多镜头序列中的角色一致性
请把这些早期数据当作方向性信号,而非绝对排名。在 Topview 在线体验 FLUX 3 视频生成,用你自己的提示词与工作流判断质量。
在 Topview 体验 FLUX 3谁适合使用 FLUX 3
面向需要原生音频多模态 AI 视频的团队——以及筹备图像 Early Access、探索动作路径的创作者与合作伙伴。
电影人与叙事创作者
用对白、音效与多镜头串联打造电影级场景,同时保持角色身份一致。
品牌与效果营销
一次生成带音频的产品揭幕、钩子与生活方式短片,加速创意测试。
社交与 UGC 创作者
产出竖屏短视频:多语言对白、潮流风格,以及参考驱动的连贯性。
动态设计师
探索字体、动态设计,以及从家用摄像机到完整电影质感的风格区间。
代理商与制作团队
用关键帧、视频参考与续写工具,控制镜头之间的过渡。
研发与物理 AI 团队
关注 FLUX 3 Action 与 FLUX-mimic 路径——视频世界模型与机器人交汇处。
如何在 Topview 体验 FLUX 3

打开 AI 视频生成器
进入 Topview 的 AI 视频生成器,选择 FLUX 3,开始文生视频、图生视频或视频参考会话。

添加提示词与参考
描述场景、对白与音频。可选上传图片或视频参考,用于动画、风格或角色一致性。

生成并下载
选择时长与画幅,生成最长 20 秒、自带原生音频的视频,预览后下载你的片段。
在线体验 FLUX 3 视频生成
在 Topview 创作带原生音频的多模态 AI 视频——文本、图片与视频参考,由 Black Forest Labs 的 FLUX 3 驱动。
FLUX 3 Video Early Access · 图像 Early Access 将于未来数周开放
