FLUX 3 AI動画ジェネレーター
Black Forest Labsのマルチモーダル基盤モデルFLUX 3で、ネイティブ音声付きのシネマティックなAI動画を生成。Topview上で、テキスト・画像・動画参照から最大20秒のクリップを生成できます

FLUX 3とは?

FLUX 3はBlack Forest Labsのマルチモーダル基盤モデルです。統一されたSelf-Flowアーキテクチャで画像・動画・音声を共同学習し、動き・音・視覚構造の一貫性を保ちます。Topviewでは、テキストから動画、画像から動画、参照駆動のクリップをネイティブ音声付きでオンライン体験できます。
マルチモーダルSelf-Flowが重要な理由
- 画像・動画・音声を一つのモデルで——分断されたパイプラインではない
- ネイティブ音声が動画と1回の生成で同時に生成される
- 最大20秒のクリップで強い時間的連続性
- テキスト・画像・動画参照による制御可能な生成
- 多言語ダイアログと高いスタイル多様性
- エージェント型マルチショット連結でより長いシーケンスへ
FLUX 3の際立つ機能
最大20秒、サウンド内蔵の動画
最大20秒の多様なクリップを1回で生成し、音声も同時に生成。衝撃音、会話、アンビエンスが映像に同期されるため、別途サウンドトラック工程は不要です。
最大20秒 | ネイティブ音声 | ワンパス
テキスト・画像・動画参照
プロンプトから始め、静止画をアニメーション化し、参照クリップのキャラクターを新シーンへ引き継ぐ——モダリティ別ツールを継ぎ接ぎする必要はありません。
テキストから動画 | 画像から動画 | 動画参照

ショットをまたいで同じキャラクターを維持
動画から動画とエージェント型マルチショット連結により、短いクリップから長いシーケンスを組み立てる際も、顔の同一性・衣装・存在感の一貫性を保てます。
V2V引き継ぎ | マルチショット | アイデンティティロック
多言語ダイアログと表現豊かな顔
初期評価では、強い表情、多言語ダイアログ、幅広いスタイル——カムコーダーのリアルからアニメ・シネマまで——が強調されています。
表情演技 | 多言語 | スタイル幅
See what creators make with FLUX 3
Real clips shared on X—watch the posts below, then try FLUX 3 yourself on Topview.
FLUX 3モデルのハイライト
TopviewでFLUX 3動画生成を試すクリエイター向けの主要パラメータと能力。
Self-Flow
画像・動画・音声にわたる統一マルチモーダルフローマッチング。
画像 + 動画 + 音声
共同学習により、音・動き・構造を揃える。
最大20秒
ネイティブ音声付きの1回の生成クリップ(Early Access)。
内蔵
音声は動画と同時に生成——別の後工程ではない。
テキスト / 画像 / 動画
T2V、I2Vアニメーションまたは参照、V2Vキャラクター引き継ぎ。
キーフレームと連続性
キーフレームから動画、映像-音声の継続、マルチショット連結。
多言語
グローバルなストーリーテリング向けの強力な多言語ダイアログ。
高い多様性
カムコーダー映像からアニメ・シネマティックな見た目まで。
モーションテキスト
強いタイポグラフィ生成とアニメーションデザイン出力。
Video Early Accessは現在利用可能
Topview経由でFLUX 3動画をオンライン体験。Image Early Accessは近日開始予定。
10s · 720p
初期の選好テストは音声付き10秒720pのT2Vクリップを使用。
基盤モデル
コンテンツ制作とフィジカルAI(アクション)のバックボーン。
FLUX 3の新機能
従来のFLUX画像モデルや典型的な単一モダリティ動画ジェネレーターと比べ、FLUX 3はSelf-Flowの下で画像・動画・音声を統合——ネイティブ音声付き動画と、より強いマルチモーダル制御を実現します。
| 能力 | 従来のFLUX / 典型的な動画モデル | FLUX 3 | なぜ重要か |
|---|---|---|---|
| モデル範囲 | 画像中心、または分離した動画スタック | 統一マルチモーダル基盤 | 画像・動画・音声を一つのバックボーンで |
| アーキテクチャ | モダリティごとの標準フローマッチング | Self-Flowマルチモーダル整列 | クロスモーダル一貫性が向上 |
| 動画 + 音声 | 無音動画、または後付け音声 | 1回の生成でネイティブ音声 | 音が物理イベントに一致 |
| クリップ長 | より短い、または複数パスのワークフロー | 最大20秒のシングルパス | より長く一貫したシーン |
| 画像から動画 | 基本的な開始フレームアニメーション | アニメーションまたは視覚参照モード | 柔軟なI2V制御 |
| キャラクター連続性 | ショット間の同一性は弱い | V2Vキャラクター引き継ぎ | 同じキャラクター、新しいシーン |
| 連続性ツール | 限定的な継続 | 映像-音声継続 + キーフレーム | 制御されたトランジション |
| より長い物語 | クリップの手動つなぎ | エージェント型マルチショット連結 | 分単位のシーケンス |
| ダイアログ | 限定的、または英語中心 | 多言語ダイアログ | グローバルなストーリーテリング |
| タイポグラフィ | 弱いモーションテキスト | 強いタイポグラフィとアニメーションデザイン | タイトルとブランドモーション |
| 画像品質 | 以前のFLUX世代 | 複雑なプロンプトとテキストが向上 | 中間学習の初期成果 |
| アクション / ロボティクス | 主要な経路ではない | アクション予測 + FLUX-mimic | コンテンツ + フィジカルAI |
初期の選好評価
Black Forest Labsは、FLUX 3 Videoの予備的な選好結果を公開しました(音声付き10秒テキストから動画、720p)。これらは初期評価であり、モデルとハーネスは開発中で、Early Access中に結果が改善する可能性があります。
| 比較モデル | FLUX 3が選好された割合 |
|---|---|
| Grok Imagine Video | 最大69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
| Runway Gen-4.5 | 77% |
| Luma Ray 3.2 | 93% |
予備的な情報のみ。選好率はBFLが報告した初期の人間比較に基づき、最終ベンチマークとして扱うべきではありません。
BFLが挙げる初期の強み
- 人間の表情
- 音と物理イベントの対応付け
- 多言語能力
- マルチショットシーケンスにおけるキャラクター一貫性
これらの初期統計は方向性のシグナルとして使い、絶対的な順位ではありません。TopviewでFLUX 3の動画生成をオンラインで試し、自分のプロンプトとワークフローで品質を判断してください。
TopviewでFLUX 3を試すFLUX 3を使うべき人
ネイティブ音声付きのマルチモーダルAI動画を必要とするチーム向け——画像Early Accessの準備やアクション探索をするクリエイター・パートナーにも。
映画制作者とストーリーテラー
ダイアログ、SFX、マルチショット連結でシネマティックなシーンを作り、キャラクターの同一性を保ちます。
ブランド・パフォーマンスマーケター
製品発表、フック、ライフスタイルスポットを音声込みで一回生成し、クリエイティブテストを加速。
ソーシャル・UGCクリエイター
多言語ダイアログ、トレンドスタイル、参照駆動の連続性で縦型リールを届けます。
モーションデザイナー
タイポグラフィ、アニメーションデザイン、カムコーダーからフルシネマまでのスタイル幅を探求。
代理店・制作チーム
キーフレーム、動画参照、継続ツールでショット間のトランジションを制御。
R&DとフィジカルAIチーム
動画世界モデルとロボティクスが交わるFLUX 3 ActionおよびFLUX-mimicの道筋を追う。
TopviewでFLUX 3を試す方法

AI動画ジェネレーターを開く
TopviewのAI動画ジェネレーターに進み、FLUX 3を選んでテキストから動画・画像から動画・動画参照セッションを開始します。

プロンプトと参照を追加
シーン、ダイアログ、音声を記述。必要に応じて画像または動画参照をアップロードし、アニメーション・スタイル・キャラクター一貫性に使います。

生成してダウンロード
尺とアスペクト比を選び、最大20秒のネイティブ音声付き動画を生成。確認してクリップをダウンロードします。
FLUX 3動画生成をオンラインで試す
Topviewでネイティブ音声付きのマルチモーダルAI動画を生成——テキスト・画像・動画参照はBlack Forest LabsのFLUX 3が駆動します
FLUX 3 Video Early Access · 画像Early Accessは今後数週間で公開予定
