Grok Imagine Video 1.5 — xAI 排名第一的圖片轉影片模型,內建原生音訊
從文字提示和參考圖片生成電影級 720p/24fps 影片,最長可達 15 秒。原生音訊——對話、音效與環境音——由 Aurora 自迴歸引擎在單次生成中同步完成。
看看 Grok Imagine Video 1.5 能創造什麼
從原生音訊驅動的電影級對話到動漫動態、商業轉場和奇幻世界建構——探索 Grok Imagine Video 1.5 能從文字提示和參考圖片生成 720p/24fps 的驚豔影片類型。
原生音訊與語音——一次生成到位
對話、音效和環境音與影片同時生成——不是後期配音。語音與動作精準對齊,更加清晰、同步更佳。
1950 年代飯店電梯。一位身穿翡翠色禮服的女性與穿著紅色制服的電梯操作員交談,金色飾邊的門緩緩關上。柔和戲劇性燈光,濃郁的電影色彩。
動態商業到片場轉場
創作引人入勝的幕後花絮和轉場型行銷內容。Grok Imagine Video 1.5 能平滑地從精緻的商業產品鏡頭轉換到複雜的攝影棚場景,並搭配完全同步的擬音音效。
連續拉遠鏡頭。一隻手將牛奶倒入裝有冰咖啡的梅森罐中,旁邊是一疊餅乾。鏡頭動態向後拉遠,展現一位女性咬下餅乾時發出同步的清脆聲響,場景位於忙碌的綠幕攝影棚中,工作人員穿梭其中。
Grok Imagine Video 1.5 vs Seedance 2.0:AI 影片模型對比
Grok Imagine Video 1.5 和 Seedance 2.0 都是頂尖的圖片轉影片模型,具備原生音訊,但它們服務於不同的優先需求。Grok Imagine Video 1.5 優先考慮生成速度和單次視聽一致性。Seedance 2.0 優先考慮參考深度和多鏡頭控制。
Grok Imagine Video 1.5 — 基於 Aurora 自迴歸(MoE)引擎構建。單次生成 720p 影片搭配原生音訊,約 25 秒生成一段 6 秒片段。
Seedance 2.0 — 雙分支擴散 Transformer。擅長多鏡頭敘事,具有更廣泛的參考輸入支援和 1080p 輸出。
| 對比項目 | Grok Imagine Video 1.5 | Seedance 2.0 | 主要差異 |
|---|---|---|---|
| 開發者 | xAI |
Grok Imagine Video — 模型演進時間軸
從 xAI 首個圖片轉影片模型發布到登上 Arena 榜首的 1.5 版——以下是 Grok Imagine Video 的演進歷程。
Grok Imagine Video 1.0 發布
xAI 推出了首個專用圖片轉影片模型——獨立於 Grok 聊天機器人。基於專有的 Aurora 自迴歸引擎構建,可從文字和圖片輸入生成最長 10 秒的 720p/24fps 片段,迅速獲得創作者青睞。
多圖片支援與影片延伸
xAI 為 Grok Imagine Video 1.0 新增了多圖片支援和影片延伸功能,讓創作者可以串接參考圖片並延伸已生成的片段,實現更複雜的敘事工作流程。
API 預覽版與開發者存取
Grok Imagine Video 1.0 透過 xAI 開發者平台 API 開放使用,讓第三方整合和創意工具(如 Topview)能夠用於更廣泛的製作用途。
Grok Imagine Video 1.5 預覽版
xAI 發布 Grok Imagine Video 1.5 預覽版。它立即在圖片轉影片 Arena 排行榜上以較 1.0 版躍升 52 Elo 分的成績占據第 1 名,超越了 Seedance 2.0 和其他競爭對手。主要升級:更快的生成速度(約 25 秒快速模式)、原生音訊改進,以及延長至 15 秒的片段時長。
Grok Imagine Video 1.5 正式可用
Grok Imagine Video 1.5 結束預覽階段,在 xAI API 上正式可用(GA)。隨著 GA 發布,xAI 推出了新的創意工作流程功能——用於組織工作的專案、用於同時執行多個提示的並行代理,以及用於快速查找過去生成結果的搜尋功能。
模型參數
Grok Imagine Video 1.5 核心規格,供評估輸出品質、生成速度和製作適配度的創作者參考。
Grok Imagine Video 1.5
xAI 最新圖片轉影片模型,2026 年 6 月發布
圖片轉影片第 1 名
1404 Elo,較 v1.0 提升 +52(2026 年 5 月)
原生:對話、音效、環境音、音樂
Grok Imagine Video 1.5 新功能 — v1.0 vs v1.5 對比
Grok Imagine Video 1.5 是 xAI 最新的圖片轉影片模型,基於升級版 Aurora 自迴歸引擎構建。相比 1.0 版本,它提供更快的生成速度、更好的運動物理效果、改進的音訊同步和更長的影片時長。
| 功能 | Grok Imagine Video 1.0 | Grok Imagine Video 1.5 | 改進 |
|---|---|---|---|
| 最高解析度 | 720p | 720p | 細節更佳,變形更少 |
| 生成速度(6 秒 720p) | 約 40 秒以上 | 約 25 秒(快速) | 近 2 倍速度提升 |
| 最長時長 | 10 秒 | 15 秒 | 片段長度增加 50% |
| 原生音訊 | 基礎同步 | 更清晰的對話、更好的唇形同步、事件對齊的音效 | 更精緻的視聽一致性 |
| 運動物理 | 部分變形 | 更好的動量、更少變形、可信的重量感 | 更寫實的運動 |
| 畫面比例 | 5 種格式 | 7 種格式(1:1 到 16:9 及直式) | 完整平台原生支援 |
Grok Imagine Video 1.5 vs Seedance 2 vs Veo 4 vs Sora 2 - 模型對比
在 2026 年選擇合適的 AI 影片模型,需要比較輸出品質、速度和流程適配度。此對比聚焦於對創作者、行銷人員和製作團隊最重要的功能。
| 功能 | Grok Imagine Video 1.5 | Seedance 2 | Veo 4 | Sora 2 |
|---|---|---|---|---|
| 開發者 | xAI | ByteDance | OpenAI | |
| 最長時長 | 15 秒 | 15 秒 | 20 秒以上 | 12 秒 |
| 最高解析度 | 720p | 1080p | 4K | 1080p |
| 原生音訊 | 對話 + 音效 + 環境音(單次生成) | 對話 + 音效 + 唇形同步 | 對話 + 環境音混合 | 生成式音訊 |
| 輸入類型 | 圖片 + 文字 | 圖片 + 文字 + 多參考 | 圖片 + 文字 |
誰適合在 Topview 使用 Grok Imagine Video 1.5
Grok Imagine Video 1.5 專為需要快速圖片轉影片生成並配有原生音訊的團隊而打造——從電影敘事者和產品行銷團隊到社群內容創作者。
電影製作人與故事優先的創作者
當你需要從參考圖片獲得電影級構圖、鏡頭語言和場景構成時,Grok Imagine Video 1.5 的 Aurora 引擎能在約 25 秒內提供連貫的動態和原生音訊——速度足以支持創意探索。
時尚、美妝與產品團隊
從產品照片開始,生成精緻的產品展示影片。Grok Imagine Video 1.5 擅長在寫實動態和氛圍中保持參考圖片的產品細節和燈光氛圍。
成效行銷人員與廣告團隊
Grok Imagine Video 1.5 約 25 秒的快速模式使其成為廣告變體測試的理想選擇。快速生成多個開頭、角度和版本——比較成效並擴展有效的內容,而不會減慢你的創意流程。
如何使用 Grok Imagine Video 1.5

上傳參考圖片並撰寫提示詞
從你的關鍵視覺開始——可以是產品照片、角色設計或場景參考。描述你想要的動態、鏡頭運動和音訊氛圍。

生成影片
點擊生成,觀看 Grok Imagine Video 1.5 在約 25 秒(快速模式)內創作出帶有原生音訊的 720p/24fps 影片。

下載影片
準備好發布到任何平台時,匯出帶有同步音訊的乾淨 MP4 檔案。
體驗 Grok Imagine Video 1.5 — 排名第一的圖片轉影片 AI
無需昂貴的 GPU。從文字提示和參考圖片生成電影級 720p 影片,搭配原生音訊——全部在 Topview 上使用 Grok Imagine Video 1.5 約 25 秒即可完成。
免費開始 · 無需信用卡 · 所有領先的 AI 影片模型都在一個工作區中
