Grok Imagine Video 1.5 — xAI 排名第一的圖片轉影片模型,內建原生音訊
從文字提示和參考圖片生成電影級 720p/24fps 影片,最長可達 15 秒。原生音訊——對話、音效與環境音——由 Aurora 自迴歸引擎在單次生成中同步完成。
看看 Grok Imagine Video 1.5 能創造什麼
從原生音訊驅動的電影級對話到動漫動態、商業轉場和奇幻世界建構——探索 Grok Imagine Video 1.5 能從文字提示和參考圖片生成 720p/24fps 的驚豔影片類型。
原生音訊與語音——一次生成到位
對話、音效和環境音與影片同時生成——不是後期配音。語音與動作精準對齊,更加清晰、同步更佳。
1950 年代飯店電梯。一位身穿翡翠色禮服的女性與穿著紅色制服的電梯操作員交談,金色飾邊的門緩緩關上。柔和戲劇性燈光,濃郁的電影色彩。
動態商業到片場轉場
創作引人入勝的幕後花絮和轉場型行銷內容。Grok Imagine Video 1.5 能平滑地從精緻的商業產品鏡頭轉換到複雜的攝影棚場景,並搭配完全同步的擬音音效。
連續拉遠鏡頭。一隻手將牛奶倒入裝有冰咖啡的梅森罐中,旁邊是一疊餅乾。鏡頭動態向後拉遠,展現一位女性咬下餅乾時發出同步的清脆聲響,場景位於忙碌的綠幕攝影棚中,工作人員穿梭其中。
風格化動漫與動作一致性
渲染充滿活力的動漫藝術和流暢的角色動態。Grok Imagine Video 1.5 在動態風格化鏡頭中保持完美的角色細節、複雜的布料物理和富有表現力的面部演出。
風格化動漫 3D 動畫。一位可愛的藍髮精靈女孩,紅色眼睛,身穿黑色賽博龐克旗袍,帶有藍龍印花和戰術綁帶,在掛著紅燈籠的傳統寺廟前俏皮跳舞。流暢的動態,俏皮的眨眼和微笑,充滿活力的燈光,細節豐富。
多主體物理與互動
模擬超寫實的動物運動和混亂的城市物理效果。Grok Imagine Video 1.5 能無縫協調自然動物運動、鳥群飛行動態和擁擠環境中的體積蒸汽。
一隻兔子在紐約市飛奔,快節奏,照片級寫實。
敘事角色成長與世界建構
呈現連續的角色演變和史詩級世界尺度轉場。Grok Imagine Video 1.5 能模擬生物成長——如孵化與成長——同時在廣闊、物理豐富的奇幻環境中保持角色身份一致性。
一支電影級奇幻場景。一隻可愛的白色幼龍從一顆閃爍著虹彩光芒、周圍環繞著發光水晶的蛋中孵化。幼龍在懸崖邊成長並展開翅膀,然後起飛平穩地穿越蓬鬆的雲層。畫面過渡到牠雄偉地翱翔,迎向壯麗的日落,背景是廣闊的浮空島嶼和巨大的水晶尖塔景觀。
Grok Imagine Video 1.5 vs Seedance 2.0:AI 影片模型對比
Grok Imagine Video 1.5 和 Seedance 2.0 都是頂尖的圖片轉影片模型,具備原生音訊,但它們服務於不同的優先需求。Grok Imagine Video 1.5 優先考慮生成速度和單次視聽一致性。Seedance 2.0 優先考慮參考深度和多鏡頭控制。
Grok Imagine Video 1.5 — 基於 Aurora 自迴歸(MoE)引擎構建。單次生成 720p 影片搭配原生音訊,約 25 秒生成一段 6 秒片段。
Seedance 2.0 — 雙分支擴散 Transformer。擅長多鏡頭敘事,具有更廣泛的參考輸入支援和 1080p 輸出。
| 對比項目 | Grok Imagine Video 1.5 | Seedance 2.0 | 主要差異 |
|---|---|---|---|
| 開發者 | xAI | ByteDance | 不同的研究團隊和架構 |
| 架構 | Aurora 自迴歸(MoE) | 雙分支擴散 Transformer | Grok 使用自迴歸;Seedance 使用擴散式生成 |
| 生成速度(6 秒片段) | 約 25 秒(快速模式) | 約 120 秒 | Grok Imagine Video 1.5 快約 5 倍 |
| 最高解析度 | 720p | 1080p | Seedance 提供更高的最高解析度 |
| 最長時長 | 15 秒 | 15 秒 | 兩者都支援最長 15 秒片段 |
| 原生音訊輸出 | 單次生成:對話、音效、環境音 | 對話、音效、唇形同步 | 兩者都提供完整的視聽生成 |
| 輸入類型 | 圖片 + 文字提示詞 | 圖片 + 文字 + 多參考支援 | Seedance 每次生成可接受更多參考圖片 |
| Arena 排行榜(I2V) | 第 1 名(2026 年 5 月) | 第 2 名 | Grok Imagine Video 1.5 目前領先 |
| 最適合 | 快速圖片轉影片、原生音訊、快速迭代 | 參考深度、多鏡頭、1080p 輸出 | Grok 適合速度;Seedance 適合參考多樣性 |
Grok Imagine Video — 模型演進時間軸
從 xAI 首個圖片轉影片模型發布到登上 Arena 榜首的 1.5 版——以下是 Grok Imagine Video 的演進歷程。
Grok Imagine Video 1.0 發布
xAI 推出了首個專用圖片轉影片模型——獨立於 Grok 聊天機器人。基於專有的 Aurora 自迴歸引擎構建,可從文字和圖片輸入生成最長 10 秒的 720p/24fps 片段,迅速獲得創作者青睞。
多圖片支援與影片延伸
xAI 為 Grok Imagine Video 1.0 新增了多圖片支援和影片延伸功能,讓創作者可以串接參考圖片並延伸已生成的片段,實現更複雜的敘事工作流程。
API 預覽版與開發者存取
Grok Imagine Video 1.0 透過 xAI 開發者平台 API 開放使用,讓第三方整合和創意工具(如 Topview)能夠用於更廣泛的製作用途。
Grok Imagine Video 1.5 預覽版
xAI 發布 Grok Imagine Video 1.5 預覽版。它立即在圖片轉影片 Arena 排行榜上以較 1.0 版躍升 52 Elo 分的成績占據第 1 名,超越了 Seedance 2.0 和其他競爭對手。主要升級:更快的生成速度(約 25 秒快速模式)、原生音訊改進,以及延長至 15 秒的片段時長。
Grok Imagine Video 1.5 正式可用
Grok Imagine Video 1.5 結束預覽階段,在 xAI API 上正式可用(GA)。隨著 GA 發布,xAI 推出了新的創意工作流程功能——用於組織工作的專案、用於同時執行多個提示的並行代理,以及用於快速查找過去生成結果的搜尋功能。
生態系與平台成長
Grok Imagine Video 模型可透過 xAI API(grok-imagine-video-1.5)、grok.com/imagine 網頁應用程式、iOS 和 Android 應用程式以及第三方創意平台使用。基於 Aurora 自迴歸架構,在 110,000 顆 NVIDIA GB200 GPU 上訓練。
現已推出模型參數
Grok Imagine Video 1.5 核心規格,供評估輸出品質、生成速度和製作適配度的創作者參考。
Grok Imagine Video 1.5
xAI 最新圖片轉影片模型,2026 年 6 月發布
圖片轉影片第 1 名
1404 Elo,較 v1.0 提升 +52(2026 年 5 月)
原生:對話、音效、環境音、音樂
與影片單次生成——無需後期配音
Aurora 自迴歸(MoE)
xAI 專有的混合專家架構
110,000 顆 GB200 GPU
最大的影片 AI GPU 叢集之一
480p(草稿)/ 720p(輸出)
24fps 電影標準幀率
每片段 6 - 15 秒
可透過串接延伸
7 種(1:1、16:9、9:16、4:3、3:4、3:2、2:3)
從方形到直式,完整平台覆蓋
圖片 + 文字
上傳參考圖片搭配自然語言提示詞
H.264 MP4
輸入接受 JPG、PNG、WEBP、GIF、AVIF
約 25 秒(6 秒 720p 快速)
比 v1.0 快約 2 倍;比競爭對手快約 4-5 倍
grok-imagine-video-1.5
透過 xAI API 正式可用
Grok Imagine Video 1.5 新功能 — v1.0 vs v1.5 對比
Grok Imagine Video 1.5 是 xAI 最新的圖片轉影片模型,基於升級版 Aurora 自迴歸引擎構建。相比 1.0 版本,它提供更快的生成速度、更好的運動物理效果、改進的音訊同步和更長的影片時長。
| 功能 | Grok Imagine Video 1.0 | Grok Imagine Video 1.5 | 改進 |
|---|---|---|---|
| 最高解析度 | 720p | 720p | 細節更佳,變形更少 |
| 生成速度(6 秒 720p) | 約 40 秒以上 | 約 25 秒(快速) | 近 2 倍速度提升 |
| 最長時長 | 10 秒 | 15 秒 | 片段長度增加 50% |
| 原生音訊 | 基礎同步 | 更清晰的對話、更好的唇形同步、事件對齊的音效 | 更精緻的視聽一致性 |
| 運動物理 | 部分變形 | 更好的動量、更少變形、可信的重量感 | 更寫實的運動 |
| 畫面比例 | 5 種格式 | 7 種格式(1:1 到 16:9 及直式) | 完整平台原生支援 |
| API 狀態 | 預覽版 | 正式可用(GA) | 生產就緒的 API |
| Arena 排行榜 | 強力競爭者 | 圖片轉影片第 1 名(+52 Elo 躍升) | 頂尖排名模型 |
| 平台功能 | 基礎生成 | 專案、並行代理、搜尋庫 | 全新創意工作流程工具 |
| 訓練算力 | 上一代叢集 | 110,000 顆 GB200 GPU | 大規模基礎設施 |
Grok Imagine Video 1.5 vs Seedance 2 vs Veo 4 vs Sora 2 - 模型對比
在 2026 年選擇合適的 AI 影片模型,需要比較輸出品質、速度和流程適配度。此對比聚焦於對創作者、行銷人員和製作團隊最重要的功能。
| 功能 | Grok Imagine Video 1.5 | Seedance 2 | Veo 4 | Sora 2 |
|---|---|---|---|---|
| 開發者 | xAI | ByteDance | OpenAI | |
| 最長時長 | 15 秒 | 15 秒 | 20 秒以上 | 12 秒 |
| 最高解析度 | 720p | 1080p | 4K | 1080p |
| 原生音訊 | 對話 + 音效 + 環境音(單次生成) | 對話 + 音效 + 唇形同步 | 對話 + 環境音混合 | 生成式音訊 |
| 輸入類型 | 圖片 + 文字 | 圖片 + 文字 + 多參考 | 圖片 + 文字 | 圖片 + 文字 |
| 架構 | Aurora 自迴歸(MoE) | 雙分支擴散 Transformer | 擴散 Transformer | 擴散 Transformer |
| 生成速度 | 約 25 秒(6 秒 720p 快速) | 約 2 分鐘 | 約 2.5 分鐘 | 約 3 分鐘 |
| 多鏡頭序列 | 透過串接 | 是 | 是 | 是 |
| Arena 排名(I2V) | 第 1 名(2026 年 5 月) | 第 2 名 | 前 5 名 | 前 5 名 |
| API 可用 | GA(grok-imagine-video-1.5) | 完整 | 完整 | 有限 |
| 最適合 | 快速圖片轉影片搭配原生音訊、快速迭代 | 參考深度與多鏡頭敘事 | 電影級精緻與 4K 輸出 | 物理真實感與文字轉影片 |
Grok Imagine Video 1.5 作為最快的圖片轉影片模型脫穎而出,內建原生音訊——約 25 秒即可生成高品質 720p 片段,比競爭對手快約 4-5 倍。截至 2026 年 5 月,它在圖片轉影片 Arena 排行榜上排名第 1。對於優先考慮速度、原生視聽一致性和製作效率的創作者來說,Grok Imagine Video 1.5 是明顯的首選。
誰適合在 Topview 使用 Grok Imagine Video 1.5
Grok Imagine Video 1.5 專為需要快速圖片轉影片生成並配有原生音訊的團隊而打造——從電影敘事者和產品行銷團隊到社群內容創作者。
電影製作人與故事優先的創作者
當你需要從參考圖片獲得電影級構圖、鏡頭語言和場景構成時,Grok Imagine Video 1.5 的 Aurora 引擎能在約 25 秒內提供連貫的動態和原生音訊——速度足以支持創意探索。
時尚、美妝與產品團隊
從產品照片開始,生成精緻的產品展示影片。Grok Imagine Video 1.5 擅長在寫實動態和氛圍中保持參考圖片的產品細節和燈光氛圍。
成效行銷人員與廣告團隊
Grok Imagine Video 1.5 約 25 秒的快速模式使其成為廣告變體測試的理想選擇。快速生成多個開頭、角度和版本——比較成效並擴展有效的內容,而不會減慢你的創意流程。
音樂與舞蹈創作者
原生視聽同步意味著節拍感知的動態和節奏驅動的視覺。生成與音樂能量匹配的表演片段,無需外部音訊對齊工作——全部在單次生成中完成。
病毒式社群與潮流創作者
Grok Imagine Video 1.5 的速度使其非常適合以社群為優先的創作者,他們需要以平台文化節奏製作的熱門開頭、寵物影片和 POV 概念。720p 是社群平台的最佳解析度。
重視速度的創意團隊
如果你的瓶頸是生成速度,Grok Imagine Video 1.5 的 25 秒快速模式是一個顯著優勢。更多迭代、更多變體、更多機會找到能產生效果的創意。
如何使用 Grok Imagine Video 1.5

上傳參考圖片並撰寫提示詞
從你的關鍵視覺開始——可以是產品照片、角色設計或場景參考。描述你想要的動態、鏡頭運動和音訊氛圍。

生成影片
點擊生成,觀看 Grok Imagine Video 1.5 在約 25 秒(快速模式)內創作出帶有原生音訊的 720p/24fps 影片。

下載影片
準備好發布到任何平台時,匯出帶有同步音訊的乾淨 MP4 檔案。
體驗 Grok Imagine Video 1.5 — 排名第一的圖片轉影片 AI
無需昂貴的 GPU。從文字提示和參考圖片生成電影級 720p 影片,搭配原生音訊——全部在 Topview 上使用 Grok Imagine Video 1.5 約 25 秒即可完成。
免費開始 · 無需信用卡 · 所有領先的 AI 影片模型都在一個工作區中
