Grok Imagine Video 1.5 — xAI 排名第一的原生音频图生视频模型
通过文本提示词和参考图片,生成电影级 720p/24fps、最长 15 秒的视频。原生音频——对话、音效和环境音——与画面在 Aurora 自回归引擎中一次生成,一气呵成。
一览 Grok Imagine Video 1.5 创作能力
从原生音频驱动的电影级对话到动漫动作、商业转场和奇幻世界观构建——探索 Grok Imagine Video 1.5 通过文本提示词和参考图片以 720p/24fps 输出所能生成的惊艳视频。
原生音频与语音——一次生成,一步到位
对话、音效和环境音与视频一起生成——不是后期配音。语音精准落在动作上,更清晰、同步更佳。
1950 年代酒店电梯。一位穿翡翠色礼服的女士对穿红色制服的电梯操作员说话,金色镶边电梯门关闭。柔和戏剧灯光,浓郁电影色彩。
动态商业片到片场转场
创作引人入胜的幕后花絮和以转场为核心的营销内容。Grok Imagine Video 1.5 从精致商业产品镜头丝滑切换到复杂摄影棚场景,配合完全同步的拟音。
连续后拉镜头。一只手将牛奶倒入冰咖啡梅森杯中,旁边是一摞饼干。镜头动态后拉,展示一位女性咬下一口饼干,伴有同步的清脆咀嚼声,背景是繁忙的绿幕摄影棚拍摄现场。
风格化动漫与运动一致性
渲染充满活力的动漫艺术和流畅角色运动。Grok Imagine Video 1.5 在动态风格化镜头中保持无懈可击的角色细节、复杂的布料物理和富有表现力的面部表演。
风格化动漫 3D 动画。一位可爱的蓝发精灵少女,红眼,身穿黑色赛博朋克旗袍配蓝龙印花和战术绑带,在传统寺庙前伴着红灯笼俏皮起舞。流畅丝滑的动作,富有表现力的眨眼和微笑,鲜明灯光,高度精细。
多智能体物理与交互
模拟超写实动物运动和混乱城市物理。Grok Imagine Video 1.5 在拥挤环境中无缝协调自然动物动作、鸟群动态和体积蒸汽效果。
一只兔子在纽约街头飞奔,快节奏,照片级写实。
叙事角色成长与世界观构建
呈现连续的角色进化和史诗级世界尺度转场。Grok Imagine Video 1.5 模拟生物学成长——如孵化与衰老——同时在广阔、物理丰富的奇幻环境中保持角色身份一致性。
电影级奇幻片段。一只可爱的白色幼龙从光芒闪烁、虹彩流转的蛋中孵化而出,周围环绕发光水晶。幼龙在悬崖边成长展翅,然后起飞,在蓬松云层间平稳穿行。随后转为向壮丽落日翱翔,掠过广阔的浮空岛屿与巨大水晶塔林。
Grok Imagine Video 1.5 vs Seedance 2.0:AI 视频模型对比
Grok Imagine Video 1.5 和 Seedance 2.0 都是顶级原生音频图生视频模型,但侧重点不同。Grok Imagine Video 1.5 优先考虑生成速度和单次视听连贯性。Seedance 2.0 优先考虑参考深度和多镜头控制。
Grok Imagine Video 1.5——基于 Aurora 自回归(MoE)引擎。单次生成带原生音频的 720p 视频,6s 片段约 25s 完成。
Seedance 2.0——双分支扩散 Transformer。擅长多镜头叙事,支持更广泛的参考输入和 1080p 输出。
| 对比维度 | Grok Imagine Video 1.5 | Seedance 2.0 | 关键差异 |
|---|---|---|---|
| 开发者 | xAI | ByteDance | 不同的研究团队和架构 |
| 架构 | Aurora 自回归(MoE) | 双分支扩散 Transformer | Grok 使用自回归;Seedance 使用扩散式生成 |
| 生成速度(6s 片段) | 约 25s(快速模式) | 约 120s | Grok Imagine Video 1.5 快约 5 倍 |
| 最高分辨率 | 720p | 1080p | Seedance 提供更高最高分辨率 |
| 最长时长 | 15s | 15s | 两者均支持最长 15 秒片段 |
| 原生音频输出 | 单次生成:对话、音效、环境音 | 对话、音效、唇形同步 | 两者均提供完整视听生成 |
| 输入类型 | 图片 + 文本提示词 | 图片 + 文本 + 多参考支持 | Seedance 每次生成可接受更多参考图片 |
| Arena 排行榜(I2V) | #1(2026 年 5 月) | #2 | Grok Imagine Video 1.5 目前领先 |
| 最佳场景 | 快速图生视频、原生音频、快速迭代 | 参考深度、多镜头、1080p 输出 | Grok 胜在速度;Seedance 胜在参考多样性 |
Grok Imagine Video — 模型演进时间线
从 xAI 首个图生视频模型发布到登顶 Arena 的 1.5 版本——回顾 Grok Imagine Video 的演进历程。
Grok Imagine Video 1.0 发布
xAI 推出首个独立于 Grok 聊天机器人的图生视频模型。基于专有 Aurora 自回归引擎构建,它可以从文本和图片输入生成最长 10 秒、720p/24fps 的视频片段,迅速在创作者中获得了关注。
多图支持与扩展
xAI 为 Grok Imagine Video 1.0 添加多图支持和视频扩展功能,使创作者能够串联参考图片并扩展已生成片段,实现更复杂的叙事工作流。
API 预览与开发者接入
Grok Imagine Video 1.0 通过 xAI 开发者平台 API 开放,使模型可接入第三方集成和创意工具(如 Topview),用于更广泛的生产用途。
Grok Imagine Video 1.5 预览
xAI 发布 Grok Imagine Video 1.5 预览版。它立即在图生视频 Arena 排行榜上占据第一,较 1.0 版本 Elo 提升 52 分,超越 Seedance 2.0 及其他竞品。关键升级:更快的生成速度(约 25s 快速模式)、原生音频改进,以及延长至 15 秒的片段时长。
Grok Imagine Video 1.5 正式可用
Grok Imagine Video 1.5 结束预览,在 xAI API 上转为正式可用(GA)。伴随 GA 发布,xAI 推出了新的创意工作流功能——用于组织工作的项目、同时运行多个提示词的并行代理执行,以及快速查找历史生成记录的搜索功能。
生态与平台增长
Grok Imagine Video 系列模型可通过 xAI API(grok-imagine-video-1.5)、grok.com/imagine 网页应用、iOS 和 Android 应用以及第三方创意平台访问。基于 Aurora 自回归架构,在 110,000 块 NVIDIA GB200 GPU 上训练。
现已可用模型参数
Grok Imagine Video 1.5 核心规格,供评估输出质量、生成速度和生产适配性的创作者参考。
Grok Imagine Video 1.5
xAI 最新图生视频模型,2026 年 6 月发布
#1 图生视频
1404 Elo,较 v1.0 +52(2026 年 5 月)
原生:对话、音效、环境音、音乐
与视频单次生成——无需后期配音
Aurora 自回归(MoE)
xAI 专有混合专家架构
110,000 GB200 GPU
视频 AI 领域最大规模 GPU 集群之一
480p(草稿)/ 720p(输出)
24fps 电影标准帧率
6s - 15s/片段
可通过串联延长
7 种(1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3)
从方形到竖屏全覆盖
图片 + 文本
上传参考图片配合自然语言提示词
H.264 MP4
输入接受 JPG、PNG、WEBP、GIF、AVIF
约 25s(6s 720p 快速)
比 v1.0 快约 2 倍;比竞品快约 4-5 倍
grok-imagine-video-1.5
通过 xAI API 正式可用
Grok Imagine Video 1.5 新特性 — v1.0 vs v1.5 对比
Grok Imagine Video 1.5 是 xAI 最新的图生视频模型,基于升级版 Aurora 自回归引擎构建。相比 1.0 版本,它实现了更快的生成速度、更出色的运动物理效果、更优的音频同步和更长的片段时长。
| 能力 | Grok Imagine Video 1.0 | Grok Imagine Video 1.5 | 提升 |
|---|---|---|---|
| 最高分辨率 | 720p | 720p | 细节更佳,变形更少 |
| 生成速度(6秒 720p) | 约 40 秒以上 | 约 25 秒(快速) | 速度提升近 2 倍 |
| 最长时长 | 10s | 15s | 片段长度增加 50% |
| 原生音频 | 基础同步 | 更清晰的对话、更好的唇形同步、事件对齐音效 | 视听连贯性更精致 |
| 运动物理 | 偶有变形 | 更好的动量表现,更少变形,自然重量感 | 运动更加逼真 |
| 画面比例 | 5 种格式 | 7 种格式(1:1 至 16:9 及竖屏) | 全平台原生支持 |
| API 状态 | 预览版 | 正式可用(GA) | 生产级 API |
| Arena 排行榜 | 强劲竞争者 | #1 图生视频(+52 Elo 跃升) | 排名第一的模型 |
| 平台功能 | 基础生成 | 项目、并行代理、搜索库 | 全新创意工作流工具 |
| 训练算力 | 上一代集群 | 110,000 GB200 GPU | 超大规模基础设施 |
Grok Imagine Video 1.5 vs Seedance 2 vs Veo 4 vs Sora 2 — 模型对比
在 2026 年选择合适的 AI 视频模型,意味着要权衡输出质量、速度和工作流匹配度。本对比聚焦于对创作者、营销人员和制作团队最重要的功能特性。
| 功能 | Grok Imagine Video 1.5 | Seedance 2 | Veo 4 | Sora 2 |
|---|---|---|---|---|
| 开发者 | xAI | ByteDance | OpenAI | |
| 最长时长 | 15s | 15s | 20s+ | 12s |
| 最高分辨率 | 720p | 1080p | 4K | 1080p |
| 原生音频 | 对话 + 音效 + 环境音(单次生成) | 对话 + 音效 + 唇形同步 | 对话 + 环境音混音 | 生成音频 |
| 输入类型 | 图片 + 文本 | 图片 + 文本 + 多参考 | 图片 + 文本 | 图片 + 文本 |
| 架构 | Aurora 自回归(MoE) | 双分支扩散 Transformer | 扩散 Transformer | 扩散 Transformer |
| 生成速度 | 约 25s(6s 720p 快速) | 约 2 分钟 | 约 2.5 分钟 | 约 3 分钟 |
| 多镜头序列 | 通过串联实现 | 是 | 是 | 是 |
| Arena 排名(I2V) | #1(2026年5月) | #2 | 前5 | 前5 |
| API 可用 | GA(grok-imagine-video-1.5) | 完整 | 完整 | 有限 |
| 最佳场景 | 快速图生视频 + 原生音频,快速迭代 | 参考深度与多镜头叙事 | 电影级打磨与 4K 输出 | 物理真实感与文生视频 |
Grok Imagine Video 1.5 作为最快的原生音频图生视频模型脱颖而出——约 25 秒即可生成高质量 720p 片段,比竞品快约 4-5 倍。截至 2026 年 5 月,它在图生视频 Arena 排行榜上位列第一。对于优先追求速度、原生视听连贯性和生产效率的创作者,Grok Imagine Video 1.5 是明确的领跑者。
谁适合在 Topview 使用 Grok Imagine Video 1.5
Grok Imagine Video 1.5 专为需要快速图生视频和原生音频的团队打造——从电影叙事者和产品营销团队到社交媒体内容创作者。
电影制作人与叙事优先的创作者
当你需要从参考图片中获得电影级构图、镜头语言和场景搭建时,Grok Imagine Video 1.5 的 Aurora 引擎可在约 25 秒内输出连贯运动和原生音频——快得足以支持创意探索。
时尚、美妆与产品团队
从产品照片出发,生成精致的产品展示视频。Grok Imagine Video 1.5 擅长在参考图片基础上保持产品细节和光影氛围,呈现逼真的运动和氛围感。
效果营销与广告团队
Grok Imagine Video 1.5 约 25 秒的快速模式使其成为广告变体测试的理想之选。快速生成多个钩子、角度和版本——对比表现并规模化放大有效创意,无需拖慢创意管线。
音乐与舞蹈创作者
原生视听同步意味着节拍感知的运动和节奏驱动的视觉。生成与音乐能量匹配的表演片段,无需外部音频对齐工作——全部在一次生成中完成。
病毒式社交与趋势创作者
Grok Imagine Video 1.5 的速度使其成为社交优先创作者的完美工具——需要以平台文化节奏制作热门钩子、宠物视频和 POV 概念。720p 正是社交平台的黄金分辨率。
重视速度的创意团队
如果你的瓶颈是生成速度,Grok Imagine Video 1.5 的 25 秒快速模式将是一个显著优势。更多迭代、更多变体、更多机会找到表现最佳的创意。
如何使用 Grok Imagine Video 1.5

上传参考图片并编写提示词
从你的核心视觉素材开始——产品照片、角色设计或场景参考。描述你想要的运动、镜头移动和音频氛围。

生成视频
点击生成,观看 Grok Imagine Video 1.5 在约 25 秒内(快速模式)创建带原生音频的 720p/24fps 视频。

下载视频
准备好在任意平台发布时,导出带有同步音频的干净 MP4 文件。
体验 Grok Imagine Video 1.5 — 排名第一的图生视频 AI
无需昂贵 GPU。通过文本提示词和参考图片,生成电影级 720p 原生音频视频——使用 Grok Imagine Video 1.5 在 Topview 上仅需约 25 秒。
免费开始 · 无需信用卡 · 所有主流 AI 视频模型尽在一个工作空间
