Grok Imagine Video 1.5 — xAI 排名第一的原生音频图生视频模型
通过文本提示词和参考图片,生成电影级 720p/24fps、最长 15 秒的视频。原生音频——对话、音效和环境音——与画面在 Aurora 自回归引擎中一次生成,一气呵成。
一览 Grok Imagine Video 1.5 创作能力
从原生音频驱动的电影级对话到动漫动作、商业转场和奇幻世界观构建——探索 Grok Imagine Video 1.5 通过文本提示词和参考图片以 720p/24fps 输出所能生成的惊艳视频。
原生音频与语音——一次生成,一步到位
对话、音效和环境音与视频一起生成——不是后期配音。语音精准落在动作上,更清晰、同步更佳。
1950 年代酒店电梯。一位穿翡翠色礼服的女士对穿红色制服的电梯操作员说话,金色镶边电梯门关闭。柔和戏剧灯光,浓郁电影色彩。
动态商业片到片场转场
创作引人入胜的幕后花絮和以转场为核心的营销内容。Grok Imagine Video 1.5 从精致商业产品镜头丝滑切换到复杂摄影棚场景,配合完全同步的拟音。
连续后拉镜头。一只手将牛奶倒入冰咖啡梅森杯中,旁边是一摞饼干。镜头动态后拉,展示一位女性咬下一口饼干,伴有同步的清脆咀嚼声,背景是繁忙的绿幕摄影棚拍摄现场。
Grok Imagine Video 1.5 vs Seedance 2.0:AI 视频模型对比
Grok Imagine Video 1.5 和 Seedance 2.0 都是顶级原生音频图生视频模型,但侧重点不同。Grok Imagine Video 1.5 优先考虑生成速度和单次视听连贯性。Seedance 2.0 优先考虑参考深度和多镜头控制。
Grok Imagine Video 1.5——基于 Aurora 自回归(MoE)引擎。单次生成带原生音频的 720p 视频,6s 片段约 25s 完成。
Seedance 2.0——双分支扩散 Transformer。擅长多镜头叙事,支持更广泛的参考输入和 1080p 输出。
| 对比维度 | Grok Imagine Video 1.5 | Seedance 2.0 | 关键差异 |
|---|---|---|---|
| 开发者 | xAI | ByteDance |
Grok Imagine Video — 模型演进时间线
从 xAI 首个图生视频模型发布到登顶 Arena 的 1.5 版本——回顾 Grok Imagine Video 的演进历程。
Grok Imagine Video 1.0 发布
xAI 推出首个独立于 Grok 聊天机器人的图生视频模型。基于专有 Aurora 自回归引擎构建,它可以从文本和图片输入生成最长 10 秒、720p/24fps 的视频片段,迅速在创作者中获得了关注。
多图支持与扩展
xAI 为 Grok Imagine Video 1.0 添加多图支持和视频扩展功能,使创作者能够串联参考图片并扩展已生成片段,实现更复杂的叙事工作流。
API 预览与开发者接入
Grok Imagine Video 1.0 通过 xAI 开发者平台 API 开放,使模型可接入第三方集成和创意工具(如 Topview),用于更广泛的生产用途。
Grok Imagine Video 1.5 预览
xAI 发布 Grok Imagine Video 1.5 预览版。它立即在图生视频 Arena 排行榜上占据第一,较 1.0 版本 Elo 提升 52 分,超越 Seedance 2.0 及其他竞品。关键升级:更快的生成速度(约 25s 快速模式)、原生音频改进,以及延长至 15 秒的片段时长。
Grok Imagine Video 1.5 正式可用
Grok Imagine Video 1.5 结束预览,在 xAI API 上转为正式可用(GA)。伴随 GA 发布,xAI 推出了新的创意工作流功能——用于组织工作的项目、同时运行多个提示词的并行代理执行,以及快速查找历史生成记录的搜索功能。
模型参数
Grok Imagine Video 1.5 核心规格,供评估输出质量、生成速度和生产适配性的创作者参考。
Grok Imagine Video 1.5
xAI 最新图生视频模型,2026 年 6 月发布
#1 图生视频
1404 Elo,较 v1.0 +52(2026 年 5 月)
原生:对话、音效、环境音、音乐
Grok Imagine Video 1.5 新特性 — v1.0 vs v1.5 对比
Grok Imagine Video 1.5 是 xAI 最新的图生视频模型,基于升级版 Aurora 自回归引擎构建。相比 1.0 版本,它实现了更快的生成速度、更出色的运动物理效果、更优的音频同步和更长的片段时长。
| 能力 | Grok Imagine Video 1.0 | Grok Imagine Video 1.5 | 提升 |
|---|---|---|---|
| 最高分辨率 | 720p | 720p | 细节更佳,变形更少 |
| 生成速度(6秒 720p) | 约 40 秒以上 | 约 25 秒(快速) | 速度提升近 2 倍 |
| 最长时长 | 10s | 15s | 片段长度增加 50% |
| 原生音频 | 基础同步 | 更清晰的对话、更好的唇形同步、事件对齐音效 | 视听连贯性更精致 |
| 运动物理 | 偶有变形 | 更好的动量表现,更少变形,自然重量感 | 运动更加逼真 |
| 画面比例 | 5 种格式 | 7 种格式(1:1 至 16:9 及竖屏) | 全平台原生支持 |
Grok Imagine Video 1.5 vs Seedance 2 vs Veo 4 vs Sora 2 — 模型对比
在 2026 年选择合适的 AI 视频模型,意味着要权衡输出质量、速度和工作流匹配度。本对比聚焦于对创作者、营销人员和制作团队最重要的功能特性。
| 功能 | Grok Imagine Video 1.5 | Seedance 2 | Veo 4 | Sora 2 |
|---|---|---|---|---|
| 开发者 | xAI | ByteDance | OpenAI | |
| 最长时长 | 15s | 15s | 20s+ | 12s |
| 最高分辨率 | 720p | 1080p | 4K | 1080p |
| 原生音频 | 对话 + 音效 + 环境音(单次生成) | 对话 + 音效 + 唇形同步 | 对话 + 环境音混音 | 生成音频 |
| 输入类型 | 图片 + 文本 | 图片 + 文本 + 多参考 | 图片 + 文本 |
谁适合在 Topview 使用 Grok Imagine Video 1.5
Grok Imagine Video 1.5 专为需要快速图生视频和原生音频的团队打造——从电影叙事者和产品营销团队到社交媒体内容创作者。
电影制作人与叙事优先的创作者
当你需要从参考图片中获得电影级构图、镜头语言和场景搭建时,Grok Imagine Video 1.5 的 Aurora 引擎可在约 25 秒内输出连贯运动和原生音频——快得足以支持创意探索。
时尚、美妆与产品团队
从产品照片出发,生成精致的产品展示视频。Grok Imagine Video 1.5 擅长在参考图片基础上保持产品细节和光影氛围,呈现逼真的运动和氛围感。
效果营销与广告团队
Grok Imagine Video 1.5 约 25 秒的快速模式使其成为广告变体测试的理想之选。快速生成多个钩子、角度和版本——对比表现并规模化放大有效创意,无需拖慢创意管线。
如何使用 Grok Imagine Video 1.5

上传参考图片并编写提示词
从你的核心视觉素材开始——产品照片、角色设计或场景参考。描述你想要的运动、镜头移动和音频氛围。

生成视频
点击生成,观看 Grok Imagine Video 1.5 在约 25 秒内(快速模式)创建带原生音频的 720p/24fps 视频。

下载视频
准备好在任意平台发布时,导出带有同步音频的干净 MP4 文件。
体验 Grok Imagine Video 1.5 — 排名第一的图生视频 AI
无需昂贵 GPU。通过文本提示词和参考图片,生成电影级 720p 原生音频视频——使用 Grok Imagine Video 1.5 在 Topview 上仅需约 25 秒。
免费开始 · 无需信用卡 · 所有主流 AI 视频模型尽在一个工作空间
