Gemini Omni Flash AI 视频生成器

Google 的原生多模态视频模型,可将文本、图像、视频和音频作为输入,在 Virse 中提供帧驱动和参考驱动两种入口。

请在桌面端浏览器打开本页开始创作。

名称中的 Omni 指的是输入侧

Gemini Omni Flash 是 Google 于 2026 年 6 月发布的高速视频模型,而真正值得了解的是它能够接受哪些输入。

大多数视频模型接收一张图片和一段文字。这个模型则是原生多模态的——文本、图像、视频和音频都通过同一个接口输入,而不是事后再接入各自独立的适配器。这是一种架构属性,而不是功能清单;当模型需要协调彼此方向不同的输入时,它所表现出的连贯性正体现了这一点。Google 还将其打造为支持对话式细化:通过继续对话来调整片段,而不是重写创意简报。

当你的输入类型多样,并且你的图像流水线已经基于 Google 时,可以使用 Gemini Omni Flash。可为来自 Nano Banana 或 Gemini 图像模型的静态图生成动画,利用参考素材驱动镜头,并通过对片段作出回应来迭代它。

The Omni in the Name Is the Input Side

什么是 Gemini Omni Flash?

Gemini Omni Flash 是由 Google DeepMind 开发的 AI 视频生成模型,属于 Gemini Flash 系列,该系列以周转速度作为设计优先级。它于 2026 年 6 月发布,定位为视频生成和对话式视频编辑的高性价比选择。

该模型围绕三大主要优势构建:

  • 原生多模态,可接受文本、图像、视频和音频输入
  • 对话式细化,可通过持续指令调整片段
  • 每个输出中都嵌入 SynthID 来源标识

Virse 列出了两个条目。Gemini Omni Flash 接收首帧、尾帧或二者,以及一份书面简述。Gemini Omni Flash Reference 则改为基于所提供的示例图像进行生成。Virse 中提供的条目是 720P 配置,每次生成都会渲染原生音频,因此这里的简述不包含音频方向。

What Is Gemini Omni Flash?

Gemini Omni Flash 规格概览

原生多模态

通过一个界面接受文本、图像、视频和音频。

两个入口

帧驱动和参考驱动,在 Virse 中分别列出。

720P Output

720P 输出

Virse 中提供的尺寸。音频会与画面一起原生生成。

Flash 级速度

Flash 系列模型;在视频上,速度的重要性比在静态图上更高。

对话式优化

通过继续补充指令来调整结果,而不是重写指令。

SynthID 溯源

嵌入每个生成短片中的不可感知信号。

Gemini Omni Flash AI 视频生成器的主要功能

Two Entries

适用于所有输入类型的统一界面

原生多模态意味着文本、图像、视频和音频由同一个模型处理,而不是通过单独的编码器传递。在拼接式系统中会相互冲突的输入,反而会被协调统一。

Refinement by Conversation

旗舰版本所没有的参考入口

Veo 3.1,Google 更重型的视频模型,是由帧驱动的。Gemini Omni Flash 增加了一条参考图像路径,这是 Google 产品家族内部实现这类连续性控制的唯一途径。

Refinement by Conversation

通过对话优化

与其为了修正一个问题而从头重写简报,模型被构建为支持迭代式调整——其设计假设是:第一版结果只是一个起点。

Speed as the Design Target

以速度为设计目标

Flash 系列优化的是周转速度。在视频上,缓慢的生成会彻底打断专注,这一点比在静态图像上更重要。

Refinement by Conversation

与 Google 图像模型保持一致

由 Nano Banana Pro、Nano Banana 2 或 Gemini 2.5 Flash Image 生成的帧来自同一系列,这能在从静态到动态的交接中保持视觉特征的连续。

Speed as the Design Target

无需配置的溯源能力

SynthID 会自动嵌入每个片段,将其标识为 AI 生成,画面上不可见,也无需启用任何功能。

在 Virse 中使用 Gemini Omni Flash 构建

在一条流程中始终使用同一模型家族,听起来像是一种偏好;但当你在项目中途跨供应商协作,并花上一下午弄清楚为什么动画版本与静帧不匹配时,它就不只是偏好了。 Virse 让同家族路线成为阻力最小的路径。画布上由任何 Google 图像模型生成的帧都可以直接进入 Gemini Omni Flash,无需导出,因此从静态图到动态画面的交接会在原处完成。

为你刚生成的静态图添加动画

在同一画布上,将 Nano Banana 或 Gemini 图像帧直接送入视频模型。

Provenance Without Configuration

保持迭代脉络可见

每次细化都会与其来源版本并排显示,这正是让对话式工作流程事后可审查的原因。

Animate the Still You Just Generated

访问 30+ 个创意模型

无需离开画布或重写简报,即可在 Gemini Omni Flash 和 30 多个其他图像与视频模型之间切换。

Keep the Iteration Thread Visible

与更重型的选项对比

当你需要判断额外的模型权重是否值得时,可将同一帧通过旁边的 Veo 3.1 运行对比。

Compare Against the Heavier Option

你可以用 Gemini Omni Flash 创作什么?

Animated Stills

动态静态图

为 Google 产品家族中其他地方生成的图像添加动态。

Reference-Driven Clips

参考驱动短片

通过示例图像而非文字描述来定义主体的镜头。

Short Social Video

社交短视频

周转速度比分辨率更重要的快速短片。

Product Motion

产品动态展示

从已定义的开场帧开始的简单揭示与旋转。

Concept Previz

概念预演

在正式确定之前,用于镜头创意的动态参考。

Iterative Sequences

迭代序列

经过多轮细化的片段,而不是一开始就完美指定。

如何在 Virse 中使用 Gemini Omni Flash

  1. 确定适合的条目

    如果手头已有帧,请使用标准条目。需要让主体在多个片段中保持一致,请使用 Reference。

  2. 加载你的输入

    放入构图,或放入示例集,并为每张图片说明任务。

  3. 说明会发生什么

    描述场景中的运动、相机行为和节奏。音频会随画面一起渲染,因此值得加入对白和环境声提示。

  4. 细化,而不是重新开始

    用后续指令调整结果,而不是重写原始简报。

如何编写 Gemini Omni Flash 提示词

一个实用的 Gemini Omni Flash 提示词通常包含四个要素:

  • 起始状态
  • 移动内容
  • 摄像机
  • 结束状态

与其这样写

一个人打开窗户,自然流畅的动作,电影感。

不如这样写

一个人站在上下推拉窗前,从背后腰部高度视角看去,双手放在下窗框上。他们以一个平滑动作将窗户向上推至完全打开,然后放下双手。摄像机全程保持静止,无推进、无跟拍。以窗户打开且他们的手臂垂在身体两侧结束。

Gemini Omni Flash 提示词示例

gemini-omni-flash-prompt-examples-tea-curtain-19.jpg

帧到帧

从 Image 1 开始:窗台上一杯茶,热气升起,窗帘静止。 在片段的前半段,一阵微风从右侧掀起窗帘,然后窗帘落回原位。热气始终持续上升。 相机保持静态近景,不移动,不切镜。 结束于 Image 2:窗帘已落定,茶杯保持不变。

Reference-Driven Continuity

参考驱动的连续性

使用图 1 中的人物、图 2 中的围裙,以及图 3 中的面包店柜台。 他把一托盘面包放到柜台上,直起身,并在围裙上擦了擦手。 从柜台顾客一侧拍摄的固定中景,摄像机不移动。 完全保留他的脸、头发,以及围裙的颜色和剪裁,与图中所示一致。以他的双手垂在身体两侧结束。

Simple Camera Move

简单相机移动

一辆自行车靠在一面粉刷过的砖墙上,正面视角。 场景中没有任何物体移动。摄像机以恒定速度缓慢向左跟拍,保持自行车在画面中,并露出其右侧的一扇门。 全程均匀的阴天光线。 以自行车位于右边缘、门居中结束。

Gemini Omni Flash 与 Veo 3.1 对比

对比维度Gemini Omni FlashVeo 3.1
输入类型文本、图像、视频和音频文本和帧
Reference 条目是,单独列出否
Virse 中的输出720P,静音720p 至 4K,音频可选
设计目标交付速度输出上限
序列构建对话式细化场景延展
适用情况输入多样,或主体必须保持一致作品需要更长时长、音频或 4K

获得更好 Gemini Omni Flash 结果的技巧

每个短片一个有边界的动作

为动作给出清晰的起点和终点,而不是开放式描述。

命名参考角色

在 Reference 条目中,说明哪张图像提供主体,哪张图像提供场景。

为帧创作留在同一家族中

来自 Nano Banana 或 Gemini 2.5 Flash Image 的图像可交接给此模型,视觉风格不会发生变化。

优化,而不是重写

该模型专为后续指令而构建。重写整份简报会丢掉已经有效的内容。

Gemini Omni Flash 常见问题

什么是 Gemini Omni Flash?
Gemini Omni Flash 是 Google DeepMind 的原生多模态视频模型,于 2026 年 6 月发布,用于快速视频生成和对话式编辑。它接受文本、图像、视频和音频输入。
这里的“原生多模态”是什么意思?
这意味着文本、图像、视频和音频由同一个模型通过同一界面处理,而不是由分开的组件拼接在一起。输入会被相互协调,而不是孤立处理。
Gemini Omni Flash 免费吗,费用是多少?
Gemini Omni Flash 可在 Virse 的付费方案中使用。生成费用按秒从每月点数额度中扣除,更高阶方案在合理使用范围内不限量。当前方案费率列在 Virse 定价页面。
Gemini Omni Flash 会生成音频吗?
是的。Gemini Omni Flash 会在生成画面的同时生成原生音频,Virse 中提供的入口会在每次生成时渲染音频——没有可选择的静音配置。
什么是 Gemini Omni Flash Reference?
一个独立入口,使用参考图像而不是帧,适用于需要让主体在一系列片段中保持可识别的工作。
它与 Veo 3.1 有何不同?
Veo 3.1 可达到 4K、生成音频,并通过场景延展来构建时长。Gemini Omni Flash 速度更快,接受更多输入类型,并提供 Veo 3.1 没有的参考入口。
它会添加水印吗?
它嵌入了 SynthID,一种不可察觉的来源信号。可见画面上不会标记任何内容。
如何在 Virse 中使用 Gemini Omni Flash?
选择任一入口,提供帧或参考图像,描述运动,然后生成。

同一家族,从帧到动态

为你的 Google 系列图像模型已生成的帧添加动画,或通过一组参考来驱动镜头——两种方式都无需离开画布。