原生多模态
通过一个界面接受文本、图像、视频和音频。
Google 的原生多模态视频模型,可将文本、图像、视频和音频作为输入,在 Virse 中提供帧驱动和参考驱动两种入口。
请在桌面端浏览器打开本页开始创作。
Gemini Omni Flash 是 Google 于 2026 年 6 月发布的高速视频模型,而真正值得了解的是它能够接受哪些输入。
大多数视频模型接收一张图片和一段文字。这个模型则是原生多模态的——文本、图像、视频和音频都通过同一个接口输入,而不是事后再接入各自独立的适配器。这是一种架构属性,而不是功能清单;当模型需要协调彼此方向不同的输入时,它所表现出的连贯性正体现了这一点。Google 还将其打造为支持对话式细化:通过继续对话来调整片段,而不是重写创意简报。
当你的输入类型多样,并且你的图像流水线已经基于 Google 时,可以使用 Gemini Omni Flash。可为来自 Nano Banana 或 Gemini 图像模型的静态图生成动画,利用参考素材驱动镜头,并通过对片段作出回应来迭代它。

Gemini Omni Flash 是由 Google DeepMind 开发的 AI 视频生成模型,属于 Gemini Flash 系列,该系列以周转速度作为设计优先级。它于 2026 年 6 月发布,定位为视频生成和对话式视频编辑的高性价比选择。
该模型围绕三大主要优势构建:
Virse 列出了两个条目。Gemini Omni Flash 接收首帧、尾帧或二者,以及一份书面简述。Gemini Omni Flash Reference 则改为基于所提供的示例图像进行生成。Virse 中提供的条目是 720P 配置,每次生成都会渲染原生音频,因此这里的简述不包含音频方向。

通过一个界面接受文本、图像、视频和音频。
帧驱动和参考驱动,在 Virse 中分别列出。

Virse 中提供的尺寸。音频会与画面一起原生生成。
Flash 系列模型;在视频上,速度的重要性比在静态图上更高。
通过继续补充指令来调整结果,而不是重写指令。
嵌入每个生成短片中的不可感知信号。

原生多模态意味着文本、图像、视频和音频由同一个模型处理,而不是通过单独的编码器传递。在拼接式系统中会相互冲突的输入,反而会被协调统一。

Veo 3.1,Google 更重型的视频模型,是由帧驱动的。Gemini Omni Flash 增加了一条参考图像路径,这是 Google 产品家族内部实现这类连续性控制的唯一途径。

与其为了修正一个问题而从头重写简报,模型被构建为支持迭代式调整——其设计假设是:第一版结果只是一个起点。

Flash 系列优化的是周转速度。在视频上,缓慢的生成会彻底打断专注,这一点比在静态图像上更重要。

由 Nano Banana Pro、Nano Banana 2 或 Gemini 2.5 Flash Image 生成的帧来自同一系列,这能在从静态到动态的交接中保持视觉特征的连续。

SynthID 会自动嵌入每个片段,将其标识为 AI 生成,画面上不可见,也无需启用任何功能。
在一条流程中始终使用同一模型家族,听起来像是一种偏好;但当你在项目中途跨供应商协作,并花上一下午弄清楚为什么动画版本与静帧不匹配时,它就不只是偏好了。 Virse 让同家族路线成为阻力最小的路径。画布上由任何 Google 图像模型生成的帧都可以直接进入 Gemini Omni Flash,无需导出,因此从静态图到动态画面的交接会在原处完成。
在同一画布上,将 Nano Banana 或 Gemini 图像帧直接送入视频模型。

每次细化都会与其来源版本并排显示,这正是让对话式工作流程事后可审查的原因。

无需离开画布或重写简报,即可在 Gemini Omni Flash 和 30 多个其他图像与视频模型之间切换。

当你需要判断额外的模型权重是否值得时,可将同一帧通过旁边的 Veo 3.1 运行对比。


为 Google 产品家族中其他地方生成的图像添加动态。

通过示例图像而非文字描述来定义主体的镜头。

周转速度比分辨率更重要的快速短片。

从已定义的开场帧开始的简单揭示与旋转。

在正式确定之前,用于镜头创意的动态参考。

经过多轮细化的片段,而不是一开始就完美指定。
如果手头已有帧,请使用标准条目。需要让主体在多个片段中保持一致,请使用 Reference。
放入构图,或放入示例集,并为每张图片说明任务。
描述场景中的运动、相机行为和节奏。音频会随画面一起渲染,因此值得加入对白和环境声提示。
用后续指令调整结果,而不是重写原始简报。
一个实用的 Gemini Omni Flash 提示词通常包含四个要素:
与其这样写
一个人打开窗户,自然流畅的动作,电影感。
不如这样写
一个人站在上下推拉窗前,从背后腰部高度视角看去,双手放在下窗框上。他们以一个平滑动作将窗户向上推至完全打开,然后放下双手。摄像机全程保持静止,无推进、无跟拍。以窗户打开且他们的手臂垂在身体两侧结束。

从 Image 1 开始:窗台上一杯茶,热气升起,窗帘静止。 在片段的前半段,一阵微风从右侧掀起窗帘,然后窗帘落回原位。热气始终持续上升。 相机保持静态近景,不移动,不切镜。 结束于 Image 2:窗帘已落定,茶杯保持不变。

使用图 1 中的人物、图 2 中的围裙,以及图 3 中的面包店柜台。 他把一托盘面包放到柜台上,直起身,并在围裙上擦了擦手。 从柜台顾客一侧拍摄的固定中景,摄像机不移动。 完全保留他的脸、头发,以及围裙的颜色和剪裁,与图中所示一致。以他的双手垂在身体两侧结束。

一辆自行车靠在一面粉刷过的砖墙上,正面视角。 场景中没有任何物体移动。摄像机以恒定速度缓慢向左跟拍,保持自行车在画面中,并露出其右侧的一扇门。 全程均匀的阴天光线。 以自行车位于右边缘、门居中结束。
| 对比维度 | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| 输入类型 | 文本、图像、视频和音频 | 文本和帧 |
| Reference 条目 | 是,单独列出 | 否 |
| Virse 中的输出 | 720P,静音 | 720p 至 4K,音频可选 |
| 设计目标 | 交付速度 | 输出上限 |
| 序列构建 | 对话式细化 | 场景延展 |
| 适用情况 | 输入多样,或主体必须保持一致 | 作品需要更长时长、音频或 4K |
为动作给出清晰的起点和终点,而不是开放式描述。
在 Reference 条目中,说明哪张图像提供主体,哪张图像提供场景。
来自 Nano Banana 或 Gemini 2.5 Flash Image 的图像可交接给此模型,视觉风格不会发生变化。
该模型专为后续指令而构建。重写整份简报会丢掉已经有效的内容。