四秒、六秒或八秒
每个片段可选择生成长度。
请在桌面端浏览器打开本页开始创作。
Veo 3.1 是 Google DeepMind 的视频模型,它在时长处理上采用了不同于该领域大多数模型的方式。
它不是拉长单次生成,而是生成四秒、六秒或八秒的片段,然后再对其进行延展——一个片段的结尾帧会成为下一个片段的开头,因此序列会逐镜头增长,并在每个衔接处延续连贯性。这种结构让你在每个片段之间都有一个决策点,而不是一次漫长的押注,这是一种构建视频作品的显著不同方式。
当成片长度超过单个镜头时,使用 Veo 3.1。可用于组装叙事序列、宣传影片、演示导览,以及任何后半部分取决于前半部分生成效果的作品。

Veo 3.1 是由 Google DeepMind 开发的 AI 视频生成模型,在 Virse 中提供,同时还有一个成本更低的变体,名为 Veo 3.1 Fast。两者都接受首帧、末帧,或同时接受两者,并配合一份文字简报。
该模型围绕三大优势构建:
生成时长为四秒、六秒或八秒,支持 16:9 和竖向 9:16。两个版本的差异在于成本和渲染质量,而不是接受的输入内容,因此为其中一个版本撰写的简报可在另一个版本上原样运行。

每个片段可选择生成长度。
一个片段的结尾帧会成为下一个片段的开头。
真正的 3840×2160 输出,并支持其下的 1080p 和 720p。
对白、音效和环境噪声与画面一同生成。
根据同一份文字简报生成横版和竖版内容。
Veo 3.1 和 Veo 3.1 Fast,采用相同输入。
场景延展将时长变成一系列决策,而不是一次性承诺。如果第三段出错,你只需重新生成第三段——而不是整部作品。
由于扩展是从上一段片段的结尾帧开始的,主体、光线和场景会在剪辑点前后延续,而不是根据描述重新推导。
在 48kHz 立体声下,声音达到能够经受实际剪辑的规格,而不是在任何内容播出前都需要替换。
四秒、六秒或八秒都是实实在在的选择,这一点很重要,因为节奏更多由时长决定,而不是由简报中的其他内容决定。
直接渲染 3840×2160,适用于需要投影、裁切放大或以完整尺寸交付的作品。
Veo 3.1 Fast 接受相同的输入,因此探索性生成和交付生成是在不同入口中使用同一个提示词。
只有当你能看清链条时,串联序列才便于管理。第四段建立在第三段之上,如果第三段被替换,下游的所有内容都需要重新检查。 Virse 会将整个运行过程按顺序铺展在一个画布上。每个扩展片段都位于它所延展的片段之后,因此序列结构始终可见,而不是仅存在于文件命名约定中。
每个片段都紧挨着它所延展的片段,因此衔接断裂一眼就能看出来。
替换链条中的一个环节,并从那里向后重新构建,而不是把整个作品从头再来。
在 Veo 3.1 与 30+ 个其他图像和视频模型之间切换,无需离开画布,也无需重写简报。
在同一工作区中用图像模型生成定场帧,并从它开始这条链。
逐镜头组装的多片段作品,在衔接处保持连续性。
打造长度超出单次生成能力范围的品牌视频。
扩展式演示,让产品在各个片段之间保持一致。
环境氛围与画面同样重要的外景素材。
使用与横屏版本相同的简报,为信息流输出 9:16 版本。
将故事板转化为动态参考,并扩展成完整序列。
适合快速探索,是交付的标准入口。根据你想要的节奏选择四秒、六秒或八秒。
上传序列开始时的构图;如果镜头必须落在某个特定画面上,也上传收尾构图。
说明运动、摄像机的行为以及混音——并具体说明该片段如何结束。
使用收尾帧生成后续镜头,并在继续之前检查每个衔接。
一个有用的 Veo 3.1 提示词通常包含五个要素:
与其这样写
海浪拍打岩石的戏剧性镜头,电影感,配以史诗般的音乐。
不如这样写
阴天光线下,灰色海浪拍打着黑色火山岩的广角镜头。每一道涌浪都以不疾不徐的节奏升起又崩落,浪花被风吹向右侧。摄像机固定在三脚架上,位置略高于水线。音频只有水声和风声,没有音乐。最后以一波海浪退去、岩石留下湿亮光泽收尾。
以图像 1 中的构图开场:黄昏时的乡村加油站,单个顶棚灯亮着,没有车辆,也没有人。 昆虫在顶棚灯的光束中飞动。其他一切都静止不动。 摄像机以恒定速度缓慢向右跟拍,始终让顶棚保持在画面中。 蝉鸣、灯光的电流嗡嗡声、一辆远处车辆经过但不出现在画面中。无音乐。结束时顶棚位于左侧边缘,开阔道路填满右侧。
以一副头戴式耳机开场,耳机闭合放置在深色胡桃木表面上,由上方偏后的一处单一光源照亮。 耳罩在前两秒内缓慢而均匀地旋转打开,同时摄像机向前短距离推进并停下。 低沉的房间环境声,耳罩到达打开位置时有一声轻柔的机械咔嗒声。无音乐。 结束时耳机完全打开,填满画面下半部分。
一名身穿帆布夹克的男子站在五金店的过道里,手里拿着一罐油漆,正在阅读标签。 他抬头看向镜头外的某个人,说:“这罐是哑光的,对吧?” 镜头从过道尽头以中景静态拍摄,没有移动。 荧光灯的嗡嗡声、远处货架的声响,他的说话声保持在交谈音量,没有音乐。最后定格在他低头重新看向油漆罐。
| 对比维度 | Veo 3.1 Fast | Veo 3.1 |
|---|---|---|
| 定位用于 | 探索与节奏把控 | 交付 |
| 输入 | 与标准版相同 | 与 Fast 相同 |
| 片段长度 | 四秒、六秒或八秒 | 四秒、六秒或八秒 |
| 场景延展 | 是 | 是 |
| 音频 | 可选,48kHz 立体声 | 可选,48kHz 立体声 |
| 输出范围 | 720p 至 4K | 720p 至 4K |
结尾状态会成为下一段的开头。一个松散的结尾会贯穿你之后构建的一切。
在生成下一段之前先检查片段之间的过渡。错误会沿着链条不断叠加。
“不要音乐,只要房间环境声和脚步声”是可以直接指导的。“史诗配乐”是一种感觉,模型只能猜。
四到八秒只适合承载一件正在发生的事。把事件堆在一起,正是分段要避免的。