Veo 3.1 AI 视频生成器

Google DeepMind 的 Veo 3.1 可生成带有同步 48kHz 音频的短片,并通过延续结尾帧将其扩展为更长的序列。

请在桌面端浏览器打开本页开始创作。

通过串联来构建长度,而不是直接要求长度

Veo 3.1 是 Google DeepMind 的视频模型,它在时长处理上采用了不同于该领域大多数模型的方式。

它不是拉长单次生成,而是生成四秒、六秒或八秒的片段,然后再对其进行延展——一个片段的结尾帧会成为下一个片段的开头,因此序列会逐镜头增长,并在每个衔接处延续连贯性。这种结构让你在每个片段之间都有一个决策点,而不是一次漫长的押注,这是一种构建视频作品的显著不同方式。

当成片长度超过单个镜头时,使用 Veo 3.1。可用于组装叙事序列、宣传影片、演示导览,以及任何后半部分取决于前半部分生成效果的作品。

Build Length by Chaining, Not by Asking for It

什么是 Veo 3.1?

Veo 3.1 是由 Google DeepMind 开发的 AI 视频生成模型,在 Virse 中提供,同时还有一个成本更低的变体,名为 Veo 3.1 Fast。两者都接受首帧、末帧,或同时接受两者,并配合一份文字简报。

该模型围绕三大优势构建:

  • 场景扩展,将短片段生成串联成更长的序列
  • 同步的 48kHz 立体声音频,涵盖对话、音效和环境声
  • 原生 4K 输出,分辨率为 3840×2160,同时支持 720p 和 1080p

生成时长为四秒、六秒或八秒,支持 16:9 和竖向 9:16。两个版本的差异在于成本和渲染质量,而不是接受的输入内容,因此为其中一个版本撰写的简报可在另一个版本上原样运行。

What Is Veo 3.1?

Veo 3.1 规格一览

四秒、六秒或八秒

每个片段可选择生成长度。

场景延展

一个片段的结尾帧会成为下一个片段的开头。

原生 4K

真正的 3840×2160 输出,并支持其下的 1080p 和 720p。

48kHz 立体声音频

对白、音效和环境噪声与画面一同生成。

16:9 和 9:16

根据同一份文字简报生成横版和竖版内容。

两种速度档位

Veo 3.1 和 Veo 3.1 Fast,采用相同输入。

Veo 3.1 AI 视频生成器的主要功能

以分段组装长度

场景延展将时长变成一系列决策,而不是一次性承诺。如果第三段出错,你只需重新生成第三段——而不是整部作品。

跨衔接延续连贯性

由于扩展是从上一段片段的结尾帧开始的,主体、光线和场景会在剪辑点前后延续,而不是根据描述重新推导。

广播级音频

在 48kHz 立体声下,声音达到能够经受实际剪辑的规格,而不是在任何内容播出前都需要替换。

可选片段长度

四秒、六秒或八秒都是实实在在的选择,这一点很重要,因为节奏更多由时长决定,而不是由简报中的其他内容决定。

原生 4K 输出

直接渲染 3840×2160,适用于需要投影、裁切放大或以完整尺寸交付的作品。

采用相同简报的快速档位

Veo 3.1 Fast 接受相同的输入,因此探索性生成和交付生成是在不同入口中使用同一个提示词。

在 Virse 中使用 Veo 3.1 构建

只有当你能看清链条时,串联序列才便于管理。第四段建立在第三段之上,如果第三段被替换,下游的所有内容都需要重新检查。 Virse 会将整个运行过程按顺序铺展在一个画布上。每个扩展片段都位于它所延展的片段之后,因此序列结构始终可见,而不是仅存在于文件命名约定中。

按顺序查看序列

每个片段都紧挨着它所延展的片段,因此衔接断裂一眼就能看出来。

重新生成某个片段而不丢失其余部分

替换链条中的一个环节,并从那里向后重新构建,而不是把整个作品从头再来。

访问 30+ 个创意模型

在 Veo 3.1 与 30+ 个其他图像和视频模型之间切换,无需离开画布,也无需重写简报。

先生成开场帧

在同一工作区中用图像模型生成定场帧,并从它开始这条链。

你可以用 Veo 3.1 创作什么?

叙事序列

逐镜头组装的多片段作品,在衔接处保持连续性。

营销活动影片

打造长度超出单次生成能力范围的品牌视频。

产品演示

扩展式演示,让产品在各个片段之间保持一致。

场景交代与氛围镜头

环境氛围与画面同样重要的外景素材。

竖版社交剪辑

使用与横屏版本相同的简报,为信息流输出 9:16 版本。

从分镜进行预演

将故事板转化为动态参考,并扩展成完整序列。

如何在 Virse 中使用 Veo 3.1

  1. 选择档位和长度

    适合快速探索,是交付的标准入口。根据你想要的节奏选择四秒、六秒或八秒。

  2. 设置开场帧

    上传序列开始时的构图;如果镜头必须落在某个特定画面上,也上传收尾构图。

  3. 编写动作与声音

    说明运动、摄像机的行为以及混音——并具体说明该片段如何结束。

  4. 延展到下一个片段

    使用收尾帧生成后续镜头,并在继续之前检查每个衔接。

如何编写 Veo 3.1 提示词

一个有用的 Veo 3.1 提示词通常包含五个要素:

  • 主体与场景
  • 运动内容
  • 摄像机
  • 声音
  • 结尾

与其这样写

海浪拍打岩石的戏剧性镜头,电影感,配以史诗般的音乐。

不如这样写

阴天光线下,灰色海浪拍打着黑色火山岩的广角镜头。每一道涌浪都以不疾不徐的节奏升起又崩落,浪花被风吹向右侧。摄像机固定在三脚架上,位置略高于水线。音频只有水声和风声,没有音乐。最后以一波海浪退去、岩石留下湿亮光泽收尾。

Veo 3.1 提示词示例

序列的开场片段

以图像 1 中的构图开场:黄昏时的乡村加油站,单个顶棚灯亮着,没有车辆,也没有人。 昆虫在顶棚灯的光束中飞动。其他一切都静止不动。 摄像机以恒定速度缓慢向右跟拍,始终让顶棚保持在画面中。 蝉鸣、灯光的电流嗡嗡声、一辆远处车辆经过但不出现在画面中。无音乐。结束时顶棚位于左侧边缘,开阔道路填满右侧。

带声音设计的产品揭示

以一副头戴式耳机开场,耳机闭合放置在深色胡桃木表面上,由上方偏后的一处单一光源照亮。 耳罩在前两秒内缓慢而均匀地旋转打开,同时摄像机向前短距离推进并停下。 低沉的房间环境声,耳罩到达打开位置时有一声轻柔的机械咔嗒声。无音乐。 结束时耳机完全打开,填满画面下半部分。

简短对白节拍

一名身穿帆布夹克的男子站在五金店的过道里,手里拿着一罐油漆,正在阅读标签。 他抬头看向镜头外的某个人,说:“这罐是哑光的,对吧?” 镜头从过道尽头以中景静态拍摄,没有移动。 荧光灯的嗡嗡声、远处货架的声响,他的说话声保持在交谈音量,没有音乐。最后定格在他低头重新看向油漆罐。

Veo 3.1 与 Veo 3.1 Fast

对比维度Veo 3.1 FastVeo 3.1
定位用于探索与节奏把控交付
输入与标准版相同与 Fast 相同
片段长度四秒、六秒或八秒四秒、六秒或八秒
场景延展是是
音频可选,48kHz 立体声可选,48kHz 立体声
输出范围720p 至 4K720p 至 4K

获得更佳 Veo 3.1 结果的技巧

仔细撰写结尾

结尾状态会成为下一段的开头。一个松散的结尾会贯穿你之后构建的一切。

在延展前检查每处衔接

在生成下一段之前先检查片段之间的过渡。错误会沿着链条不断叠加。

命名混音,而不是情绪

“不要音乐,只要房间环境声和脚步声”是可以直接指导的。“史诗配乐”是一种感觉,模型只能猜。

每个片段一个动作

四到八秒只适合承载一件正在发生的事。把事件堆在一起,正是分段要避免的。

Veo 3.1 常见问题

什么是 Veo 3.1?
Veo 3.1 是 Google DeepMind 的视频生成模型,可生成四秒、六秒或八秒的片段,并带有同步音频,还可扩展为更长的序列。
Veo 3.1 片段可以有多长?
每次生成的时长为四秒、六秒或八秒。场景延展会使用一个片段的结尾帧作为下一个片段的开头,将它们串联起来。
Veo 3.1 免费吗,费用是多少?
Veo 3.1 可在 Virse 的付费套餐中使用。生成按秒从每月积分额度中计费,更高级套餐可在合理使用范围内不限量使用。当前套餐费率列于 Virse 定价页面。
Veo 3.1 可以生成音频吗?
可以 — 48kHz 立体声,涵盖对白、音效和环境声,并根据动作同步,而不是叠加在已完成的片段上。
Veo 3.1 可以生成 4K 视频吗?
可以,原生支持 3840×2160,同时也提供 1080p 和 720p。
Veo 3.1 和 Veo 3.1 Fast 有什么区别?
成本和渲染质量。两者接受相同的输入、相同的片段时长和相同的提示词,因此同一份简报可在二者之间无改动地切换。
Veo 3.1 支持哪些宽高比?
基于同一份文字简报,生成 16:9 横向和 9:16 竖向视频。
如何在 Virse 中使用 Veo 3.1?
选择 Veo 3.1 或 Veo 3.1 Fast,上传首帧、尾帧或两者都上传,撰写涵盖运动和声音的简报,然后生成。

一次一个片段

分段构建序列,检查每个衔接,并保留单次长生成会让你失去的决策点。