音频与视频联合生成
声音与画面同步生成,而不是事后添加。
ByteDance 的 Seedance 2.0 可通过首尾帧或参考图像,一次性生成画面和声音,尺寸范围从 480P 到原生 4K。
请在桌面端浏览器打开本页开始创作。
Seedance 2.0 是 ByteDance 的视频模型,其定义性特性在于音频不是一个独立阶段。
大多数生成的视频一开始是无声的,之后才配乐,这就是为什么其中很多感觉像是在素材上叠加了音乐。Seedance 2.0 会联合生成音频和视频,因此环境声、运动音效和节奏会根据屏幕上实际发生的内容来定时,而不是事后再进行大致匹配。Virse 将该模型作为四个条目提供,将由帧驱动的生成与由参考驱动的生成分开,并为每种方式提供 Fast 变体。
当片段需要听起来像它所描绘的场所时,请使用 Seedance 2.0。制作广告剪辑、产品动态展示、动画序列、角色主导的系列内容,以及音频是镜头一部分而不是之后才决定的社交视频。

Seedance 2.0 是由 ByteDance 开发的 AI 视频生成模型。它可生成带有同步双声道音频的视频,并遵循关于主体、动作、镜头行为、节奏和声音的文字指令。
该模型围绕三大核心优势构建:
生成时长为四到十五秒,宽高比覆盖从 21:9 到 9:16。Virse 列出了四个条目:Seedance 2.0 和 Seedance 2.0 Fast 可采用首帧、末帧或两者同时作为输入,而 Seedance 2.0 Reference 和 Seedance 2.0 Fast Reference 则改为基于所提供的参考素材工作。

声音与画面同步生成,而不是事后添加。
单次生成的时长,可通过接续上一次结果进行延长。
真正的 4K 输出,而非放大处理,同时支持其下的 480P、720P 和 1080P。
图像、视频片段和音频都可以作为输入提供。
帧驱动和参考驱动两种路径,每种都提供 Fast 变体。
同一份文字简报可生成从 21:9 到 9:16 的画面比例。
由于声音是与画面同步生成的,脚落地时脚步声也会落下。这种同步很难通过事后为无声片段配乐来实现,也是选择联合模型的主要原因。
大多数视频模型接受图片输入。这个模型还可以将视频片段和音频作为参考素材,因此可以直接展示运动特征和声音质感,而不必用文字描述。
这四个入口划分得很清楚。当你知道镜头的开场和收尾画面时,提供帧;当主体必须保持可识别,而描述它比展示它更困难时,提供参考。
480P 的存在,是为了在测试时机和运动时不消耗成片预算。当你提升规格时,简报无需改变。
Seedance 2.0 Fast 和 Fast Reference 以更低成本覆盖较低尺寸,探索阶段的多轮尝试就适合放在这里。
该模型能够同样轻松地处理 2D 卡通运动、3D 动画序列和插画风格方案,也能处理真人实拍风格素材。
参考驱动的视频需要先有参考素材,而这些素材很少会以整齐的一套形式出现。角色来自一个地方,产品图来自另一个地方,动作参考又来自第三个地方。 Virse 会在制作视频的同一空间中整合这些素材。画布上由任何图像模型生成的静帧都可以直接作为参考或帧导入 Seedance 2.0,无需在中间导出再重新上传。
使用图像模型生成角色和产品静帧,然后直接让 Seedance 2.0 参考它们。
先在 480P 下确定时机和运动,然后用相同的简报在 1080P 或 4K 下重新运行。
在 Seedance 2.0 与其他 30+ 个图像和视频模型之间切换,无需离开画布或重写简报。
在一个序列的每个片段中复用同一组参考,使整段生成保持一致。
音频铺底与画面一同生成的短品牌序列。
从已定义构图开始并结束的旋转、揭示和细节展示。
在不同镜头间保持一致视觉风格的插画和动画序列。
一组片段中,同一位表演者在各镜头之间保持可识别。
以 480P 起草、以 1080P 完成的竖版和横版剪辑。
在投入制作前,将分镜板转化为动态参考。
基于帧用于明确构图,基于参考用于保持连续性,Fast 用于探索。
上传开场帧和结尾帧,或参考素材,并说明每项素材的作用。
描述什么在移动、镜头如何表现,以及片段应呈现怎样的声音。
将已批准的简报提升到 1080P 或 4K,而不改动其中任何一个字。
一个有用的 Seedance 2.0 提示词通常包含六个元素:
与其这样写
一段电影感的手表产品视频。
不如这样写
以图像 1 中展示的表盘开场,在单一硬质顶光下铺满画面。围绕表壳缓慢顺时针旋转,反光掠过抛光表圈。到一半时,拉远以展示整只手表置于深色石面上。以图像 2 中的构图收尾。保持运动连续,无剪辑。全程保持安静的房间环境声,镜头稳定下来时加入一声低沉的金属音。
从 Image 1 中显示的闭合香水瓶开始,瓶子居中置于深酒红色背景前。 在片段的前三分之一缓慢推进,同时光线掠过玻璃。 以一个连续动作将瓶塞提起,保持瓶身不动、镜头稳定。 以 Image 2 中的构图结束,瓶塞悬停在瓶子上方。瓶塞提起的瞬间有微弱的房间环境声和一声柔和的玻璃清响。
将图像 1 中的角色以图像 2 的插画风格制作动画。 角色从手绘森林空地的左侧走入,在中央停下,并在光线穿透树冠时抬头仰望。 全程保持参考图中的线稿、配色和比例。摄像机固定不动。 分层的森林环境声与鸟鸣,并在角色抬头时加入一段轻盈上扬的音乐乐句。
使用图像 1 中的模特、图像 2 中的夹克,以及图像 3 中的屋顶场景。 从中景开始,模特转向摄像机,然后镜头缓慢向右跟拍,使城市天际线进入其身后的画面。 保持面部,以及夹克的剪裁、颜色和质感,与参考图所示一致。 阴天日光。风声、远处交通声,以及底层克制的电子铺底音乐。
| 对比维度 | Seedance 2.0 | Seedance 2.5 |
|---|---|---|
| 片段长度 | 四到十五秒 | 最长三十秒 |
| 参考输入 | 图像、视频和音频 | 更广泛的多模态参考集 |
| 故事连续性 | 单个镜头和短序列 | 用于更长叙事的多轮扩展 |
| 编辑控制 | 整个片段的提示词级控制 | 针对特定时刻的时间戳级控制 |
| Virse 中的入口 | 四个,将帧与参考素材分开 | 一个 |
| 适用场景 | 按所选尺寸生成明确镜头 | 更长的结构化叙事 |
在联合模型中,对声音保持沉默并不是中立的——这意味着由模型来决定。即使很简单,也要明确说明混音。
约束收尾构图,可以消除一个必须落在特定位置的镜头中的大部分偏移。
明确命名每张图像、每个片段或每个音频文件所提供的内容,才能避免模型把它们平均混在一起。
先在最低尺寸下确定构图、节奏和镜头运动,然后一次性投入交付预算。