唇形同步对白
语音与口型动作同步,而不是简单叠加在画面上。
Kuaishou 的 Kling 3.0 会“开口说话”——支持五种语言的唇形同步对白、每个角色使用不同声线,以及可铺排完整镜头序列的故事板模式。
请在桌面端浏览器打开本页开始创作。
Kling 3.0 是快手的第三代视频模型,而让它从其他模型中脱颖而出的能力是语音。
很多模型都能生成声音。但能生成对口型对白的模型要少得多,能为每个角色赋予独特声音、支持五种语言,并处理两个人说不同语言的场景的模型就更少了。Kling 3.0 能在生成画面的同一过程中完成所有这些,同时还具备多镜头分镜模式,可根据一个提示词规划出一系列独立的摄影机机位。
当画面中的人物有话要说时,就使用 Kling 3.0。用它来制作对白场景、叙事短片、带主持人的讲解内容、多语言营销版本,以及原本需要多次生成才能组装完成的多镜头序列。

Kling 3.0 是由快手开发的 AI 视频生成模型。你可以向它提供开场帧、结束帧,或两者都提供,并附上对它们之间应发生内容的文字描述。
该模型围绕三大优势构建:
片段最长可达十五秒,帧率最高可达 60fps。声音会与画面共同生成——音乐、音效、环境声和语音同步生成。Virse 将该系列列为两个条目,快手将 Standard 定位为成本效益高的迭代层级,将 Pro 定位为最终质量层级;两者接受相同的输入。

语音与口型动作同步,而不是简单叠加在画面上。
中文、英语、日语、韩语和西班牙语,包括混合语言场景。
场景中的每位说话者听起来都像不同的人。
单次生成的片段长度,高于上一代的上限。
是前一版本帧率的两倍。
通过单个提示词规划的一系列独立机位设置。

唇形同步决定了一个角色是在说话,还是看起来像在咀嚼。Kling 3.0 会将台词节奏与可见的嘴部动作对齐,这让对话真正可用,而不只是“有声音”而已。

在双人对手戏中,两个人听起来一模一样会立刻显得不对。为每个角色提供不同的声音,消除了生成式对话场景中最明显的破绽。

支持五种语言,而且一个场景中可以包含说不同语言的角色——这确实很少见,并且对面向多个市场投放的营销活动非常实用。

多镜头模式不是生成三个镜头再把它们剪在一起,而是根据一个提示词来规划整个序列,因此各个机位从设计上就彼此关联。

帧率达到上一代的两倍,在快速动作和镜头运动中最为明显,因为 30fps 在这些情况下会开始出现卡顿。

Standard 和 Pro 使用相同的输入和相同的提示词,因此从迭代切换到交付只需一次点击,而不必重写。
对白创作存在一个无声视频没有的节奏问题。一句在页面上读起来没问题的台词,真正说出来需要四秒,而你通常要到生成之后才会发现。 Virse 会把脚本放在输出旁边。书面对话、其对应播放的画面,以及每一次生成结果都位于同一画布上,因此调整台词并重新运行是在原处编辑,而不是在文件中四处翻找。
把书面台词放在生成的视频片段旁边,这样就能将时序问题追溯到造成问题的具体台词。
在同一画布上用图像模型构建开场构图,然后直接交给 Kling 3.0。
在 Kling 3.0 与 30+ 个其他图像和视频模型之间切换,无需离开画布,也无需重写简报。
用每个市场的语言生成同一个场景,并将各个版本并排摆放。

简短对白,其中语音必须对上口型并匹配表演。

按序列规划的多镜头段落,而不是由互不相关的片段拼接而成。

一个人面对镜头讲话,使用市场所需的任一受支持语言。

无需重新设计,即可为每种语言重拍同一个场景。

用于揭示和演示的画面,其中效果和环境氛围会与画面一同生成。

反复出现的角色在一系列帖子中说出简短台词。
在打磨场景时使用 Standard,用于交付版本时使用 Pro。
上传开场帧、收尾帧,或两者都上传。固定两端会得到最可预测的结果。
把实际对白放在引号中,并说明由谁说出。
先看一遍节奏,再看画面质量。节奏问题通常是短暂的问题。
一个有用的 Kling 3.0 提示词通常包含五个要素:
与其这样写
一位店主正在与顾客交谈,电影感,自然对话。
不如这样写
开场是一位五十多岁的女士站在书店柜台后方,侧身面对镜头,正在整理收据。她抬起头说:“我们十分钟后关门”,然后继续整理收据。从顾客位置拍摄的静态中景,无运动。安静的室内环境声、纸张处理声、透过玻璃传来的远处街道噪音,没有音乐。以她再次低下头结束。
两个人坐在小咖啡馆的桌旁,从侧面以静态中景拍摄。 男人说:“你没有告诉她。”女人等了一下,然后回答:“我没必要。” 每个声音都清晰可辨,语速从容,两句台词之间有一拍沉默。 咖啡馆环境声,包括杯子声和低声交谈,没有音乐。以女人移开目光作为结尾。
一个发生在工作坊里的三镜头序列,按一个连续场景来规划。 镜头一:广角,一名女人从门口走进来。镜头二:中景,她把工具箱放到工作台上。镜头三:特写,她的手打开锁扣。 全程保持一致的顶光照明,并使用同一个角色。 工作坊环境声、脚步声,以及最后一个镜头中锁扣咔嗒一声。无对白,无音乐。
一名身穿素色灰衬衫的男子站在柔焦的办公室背景前,画面从腰部以上取景,面向镜头。 他说:“本季度有三件事发生了变化,而其中只有一件是计划中的。” 摄像机固定不动,无运动。从左前方打来均匀柔和的主光。 安静的房间环境声,没有音乐,没有背景人声。以他停顿、闭上嘴结束。
| 对比维度 | Kling 3.0 Standard | Kling 3.0 Pro |
|---|---|---|
| 适用于 | 高性价比迭代 | 最终品质输出 |
| 输入 | 与 Pro 相同 | 与 Standard 相同 |
| 对白支持 | 是 | 是 |
| 分镜模式 | 是 | 是 |
| 音频 | 可选,单独计价 | 可选,单独计价 |
| 典型用途 | 设计调度、节奏和表演 | 用于交付的成片 |
一个三秒视频片段按自然语速大约能容纳一句简短的话。一整段文字会迫使模型加快语速或将其截断。
将它们命名为三个层次。把它们塞进一句话里会产生混乱的混合体。
在一句台词前保留停顿是一种可指导的选择,而且通常比连续不断的声音更好理解。
按顺序描述三个镜头,胜过把它们压缩成一个需要模型自行解读的连续长镜头。