Kling 3.0 AI 视频生成器

Kuaishou 的 Kling 3.0 会“开口说话”——支持五种语言的唇形同步对白、每个角色使用不同声线,以及可铺排完整镜头序列的故事板模式。

请在桌面端浏览器打开本页开始创作。

真正会说话的角色

Kling 3.0 是快手的第三代视频模型,而让它从其他模型中脱颖而出的能力是语音。

很多模型都能生成声音。但能生成对口型对白的模型要少得多,能为每个角色赋予独特声音、支持五种语言,并处理两个人说不同语言的场景的模型就更少了。Kling 3.0 能在生成画面的同一过程中完成所有这些,同时还具备多镜头分镜模式,可根据一个提示词规划出一系列独立的摄影机机位。

当画面中的人物有话要说时,就使用 Kling 3.0。用它来制作对白场景、叙事短片、带主持人的讲解内容、多语言营销版本,以及原本需要多次生成才能组装完成的多镜头序列。

Characters That Actually Talk

什么是 Kling 3.0?

Kling 3.0 是由快手开发的 AI 视频生成模型。你可以向它提供开场帧、结束帧,或两者都提供,并附上对它们之间应发生内容的文字描述。

该模型围绕三大优势构建:

  • 支持中文、英语、日语、韩语和西班牙语的口型同步对话
  • 每个角色拥有不同的声音,包括每个角色说不同语言的场景
  • 多镜头故事板模式,可根据一个提示词规划一系列摄像机机位

片段最长可达十五秒,帧率最高可达 60fps。声音会与画面共同生成——音乐、音效、环境声和语音同步生成。Virse 将该系列列为两个条目,快手将 Standard 定位为成本效益高的迭代层级,将 Pro 定位为最终质量层级;两者接受相同的输入。

What Is Kling 3.0?

Kling 3.0 规格一览

唇形同步对白

语音与口型动作同步,而不是简单叠加在画面上。

五种语言

中文、英语、日语、韩语和西班牙语,包括混合语言场景。

每个角色都有独特声线

场景中的每位说话者听起来都像不同的人。

最长十五秒

单次生成的片段长度,高于上一代的上限。

最高 60fps

是前一版本帧率的两倍。

多镜头故事板模式

通过单个提示词规划的一系列独立机位设置。

Kling 3.0 AI 视频生成器的主要功能

Speech That Lands on the Mouth

贴合口型的语音

唇形同步决定了一个角色是在说话,还是看起来像在咀嚼。Kling 3.0 会将台词节奏与可见的嘴部动作对齐,这让对话真正可用,而不只是“有声音”而已。

One Voice per Character

每个角色一种声线

在双人对手戏中,两个人听起来一模一样会立刻显得不对。为每个角色提供不同的声音,消除了生成式对话场景中最明显的破绽。

Multilingual, Including Within One Scene

多语言,支持同一场景内混合使用

支持五种语言,而且一个场景中可以包含说不同语言的角色——这确实很少见,并且对面向多个市场投放的营销活动非常实用。

Storyboard Mode for Sequences

用于镜头序列的故事板模式

多镜头模式不是生成三个镜头再把它们剪在一起,而是根据一个提示词来规划整个序列,因此各个机位从设计上就彼此关联。

Sixty Frames per Second

每秒六十帧

帧率达到上一代的两倍,在快速动作和镜头运动中最为明显,因为 30fps 在这些情况下会开始出现卡顿。

Two Tiers, One Brief

两个档位,同一创作简报

Standard 和 Pro 使用相同的输入和相同的提示词,因此从迭代切换到交付只需一次点击,而不必重写。

在 Virse 中使用 Kling 3.0 构建

对白创作存在一个无声视频没有的节奏问题。一句在页面上读起来没问题的台词,真正说出来需要四秒,而你通常要到生成之后才会发现。 Virse 会把脚本放在输出旁边。书面对话、其对应播放的画面,以及每一次生成结果都位于同一画布上,因此调整台词并重新运行是在原处编辑,而不是在文件中四处翻找。

让脚本与生成结果相邻

把书面台词放在生成的视频片段旁边,这样就能将时序问题追溯到造成问题的具体台词。

先生成画面,再生成表演

在同一画布上用图像模型构建开场构图,然后直接交给 Kling 3.0。

访问 30+ 个创意模型

在 Kling 3.0 与 30+ 个其他图像和视频模型之间切换,无需离开画布,也无需重写简报。

统一管理各语言版本

用每个市场的语言生成同一个场景,并将各个版本并排摆放。

你可以用 Kling 3.0 创作什么?

Dialogue Scenes

对白场景

简短对白,其中语音必须对上口型并匹配表演。

Narrative Shorts

叙事短片

按序列规划的多镜头段落,而不是由互不相关的片段拼接而成。

Presenter and Explainer Video

主持人和讲解视频

一个人面对镜头讲话,使用市场所需的任一受支持语言。

Multilingual Campaign Versions

多语言营销版本

无需重新设计,即可为每种语言重拍同一个场景。

Product Motion With Sound

带声音的产品动态展示

用于揭示和演示的画面,其中效果和环境氛围会与画面一同生成。

Character-Led Social Content

角色驱动的社交内容

反复出现的角色在一系列帖子中说出简短台词。

如何在 Virse 中使用 Kling 3.0

  1. 选择一个层级

    在打磨场景时使用 Standard,用于交付版本时使用 Pro。

  2. 添加你的画面帧

    上传开场帧、收尾帧,或两者都上传。固定两端会得到最可预测的结果。

  3. 写出台词,而不只是场景

    把实际对白放在引号中,并说明由谁说出。

  4. 先判断节奏

    先看一遍节奏,再看画面质量。节奏问题通常是短暂的问题。

如何编写 Kling 3.0 提示词

一个有用的 Kling 3.0 提示词通常包含五个要素:

  • 开场状态
  • 台词
  • 摄像机
  • 环境声
  • 结束状态

与其这样写

一位店主正在与顾客交谈,电影感,自然对话。

不如这样写

开场是一位五十多岁的女士站在书店柜台后方,侧身面对镜头,正在整理收据。她抬起头说:“我们十分钟后关门”,然后继续整理收据。从顾客位置拍摄的静态中景,无运动。安静的室内环境声、纸张处理声、透过玻璃传来的远处街道噪音,没有音乐。以她再次低下头结束。

Kling 3.0 提示词示例

双人对白

两个人坐在小咖啡馆的桌旁,从侧面以静态中景拍摄。 男人说:“你没有告诉她。”女人等了一下,然后回答:“我没必要。” 每个声音都清晰可辨,语速从容,两句台词之间有一拍沉默。 咖啡馆环境声,包括杯子声和低声交谈,没有音乐。以女人移开目光作为结尾。

多镜头序列

一个发生在工作坊里的三镜头序列,按一个连续场景来规划。 镜头一:广角,一名女人从门口走进来。镜头二:中景,她把工具箱放到工作台上。镜头三:特写,她的手打开锁扣。 全程保持一致的顶光照明,并使用同一个角色。 工作坊环境声、脚步声,以及最后一个镜头中锁扣咔嗒一声。无对白,无音乐。

主持人对镜头讲话

一名身穿素色灰衬衫的男子站在柔焦的办公室背景前,画面从腰部以上取景,面向镜头。 他说:“本季度有三件事发生了变化,而其中只有一件是计划中的。” 摄像机固定不动,无运动。从左前方打来均匀柔和的主光。 安静的房间环境声,没有音乐,没有背景人声。以他停顿、闭上嘴结束。

Kling 3.0 Pro 与 Kling 3.0 Standard

对比维度Kling 3.0 StandardKling 3.0 Pro
适用于高性价比迭代最终品质输出
输入与 Pro 相同与 Standard 相同
对白支持是是
分镜模式是是
音频可选,单独计价可选,单独计价
典型用途设计调度、节奏和表演用于交付的成片

获得更佳 Kling 3.0 效果的技巧

保持台词简短

一个三秒视频片段按自然语速大约能容纳一句简短的话。一整段文字会迫使模型加快语速或将其截断。

分离语音、环境声和音乐

将它们命名为三个层次。把它们塞进一句话里会产生混乱的混合体。

指导静默部分

在一句台词前保留停顿是一种可指导的选择,而且通常比连续不断的声音更好理解。

为镜头序列使用故事板模式

按顺序描述三个镜头,胜过把它们压缩成一个需要模型自行解读的连续长镜头。

Kling 3.0 常见问题

什么是 Kling 3.0?
Kling 3.0 是快手的第三代视频模型,可生成最长十五秒、最高 60fps 的片段,并同步生成音频,包括口型同步对话。
Kling 3.0 可以生成对话吗?
可以——支持中文、英语、日语、韩语和西班牙语的口型同步语音,每个角色都有独特的声音,并支持角色使用不同语言说话的场景。
Kling 3.0 是免费的吗,费用是多少?
Kling 3.0 可用于 Virse 的付费套餐。生成按秒从每月信用额度中计费,更高级套餐在合理使用范围内不计量。当前套餐费率列在 Virse 定价页面上。
Kling 3.0 片段最长可以多长?
每次生成最长十五秒,最高 60 帧每秒。
Kling 3.0 Pro 和 Standard 有什么区别?
快手将 Standard 定位为具成本效益的迭代层级,将 Pro 定位为最终质量层级。两者接受相同的输入和相同的提示词。
什么是多镜头故事板模式?
一种模式,可根据单个提示规划一系列不同的摄像机机位设置,让各个镜头在设计上相互关联,而不是分别生成后再剪辑到一起。
如何为 Kling 3.0 编写对话?
将台词放在引号中,并说明由谁说出。大约每三秒控制在一个短句以内,并将环境氛围和音乐与语音分开描述。
如何在 Virse 中使用 Kling 3.0?
选择一个档位,加载端点帧,在简报中引用对话,然后生成。

给他们一些话可说

写出台词,指定声音,让模型处理口型、时机以及说话所在的房间环境。