Kling 3.0 AI 비디오 생성기

Kuaishou의 Kling 3.0은 말합니다 — 5개 언어의 립싱크 대화, 캐릭터별 서로 다른 음성, 전체 시퀀스를 구성하는 스토리보드 모드를 제공합니다.

데스크톱 브라우저에서 이 페이지를 열어 창작을 시작하세요.

실제로 말하는 캐릭터

Kling 3.0은 Kuaishou의 3세대 비디오 모델이며, 라인업의 다른 모델들과 차별화되는 기능은 음성입니다.

많은 모델이 사운드를 생성합니다. 하지만 립싱크되는 대화를 생성하는 모델은 훨씬 적고, 각 캐릭터에 고유한 목소리를 부여하고, 5개 언어를 처리하며, 두 사람이 서로 다른 언어로 말하는 장면까지 지원하는 모델은 더욱 드뭅니다. Kling 3.0은 이 모든 것을 영상과 같은 패스에서 수행하며, 하나의 프롬프트로 여러 개의 별도 카메라 설정 시퀀스를 구성하는 멀티샷 스토리보드 모드도 함께 제공합니다.

샷 속 인물이 할 말이 있을 때 Kling 3.0을 사용하세요. 대화 장면, 내러티브 쇼츠, 진행자가 있는 설명 콘텐츠, 다국어 캠페인 버전, 그리고 그렇지 않으면 여러 번의 생성 과정을 거쳐 조립해야 할 멀티샷 시퀀스를 제작할 수 있습니다.

Characters That Actually Talk

Kling 3.0이란?

Kling 3.0은 Kuaishou가 개발한 AI 동영상 생성 모델입니다. 시작 프레임, 종료 프레임 또는 둘 다와 함께 그 사이에 어떤 일이 일어나야 하는지에 대한 서면 설명을 입력합니다.

이 모델은 세 가지 주요 강점을 중심으로 구축되었습니다:

  • 중국어, 영어, 일본어, 한국어, 스페인어 전반의 립싱크 대화
  • 각 캐릭터별 고유한 목소리, 각자가 서로 다른 언어를 말하는 장면 포함
  • 하나의 프롬프트에서 카메라 설정의 시퀀스를 계획하는 멀티샷 스토리보드 모드

클립은 최대 60fps에서 최대 15초까지 실행됩니다. 사운드는 화면과 함께 공동 생성됩니다 — 음악, 효과음, 앰비언스, 음성이 함께 생성됩니다. Virse는 이 라인을 두 가지 항목으로 나열하며, Kuaishou는 Standard를 비용 효율적인 반복 작업용 티어로, Pro를 최종 품질용 티어로 포지셔닝합니다. 둘 다 동일한 입력을 받습니다.

What Is Kling 3.0?

Kling 3.0 사양 한눈에 보기

립싱크 대화

음성을 단순히 덧씌우는 것이 아니라 입 움직임에 맞춰 타이밍을 조정합니다.

5개 언어

중국어, 영어, 일본어, 한국어, 스페인어를 지원하며, 혼합 언어 장면도 가능합니다.

캐릭터별 고유 음성

장면 속 각 화자가 서로 다른 사람처럼 들립니다.

최대 15초

이전 세대의 한계보다 늘어난 단일 패스 클립 길이입니다.

최대 60fps

이전 버전 대비 두 배의 프레임 속도입니다.

멀티샷 스토리보드 모드

하나의 프롬프트로 계획된 별도의 카메라 설정 시퀀스입니다.

Kling 3.0 AI 비디오 생성기의 주요 기능

Speech That Lands on the Mouth

입 모양에 맞게 전달되는 음성

립싱크는 말하는 캐릭터와 씹는 것처럼 보이는 캐릭터를 가르는 차이입니다. Kling 3.0은 전달 타이밍을 눈에 보이는 입 움직임에 맞추며, 바로 이것이 대화를 단순히 존재하는 것이 아니라 실제로 사용할 수 있게 만듭니다.

One Voice per Character

캐릭터당 하나의 음성

두 인물이 등장하는 장면에서 두 사람의 목소리가 똑같이 들리면 즉시 어색합니다. 캐릭터별로 구분되는 목소리는 생성된 대화 장면에서 가장 명백하게 티 나는 단서를 제거합니다.

Multilingual, Including Within One Scene

한 장면 내에서도 가능한 다국어 지원

다섯 개 언어가 지원되며, 한 장면 안에 서로 다른 언어를 말하는 캐릭터들을 포함할 수 있습니다 — 이는 실제로 매우 드문 기능이며 여러 시장에 걸쳐 배포되는 캠페인에 직접적으로 유용합니다.

Storyboard Mode for Sequences

시퀀스를 위한 스토리보드 모드

세 개의 샷을 생성한 뒤 이어 붙이는 대신, 멀티샷 모드는 하나의 프롬프트에서 시퀀스를 설계하므로 각 세팅이 의도적으로 서로 연결됩니다.

Sixty Frames per Second

초당 60프레임

이전 세대보다 프레임 레이트가 두 배 높아져, 30fps에서 버벅임이 시작되는 빠른 동작과 카메라 움직임에서 그 차이가 가장 두드러집니다.

Two Tiers, One Brief

두 가지 티어, 하나의 브리프

Standard와 Pro는 동일한 입력과 동일한 프롬프트를 사용하므로, 반복 작업에서 납품 단계로 넘어가는 과정이 다시 작성하는 일이 아니라 클릭 한 번으로 끝납니다.

Virse에서 Kling 3.0으로 만들기

대화 작업에는 무성 비디오에는 없는 리듬 문제가 있습니다. 페이지에서 보기에는 괜찮은 대사도 말로 하면 4초가 걸리고, 그 사실은 생성한 뒤에야 알게 됩니다. Virse는 스크립트를 출력물 옆에 유지합니다. 작성된 대화, 그것이 재생되는 프레임, 모든 테이크가 하나의 캔버스에 놓이므로, 대사를 조정하고 다시 실행하는 작업은 파일을 뒤지는 것이 아니라 그 자리에서 편집하는 일이 됩니다.

테이크 옆에 스크립트 유지

작성한 대사를 생성된 클립 옆에 배치해, 타이밍 문제를 그 원인이 된 대사 줄까지 추적할 수 있게 하세요.

프레임을 생성한 다음 퍼포먼스 생성

같은 캔버스에서 이미지 모델로 오프닝 구도를 만들고 이를 곧바로 Kling 3.0에 넘기세요.

30개 이상의 크리에이티브 모델 이용

캔버스를 떠나거나 브리프를 다시 작성하지 않고 Kling 3.0과 30개 이상의 다른 이미지 및 비디오 모델 사이를 이동하세요.

언어 버전을 함께 관리

각 시장의 언어로 동일한 장면을 생성하고 테이크를 나란히 배치하세요.

Kling 3.0으로 무엇을 만들 수 있나요?

Dialogue Scenes

대화 장면

말이 입 모양에 맞아야 하고 연기와도 일치해야 하는 짧은 대화.

Narrative Shorts

내러티브 쇼츠

서로 무관한 클립을 조립하는 것이 아니라 하나의 시퀀스로 계획된 멀티샷 시퀀스.

Presenter and Explainer Video

프레젠터 및 설명 영상

시장이 필요로 하는 지원 언어 중 어느 언어로든 카메라를 향해 말하는 사람.

Multilingual Campaign Versions

다국어 캠페인 버전

다시 설계하지 않고 각 언어별로 다시 촬영한 동일한 장면.

Product Motion With Sound

사운드가 있는 제품 모션

효과와 분위기가 화면과 함께 생성되는 공개 장면과 데모.

Character-Led Social Content

캐릭터 중심 소셜 콘텐츠

일련의 게시물에서 짧은 대사를 전달하는 반복 등장 캐릭터.

Virse에서 Kling 3.0 사용하는 방법

  1. 티어 선택

    장면을 다듬는 동안에는 Standard를, 최종으로 내보낼 버전에는 Pro를 사용하세요.

  2. 프레임 추가

    시작 프레임, 종료 프레임 또는 둘 다 업로드하세요. 양끝을 모두 고정하면 가장 예측 가능한 결과를 얻을 수 있습니다.

  3. 장면만이 아니라 대사를 작성하세요

    실제 대사를 따옴표 안에 넣고 누가 말하는지 명시하세요.

  4. 먼저 타이밍을 판단하세요

    화질을 보기 전에 리듬을 먼저 한 번 확인하세요. 페이싱 문제는 대개 짧은 구간의 문제입니다.

Kling 3.0 프롬프트 작성 방법

유용한 Kling 3.0 프롬프트에는 보통 다섯 가지 요소가 포함됩니다.

  • 시작 상태
  • 대사
  • 카메라
  • 분위기음
  • 마무리 상태

이렇게 쓰는 대신

고객과 이야기하는 가게 주인, 영화적인 느낌, 자연스러운 대화.

이렇게 쓰세요

서점 카운터 뒤에 있는 50대 여성을 측면에서 보여주며 시작한다. 그녀는 영수증을 정리하고 있다. 그녀가 고개를 들고 '10분 뒤에 문 닫아요'라고 말한 뒤 다시 영수증으로 돌아간다. 고객의 위치에서 촬영한 고정 미디엄 샷, 움직임 없음. 조용한 실내 분위기음, 종이 만지는 소리, 유리창 너머로 들리는 먼 거리 소음, 음악 없음. 그녀가 다시 고개를 숙인 상태로 끝낸다.

Kling 3.0 프롬프트 예시

두 인물의 대화

작은 카페 테이블에 앉은 두 사람, 측면에서 보이는 고정 미디엄 샷. 남자가 말한다. "그녀에게 말하지 않았잖아." 여자가 잠시 기다렸다가 대답한다. "그럴 필요 없었어." 각 목소리는 뚜렷하게 구분되고, 전달은 서두르지 않으며, 대사 사이에는 한 박자의 침묵이 있다. 컵 소리와 낮은 대화가 섞인 카페 분위기, 음악 없음. 여자가 시선을 돌리는 장면으로 끝난다.

멀티샷 시퀀스

워크숍 안의 3샷 시퀀스, 하나의 연속 장면으로 계획됨. 샷 1: 와이드, 여자가 출입구를 통해 들어온다. 샷 2: 미디엄, 그녀가 공구함을 작업대 위에 올려놓는다. 샷 3: 클로즈, 그녀의 손이 걸쇠를 연다. 전체에 걸쳐 일관된 천장 조명과 동일한 캐릭터. 워크숍 분위기, 발소리, 마지막 샷에서 걸쇠가 딸깍하는 소리. 대사 없음, 음악 없음.

카메라를 향한 진행자

부드럽게 초점이 흐려진 사무실 배경을 등지고 서 있는 평범한 회색 셔츠 차림의 남성, 허리 위로 프레이밍되어 카메라를 바라본다. 그가 말한다. "이번 분기에 세 가지가 바뀌었고, 그중 계획된 것은 하나뿐이었습니다." 카메라 고정, 움직임 없음. 전면 왼쪽에서 비추는 균일하고 부드러운 키 라이트. 조용한 실내 톤, 음악 없음, 배경 목소리 없음. 그가 잠시 멈추고 입을 다문 상태로 끝낸다.

Kling 3.0 Pro vs. Kling 3.0 Standard

비교 항목Kling 3.0 StandardKling 3.0 Pro
적합한 용도비용 효율적인 반복 작업최종 품질 출력
입력Pro와 동일Standard와 동일
대화 지원예예
스토리보드 모드예예
오디오선택 사항, 별도 과금선택 사항, 별도 과금
일반적인 사용동선, 타이밍 및 연기 조율최종으로 내보낼 테이크

더 나은 Kling 3.0 결과를 위한 팁

대사는 짧게 유지하세요

3초짜리 클립에는 자연스러운 속도로 대략 한 개의 짧은 문장이 들어갑니다. 한 문단을 넣으면 모델이 서두르거나 잘라내게 됩니다.

음성, 앰비언스, 음악을 분리하세요

세 가지 레이어로 나누어 이름 붙이세요. 한 문장으로 묶으면 뒤섞여 모호해집니다.

침묵까지 연출하세요

대사 전에 의도적으로 둔 정적은 연출 가능한 선택이며, 보통 끊임없는 소리보다 더 자연스럽게 읽힙니다.

시퀀스에는 스토리보드 모드를 사용하세요

세 개의 샷을 순서대로 설명하는 것이, 모델이 해석해야 하는 하나의 연속 테이크로 압축하는 것보다 낫습니다.

Kling 3.0 FAQ

Kling 3.0이란 무엇인가요?
Kling 3.0은 Kuaishou의 3세대 동영상 모델로, 립싱크 대화를 포함해 공동 생성된 오디오와 함께 최대 60fps로 최대 15초 길이의 클립을 생성합니다.
Kling 3.0은 대화를 생성할 수 있나요?
예 — 중국어, 영어, 일본어, 한국어, 스페인어로 립싱크 음성을 지원하며, 캐릭터마다 고유한 목소리를 제공하고 캐릭터들이 서로 다른 언어를 말하는 장면도 지원합니다.
Kling 3.0은 무료인가요, 비용은 얼마인가요?
Kling 3.0은 Virse의 유료 플랜에서 이용할 수 있습니다. 생성은 월간 크레딧 한도에서 초 단위로 청구되며, 상위 플랜에서는 공정 사용 범위 내에서 무제한으로 이용할 수 있습니다. 현재 플랜 요금은 Virse 가격 페이지에 표시되어 있습니다.
Kling 3.0 클립은 얼마나 길 수 있나요?
생성당 최대 15초, 최대 초당 60프레임까지 가능합니다.
Kling 3.0 Pro와 Standard의 차이는 무엇인가요?
Kuaishou는 Standard를 비용 효율적인 반복 작업용 등급으로, Pro를 최종 품질용 등급으로 포지셔닝합니다. 둘 다 동일한 입력과 동일한 프롬프트를 받습니다.
멀티샷 스토리보드 모드란 무엇인가요?
하나의 프롬프트에서 서로 다른 카메라 설정의 시퀀스를 계획하는 모드로, 샷들이 별도로 생성되어 이어 붙여지는 것이 아니라 설계상 서로 연관됩니다.
Kling 3.0용 대화는 어떻게 작성하나요?
대사는 따옴표 안에 넣고 누가 말하는지 명시하세요. 3초당 짧은 한 문장 정도로 유지하고, 분위기와 음악은 말과 별도로 설명하세요.
Virse에서 Kling 3.0을 어떻게 사용하나요?
등급을 선택하고, 엔드포인트 프레임을 불러오고, 브리프에 대사를 따옴표로 넣은 뒤 생성하세요.

그들에게 할 말을 주세요

대사를 쓰고, 목소리를 지정하면 모델이 입 모양, 타이밍, 그리고 대사가 들리는 공간을 처리합니다.