사운드 작업은 크게 세 갈래입니다. 효과음, 배경음악, 그리고 **음성(대사·내레이션)**입니다. 뒤에 이어지는 "사운드와 배경음악" 문서가 효과음과 BGM을 다뤘다면, 이 문서는 인물이 말하는 목소리, 즉 음성을 다룹니다.
음성은 AI 영화에서 가장 까다로운 요소 중 하나입니다. 12가지 체크리스트에서 "대사가 있으면 비용이 5배가 된다"고 했던 이유가 여기 있습니다. 목소리의 캐스팅, 감정, 일관성, 그리고 입 모양과의 동기화(립싱크)까지 모두 맞아떨어져야 관객이 어색함을 느끼지 않습니다.
음성을 만드는 방법은 크게 두 가지입니다.
| 네이티브 오디오 | 외부 TTS 합성 | |
|---|---|---|
| 방식 | Kling 3.0 / Seedance 2.0이 영상 생성 시 음성·립싱크를 함께 만듦 | ElevenLabs 등으로 음성을 따로 만들고 영상에 입힘 |
| 립싱크 | 자동으로 맞음 | 별도로 맞춰야 함 |
| 목소리 일관성 | 클립마다 달라질 수 있음 | 같은 보이스로 고정 가능 |
| 감정·톤 제어 | 프롬프트로 제한적 | 세밀하게 조정 가능 |
| 한국어 품질 | 3.0부터 지원, 정밀도 다소 낮음 | 도구에 따라 우수 |
"비디오 생성 (2)"에서 다룬 네이티브 오디오는 립싱크가 자동이라는 큰 장점이 있지만, 목소리가 클립마다 미묘하게 달라지는 약점이 있습니다. 외부 TTS는 영화 전체에서 같은 목소리를 유지할 수 있지만, 립싱크를 직접 맞춰야 하는 수고가 듭니다.
실전에서는 둘을 섞어 씁니다. 짧은 대사나 즉흥적인 장면은 네이티브 오디오로, 주인공의 중요한 대사나 내레이션은 외부 TTS로 목소리를 고정하는 식입니다.
외부 TTS를 쓰는 가장 큰 이유는 영화 내내 같은 목소리를 유지하기 위함입니다. 캐릭터마다 하나의 보이스를 정하고, 그 보이스를 모든 대사에 일관되게 사용합니다. ElevenLabs 같은 도구는 보이스를 라이브러리에 저장해두고 재사용할 수 있으므로, 캐릭터 시트를 만들 때 "보이스 시트"도 함께 확정해두는 것이 좋습니다.
자주 쓰는 음성 서비스 (2026년 기준)
도구는 빠르게 바뀌니, 한국어 대사라면 국내 서비스(타입캐스트·수퍼톤)와 ElevenLabs를 같은 대사로 각각 생성해보고 가장 자연스러운 쪽을 고르는 방식을 권합니다.
같은 문장도 어떻게 말하느냐에 따라 전혀 다른 장면이 됩니다. TTS에 단순히 대사만 넣으면 평이한 톤이 나오므로, 감정과 호흡을 지시합니다.