1 – 미니맥스로 내 목소리 복제하기
1.1 – 작업 환경 준비
- 바탕화면에
contents폴더를 만들고, 그 안에voice_lab폴더를 만듭니다. - 메모장을 열고
voice_lab폴더 안에voice_memo.txt파일로 저장합니다. - Chrome 주소창을 클릭하고
https://www.minimax.io/audio를 입력한 다음 Enter 키를 누릅니다. - 화면 우상단의 Sign In 버튼을 클릭해 계정을 만들거나 로그인합니다.
- 화면 왼쪽 메뉴에서 [AI Tools] 아래의 [Voice Clone]을 클릭합니다.
미니맥스 오디오는 글자를 음성으로 바꾸고 목소리를 복제하는 웹 서비스입니다. 화면은 영어로 되어 있고, 왼쪽 메뉴가 [Home], [Voice Library], [AI Generation], [AI Tools], [Subscribe], [Access API] 순서로 놓여 있습니다.
보이스 클로닝(내 목소리 녹음을 올려 그 목소리로 말하는 음성을 만드는 기능)은 [AI Tools] 아래 [Voice Clone]에 있습니다. voice_memo.txt 파일에는 만든 음성 이름과 넣어 본 문장을 적어 둡니다. 같은 결과를 다시 만들 때 이 기록을 씁니다.

무료 등급은 매달 크레딧 10,000점을 받고, 음성 슬롯 3개를 씁니다. 이 슬롯은 복제한 음성과 Voice Design으로 만든 음성이 함께 나눠 쓰는 자리입니다. HD 모델 기준 생성 분량은 약 12분입니다(2026-09-08 확인, https://www.minimax.io/audio/subscribe).
무료 등급의 상업적 이용 표기는 무료 기간에 만든 곡으로 한정돼 있습니다. 만든 음성을 외부에 공개할 계획이라면 유료 서비스 약관을 먼저 확인합니다.
1.2 – 녹음 대본 준비하기
voice_memo.txt파일을 엽니다.- 아래 대본을 그대로 붙여 넣습니다.
- Ctrl+
S를 눌러 저장합니다.
아래는 녹음에 쓸 대본입니다. 이름·전화번호·주소 같은 실제 개인정보가 들어가지 않은 가상의 문장으로 되어 있습니다.
안녕하세요. 오늘은 목소리 녹음 연습을 해 보려고 합니다.
창밖에는 비가 조금씩 내리고 있고, 책상 위에는 따뜻한 차 한 잔이 놓여 있습니다.
저는 아침에 일어나면 물을 한 컵 마시고, 짧게 산책을 다녀옵니다.
산책길에는 작은 공원이 하나 있는데, 그곳에는 벤치가 세 개 놓여 있습니다.
가끔은 그 벤치에 앉아 나무를 바라보다가 돌아옵니다.
이렇게 천천히 읽으면 목소리의 높낮이와 속도가 고르게 유지됩니다.
숫자도 한번 읽어 보겠습니다. 하나, 둘, 셋, 넷, 다섯.
마지막으로 조금 밝은 목소리로 인사를 하겠습니다. 오늘 하루도 좋은 하루 보내세요.
대본을 미리 정해 두는 까닭은 녹음이 고르게 나오게 하기 위해서입니다. 복제 모델은 말하는 속도와 억양, 발음 습관, 숨소리를 그대로 흉내 냅니다. 들어간 소리가 고르면 나오는 소리도 고릅니다.
즉흥으로 말하면 중간에 말이 끊기고 "음", "어" 같은 소리가 섞입니다. 그 소리도 목소리의 일부로 학습되므로, 만든 음성에서도 같은 습관이 나타납니다.
복제할 수 있는 목소리는 본인 목소리나 사용 동의를 받은 목소리뿐입니다. 화면 아래쪽에 권리와 동의를 확인하는 항목이 있고, 여기에 체크해야 생성이 진행됩니다. 목소리는 사람을 가려낼 수 있는 자료이므로 다른 사람의 녹음을 올리는 실습은 하지 않습니다.
1.3 – 목소리 녹음하기
- 방문과 창문을 닫고, 선풍기와 에어컨을 끕니다.
- 녹음 앱을 엽니다. Windows에서는 시작 메뉴에서
사운드 레코더를 찾아 열고, macOS에서는음성 메모를 엽니다. - 마이크나 노트북 화면 위쪽을 입에서 약 20cm 떨어뜨립니다.
- 녹음 버튼을 누르고 2초 기다린 다음,
voice_memo.txt의 대본을 평소 말하는 속도로 읽습니다. - 대본을 다 읽으면 2초 기다린 뒤 정지 버튼을 누릅니다.
- 녹음 파일을
contents/voice_lab폴더에voice_sample_01.mp3이름으로 저장합니다.
앞뒤로 2초를 비우는 까닭은 버튼을 누르는 소리가 녹음에 섞이지 않게 하기 위해서입니다. 대본을 한 번 읽으면 대략 1분에서 2분 사이가 됩니다.
미니맥스는 10초짜리 깨끗한 녹음만으로도 복제가 된다고 안내합니다. 화면의 녹음 기능은 10초에서 60초까지 받고, 파일 업로드는 한 개당 20MB까지 받습니다. 짧은 녹음으로도 되지만, 문장이 여럿 든 녹음이 말투를 더 고르게 담습니다.
녹음 앱이 MP3로 저장하지 않으면 저장된 파일을 Audacity 같은 무료 편집 프로그램에서 열어 파일 메뉴의 내보내기로 MP3를 고릅니다. 파일 이름은 voice_sample_01.mp3처럼 짧은 영문으로 짓습니다.
1.4 – 녹음 파일이 쓸 만한지 가리기
contents/voice_lab폴더에서voice_sample_01.mp3를 두 번 클릭해 재생합니다.- 이어폰이나 헤드폰을 끼고 처음부터 끝까지 듣습니다.
- 재생을 멈추려면 Space 키를 누릅니다.
- 아래 다섯 가지 기준에 맞는지 하나씩 확인하고, 맞은 개수를
voice_memo.txt에 적습니다.
아래는 지금까지 한 녹음이 제대로 됐는지 가리는 기준입니다. 다섯 가지 가운데 세 가지 이상이 맞으면 다음 단계로 넘어갑니다. 두 가지 이하이면 녹음을 다시 합니다.
- 목소리가 한 사람 것만 들어 있고, 다른 사람 말소리가 섞이지 않았습니다.
- 에어컨 소리, 키보드 소리, 방이 울리는 소리가 들리지 않습니다.
- 처음부터 끝까지 말하는 속도와 목소리 높낮이가 비슷합니다.
- 소리가 작아서 볼륨을 끝까지 올려야 들리지 않고, 반대로 커서 소리가 갈라지지도 않습니다.
- 말과 말 사이에 5초가 넘는 빈 구간이 없습니다.
이 기준은 만든 음성의 품질을 미리 가늠하는 자리입니다. 미니맥스 화면도 조용한 곳에서 녹음하라고 안내하며, 잔향과 여러 사람의 목소리, 배경 소음이 복제 품질을 떨어뜨린다고 적습니다.
소음이 조금 섞였다면 다음 단계의 Remove Background Noise 항목을 켜서 줄일 수 있습니다. 다만 이 기능은 목소리의 미세한 결까지 함께 깎으므로, 처음부터 깨끗하게 녹음한 파일이 낫습니다.
1.5 – Voice Clone 만들기
- 왼쪽 메뉴에서 [Voice Clone]을 클릭합니다.
- [Import your Voice] 아래의 [Add or drop a file] 영역을 클릭합니다. 파일 선택 창이 뜨면
contents/voice_lab폴더로 이동해voice_sample_01.mp3를 선택하고 Open을 누릅니다. 파일을 마우스로 잡아 이 영역에 끌어다 놓아도 됩니다. - [Uploaded Samples] 옆의 숫자가
1/10으로 바뀌었는지 확인합니다. - Advanced Settings에서 필요하면 [Remove Background Noise]를 켭니다.
- Text to Preview의 언어 칸을 클릭해
Korean을 고릅니다. - 아래 입력란의 영어 예시 문장을 지우고
안녕하세요. 제 목소리로 만든 첫 음성입니다.를 입력합니다. - 화면 아래쪽의 권리와 동의 확인 항목에 체크합니다.
- Voice slots remaining 표시에서 쓸 수 있는 슬롯이 남아 있는지 확인합니다.
- Generate 버튼을 클릭합니다.
버튼을 누르면 오른쪽 아래에 결과가 나타납니다. 만들어진 음성은 Voice Library에 들어가고, 다른 화면에서 목소리를 고를 때 목록에 나옵니다.
[Text to Preview]에 적는 문장은 만들어진 목소리가 곧바로 읽어 주는 예시입니다. 이 문장 길이만큼 크레딧이 차감되고, 최대 300자까지 넣을 수 있습니다. 미리듣기 문장을 한국어로 바꾸는 까닭은 한국어 발음이 어떻게 나오는지를 그 자리에서 듣기 위해서입니다.
Enable Accent Optimization은 특정 억양을 다듬는 항목입니다. 처음에는 꺼 둔 채로 만들어 보고, 발음이 어색할 때만 켜서 견줍니다.
음성 슬롯이 모두 차 있으면 [Generate] 버튼을 눌러도 생성이 진행되지 않습니다. 이때는 [Voice Library]에서 쓰지 않는 음성을 지워 슬롯을 비운 다음 다시 만듭니다.
1.6 – 만든 음성으로 문장 읽히기
- 왼쪽 메뉴에서 [AI Generation] 아래의 [Text to Speech]를 클릭합니다.
- 화면 오른쪽의 Settings 탭에서 Voice 칸을 클릭하고 방금 만든 음성을 고릅니다.
- 화면 위쪽 Model 칸에
speech-2.8-hd가 골라져 있는지 확인합니다. - 가운데 입력란을 클릭하고
오늘은 제 목소리를 복제해서 첫 문장을 읽어 보고 있습니다.를 입력합니다. - 입력란 아래의 Credit Usage 표시를 눌러 이번 생성에 얼마가 차감되는지 확인합니다.
- [Generate] 버튼을 클릭합니다.
- 만들어진 소리를 재생해 듣고, 내려받기 아이콘을 클릭해 파일을 저장합니다.
- 저장한 파일을
contents/voice_lab폴더로 옮기고 이름을clone_test_01.mp3로 바꿉니다.
이 화면의 이름은 Speech Synthesis입니다. 왼쪽에 읽힐 글을 넣고 오른쪽에서 음성과 속도, 높낮이, 크기를 고르는 구조입니다. 입력란은 한 번에 5,000자까지 받습니다.
내려받은 파일은 브라우저의 기본 다운로드 폴더에 들어갑니다. Windows에서는 Ctrl+J를 눌러 내려받은 파일 목록을 열고, macOS에서는 Finder에서 다운로드 폴더를 엽니다.

이 화면의 입력란 아래에는 Emotion, <#> Pause, ( ) Sound Tag 단축 버튼이 있습니다. 미니맥스에서 감정과 쉼을 지시하는 기능이며, 다음 부분에서 다루는 일레븐랩스의 대괄호 표기와는 적는 방식이 다릅니다.
코칭 프롬프트
여기까지 혼자 해 보다 막히면 아래 프롬프트를 대화형 AI(ChatGPT·Claude·Gemini)에 붙여 넣고 한 단계씩 도움을 받습니다.
실습에 쓰던 대화창이 아니라 새 대화창을 열어 붙여 넣습니다. 쓰던 대화창에는 앞서 시킨 다른 지시가 남아 있어 답이 뒤섞입니다.
아래는 미니맥스 오디오에서 내 목소리를 복제하는 실습을 하다 막혀서 점검받으려는 요청입니다.
다음 규칙을 지켜서 답해 주세요.
1. 정답을 통째로 알려 주지 말고, 지금 확인할 한 단계만 알려 주세요.
2. 먼저 막힌 까닭으로 짐작되는 것을 한 줄로 짚어 주세요.
3. 내가 그 단계를 해 보고 결과를 말하면, 그때 다음 한 단계를 알려 주세요.
4. 원인을 녹음 상태 문제와 화면 설정 문제로 나눠서 물어봐 주세요.
내가 하려는 것: 내 목소리 녹음을 올려 Voice Clone을 만들고, Text to Speech 화면에서 그 음성으로 문장을 읽히는 것입니다.
지금까지 한 것: {지금까지 한 것}
막힌 지점과 화면에 뜬 문구: {막힌 지점과 화면 문구}
내 녹음 상태: {녹음 길이, 녹음한 장소, 파일 형식}
마지막으로, 처음 하는 사람이 자주 놓치는 부분이 내 상황에 보이면 짚어 주세요.
아래는 미니맥스 오디오에서 내 목소리를 복제하는 실습을 하다 막혀서 점검받으려는 요청입니다.
다음 규칙을 지켜서 답해 주세요.
1. 정답을 통째로 알려 주지 말고, 지금 확인할 한 단계만 알려 주세요.
2. 먼저 막힌 까닭으로 짐작되는 것을 한 줄로 짚어 주세요.
3. 내가 그 단계를 해 보고 결과를 말하면, 그때 다음 한 단계를 알려 주세요.
4. 원인을 녹음 상태 문제와 화면 설정 문제로 나눠서 물어봐 주세요.
내가 하려는 것: 내 목소리 녹음을 올려 Voice Clone을 만들고, Text to Speech 화면에서 그 음성으로 문장을 읽히는 것입니다.
지금까지 한 것: 1분 20초짜리 mp3를 올리고 동의 항목에 체크한 뒤 Generate를 눌렀습니다.
막힌 지점과 화면에 뜬 문구: 만들어진 음성으로 한국어 문장을 읽히면 발음이 뭉개지고 말이 빨라집니다. 오류 문구는 없습니다.
내 녹음 상태: 1분 20초, 카페에서 노트북 마이크로 녹음, mp3 파일
마지막으로, 처음 하는 사람이 자주 놓치는 부분이 내 상황에 보이면 짚어 주세요.
{지금까지 한 것}— 어디까지 진행했는지 적습니다. 예: 파일을 올리고 미리듣기 문장을 한국어로 바꿨습니다.{막힌 지점과 화면 문구}— 무엇이 안 되는지와 화면에 뜬 글을 그대로 적습니다. 예: Generate 버튼이 눌리지 않습니다.{녹음 길이, 녹음한 장소, 파일 형식}— 예: 40초, 조용한 방, mp3 파일.
AI가 정답 절차를 한꺼번에 늘어놓으면 한 단계만 알려 주세요. 제가 해 보고 결과를 말하겠습니다.라고 다시 요청합니다. 녹음 길이와 녹음한 장소를 빼고 물으면 원인을 짚기 어려우므로 두 가지는 꼭 적습니다.
2 – 일레븐랩스 오디오 태그로 감정 지시하기
2.1 – 읽힐 음성 고르기
- Chrome 주소창을 클릭하고
https://elevenlabs.io를 입력한 다음 Enter 키를 누릅니다. - 화면 우상단의 Sign up 버튼을 클릭해 계정을 만들거나, Log in 버튼을 클릭합니다.
- 왼쪽 메뉴에서 Voices를 클릭합니다.
- Voice Library 탭에서 목록의 재생 버튼을 눌러 목소리를 들어 봅니다.
- 마음에 드는 목소리를 하나 골라 Add 버튼을 클릭해 내 목록에 담습니다.
- 고른 음성 이름을
voice_memo.txt에 적습니다.
일레븐랩스는 감정 지시 기능이 발달한 음성 서비스입니다. 앞에서 만든 복제 음성은 미니맥스 계정 안에만 있으므로, 여기서는 일레븐랩스가 제공하는 라이브러리 음성을 골라 씁니다.
목소리 선택이 결과를 크게 가릅니다. 공식 문서는 오디오 태그가 얼마나 먹히는지가 고른 목소리에 달렸다고 적으며, 차분한 목소리에 크게 외치는 지시를 넣어도 그대로 되지는 않는다고 밝힙니다. 감정 폭이 넓은 목소리를 고르면 뒤 단계가 수월합니다.
일레븐랩스 무료 등급에는 보이스 클로닝이 들어 있지 않습니다. 요금제 화면의 Free 카드에는 Text to Speech, Speech to Text, Sound Effects, Voice Design, Music이 적혀 있고, Instant Voice Cloning은 Starter($6/월) 카드의 목록에 있습니다(2026-09-08 확인, https://elevenlabs.io/pricing). 목소리 복제는 앞 부분의 미니맥스에서 하고, 여기서는 라이브러리 음성으로 진행합니다.

2.2 – 태그를 넣지 않은 문장과 넣은 문장 비교하기
- 왼쪽 메뉴에서 Text to Speech를 클릭합니다.
- 오른쪽 설정 영역의 모델 선택 칸을 클릭하고
Eleven v3를 고릅니다. - 음성 선택 칸에서 앞에서 담은 음성을 고릅니다.
- 입력란에
드디어 끝났어요. 이제 좀 쉴 수 있겠네요.를 입력하고 Generate를 클릭합니다. - 만들어진 소리를 내려받아
contents/voice_lab폴더에tag_off_01.mp3로 저장합니다. - 입력란의 글을 지우고
[excited] 드디어 끝났어요. 이제 좀 쉴 수 있겠네요.를 입력한 다음 [Generate]를 클릭합니다. - 만들어진 소리를 내려받아
tag_on_01.mp3로 저장합니다. - 두 파일을 차례로 재생해 들어 봅니다.
오디오 태그는 대괄호 안에 감정이나 행동을 적어 읽는 방식을 지시하는 표기입니다. [excited]는 신이 난 상태로 읽으라는 지시이고, 이 표기는 소리로 읽히지 않고 연기 지시로 처리됩니다. 대본 옆에 감독이 적어 두는 지시문과 같은 자리입니다.
두 파일을 비교하면 같은 문장인데 말끝의 높낮이와 속도가 달라진 것을 들을 수 있습니다. 태그는 그 뒤에 오는 글부터 다음 태그가 나올 때까지 적용됩니다.
오디오 태그는 Eleven v3 모델의 기능입니다. 모델 목록에 Eleven v3가 보이지 않으면 태그가 글자 그대로 읽히므로, 모델 칸을 먼저 확인합니다. 공식 문서는 v3가 SSML의 break 태그를 지원하지 않고, 쉼은 태그와 문장부호로 만든다고 적습니다(2026-09-08 확인).
2.3 – 태그를 종류별로 골라 쓰기
- 입력란에
[whispers] 조용히 해요. 지금 저쪽에서 소리가 들렸어요.를 입력하고 [Generate]를 클릭합니다. - 만들어진 소리를
tag_whisper_01.mp3로 저장합니다. - 입력란의 글을 지우고
[sighs] 오늘도 결국 다 못 끝냈네요.를 입력한 다음 [Generate]를 클릭합니다. - 만들어진 소리를
tag_sigh_01.mp3로 저장합니다. - 입력란의 글을 지우고
[applause] 여러분, 정말 고맙습니다.를 입력한 다음 [Generate]를 클릭합니다. - 만들어진 소리를
tag_applause_01.mp3로 저장합니다. - 세 파일에서 어떤 태그가 잘 들리고 어떤 태그가 흐릿한지
voice_memo.txt에 적습니다.
공식 문서가 예로 든 태그는 아래와 같이 세 묶음으로 나뉩니다(2026-09-08 확인).
| 묶음 | 예로 든 태그 | 쓰는 자리 |
|---|---|---|
| 목소리 연기 | [laughs], [whispers], [sighs], [sarcastic], [curious], [excited], [crying] |
대사의 감정과 말하는 방식을 정할 때 |
| 효과음 | [applause], [clapping], [gunshot], [explosion], [gulps] |
목소리 사이에 상황 소리를 넣을 때 |
| 실험 성격 | [strong French accent], [sings] |
억양이나 노래처럼 특별한 연기를 시킬 때 |
효과음 태그와 실험 성격 태그는 목소리에 따라 결과가 크게 갈립니다. 공식 문서도 실험 성격 태그는 목소리마다 일관되지 않을 수 있으니 실제 작업에 쓰기 전에 충분히 시험하라고 적습니다.
고른 음성과 어울리지 않는 태그는 잘 듣지 않습니다. 태그가 안 먹으면 태그를 바꾸기 전에 음성을 먼저 바꿔 봅니다.
2.4 – Stability 값과 문장부호로 다듬기
- 입력란에
[curious] 이 안에 뭐가 들어 있을까요? [excited] 열어 봐도 될까요?를 입력합니다. - 오른쪽 설정 영역에서 Stability(안정성) 값을
Creative로 맞추고 [Generate]를 클릭한 다음, 결과를stability_creative_01.mp3로 저장합니다. - 같은 글을 그대로 두고 값을
Natural로 바꿔 만들고stability_natural_01.mp3로 저장합니다. - 같은 방법으로
Robust로도 만들어stability_robust_01.mp3로 저장합니다. - 입력란의 글을 지우고 아래 문장을 입력한 다음 [Generate]를 클릭하고, 결과를
punct_on_01.mp3로 저장합니다.
다섯 번째 단계에서 넣는 문장입니다.
그날은 정말 긴 하루였어요 [sighs] … 아무도 제 말을 듣지 않았어요. NOBODY.
Stability는 만들어진 음성이 원본 목소리를 얼마나 그대로 따르는지 정하는 값입니다. 공식 문서는 세 단계를 이렇게 적습니다. Creative는 감정 표현이 풍부한 대신 없던 소리를 지어낼 위험이 있고, Natural은 원본 목소리에 가장 가까우며, Robust는 아주 안정적인 대신 지시에 덜 반응합니다.
그래서 오디오 태그를 살리려면 Creative나 Natural을 고릅니다. 긴 글을 고르게 읽혀야 할 때는 Robust가 맞습니다.
말줄임표(…)는 쉼을 만들고 그 앞뒤 말에 무게를 싣습니다. 대문자로 적은 단어는 더 세게 읽힙니다. 한국어 문장에서는 대문자를 쓸 자리가 없으므로, 강조할 단어를 영문으로 적거나 그 앞에 [excited] 같은 태그를 두는 방법으로 갈음합니다.
입력란 위쪽의 [Enhance](보강) 버튼을 누르면 넣은 글에 어울리는 태그가 자동으로 붙습니다. 붙은 태그를 그대로 쓰기보다, 어떤 자리에 어떤 태그가 붙었는지 보고 내 대본에 맞게 고쳐 씁니다.
2.5 – 두 사람 대사 대본 만들기
voice_memo.txt를 열고 두 사람이 주고받는 대사를 여섯 줄에서 열 줄 사이로 씁니다. 실제 인물의 이름이나 개인정보는 넣지 않습니다.- 각 줄 앞에
Speaker 1:,Speaker 2:를 적어 말하는 사람을 구분합니다. - 줄마다 어울리는 오디오 태그를 하나씩 넣습니다.
- 쉼이 필요한 자리에 말줄임표(…)를 넣습니다.
- 대본을 [Text to Speech] 입력란에 붙여 넣고 Stability 값을
Natural로 맞춘 다음 [Generate]를 클릭합니다. - 만들어진 소리를
dialogue_01.mp3로 저장하고 들어 봅니다. - 아래 기준으로 확인한 다음, 아쉬운 줄의 태그를 바꿔 다시 만듭니다.
아래는 대본 형태를 보여 주는 예시입니다. 태그와 문장은 각자 쓰는 이야기에 맞게 바꿉니다.
Speaker 1: [curious] 이 상자, 언제부터 여기 있었어요?
Speaker 2: [sighs] 저도 몰라요. 아침에 왔더니 그냥 있었어요.
Speaker 1: [excited] 열어 볼까요? 뭔가 들어 있는 것 같은데요.
Speaker 2: [whispers] 잠깐만요 … 안에서 소리가 나요.
바꿀 조각은 세 가지입니다. 말하는 사람 표시는 그대로 두고, 대사 내용은 각자 이야기로 바꾸고, 대괄호 안 태그는 그 줄의 감정에 맞게 고릅니다. 놀라는 장면이면 [curious] 자리에 [excited]를 넣고, 지친 장면이면 [sighs]를 그대로 둡니다.
아래는 만든 대사 음성이 제대로 됐는지 가리는 기준입니다. 다섯 가지 가운데 세 가지 이상이 맞으면 다음 태그 조합으로 넘어가고, 두 가지 이하이면 태그와 문장부호를 고쳐 다시 만듭니다.
- 대괄호 안의 글자가 소리로 읽히지 않았습니다.
- 태그를 넣은 줄과 넣지 않은 줄의 말투가 서로 다르게 들립니다.
- 말줄임표를 넣은 자리에서 실제로 쉼이 생겼습니다.
- 두 사람의 말투가 서로 구분됩니다.
- 없던 잡음이나 알아들을 수 없는 소리가 끼어들지 않았습니다.
첫 번째 기준이 어긋나 태그가 소리로 읽히면 모델 칸이 Eleven v3인지 다시 확인합니다. 다섯 번째 기준이 어긋나면 Stability 값을 Creative에서 Natural로 낮춰 다시 만듭니다. 공식 문서가 Creative에서 없던 소리가 생길 수 있다고 밝힌 부분과 이어지는 증상입니다.
코칭 프롬프트
태그를 넣었는데 원하는 말투가 나오지 않으면 아래 프롬프트를 대화형 AI에 붙여 넣고 대본을 고쳐 나갑니다.
실습에 쓰던 대화창이 아니라 새 대화창을 열어 붙여 넣습니다. 쓰던 대화창에는 앞서 시킨 다른 지시가 남아 있어 답이 뒤섞입니다.
아래는 일레븐랩스 Eleven v3에서 오디오 태그로 대사 음성을 만드는 실습을 점검받으려는 요청입니다.
다음 규칙을 지켜서 답해 주세요.
1. 고친 대본 전체를 바로 주지 말고, 한 번에 한 줄만 골라 무엇을 바꿔 볼지 알려 주세요.
2. 먼저 지금 결과가 아쉬운 까닭으로 짐작되는 것을 한 줄로 짚어 주세요.
3. 태그 문제인지, 문장부호 문제인지, 고른 음성 문제인지 갈라서 물어봐 주세요.
4. 제가 고쳐서 다시 만들어 본 뒤 결과를 말하면, 그때 다음 한 줄을 알려 주세요.
내가 하려는 것: 두 사람이 주고받는 대사를 오디오 태그로 감정까지 살려 음성으로 만드는 것입니다.
내 대본: {내 대본}
원하는 분위기: {원하는 분위기}
지금 결과에서 아쉬운 점: {지금 결과에서 아쉬운 점}
쓰고 있는 설정: {고른 음성과 Stability 값}
마지막으로, 고른 음성과 어울리지 않는 태그가 대본에 있으면 짚어 주세요.
아래는 일레븐랩스 Eleven v3에서 오디오 태그로 대사 음성을 만드는 실습을 점검받으려는 요청입니다.
다음 규칙을 지켜서 답해 주세요.
1. 고친 대본 전체를 바로 주지 말고, 한 번에 한 줄만 골라 무엇을 바꿔 볼지 알려 주세요.
2. 먼저 지금 결과가 아쉬운 까닭으로 짐작되는 것을 한 줄로 짚어 주세요.
3. 태그 문제인지, 문장부호 문제인지, 고른 음성 문제인지 갈라서 물어봐 주세요.
4. 제가 고쳐서 다시 만들어 본 뒤 결과를 말하면, 그때 다음 한 줄을 알려 주세요.
내가 하려는 것: 두 사람이 주고받는 대사를 오디오 태그로 감정까지 살려 음성으로 만드는 것입니다.
내 대본: Speaker 1: [curious] 이 상자, 언제부터 여기 있었어요? / Speaker 2: [sighs] 저도 몰라요. 아침에 왔더니 그냥 있었어요.
원하는 분위기: 조용한 밤에 둘이 소곤거리는 느낌
지금 결과에서 아쉬운 점: 두 줄 다 비슷한 말투로 들리고, 한숨 소리가 거의 안 들립니다.
쓰고 있는 설정: 라이브러리 음성 Rachel, Stability는 Robust
마지막으로, 고른 음성과 어울리지 않는 태그가 대본에 있으면 짚어 주세요.
{내 대본}— 만든 대사를 그대로 붙여 넣습니다. 태그와 말줄임표도 지우지 않고 함께 넣습니다.{원하는 분위기}— 예: 밝고 빠른 광고 느낌, 조용한 밤에 소곤거리는 느낌.{지금 결과에서 아쉬운 점}— 예: 태그가 글자 그대로 읽힙니다. 두 사람 목소리가 똑같이 들립니다.{고른 음성과 Stability 값}— 예: 라이브러리 음성 Rachel, Stability는 Natural.
AI가 고친 대본을 통째로 내놓으면 한 줄만 골라 주세요. 제가 고쳐서 다시 만들어 보고 결과를 말하겠습니다.라고 다시 요청합니다. 고른 음성과 Stability 값을 빼고 물으면 원인을 태그에서만 찾게 되므로 두 가지는 꼭 적습니다.