글을 넣으면 사람 목소리로 읽어주는 서비스가 있습니다. 예전에도 있었죠. 그런데 요즘 것은 좀 달라요. 옛날 기계음이 아니라, 숨 쉬는 지점과 억양까지 흉내 냅니다.
일레븐랩스가 그 분야에서 제일 많이 언급되는 이름이에요. 유튜브 나레이션이나 오디오북에 쓰였다는 얘기를 심심찮게 봅니다.
정리하다 보니 이 글이 두 갈래가 됐어요. 내가 이걸 쓰는 쪽과, 누군가 이걸로 나를 흉내 내는 쪽. 둘 다 같은 기술입니다.
무료 계정이 주는 것
숫자부터 보겠습니다. 2026년 8월 초에 확인한 기준이에요.
무료 계정은 한 달에 1만 크레딧을 줍니다. 다국어 음성으로 대략 10분 분량, 빠른 모델로는 20분 정도예요. 커스텀 목소리는 3개까지 만들 수 있고, 텍스트를 음성으로 바꾸는 것 외에 음성을 텍스트로 옮기거나 효과음을 만드는 기능도 열려 있습니다.

다만 무료에는 두 가지 조건이 붙어요.
- 상업적 이용 라이선스가 없습니다. 수익이 걸린 콘텐츠에는 못 쓴다는 뜻이에요.
- 만든 음성에 출처를 표시해야 합니다.
유료는 월 5달러짜리부터 시작합니다. 여기서부터 상업 이용이 열리고 분량도 3만 자로 늘어요. 요금과 한도는 자주 바뀌는 영역이니 결제 전에는 공식 페이지에서 그 시점 기준을 확인하는 게 정확합니다.
한국어는 됩니다. 30개가 넘는 언어를 지원하는데, 다만 영어와 서유럽 언어에서 품질이 가장 높고 나머지는 편차가 있다고 안내돼 있어요. 한국어 결과가 기대만큼일지는 짧게 넣어보고 판단하는 게 빠를 겁니다.
그래서 어디에 쓰나
떠오르는 쓰임은 대체로 이렇습니다.
- 얼굴을 안 내보내는 영상의 나레이션
- 내가 쓴 글을 소리로 들으며 검토하기. 눈으로 읽을 때 안 걸리던 어색한 문장이 귀로 들으면 걸립니다
- 긴 자료를 오디오로 바꿔 이동 중에 듣기
세 번째는 자료를 오디오로 바꿔주는 다른 도구들과 겹치는 영역이에요. 자료 자체를 통째로 넣어 요약까지 맡기는 방식은 예전에 정리한 글이 있습니다.
뒤집어보면
여기까지가 내가 쓰는 쪽입니다. 이제 뒤집어볼게요.
목소리는 우리가 아주 오래 써온 신분증입니다. 전화로 "나야" 한마디면 통했잖아요. 은행 상담도, 급한 부탁도 목소리로 확인했고요. 그런데 그 신분증이 복사 가능해졌습니다.
이건 특정 회사 얘기가 아니에요. 기술 자체가 그 단계에 왔다는 뜻입니다. 그리고 목소리 샘플은 생각보다 구하기 쉽습니다. 영상 하나, 통화 몇 초면 되니까요.
회사들이 만든 안전장치
그래서 업계도 장치를 걸어뒀습니다. 일레븐랩스는 2025년에 음성 복제 동의 확인 절차를 도입했어요. 실제 사람의 목소리를 복제하려면 정해진 인증 문구를 직접 녹음해서 권한이 있음을 증명해야 합니다. 약관에서도 동의 없는 복제를 금지하고 있고요.
의미 있는 장치입니다. 다만 이건 정식 서비스 안에서의 규칙이에요. 규칙을 지킬 생각이 없는 쪽까지 막아주지는 못합니다.
개인이 지금 할 수 있는 것
거창한 대비는 어렵고, 현실적으로 이 정도는 해둘 만합니다.
1. 가족끼리 확인 문구 하나 정해두기 목소리만으로 급한 부탁을 받았을 때 되물을 말을 미리 정해두는 겁니다. 우리끼리만 아는 짧은 질문이면 충분해요. 기술이 아니라 약속으로 막는 방법입니다.
2. 돈이 걸린 요청은 목소리로 끝내지 않기 송금이나 인증번호 같은 게 걸린 대화는 다른 경로로 한 번 더 확인하는 습관. 전화를 끊고 내가 아는 번호로 다시 거는 것만으로도 많이 걸러집니다.
3. 내 목소리가 담긴 자료를 아무 데나 올리지 않기 완전히 피할 수는 없지만, 긴 분량을 공개된 곳에 그대로 두는 건 다시 생각해볼 만해요.
만들어보면 알게 되는 것 하나
무료 범위로도 확인할 수 있는 게 하나 있어요. 같은 문장을 여러 목소리로 읽혀보는 것입니다.
똑같은 문장인데 목소리에 따라 전혀 다른 말처럼 들립니다. 차분한 목소리로 읽으면 설명처럼 들리고, 힘이 실린 목소리로 읽으면 주장처럼 들려요. 내용은 한 글자도 안 바뀌었는데요.
이게 왜 중요하냐면, 우리가 어떤 정보를 믿을지 정할 때 내용만 보고 판단한다고 착각하지만 실제로는 전달 방식에 꽤 흔들린다는 뜻이거든요. 자신 있게 말하면 더 믿게 되는 것과 같은 얘기입니다.
AI가 만든 목소리는 언제나 자신 있게 읽습니다. 망설이거나 말끝을 흐리는 법이 없어요. 그래서 듣는 쪽은 실제보다 더 확신에 찬 정보로 받아들이기 쉽습니다. 도구를 쓰는 입장에서도, 듣는 입장에서도 알아둘 만한 성질이에요.
도구를 볼 때 항목이 하나 더 늘었다
전에 AI 도구를 고를 때 성능과 가격 말고 데이터가 어디로 가는지도 봐야 한다고 정리한 적이 있어요(그 글). 목소리는 여기서 한 칸 더 나갑니다. 내 데이터가 아니라 나 자신을 흉내 낼 수 있는 재료가 되니까요.
그렇다고 쓰지 말자는 얘기는 아닙니다. 저는 오히려 이런 도구는 한 번 만들어봐야 감이 온다고 생각해요. 내 목소리로 30초만 만들어보면, 왜 사람들이 조심하라고 하는지 설명 없이도 알게 되거든요.