보이스 클로닝이란 — 3초 녹음으로 목소리를 복제하는 원리와 막는 법
Voice cloning is the use of AI speech synthesis to reproduce a specific person's voice so it can say things they never said. Modern zero-shot models learn speech in general from tens of thousands of hours of audio and then imitate a new speaker from a short sample — Microsoft's VALL-E research in 2023 needed only three seconds. The technology powers audiobooks and voice restoration, but also scams such as a 2019 case in which fraudsters used a cloned executive's voice to obtain €220,000. Simple defences such as call-backs and family code words still work best.
보이스 클로닝은 AI 음성 합성으로 특정인의 목소리를 흉내 내 그 사람이 하지 않은 말을 하게 만드는 기술이다. 요즘 모델은 수만 시간의 음성으로 말하는 법 전반을 먼저 배운 뒤, 처음 듣는 사람의 짧은 녹음만으로 음색과 말투를 따라 한다. 2023년 마이크로소프트의 연구 모델 발리(VALL-E)는 3초짜리 녹음으로 이를 해냈다. 오디오북 낭독이나 병으로 목소리를 잃은 사람의 음성 복원에 쓰이지만, 가족·임원을 사칭한 송금 사기와 선거 허위 음성에도 쓰인다. 탐지 기술은 아직 완벽하지 않아 전화를 끊고 원래 번호로 다시 거는 확인 절차와 가족끼리 정한 암호 같은 단순한 방법이 가장 효과적이다
3줄 요약
- 원리 — 수만 시간 음성으로 '말하는 법'을 배운 모델이 짧은 녹음에서 음색만 뽑아 입힌다. 연구 수준에서 3초면 된다
- 쓰임과 악용 — 낭독·음성 복원에 쓰이지만 임원·가족 사칭 송금 사기, 선거 가짜 전화에도 쓰였다
- 막는 법 — 탐지기보다 절차. 끊고 다시 걸기, 가족 암호, 급한 송금 요구는 무조건 의심
핵심 질문
- 보이스 클로닝 몇 초
- **연구 수준에서는 3초, 상용 서비스는 수십 초~수 분 녹음을 요구하는 경우가 많다.** | 사례 | 필요한 녹음 | |---|---| | 마이크로소프트 발리(VALL-E, 2023 연구) | 3초 | | 오픈AI 보이스 엔진(2024 공개, 제한 배포) | 15초 | | 일반 상용 서비스 | 수십 초~수 분(품질 차이) | 녹음이 길고 깨끗할수록 억양·호흡까지 비슷해진다.
- AI 목소리 사기 사례
- **임원 사칭 송금과 선거 가짜 전화가 대표적이다.** | 시기 | 사례 | |---|---| | 2019년 | 영국 에너지 회사 대표가 모회사 임원 목소리를 흉내 낸 전화에 22만 유로 송금 | | 2024년 1월 | 미국 뉴햄프셔 예비선거 전 대통령 목소리를 흉내 낸 투표 거부 권유 자동전화 | | 2024년 2월 | 미국 연방통신위원회(FCC), 자동전화의 AI 생성 음성을 불법으로 판정 |
- 보이스 클로닝 예방법
- **기술보다 확인 절차가 더 잘 막는다.** | 방법 | 이유 | |---|---| | 끊고 저장된 번호로 다시 걸기 | 발신번호는 조작 가능, 다시 걸면 진짜와 연결 | | 가족 암호 정하기 | 복제 음성은 둘만 아는 답을 모른다 | | 급한 송금 요구는 일단 멈춤 | 사기는 시간 압박에 기댄다 | | SNS 공개 영상 줄이기 | 복제용 음성 재료를 줄인다 |
전화 속 목소리가 엄마 목소리와 똑같아도, 엄마가 아닐 수 있다. 보이스 클로닝(voice cloning)은 AI로 특정인의 목소리를 복제해 그 사람이 한 적 없는 말을 하게 만드는 기술이다. 2026년 10월 이탈리아 멜로니 총리가 자기 목소리를 상표로 출원한 것(「멜로니 총리, 자기 목소리 상표 출원」)도 이 기술 때문이다. 원리를 알면 왜 막기 어려운지, 그리고 무엇이 실제로 통하는지가 보인다.
1. 원리 — '말하는 법'과 '누구의 목소리'를 나눠 배운다
예전 음성 합성은 한 사람의 목소리를 만들려면 그 사람이 스튜디오에서 수십 시간을 녹음해야 했다. 지금은 두 단계로 나뉜다.
| 단계 | 하는 일 | 필요한 데이터 |
|---|---|---|
| ① 사전 학습 | 수많은 사람의 음성으로 말소리의 일반 규칙(발음·억양·호흡)을 배운다 | 수만 시간 |
| ② 화자 적응 | 새 사람의 짧은 녹음에서 음색·말버릇의 '특징값'만 뽑는다 | 수 초~수 분 |
| ③ 합성 | 입력한 문장을 ②의 음색으로 읽는다 | 텍스트 |
이렇게 한 번도 듣지 못한 화자를 짧은 샘플로 흉내 내는 것을 제로샷(zero-shot) 음성 합성이라고 한다. 2023년 마이크로소프트 연구진의 발리(VALL-E)는 약 6만 시간의 영어 음성으로 학습한 뒤 3초 녹음만으로 처음 듣는 사람의 목소리와 말할 때의 감정, 녹음 환경의 울림까지 따라 했다. 2024년 오픈AI는 15초 샘플로 목소리를 복제하는 보이스 엔진을 공개했지만 악용 우려로 일반에 풀지 않고 제한된 협력사에만 제공했다.
| 사례 | 필요한 녹음 | 공개 범위 |
|---|---|---|
| 마이크로소프트 발리(2023) | 3초 | 연구 논문, 모델 미공개 |
| 오픈AI 보이스 엔진(2024) | 15초 | 제한 배포 |
| 상용 음성 복제 서비스 | 수십 초~수 분 | 일반 공개(본인 동의 절차 다양) |
2. 어디에 쓰이고, 어떻게 악용되나
좋은 쓰임은 분명하다. 오디오북·강의 낭독을 저자 목소리로 만들거나, 루게릭병 등으로 목소리를 잃어 가는 환자가 미리 녹음해 두었다가 자기 목소리로 말하는 데 쓴다. 영상 더빙에서 배우 목소리를 유지한 채 다른 언어로 바꾸는 것도 같은 기술이다.
악용 사례도 일찍 나왔다.
| 시기 | 사례 | 피해·결과 |
|---|---|---|
| 2019년 | 영국 에너지 회사 대표가 독일 모회사 임원 목소리를 흉내 낸 전화를 받음 | 22만 유로 송금 |
| 2024년 1월 | 미국 뉴햄프셔 예비선거 직전 대통령 목소리로 "투표하지 말라" 자동전화 | 선거 개입 수사 |
| 2024년 2월 | 미국 연방통신위원회(FCC) | 자동전화의 AI 생성 음성을 불법으로 판정 |
| 2026년 10월 | 이탈리아 멜로니 총리 | 목소리 상표 출원으로 대응 |
공통점은 목소리를 신원 증명으로 믿는 습관을 노린다는 것이다. 사람은 익숙한 목소리를 들으면 의심을 내려놓는다. 여기에 "지금 당장"이라는 시간 압박이 붙으면 확인할 틈이 사라진다. 한국에서 흔한 보이스피싱이 가족 목소리까지 갖추면 위력이 커지는 이유다.
3. 탐지는 왜 어려운가
AI가 만든 음성을 가려내는 탐지기도 있지만 한계가 뚜렷하다.
| 문제 | 설명 |
|---|---|
| 전화 음질 | 통화는 음질을 압축해 합성 흔적이 함께 지워진다 |
| 쫓고 쫓기기 | 탐지기가 잡는 특징을 다음 세대 모델이 고친다 |
| 짧은 길이 | 몇 초짜리 "엄마, 나야"는 판정할 단서가 부족하다 |
| 표시 의무의 한계 | 정직한 회사는 워터마크를 넣지만 사기범은 넣지 않는다 |
EU AI법은 AI가 만든 음성에 기계가 읽을 수 있는 표식을 넣으라고 요구하지만(「EU AI법 50조란」), 표식을 지키는 쪽은 합법 서비스뿐이다. 텍스트 워터마크조차 단어 일부를 바꾸면 탐지율이 크게 떨어졌다(「챗GPT 텍스트 워터마크, EU부터」).
4. 실제로 통하는 방어 — 기술보다 절차
| 방법 | 왜 통하나 |
|---|---|
| 끊고 저장된 번호로 다시 걸기 | 발신번호는 조작할 수 있지만, 내가 거는 번호는 진짜 상대와 연결된다 |
| 가족·회사 암호 정하기 | 복제 음성은 목소리는 따라 해도 둘만 아는 답은 모른다 |
| 급한 송금·인증번호 요구는 일단 멈춤 | 사기는 거의 예외 없이 시간 압박에 기댄다 |
| 송금은 두 사람 이상 승인(회사) | 한 사람의 착각으로 돈이 나가지 않게 |
| 공개 영상·음성 줄이기 | 복제 재료를 덜 남긴다(완전히 막지는 못한다) |
| 목소리 인증만으로 된 금융 거래 피하기 | 목소리는 더 이상 혼자서 신원 증명이 못 된다 |
결국 핵심은 하나다. 목소리를 신원 증명으로 쓰지 않는 것. 기술이 목소리를 흉내 낼 수 있게 된 이상, 확인은 목소리가 아니라 별도의 경로로 해야 한다. 금융사 개인정보 유출로 연소득·대출한도까지 알려진 경우라면(「금융권 AI 해킹 7곳 6만6천 명 유출」) 사칭 전화의 신빙성이 더 높아지므로 더 조심해야 한다.
5. 남은 것과 확인되지 않은 것
- 국내 보이스피싱 중 AI 음성 복제가 쓰인 건수에 대한 공식 통계는 확인하지 못했다.
- 상용 복제 서비스의 최소 녹음 길이·본인 확인 절차는 서비스마다 다르고 자주 바뀐다.
- AI 음성 탐지 도구의 정확도에 대한 독립 평가는 확인하지 못했다.
출처
- Microsoft Research(arXiv) — Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers (VALL-E)
- OpenAI — Navigating the Challenges and Opportunities of Synthetic Voices
- FCC — FCC Makes AI-Generated Voices in Robocalls Illegal
- The Wall Street Journal — Fraudsters Used AI to Mimic CEO's Voice in Unusual Cybercrime Case
- AP(ABC News) — Italy's Meloni follows pop stars in seeking to trademark her voice to combat AI deepfakes