제미나이 3.8 TTS: 내 목소리 30초 샘플로 복제해봤다
목소리를 복제하는 데 딱 30초면 충분하다는 말을 처음 읽었을 때, 반응이 엇갈렸다. 기술이 빠르게 발전한다는 건 알지만 이 숫자는 좀 더 생각하게 했다. Gemini 3.8 TTS에 새로 들어온 커스텀 보이스 기능의 요건이 오디오 샘플 30초라는 점이 화제가 된 이유다. 단순히 짧다는 것이 아니라, 스마트폰으로 찍은 영상 한 클립 분량으로 누군가의 음성 특성을 포착할 수 있다는 뜻이기 때문이다. 이 기능이 어떤 원리로 작동하는지, 실제 결과가 어땠는지, 그리고 이 숫자가 무엇을 의미하는지를 정리해봤다.
30초 샘플로 할 수 있는 것
Gemini 3.8 TTS의 커스텀 보이스는 스피커 임베딩 방식으로 작동한다. 스피커 임베딩이란 짧은 오디오 클립에서 화자의 음색, 발화 리듬, 억양 패턴을 수치 벡터로 압축해 저장하는 기술로, 수백 개의 실수값 배열 하나로 한 사람의 목소리 특성 전체를 요약한다고 이해하면 된다. TTS는 텍스트를 음성으로 변환하는 기술을 말하며, 이 두 기술이 합쳐지면 특정 사람의 목소리 특성으로 임의의 텍스트를 읽어내는 것이 가능해진다. 예를 들어 팟캐스트 오프닝 클립 30초를 업로드하면 수십 페이지 분량의 스크립트를 같은 음색으로 읽어내는 음성 파일을 생성할 수 있다.
실제 사용 흐름은 단순하다. Google AI Studio에서 오디오 파일을 업로드하거나 브라우저 마이크로 직접 녹음한 뒤 API 호출 시 커스텀 보이스 파라미터로 전달하면 된다. 별도의 파인튜닝이 없다는 점이 중요한데, 파인튜닝이란 기존 모델을 새 데이터로 추가 학습시키는 과정으로 통상 수 시간에서 수일이 걸린다. 그 단계 없이 단일 API 호출로 즉시 적용된다는 점이 이 기능의 특징이며, 기존 TTS API 호출 코드에 파라미터 몇 줄만 추가하면 바로 시험해볼 수 있는 수준이다.
샘플 품질이 결과물 수준을 크게 좌우한다. 배경 소음, 에코, 마이크 거리 같은 요소가 생성 품질에 직결되는데, 실내 반향이 심한 공간에서 녹음한 샘플과 흡음재가 있는 조용한 방에서 녹음한 샘플을 비교하면 결과물 품질 차이가 뚜렷하다는 보고가 많다. 말 속도가 지나치게 빠르거나 문장 끝을 흐리면 임베딩 품질이 낮아지고, 그 영향이 생성 결과에 그대로 나타난다. 헤드셋 마이크보다 좋은 콘덴서 마이크로 녹음한 샘플을 쓴 경우 결과가 일관되게 낫다는 후기가 있었다.
30초라는 길이가 어떻게 가능해졌는지에 대해 구글은 대규모 멀티스피커 학습 데이터와 모델 아키텍처 개선의 결합이라고 설명한다. 기존 커스텀 보이스 서비스들이 5분 이상의 샘플을 요구했던 건 모델이 화자 특성을 포착하기 위한 최소 입력량이 그만큼 필요했기 때문이며, 다양한 피치, 속도, 어미 처리 방식이 골고루 담긴 표본이 있어야 일반화가 가능했다. 지금은 그 양이 크게 줄었고, 이는 모델이 훨씬 적은 정보에서도 화자 특성을 추론하는 능력이 향상됐다는 의미다. 이 수치가 앞으로 더 줄어들 가능성도 열려 있다.
한국어 테스트 결과
한국어 결과에 대한 외부 리뷰는 방향이 갈린다. 뉴스 낭독체 문장에서는 대체로 긍정적인 평이 많았는데, “오늘 오후 서울 기온은 25도를 기록했습니다”처럼 짧고 정보 전달 중심인 문장에서 원본 음색을 잘 유지했다는 반응이 여럿 있었다. 발음 정확도나 자음·모음 처리에서 이상한 점이 눈에 띄지 않는다는 평도 있었으며, 특히 받침 처리와 연음 현상이 자연스럽다는 언급이 반복됐다. 짧고 명확하게 끊어 읽는 리듬이 뚜렷한 문장에서는 커스텀 보이스의 강점이 비교적 잘 드러났다.
대화체에서는 결과가 엇갈렸다. ‘~잖아요’, ‘~거든요’, ‘~죠’ 같은 구어 어미가 포함된 문장에서 어색함이 드러나는 경우가 보고됐고, 같은 문장을 반복 생성해도 어미 처리 방식이 달라지는 비일관성이 지적되기도 했다. 특히 말끝을 올리는 억양 패턴이 일관되지 않게 나온다는 지적이 있었다. 이건 한국어 TTS 서비스 전반이 공유하는 오래된 어려움이기도 해서 Gemini만의 문제라고 보기는 어렵다.
감정 표현이 담긴 문장 테스트는 아직 평가가 충분히 쌓이지 않은 상태다. 기쁨, 놀람, 걱정 같은 감정이 실린 발화에서 커스텀 보이스가 원본의 감정 톤을 얼마나 따라가는지에 대한 체계적인 비교가 나오지 않았다. “정말요? 그게 사실이에요?”처럼 억양 변화가 의미를 결정하는 문장에서는 평탄하게 읽히는 경향이 있다는 비공식 후기가 있었다. 커스텀 보이스가 이 부분을 어느 정도 보완하는지는 더 많은 데이터가 필요하다.
전반적인 패턴은 있다. 단조롭고 명확한 텍스트, 예컨대 제품 설명·뉴스 요약·교육 콘텐츠 나레이션에서는 결과가 안정적이다. 즉흥성이나 감정 변화가 요구되는 발화에서는 아직 한계가 보이며, 이 경계는 현재 TTS 기술 전반에서 나타나는 특성이라 기대치를 그에 맞춰두는 게 현실적이다. 30초 샘플로 이 정도 결과가 나온다는 것 자체는 1년 전과 다른 상황이라는 점은 분명하다.
ElevenLabs·클로바와 나란히
같은 텍스트를 세 서비스에 넣은 비교 리뷰들이 커뮤니티에 꾸준히 올라오고 있다. ElevenLabs는 영어 TTS에서 자연스러움 기준으로 오랫동안 높은 평가를 받아온 서비스로, 영어 원어민 청취자를 대상으로 한 블라인드 테스트에서 실제 사람 목소리와 혼동되는 경우가 많다는 결과가 여러 벤치마크에 기록돼 있다. 한국어에서도 전반적으로 괜찮은 결과가 나오지만 영어만큼의 완성도가 나오지는 않는다는 인식이 많다. Gemini 3.8 TTS는 한국어 자연스러움에서 ElevenLabs와 비슷하거나 경우에 따라 앞선다는 비교 후기가 나오기 시작했다.
NAVER 클로바 보이스는 한국어 억양과 리듬 처리에서 강점을 유지해왔다. 국내 사용자 음성 데이터를 많이 확보한 만큼 한국어 고유의 어감과 발화 리듬에 익숙하며, 서울 표준어 억양의 낭독체 리듬을 다른 서비스보다 안정적으로 재현한다는 평가가 많다. 그러나 커스텀 보이스 기능은 기업 계약 중심으로 제공돼 개인 개발자나 소규모 크리에이터가 접근하기 어렵다. 이 접근성 차이가 Gemini나 ElevenLabs와의 가장 현실적인 차이점이다.
처리 속도를 비교한 벤치마크에서는 Gemini 3.8 TTS가 빠른 편이라는 결과가 나왔다. API 응답 지연이 ElevenLabs 대비 낮다는 수치가 공유됐는데, 500자 분량 텍스트를 기준으로 응답 시간이 절반 수준이라는 비공식 측정 결과가 공유된 바 있다. 측정 조건이 달라 단일 수치로 단정 짓기는 어렵지만, 실시간 응용이나 긴 텍스트 배치 처리에서 속도 차이가 체감된다는 후기는 여럿 있었다. 짧은 텍스트를 빠르게 처리하는 상황에서는 차이가 거의 없다는 의견도 공존한다.
비용 구조를 단순 비교하면 Gemini 3.8 TTS가 텍스트 분량 기준 단가가 낮은 편이다. ElevenLabs는 생성 글자 수에 따라 크레딧을 소비하는 구조인데, 무료 티어의 월 한도가 빠르게 소진되고 유료 플랜으로 넘어가면 사용량에 따라 비용 격차가 상당해진다. 클로바는 개인 대상 가격 비교가 어려운 기업 계약 중심 구조라서 단순 비교 자체가 성립하지 않는다. 결국 개인 개발자나 소규모 팀이라면 Gemini나 ElevenLabs 중 하나를 먼저 검토하는 게 현실적이며, 용도와 사용량에 따라 선택이 달라지는 상황이라고 보는 게 맞다.
목소리 복제의 문턱
30초라는 수치가 실용적으로 의미하는 바가 작지 않다. 1인 팟캐스트 제작자 입장에서 이전에는 커스텀 음성을 만들기 위해 고품질 장비와 최소 5분 이상의 녹음 샘플이 필요했고, 그조차 전문 서비스를 통해야 했다. 이제 짧은 클립 하나로 대역 목소리를 만들거나 녹음 없이 나레이션을 보충하는 작업이 현실적으로 가능해졌으며, 기존 에피소드 도입부 30초를 그대로 샘플로 활용해도 된다. 이 정도면 소규모 크리에이터에게 이전과 다른 선택지가 생긴 것이다.
다국어 더빙 워크플로에서도 변화가 생긴다. 한국어 콘텐츠를 영어나 일본어로 더빙할 때 원본 진행자의 음색을 어느 정도 유지한 채로 다른 언어 텍스트를 읽게 할 수 있다면, 기존에는 현지 더빙 배우를 섭외하고 녹음 스튜디오를 예약해야 했던 작업이 API 몇 줄로 대체될 수 있다. 완성도에서 전문 더빙 배우와의 차이는 여전히 있다. 그래도 유튜브 영상이나 온라인 강의처럼 소규모 콘텐츠에서는 충분히 쓸 만한 결과가 나올 수 있는 수준이 됐다.
문턱이 낮아진 것은 남용 가능성의 범위도 함께 넓어졌다는 뜻이다. 유튜브 영상 한 클립, 인터뷰 녹음 한 토막이면 누군가의 목소리를 흉내 낸 음성 파일을 만드는 게 기술적으로 가능해지고, 이를 보이스 피싱이나 딥페이크 콘텐츠에 악용하는 시나리오는 이미 현실에서 발생하고 있다. 동의 없는 음성 복제에 대한 법적 규정이 아직 명확하지 않은 나라가 많으며, 피해가 발생하더라도 법적 구제 수단이 불분명한 경우가 대부분이다. 기술이 규제보다 빠르게 움직이는 흔한 패턴이 여기서도 반복된다.
구글은 커스텀 보이스 기능 사용 시 화자 동의 확인을 권고하지만 강제 메커니즘은 아니다. 어떻게 쓰이는지는 플랫폼보다 사용자에게 달려 있고, 팟캐스트·나레이션·더빙·접근성 보조 도구 같은 용도에서는 분명히 유용한 도구다. 그 유용함과 남용 가능성이 동일한 기능 안에 공존한다는 점은 알고 쓰는 것과 모르고 쓰는 것 사이의 차이가 있다.
목소리는 얼굴이나 텍스트보다 더 즉각적으로 사람을 특정한다. 전화 한 통에 목소리만 들어도 가족이나 지인을 알아보듯, 음성은 신원 확인의 가장 원초적인 수단 중 하나였다. 30초면 충분하다는 사실이 편리함인지 위험인지는 결국 어떻게 쓰느냐에 달려 있고, 기술이 만든 가능성의 범위가 커질수록 사용 맥락에 대한 판단도 함께 정교해져야 한다. 그 판단을 기술이 대신해주지는 않는다.