Google이 새 음성 합성 모델 두 종을 공개했습니다. Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS입니다. 이 모델의 핵심은 목소리를 고르는 단계를 넘어 목소리를 연출할 수 있다는 점입니다. 별도의 마크업 언어 없이 문장 안에 대괄호 태그를 넣어 웃음이나 기침, 환호 같은 소리를 지시할 수 있고, 50대 영국 여성 건축 비평가처럼 날카로운 위트와 극적인 말투를 가진 인물이라는 설명만으로 새 캐릭터의 목소리를 만들어냅니다. 자연어 설명으로 목소리를 설계하는 부문의 공개 리더보드에서는 1위에 올랐고, 전체 음성 품질 순위에서는 두 모델이 나란히 최상위 두 자리를 차지했습니다. Google AI Studio에서 어떤 순서로 따라 하면 되는지 정리합니다.
benchmark가 보여주는 위치
Hume AI 공개 리더보드에서 Gemini 3.8 Flash TTS는 자연어 설명으로 새 목소리를 만드는 음성 설계 부문 1위를 기록했습니다. 점수는 71.4입니다. 전체 음성 품질 순위에서는 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS가 1위와 2위를 나눠 가졌습니다.
| 항목 | 내용 |
|---|---|
| 음성 설계 순위 | 1위, 71.4점 |
| 전체 품질 순위 | Gemini 3.8 Flash TTS와 Flash-Lite TTS가 1, 2위 |
| 제공 목소리 | 2,000개 이상의 기성 목소리 |
| 지원 언어 | 100개 이상 |
숫자 자체보다 눈여겨볼 부분은 평가 항목입니다. 설명으로 목소리를 설계하는 능력이 별도 순위로 측정된다는 것은 음성 합성의 경쟁 축이 자연스러움에서 연출 가능성으로 옮겨가고 있다는 신호로 보입니다. 다양한 캐릭터 음성은 물론 실제 사람의 목소리를 복제한 음성도 이 모델 하나로 만들 수 있다고 소개됩니다.

▲ 음성 품질 순위 비교
표현의 폭도 넓습니다. 자연스러운 웃음과 영국식 억양이 섞인 진행자형 목소리, 스코틀랜드 발음, 마케팅 주장을 의심하는 개발자형 목소리 같은 캐릭터를 만들 수 있습니다. ASMR 수준의 속삭임부터 뮤지컬 무대에서 지르는 듯한 고음까지 음역을 오가며, 저음의 영화 예고편풍 내레이션과 스페인어, 힌디어 발화도 지원합니다. 음량이 크게 올라가는 구간에서도 소리가 깨지지 않는 것으로 소개됩니다.
목소리를 만드는 두 가지 경로
AI Studio의 오디오 모델 목록에서 Gemini 3.8 Flash TTS를 찾으면 두 갈래의 제작 방식이 나옵니다.
| 방식 | 입력 | 결과 |
|---|---|---|
| 음성 설계 | 텍스트 설명 | 설명에 맞는 새 목소리 |
| 음성 복제 | 기존 화자의 오디오 | 그 화자의 목소리 |
음성 복제는 사용자의 지역에 따라 제공되지 않을 수 있습니다. 같은 기능을 쓰려 해도 접속 환경에 따라 메뉴가 보이지 않을 수 있으니, 먼저 어떤 경로가 열려 있는지 확인하는 편이 좋습니다.
캐릭터 목소리 설계 절차
- 모델 선택 메뉴에서 오디오 모델 중 Gemini 3.8 Flash TTS를 고릅니다.
- 음성 설계 방식을 선택합니다.
- 캐릭터 설명을 입력합니다. 예시로 쓰인 설정은 50대 영국인 여성 건축 비평가, 날카로운 위트, 극적인 연출 취향입니다.
- prompt 개선 버튼을 누릅니다. 짧은 설명이 억양과 말의 리듬, 음색의 질감, 감정 전달 방식까지 담은 연출 지시문으로 늘어납니다.
- 한 번 실행하면 오디션용 샘플 3개가 만들어집니다. 각각을 들어보고 톤과 발음을 비교합니다.

▲ 텍스트 설명에서 목소리 생성
지시문에 담아야 할 요소
캐릭터를 설계할 때 넣을 수 있는 값은 나이, 국적이나 억양, 직업, 음색과 질감, 성격과 감정 상태, 말의 속도입니다. 이 값을 어떻게 조합하느냐에 따라 같은 문장이 전혀 다른 사람의 말처럼 들립니다. prompt 개선 기능은 이 조합을 자동으로 채워 주는 역할을 합니다. 처음부터 완벽한 지시문을 쓰기 어렵다면 짧게 적고 확장하는 방식이 효율적입니다.
여러 화자 대화와 표현 태그
한 목소리를 만든 뒤에는 대화 작성기에서 화자별 발화 블록에 목소리를 배정합니다. 스타일 프리셋으로 속삭임, 친근함, 내레이션, 홍보, 팟캐스트 같은 연기 톤을 지정할 수 있습니다. 표현 태그는 문장 안에 직접 넣습니다.
| 태그 | 지시하는 소리 |
|---|---|
| [chuckle] | 낮게 웃는 소리 |
| [laugh] | 웃음 |
| [cough] | 기침 |
| [cheer] | 환호 |
이 태그를 발화 중간에 배치하면 웃음소리와 숨소리, 감정의 기복이 문장 흐름 안에서 자연스럽게 표현됩니다. 별도의 마크업 언어를 배울 필요가 없다는 점이 이 방식의 장점입니다.
설정 패널도 함께 조정합니다. 모델 temperature를 조절하면 발화의 변주 폭이 달라지고, Filter Words 옵션을 켜면 대화체 추임새와 배경의 멈춤이 삽입됩니다. 사람이 말할 때 자연스럽게 나오는 군더더기가 더해지는 셈입니다.
완성된 대화는 Get Code 탭에서 코드로 확인할 수 있습니다. google-genai 라이브러리를 사용해 오디오를 프로그램으로 생성하는 Python 코드가 나오며, 이를 그대로 응용 프로그램에 옮길 수 있습니다.
활용처와 시작 순서
Gemini 3.8 TTS가 특히 잘 맞는 작업은 사내 교육 영상, 제품 사용 안내, 다국어 콘텐츠 현지화입니다. 같은 대본을 언어별 목소리로 다시 만들거나, 한 캐릭터가 일관된 톤으로 여러 편의 콘텐츠를 이어 가는 구성이 가능해집니다. 지시문으로 감정과 억양을 지정하는 방식은 기존 TTS에서 지적되던 평평한 낭독 느낌을 줄이는 데 초점이 맞춰져 있습니다.
지금 해볼 일은 분명합니다. AI Studio에 접속해 오디오 모델에서 Gemini 3.8 Flash TTS를 고르고, 음성 설계로 캐릭터 하나를 만들어 보는 것입니다. 짧게 설명을 적고 prompt 개선 기능으로 늘린 뒤, 나온 샘플 3개를 비교 청취합니다. 마음에 드는 목소리를 골랐다면 대화 작성기에서 표현 태그를 한 번 넣어 보고, Get Code로 코드까지 확인하면 첫 실험이 끝납니다.