제미나이 3.8 Flash TTS 공개: 음성 30개 프리셋을 버리고 목소리를 프롬프트로 설계하는 단계로 넘어갔다
구글은 2026년 9월 23일 제미나이 3.8 Flash TTS와 제미나이 3.8 Flash-Lite TTS를 공개하면서, 기존 원본 음성 30개 체제에서 자연어 프롬프트로 목소리를 새로 만들어 내는 생성형 보이스 디자인 체제로 전환했다고 밝혔다. 두 모델은 100개 이상 언어와 방언을 지원하고 즉시 쓸 수 있는 음성 2,000개 이상을 제공하며, 30초 음성 표본으로 목소리를 복제할 때는 목소리 주인의 구두 동의 녹음을 요구한다. 구글은 3.8 Flash TTS가 휴 AI의 보이스 디자인 벤치마크에서 71.4점으로 종합 1위, 액센트 모델링 60.8점으로 1위에 올랐고, 휴 AI 종합 품질 지수에서 3.8 Flash TTS와 Flash-Lite TTS가 각각 1위와 2위를 차지했다고 밝혔다. ASAP은 구글 공식 발표만으로 무엇이 바뀌었는지 정리하고, 이 발표에서 정작 중요한 지점이 점수가 아니라 음성 합성 제품의 경쟁축이 음질에서 연출 권한과 동의 절차로 옮겨 갔다는 사실이라는 점까지 짚는다.
두 모델은 품질 등급이 아니라 작업 성격으로 갈렸다
구글이 같은 날 내놓은 두 모델은 상위 모델과 하위 모델의 관계가 아니다. 제미나이 3.8 Flash TTS는 깊은 창작 연출과 캐릭터 설계용으로, 게임과 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어에서 새 캐릭터 목소리를 만들어 쓰는 쪽에 맞췄다. 제미나이 3.8 Flash-Lite TTS는 대량 처리와 비용 효율용으로, 대규모 더빙과 오디오 콘텐츠 제작, 표현력 있는 음성 에이전트를 겨냥했다.
두 모델이 공유하는 기능은 연출 통제다. 스크립트 한 줄마다 연기 지시를 직접 써넣거나 제미나이가 대본의 흐름에서 전달 방식을 스스로 잡게 할 수 있고, 연기 큐와 속도, 방언 전환, 백채널링까지 통제 대상에 들어간다. 여기서 백채널링은 상대 말에 끼어 넣는 반응 표시를 뜻한다. 구글은 웃음과 한숨, 탄식 같은 비언어 큐와 "음", "그래" 같은 맞장구 표현을 스크립트에 태그로 직접 써서 코미디 타이밍과 반응 박자를 맞추는 방식을 예로 들었다.
두 모델은 구글이 제미나이 오디오 계열로 묶는 흐름의 연장선에 있다. 앞서 3.5 라이브 트랜슬레이트와 3.5 트랜스크라이브, 3.8 라이브, 3.8 라이브 익스텐디드 싱킹이 나왔고, 이번 TTS 두 종은 그 계열에서 합성 쪽을 채운 셈이다.
음성 라이브러리 2,000개보다 중요한 것은 목소리를 새로 만드는 경로다
구글이 이번 발표에서 기능 목록 첫 줄에 올린 것은 생성형 보이스 디자인이다. 3.8 Flash TTS에서는 역할과 액센트, 목소리 특성을 자연어 프롬프트로 지정해 처음부터 목소리를 만들어 낼 수 있고, 지원 범위는 100개 이상 언어와 방언이다. 구글이 제시한 예시는 불을 뿜는 드라마틱한 용, 멜버른 출신 고에너지 DJ, 아주 얇고 단조로운 로봇 목소리, 일본어를 쓰는 용처럼 기존 프리셋에 존재하지 않는 캐릭터들이다.
미리 준비된 음성도 함께 늘었다. 즉시 프로덕션에 투입할 수 있는 음성이 2,000개 이상이고, 멕시코 스페인어와 퀘벡 프랑스어, 스코틀랜드 영어처럼 지역 변종이 포함된다. 만든 목소리를 저장해 관리하는 기능이 붙어 프로젝트를 이어 갈 때 음색이 흘러가는 것을 막고, 라이브러리의 목소리를 골라 음색과 음높이, 속도, 액센트를 조정하는 보이스 리믹싱은 출시 예정으로 잡혔다.
목소리 복제는 30초 분량 음성 표본을 요구한다. 조건은 자기 목소리이거나 사용 권리를 가진 목소리이고, 여기에 구두 동의 검증과 신스아이디(SynthID) 워터마크, C2PA 자격증명이 함께 걸린다.
벤치마크 1위를 인용하려면 채점 주체가 누구인지 함께 적어야 한다
구글이 제시한 수치는 세 갈래다. 첫째, 휴 AI의 보이스 디자인 벤치마크에서 3.8 Flash TTS가 종합 71.4점으로 1위, 액센트 모델링 60.8점으로 1위에 올랐다. 둘째, 휴 AI 종합 품질 지수에서 3.8 Flash TTS가 1위, 3.8 Flash-Lite TTS가 2위를 차지했다. 셋째, 보이스 아레나의 블라인드 사람 선호 평가에서 두 모델이 일본어와 브라질 포르투갈어, 베트남어, 표준 아랍어, 멕시코 스페인어, 힌디어 같은 주요 언어에서 상위권에 들었다.
이 수치를 읽을 때 붙여야 할 단서는 채점 주체다. 세 결과 모두 구글 내부 평가가 아니라 외부 벤치마크와 아레나에서 나온 값이지만, 발표는 구글이 자사 모델의 성적을 선별해 인용한 것이다. 특히 종합 품질 지수 1위와 2위는 점수 없이 순위만 제시됐으므로, 2위와의 격차가 얼마인지는 이 발표만으로 알 수 없다.
비교 기준이 자사 모델이라는 점도 짚을 만하다. 구글이 큰 폭의 개선으로 언급한 대상은 장문 콘텐츠와 이중 화자 각본 통제 같은 용례이고, 비교 상대는 경쟁사가 아니라 제미나이 3.1 Flash TTS다. 세대 간 개선치와 경쟁사 대비 우위는 다른 주장이므로, 이 발표를 인용할 때 두 층을 섞으면 과장이 된다.
가격은 이번 발표에 없다. Flash-Lite TTS를 고용량·비용 효율 모델로 규정했지만 토큰당이든 초당이든 구체적 단가가 공개되지 않았으므로, 더빙 물량을 실제로 돌리는 팀이라면 단가 확인 전까지는 비용 계획을 세울 수 없다.
경쟁축이 음질에서 연출 권한으로 옮겨 갔다
이 발표를 기존 TTS 흐름과 구분하는 지점은 음질 지표가 아니라 작업 단위다. 지금까지 상용 TTS 제품의 선택 기준은 대체로 목소리가 얼마나 사람처럼 들리는지였고, 사용자가 통제할 수 있는 것은 음성 선택과 속도, 음높이 같은 전역 파라미터였다. 반면 이번 모델이 파는 것은 대본 한 줄 단위의 연기 지시와 두 화자 장면 구성, 비언어 큐 삽입이다. 다루는 단위가 목소리에서 장면으로 올라갔다.
이 변화는 필요한 역량의 종류를 바꾼다. 음성 선택이 드롭다운에서 끝나던 작업이 대본과 연출 지시를 쓰는 작업으로 바뀌면, 결과물의 품질을 가르는 것은 모델이 아니라 지시문을 쓰는 사람의 연출 감각이 된다. 구글이 파트너로 제시한 명단이 이 해석을 뒷받침한다. 개발 플랫폼 쪽에는 아고라와 라이브킷, 파이프캣, 버셀이 있고, 통합 기업으로는 피그마와 헤이젠, 링구아나, 원더크래프트, 99.co, 올랭이 언급됐다. 목적은 글로벌 더빙 가속과 지역 액센트가 반영된 미디어 현지화, 대화형 음성 에이전트다. 모두 대본과 연출이 이미 업무의 중심인 영역이다.
국내 콘텐츠 제작 관점에서 실무적으로 갈리는 지점은 두 가지다. 하나는 100개 이상 언어와 지역 변종 지원이 현지화 비용을 낮추는 쪽이고, 다른 하나는 캐릭터 목소리를 프롬프트로 만들 수 있게 되면서 성우 캐스팅 전에 시안 단계를 붙일 수 있게 된 쪽이다. 다만 한국어에 대한 별도 성적은 이번 발표에 없다. 보이스 아레나 상위권으로 열거된 언어에 한국어는 들어 있지 않으므로, 한국어 품질은 직접 시험해 확인해야 한다.
동의 녹음을 필수로 걸었다는 점이 제품 설계의 분기점이다
목소리 복제에서 구글이 택한 절차는 사후 신고가 아니라 사전 검증이다. 목소리를 만들기 전에 참조 화자와 일치하는 목소리 주인의 구두 동의 녹음을 제출해야 하고, 이것이 통과되지 않으면 복제 자체가 진행되지 않는다. 여기에 모든 제미나이 오디오 모델 출력에 신스아이디 워터마크가 들어가 사람이 들어서는 알아챌 수 없는 형태로 AI 생성 음성을 탐지 가능하게 남긴다.
이 설계가 중요한 이유는 음성 복제가 오용될 때의 피해가 이미지나 텍스트와 성격이 다르기 때문이다. 목소리는 전화 한 통으로 신원 확인을 대체하는 용도로 쓰여 왔고, 복제 문턱이 30초로 내려가면 그 전제가 흔들린다. 사전 동의 검증을 제품 흐름에 박아 넣은 선택은 이 문제를 이용약관이 아니라 기능으로 처리하겠다는 뜻으로 읽힌다.
동시에 이 방식이 해결하지 못하는 구간이 남는다. 동의 녹음이 요구되는 것은 구글의 경로를 통과하는 복제이고, 다른 경로로 만들어진 합성 음성에는 이 절차가 적용되지 않는다. 신스아이디 역시 탐지 도구가 있는 쪽에서만 의미가 있으므로, 워터마크가 유통 단계에서 실제로 확인되는지가 다음 질문이 된다. 구글 스스로도 안전과 책임 접근에 관한 상세 내용은 모델 카드로 넘겼다.
남은 확인 사항은 가격과 한국어, 그리고 실사용 편차다
현재 배포 상태는 갈라져 있다. 3.8 Flash TTS는 개발자에게 제미나이 API와 구글 AI 스튜디오로 당일 출시되고, 기업용 제미나이 엔터프라이즈 API는 예정이며, 일반 사용자는 제미나이 노트북에서 만난다. 3.8 Flash-Lite TTS도 개발자 경로는 같고, 일반 사용자 쪽은 구글 비즈다. 구글 AI 스튜디오에는 목소리를 처음부터 프롬프트로 만들거나 자기 목소리를 복제한 뒤 이중 화자 각본 편집기로 옮겨 라인별 전달을 연출하는 오디오 플레이그라운드가 함께 열렸다.
정리하면 확인된 사실은 두 모델의 역할 분담과 기능 목록, 구글이 인용한 외부 벤치마크 성적, 동의·워터마크 절차, 배포 경로다. 확인되지 않은 것은 가격과 한국어 품질, 그리고 라인별 연출 지시가 실제 제작 현장에서 얼마나 일관되게 재현되는지다. 장문 생성에서 화자 드리프트가 최소라는 설명도 시간 단위 길이에서 직접 확인해야 하는 항목에 속한다. 음성 합성을 업무에 넣을 계획이라면, 벤치마크 순위보다 자기 대본으로 돌린 결과의 편차를 먼저 재는 편이 실용적이다.

AI 인사이트·이슈·오픈소스 아카이브
다가올 AGI를 가장 깊게 읽습니다
AGI Soon As Possible · asapai.co.kr