← 목록으로

Google, 목소리를 만들고 연기까지 지시하는 Gemini 3.8 TTS 공개

요약
  • 구글이 자연어 프롬프트로 목소리를 설계하고 대사별 연기 지시와 감정 표현이 가능한 'Gemini 3.8 Flash TTS'와 비용 효율적인 'Flash-Lite TTS'를 공개했다.
  • 두 모델은 100개 이상의 언어를 지원하며 음성 복제, 장시간 대화 생성, 비언어적 발성 제어 기능을 제공한다.
  • 원하는 목소리와 말투를 자연어로 만들고 대사별로 연기를 지시하는 Gemini 3.8 Flash TTS와, 대량 음성 생성의 비용 효율성을 높인 Flash-Lite TTS를 공개함
  • Flash TTS는 2,000개 이상의 목소리를 제공하며, 새로운 목소리를 직접 설계하거나 사용 권한이 있는 목소리를 30초 음성 샘플로 복제할 수 있음
  • 두 모델 모두 대사마다 속도와 감정, 웃음과 한숨, 맞장구를 지정하고, 두 사람이 주고받는 대화와 수 시간 길이의 오디오를 일관된 목소리로 생성
  • 100개 이상의 언어를 지원하며, Google 발표 기준 Hume AI의 음성 품질 평가에서 Flash와 Flash-Lite가 각각 1위와 2위를 기록함
  • Google AI Studio와 Gemini API에서 순차 제공하며, 음성 복제에는 목소리 소유자의 동의 녹음이 필요하고 생성 오디오에는 SynthID 워터마크가 삽입됨
창작용 Flash TTS와 대규모 생성용 Flash-Lite TTS
  • Gemini 3.8 Flash TTS는 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어의 캐릭터 설계와 세밀한 음성 연출에 초점을 맞춤
    • 자연어 프롬프트로 새로운 목소리를 만들고, 대사마다 연기 지시, 말의 속도와 호흡, 방언 전환, 맞장구를 제어할 수 있음
  • Gemini 3.8 Flash-Lite TTS는 대규모 더빙, 오디오 콘텐츠 제작, 표현력 있는 음성 에이전트를 비용 효율적으로 운영하도록 최적화됨
    • 어조, 속도, 표현의 미묘한 차이를 세밀하게 조절할 수 있음
  • 두 모델은 3.5 Live Translate, 3.5 Transcribe, 3.8 Live 및 3.8 Live Extended Thinking에 이어 Gemini Audio 제품군에 추가됨
목소리 생성, 복제, 저장과 리믹스
  • Flash TTS의 생성형 음성 설계는 기존 30개 목소리 중 고르는 방식에서, 원하는 목소리를 직접 만들어 저장하는 방식으로 확장
    • 100개 이상의 언어와 방언에서 역할, 억양, 목소리 특성을 자연어로 지정할 수 있음
    • 불을 뿜는 극적인 용이나 지역 특유의 운율을 지닌 내레이터처럼 독창적인 캐릭터와 일관된 브랜드 목소리를 만들 수 있음
    • 시연에는 활기찬 멜버른 DJ, 매우 가늘고 단조로운 로봇, 일본어로 말하는 용의 목소리가 포함됨
  • 2,000개 이상의 제작용 음성을 제공하며, 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역별 변형도 지원함
  • 음성 복제는 본인 또는 사용 권한을 가진 목소리의 30초 오디오 샘플로 일관된 음성 특성을 재현함
    • 동의 검증, SynthID 워터마크, C2PA 자격 증명을 내장해 개발자와 목소리 제공자를 보호함
  • 설계한 맞춤형 목소리를 저장하고 관리해 여러 프로젝트에서 일관된 연기를 유지하고 음성 특성의 변화를 최소화할 수 있음
  • 음성 리믹스는 추후 제공 예정이며, 라이브러리의 목소리를 골라 음색, 음높이, 속도, 억양을 조정하는 기능임
    • “미국 남부 억양을 살짝 추가”하거나 “더 부드럽게 말하기” 같은 프롬프트를 사용할 수 있음
대사별 연출과 장시간 대화 생성
  • 두 모델 모두 대사별 전달 방식을 제어할 수 있으며, 직접 연기 지시를 쓰거나 대본의 자연스러운 단서를 바탕으로 Gemini가 연출하도록 할 수 있음
    • 차분한 고객 서비스 상담원부터 속삭이는 서스펜스 장면까지 구현할 수 있음
    • 시연에는 인터랙티브 음성 에이전트의 대화, 몰입형 오디오, 애니메이션 대화 장면과 대본 기반 연기가 포함됨
  • 장시간 생성에서는 수 시간의 연속 오디오에 걸쳐 높은 음성 품질, 자연스러운 속도, 캐릭터의 음색을 유지하면서 화자 특성의 변화를 최소화함
    • 팟캐스트와 오디오북 제작에 적합함
  • 두 사람이 대화하는 장면 만들기를 기본 지원해 단일 대본으로 여러 차례 주고받는 대화를 연출할 수 있음
    • 두 목소리를 뚜렷하게 구분하면서 자연스럽게 발언 순서를 전환함
  • 비언어적 발성과 맞장구를 대본에 넣어 대화의 질감과 반응 시점을 조절할 수 있음
    • <laughs>, <sigh>, <gasp>로 웃음, 한숨, 놀라는 숨소리를 지정함
    • |mhm|, |yeah| 같은 경청 반응으로 코미디 타이밍과 반응 지점을 조절함
음성 품질과 다국어 평가 결과
  • Gemini 3.8 Flash TTS는 Hume AI Voice Design Benchmark에서 종합 점수 71.4로 1위를 기록했으며, 억양 모델링에서도 60.8로 선두를 차지함
  • Overall Quality Index에서는 Flash TTS가 1위, Flash-Lite TTS가 2위를 기록함
    • Gemini 3.1 Flash TTS와 비교해 장시간 콘텐츠와 두 화자 대본 제어 등 여러 사용 사례에서 크게 개선됨
  • Voice Arena의 블라인드 선호도 평가에서 두 모델은 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어(MSA), 멕시코 스페인어, 힌디어 등 주요 언어에서 경쟁 모델 대비 상위권을 기록함
    • 사람이 직접 듣고 선호도를 평가함
  • 100개 이상의 언어 지원으로 창작자, 개발자, 기업이 다국어 음성 경험을 구축할 수 있음
음성 소유자의 동의와 생성 콘텐츠 식별
  • 음성 복제 동의 검증을 통과하려면 목소리 소유자가 구두로 동의한 녹음을 제출해야 하며, 녹음의 화자가 참조 음성의 화자와 일치해야 함
  • Gemini Audio 모델이 생성한 모든 오디오에는 지각하기 어려운 SynthID 워터마크가 출력에 직접 삽입됨
    • AI 생성 음성을 탐지할 수 있게 해 허위 정보 방지를 도움
  • 안전성과 책임 있는 사용에 관한 세부 사항은 모델 카드 에서 확인할 수 있음
Google AI Studio와 개발 플랫폼 통합
  • Google AI Studio 오디오 플레이그라운드 에서 출시일부터 새 음성 생성 기능을 체험할 수 있음
    • 프롬프트로 새로운 목소리를 설계하거나 본인의 목소리를 복제할 수 있음
    • 만든 목소리를 두 화자 대본 편집기로 바로 가져와 대사별 전달 방식을 연출할 수 있음
  • Gemini API를 활용하는 Agora, LiveKit, Pipecat, Vercel 등의 개발 플랫폼에서 음성 생성 기능을 구축하고 배포할 수 있음
  • Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang은 최신 TTS 모델을 통합하고 있음
    • 글로벌 더빙 가속, 세밀한 지역 억양을 반영한 미디어 현지화, 대규모 대화형 음성 에이전트에 활용함
모델별 제공 경로
  • Gemini 3.8 Flash TTS는 출시일부터 순차 제공됨
    • 개발자는 Gemini API와 Google AI Studio에서 이용할 수 있음
    • 일반 사용자는 Gemini Notebook에서 이용할 수 있음
  • Gemini 3.8 Flash-Lite TTS도 출시일부터 순차 제공됨
    • 개발자는 Gemini API와 Google AI Studio에서 이용할 수 있음
    • 일반 사용자는 Google Vids에서 이용할 수 있음
  • 두 모델의 기업용 API는 Gemini Enterprise 를 통해 추후 제공될 예정임
그냥 목록으로
원문 보기 ↗