구글, 목소리 2000종 갖춘 신형 TTS 모델 공개
최근 30일 조회수 — 좋아요 —핵심 요약
구글이 커스텀 보이스와 다중 화자 대화를 지원하는 Gemini 3.8 TTS 모델 두 종을 공개했다.
구글이 23일 새로운 텍스트 음성 변환(TTS) 모델 두 종을 공개했다. gemini-3.8-flash-tts와 더 가벼운 gemini-3.8-flash-lite-tts로, 두 모델 모두 2000개가 넘는 목소리 라이브러리를 갖췄다고 개발자 사이먼 윌리슨이 자신의 블로그에서 전했다.1
윌리슨에 따르면 이번 모델의 특징은 목소리 개수만이 아니다. 사용자가 30초 분량의 음성 샘플만 있으면 본인 목소리나 사용 권한이 있는 목소리를 커스텀 보이스로 등록해 쓸 수 있다. API 차원에서는 여러 등장인물이 각자 다른 목소리와 말투 지시(voice style instruction)를 받아 대화를 나누는 시나리오를 한 번에 구성할 수 있는 기능도 눈에 띈다고 그는 설명했다.
윌리슨은 이 API를 써서 별도 키를 입력해 쓰는 플레이그라운드 웹 도구를 직접 만들어 공개했다. GPT-6 Astra로 이 인터페이스를 “바이브 코딩(vibe coded)“했으며, 기반이 되는 Gemini API가 CORS 정책을 열어둔 덕분에 별도 서버 없이 브라우저에서 바로 호출하는 구조로 만들 수 있었다고 밝혔다. 이는 구글의 공식 제품이 아니라 윌리슨 개인이 API 공개 직후 만든 도구다.
그가 공개한 데모는 퍼시피카 부두(Pacifica Pier)로 이사할지를 놓고 다투는 펠리컨 두 마리의 대화 클립이다. 대사는 Claude 4.5 Opus가 작성했고, 이를 재생하는 URL을 생성해 렌더링했다. 1분 18초 분량의 오디오를 만드는 데 걸린 시간은 약 20초, 비용은 2.74센트였다. 이 수치는 더 저렴한 Flash-Lite가 아니라 상위 모델인 Gemini 3.8 Flash TTS를 썼을 때 나온 값이다.
이 글은 구글의 공식 발표 내용을 상세히 전하기보다 윌리슨이 API를 직접 써본 소감과 도구 제작 과정에 가깝다. 가격 체계나 각 모델의 세부 기술 사양, 2000개 목소리의 언어·화자 구성 같은 정보는 담겨 있지 않다.
Footnotes
-
Simon Willison’s Weblog, “Tool: Gemini 3.8 TTS Playground” ↩
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Tool: Gemini 3.8 TTS Playground — Simon Willison's Weblog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.