구글, 실시간 음성 AI '제미나이 3.8 라이브' 공개
최근 30일 조회수 — 좋아요 —핵심 요약
구글이 실시간 음성 대화용 신모델 제미나이 3.8 라이브와 추론 강화판 익스텐디드 씽킹을 공개하고 비공개 프리뷰를 시작했다.
구글이 실시간 음성 대화에 특화한 신형 인공지능 모델 ‘제미나이 3.8 라이브(Gemini 3.8 Live)‘와 그 상위 버전인 ‘제미나이 3.8 라이브 익스텐디드 씽킹(Gemini 3.8 Live Extended Thinking)‘을 공개했다. 구글 공식 블로그에 따르면 두 모델은 음성 에이전트가 사람과 대화하듯 자연스럽게 반응하면서도 복잡한 작업을 실시간으로 처리하도록 만드는 데 초점을 맞췄다.
두 모델은 역할이 나뉜다. 제미나이 3.8 라이브는 비용 효율과 확장성을 우선한 모델로, 대화의 유창함과 시각 정보 인식 능력을 결합했다. 반면 제미나이 3.8 라이브 익스텐디드 씽킹은 여러 단계를 거쳐야 하는 고난도 작업을 처리하도록 설계돼, 추론 능력과 지능이 더 높다.
성능 지표에서는 익스텐디드 씽킹 쪽이 두드러진다. 음성 대 음성 품질을 재는 아티피셜 애널리시스(Artificial Analysis)의 스피치 투 스피치 퀄리티 인덱스에서 82.6점으로 1위를 차지했고, 에이전트가 실제 작업을 완수하는 능력을 측정하는 타우-보이스(τ-Voice) 벤치마크에서도 68.6%로 선두를 지켰다. 은행 업무 시나리오에 특화한 시에라(Sierra)의 타우-보이스-뱅킹 벤치마크에서는 35.1%를 기록했다. 순수 추론 능력을 보는 빅 벤치 오디오(Big Bench Audio)에서는 97.7%를 받았는데, 구글은 이 수치를 다른 최상급 모델과 비교해 가격 대비 성능이 경쟁력 있다고 설명했다. 서비스나우(ServiceNow)의 음성 에이전트 평가 벤치마크 EVA-벤치에서는 정확도와 대화 품질을 동시에 잡아 파레토 프론티어를 넓혔다고 밝혔는데, 이 결과는 제미나이 엔터프라이즈 에이전트 플랫폼의 라이브 API에서 측정됐다.
경량 모델인 제미나이 3.8 라이브는 스피치 에이전트 아레나(Speech Agent Arena)에서 사용자 선호도 2위에 올랐다. 이 모델은 시각 입력을 실시간으로 처리해 대화 맥락을 풍부하게 만들고, 97개 언어를 대화 도중 자동으로 감지해 전환하며, 도구 호출이나 API 요청을 백그라운드에서 처리하면서 대화를 끊지 않고 이어간다. 익스텐디드 씽킹은 여기서 한 발 더 나아가 추론과 발화를 동시에 수행한다. “확인해볼게요” 같은 짧은 반응으로 요청을 먼저 인지시킨 뒤, 여러 단계짜리 작업이 진행되는 동안 진행 상황을 실시간으로 설명하는 방식이다.
구글은 아고라(Agora), 피시젬(Fishjam), 랭체인(LangChain), 라이브킷(LiveKit), 파이프캣(Pipecat), 버셀(Vercel), 비전 에이전츠(Vision Agents) 같은 개발자 플랫폼이 제미나이 라이브 API를 통해 실시간 음성 인터페이스를 구축할 수 있도록 지원한다고 밝혔다. 세일즈포스(Salesforce), 젠스파크(Genspark), 루메리스(Lumeris)와도 협력해 지연 시간과 대화 유창함, 도구 호출 능력을 검증했다고 설명했다.
모든 음성 출력에는 신시아이디(SynthID) 워터마크가 삽입된다. 오디오에 감지 불가능한 형태로 표시를 넣어 AI 생성 콘텐츠임을 추적할 수 있게 하기 위해서라고 구글은 설명했다. 제미나이 3.8 라이브는 이날부터 개발자용으로는 제미나이 API와 구글 AI 스튜디오에서 제공되며, 기업용으로는 제미나이 엔터프라이즈에서 비공개 프리뷰 형태로 제공된다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.