[모델]구글, 음성 AI 모델 제미나이 3.8 라이브 공개
구글이 실시간 음성 대화에 특화된 신규 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다. 대화 도중 백그라운드에서 추론과 도구 호출을 끊김 없이 병렬 처리하며, Gemini API와 앱, 구글 워크스페이스에 즉시 적용됩니다.
전문 읽기접기
무슨 일이야
구글이 새로운 실시간 음성 대화 모델인 Gemini 3.8 Live와 심층 추론 능력을 더한 Gemini 3.8 Live Extended Thinking을 선보였습니다. 이 모델들은 말하는 도중 사용자가 끼어들어도 자연스럽게 반응하며, 대화 중에 자동으로 97개 언어를 감지하고 전환할 수 있습니다. 또한 시각적 입력을 거의 실시간으로 처리해 화면이나 카메라 영상을 보며 이야기를 나눌 수 있습니다.
특히 돋보이는 부분은 '병렬 추론'과 백그라운드 작업 처리입니다. 대화가 뚝 끊긴 채 답변을 기다릴 필요 없이, 모델이 백그라운드에서 API 호출이나 툴을 실행하는 동안에도 음성 대화를 이어갑니다. Extended Thinking 모델의 경우 복잡한 단계가 필요한 작업을 수행할 때 진행 상황을 말로 중계해 주는 기능도 갖췄습니다.
벤치마크 성적도 함께 공개됐습니다. Gemini 3.8 Live Extended Thinking은 Artificial Analysis의 음성 품질 지수(Speech to Speech Quality Index)에서 82.6점으로 전체 1위를 기록했습니다. 에이전트 작업 완료 벤치마크인 τ-Voice에서는 68.6%, Big Bench Audio에서는 97.7%를 달성했습니다. Gemini 3.8 Live 역시 Speech Agent Arena에서 선호도 2위를 차지했습니다.
왜 중요해
음성 기반 AI 에이전트를 실서비스에 도입하려는 개발사와 엔터프라이즈 환경에 큰 진전입니다. 기존 음성 모델의 고질적인 문제였던 느린 응답 지연과 도구 호출 시의 어색한 침묵을 해결해 완성도 높은 음성 인터페이스를 구축하기 수월해졌습니다.
개발자들은 LiveKit, Pipecat, LangChain, Vercel 등의 플랫폼을 통해 Gemini Live API를 바로 활용할 수 있습니다. 일반 사용자 역시 제미나이 앱뿐 아니라 Docs, Gmail 등 구글 워크스페이스 전반에서 복잡한 문서 작업이나 일정 관리를 실시간 음성으로 처리할 수 있게 됩니다.
참고: DeepMind
댓글 0
첫 댓글을 남겨보세요.