[모델]구글, 음성 인식 모델 '제미나이 3.5 트랜스크라이브' 공개
구글이 실시간 음성 인식 및 텍스트 변환 모델인 '제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)'를 선보였습니다. 이전 모델인 Chirp 3 대비 최종 텍스트 변환 속도가 70% 빨라졌으며, 불필요한 추임새 제거와 화자 분리 기능을 지원합니다. 개발자는 구글 AI 스튜디오의 제미나이 API 등을 통해 해당 모델을 바로 사용할 수 있습니다.
전문 읽기접기
무슨 일이야
구글이 정밀한 실시간 음성 상호작용을 지원하는 음성 인식(STT) 모델 '제미나이 3.5 트랜스크라이브'를 출시했습니다. 배경 소음이나 복잡한 전문 용어, 말더듬 현상 처리에 취약했던 기존 방식을 개선해 원시 오디오를 깔끔하게 정돈된 텍스트로 직접 변환하는 것이 특징입니다.
성능 측면에서는 기존 음성 모델인 Chirp 3와 비교해 눈에 띄는 개선을 이뤄냈습니다. 인공지능 분석 플랫폼(Artificial Analysis) 측정 기준 최종 전사 완료 시간이 70% 단축되었으며, FLEURS 벤치마크 기준 단어 오류율(WER)은 스트리밍 모드에서 5.50%, 비스트리밍 모드에서 5.04%를 기록했습니다.
기능적으로는 실시간 다국어 전환, 단어 단위 타임스탬프, 다중 화자 분리(화자 식별), 추임새 자동 제거 기능을 기본 지원합니다. 구글 AI 스튜디오 및 제미나이 엔터프라이즈 에이전트 플랫폼의 제미나이 API를 통해 개발자에게 제공되며, 라이브킷(LiveKit), 랭체인(LangChain), 파이프캣(Pipecat), 버셀(Vercel) 등 주요 개발 플랫폼과도 연동됩니다.
왜 중요해
음성 에이전트나 실시간 자막 도구를 개발할 때 큰 골칫거리였던 지연 시간과 전사 품질이 크게 개선되었습니다. 특히 말버릇이나 추임새를 실시간으로 다듬어 주기 때문에, 음성 인식 결과를 LLM에 프롬프트로 넘기는 음성 파이프라인에서 입력 데이터의 품질을 한층 높일 수 있게 되었습니다.
참고: DeepMind
댓글 0
첫 댓글을 남겨보세요.