📰 AI뉴스#AI뉴스
[모델]구글, 음성인식 모델 '제미나 3.5 트랜스크라이브' 공개
방앗간지기08.28 0
구글이 85개 이상 언어를 지원하는 음성인식(STT) 모델 '제미나 3.5 트랜스크라이브'를 공개했습니다. 스트리밍과 배치 두 가지 전용 엔드포인트로 나뉘어 제공되며, 배치 기준 평균 2.6%의 단어 오류율(WER)을 기록했습니다.
전문 읽기접기
무슨 일이야
구글이 새로운 음성-텍스트 변환(STT) 모델인 Gemini 3.5 Transcribe를 출시했습니다. 이번 모델은 단일 엔드포인트 대신 사용 목적에 맞춘 두 가지 엔드포인트로 나뉘어 제공되는 것이 특징입니다.
스트리밍 엔드포인트는 1초 미만(sub-second)의 빠른 전사를 제공하지만 화자 분리(diarization)와 단어 단위 타임스탬프 기능은 제외됩니다. 반면 배치 엔드포인트는 화자 분리와 타임스탬프를 모두 지원하며, 스트리밍 대비 절반의 비용으로 이용할 수 있습니다.
성능 면에서는 85개 이상의 언어에서 배치(비스트리밍) 기준 2.6%, 스트리밍 기준 4.0%의 평균 단어 오류율(WER)을 기록했습니다. 또한 기존 Chirp 3 대비 전사 완료 속도가 70% 빨라졌습니다.
왜 중요해
음성 에이전트나 대규모 텍스트 전사 파이프라인을 구축하는 개발자들에게 선택지가 명확해졌습니다. 실시간 응답 속도가 최우선인 음성 대화형 서비스와, 분석 정확도 및 비용 효율이 중요한 대용량 녹음 파일 처리 작업을 분리해 최적화할 수 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.