📰 AI뉴스#AI뉴스
[모델]Sarvam AI, 인도어 22개 지원 STT 모델 Saaras V4 공개
방앗간지기1일 전 0
Sarvam AI가 인도 공용어 22개와 글로벌 영어를 지원하는 음성인식(STT) 모델 'Saaras V4'를 출시했습니다. 오디오 인코더와 3B 하이브리드 상태공간(SSM) 디코더를 결합해 첫 토큰 지연 시간을 150ms 미만으로 낮췄습니다. 현재 전용 API를 통해 시간당 30루피 가격으로 이용할 수 있습니다.
전문 읽기접기
무슨 일이야
인도의 AI 스타트업 Sarvam AI가 새로운 다국어 음성인식 모델인 Saaras V4를 선보였습니다. 이 모델은 인도 내 22개 언어 전체와 글로벌 영어를 지원하는 것이 특징입니다.
기술적으로는 오디오 인코더와 30억 파라미터(3B) 규모의 하이브리드 상태공간 모델(SSM) 디코더를 결합한 구조를 채택했습니다. 단일 모델로 5가지 출력 모드를 제공하며, 최대 50개의 주요 용어를 사전에 주입할 수 있는 키워드 프롬프팅 기능도 갖췄습니다.
실시간 스트리밍 환경을 고려해 첫 토큰 지연 시간(TTFT)을 150ms 미만으로 줄였습니다. 요금은 Sarvam API 기준 1시간 처리당 30루피(한화 약 500원 수준)로 책정되었습니다.
왜 중요해
다국어 환경이 복잡한 인도 시장을 겨냥한 저지연 STT 인프라가 갖춰졌다는 점에서 의미가 있습니다. 특히 3B SSM 기반 디코더를 통해 실시간 스트리밍 지연 시간을 150ms 미만으로 잡았고, 특정 전문 용어나 인명 처리를 돕는 키워드 프롬프팅을 지원해 실제 서비스 도입 장벽을 낮췄습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.