[모델]MS, 첫 실시간 음성인식 모델 공개… 벤치마크 1위 기록
마이크로소프트 AI가 첫 실시간 음성-텍스트 변환(STT) 모델인 'MAI-Transcribe-2-Streaming'을 공개했습니다. 인공지능 평가 플랫폼 아티피셜 아날리시스(Artificial Analysis)의 스트리밍 벤치마크에서 38개 모델 중 1위를 기록했습니다. 현재 마이크로소프트 파운드리에서 퍼블릭 프리뷰로 써볼 수 있습니다.
전문 읽기접기
무슨 일이야
마이크로소프트 AI가 실시간 음성 인식을 지원하는 'MAI-Transcribe-2-Streaming'을 선보였습니다. 마이크로소프트가 내놓은 첫 번째 실시간 STT 모델입니다.
성능 지표를 보면 Artificial Analysis의 AA-WER Streaming 벤치마크에서 38개 비교 모델 중 1위에 올랐습니다. 최종 전사(final transcripts) 기준 0.13초의 지연 시간에 2.5%의 단어 오류율(WER)을 기록했고, 첫 부분 전사(first partials) 역시 0.12초에 2.5% WER을 나타냈습니다.
지원 언어는 총 60개이며, 발화 도중 언어가 바뀌어도 알아채는 연속 언어 감지(continuous language detection) 기능을 포함합니다. 현재 Microsoft Foundry에서 퍼블릭 프리뷰로 제공되고 있으며, 도입 프로모션 가격은 시간당 0.54달러로 책정되었습니다.
왜 중요해
실시간 STT에서 핵심은 지연 시간과 정확도의 균형인데, 0.1초대의 짧은 지연 시간과 2.5% 수준의 낮은 오류율을 동시에 달성했다는 점이 눈에 띕니다. 실시간 번역, 상담 녹취, 라이브 자막 등 즉각적인 반응이 필요한 음성 AI 서비스를 구축하는 개발자들에게 강력한 선택지가 하나 더 늘어난 셈입니다.
짚고 넘어갈 점
현재 공개된 가격(시간당 0.54달러)은 출시 기념 도입 기간(introductory period) 기준이라, 향후 정식 서비스 전환 시 가격이 변동될 가능성이 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.