[연구]음성인식 모델의 벤치마크 과적합, 실측 데이터로 확인됐다
오픈소스 음성인식(ASR) 모델들이 벤치마크 점수를 높이기 위해 오디오 내용과 무관하게 정답 라벨을 외워 출력하는 현상이 확인됐습니다. 오디오에 오타나 누락이 있어도 벤치마크의 잘못된 텍스트를 그대로 재현하는 등 점수 왜곡이 심각한 수준입니다.
전문 읽기접기
무슨 일이야
Hume AI 연구진이 오픈소스 ASR 모델 11개를 대상으로 VoxPopuli, LibriSpeech 등 주요 벤치마크에 대한 '벤치마킹 최적화(Benchmaxxing)' 현상을 측정했습니다. 연구진은 오디오에 실제로 들리는 단어를 벤치마크 정답지에서 누락하거나 오디오의 특정 단어를 무음 처리하는 방식으로 모델의 반응을 테스트했습니다.
실험 결과, 벤치마크 정답지에 오류가 있을 때 모델이 들리는 음성 대신 잘못된 정답지 텍스트를 그대로 출력하는 현상이 다수 포착됐습니다. 예를 들어 VoxPopuli 음성에는 "Thank you, Mr. President"가 명확히 들리지만 정답지에 "Thank you"가 빠져 있는 경우, 테스트한 11개 모델 중 6개가 음성을 무시하고 "Thank you"를 누락한 정답지 형태 그대로 출력했습니다.
특히 벤치마크에서 단어 오류율(WER)이 가장 낮아 성능이 뛰어나다고 평가받은 모델일수록 이러한 정답지 오류를 18~30% 확률로 그대로 따라 하는 경향을 보였습니다. 음성을 다른 음색의 TTS로 다시 합성해 들려주었을 때는 정상적으로 단어를 받아적는 것으로 보아, 모델들이 특정 데이터셋의 음향적 특성을 인식해 외운 텍스트를 뱉어내는 것으로 분석됩니다.
왜 중요해
음성인식 모델 리더보드 상위권의 점수가 실제 일반 음성 전사 성능을 온전하게 대변하지 못한다는 점이 수치로 증명됐습니다. 벤치마크에 포함된 오류 데이터셋까지 그대로 암기한 모델이 높은 점수를 받는 구조적 문제가 드러난 만큼, ASR 모델을 도입하려는 개발자는 공개 리더보드 점수만 믿지 말고 자체 도메인 데이터로 검증해야 합니다.
짚고 넘어갈 점
이번 분석은 주로 VoxPopuli와 LibriSpeech 등 널리 쓰이는 오픈소스 벤치마크와 오픈소스 ASR 모델을 중심으로 진행됐으며, 상용 비공개 ASR API에서도 동일한 수준의 데이터 암기 현상이 나타나는지는 추가 확인이 필요합니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.