[연구]LLM 벤치마크 점수의 실체를 까보는 BenchMIRT 공개
앨런 인공지능 연구소(Ai2)가 벤치마크 문제 단위로 모델의 실제 능력을 역추적하는 분석 프레임워크 'BenchMIRT'를 공개했습니다. 심리측정학의 다차원 문항반응이론을 활용해 100개 LLM의 평가 데이터를 분석한 결과, 안전성 벤치마크로 분류되던 BBQ나 WMDP 같은 평가가 실제로는 일반 추론 능력과 더 강하게 연결되어 있다는 사실이 확인됐습니다.
전문 읽기접기
무슨 일이야
Ai2가 공개한 BenchMIRT는 LLM 벤치마크의 개별 프롬프트 수준에서 모델이 실제로 어떤 능력 때문에 문제를 맞히거나 틀렸는지를 분석하는 도구입니다. 심리측정학에서 시험 문항의 변별도와 난이도를 측정할 때 쓰는 '다차원 문항반응이론(MIRT)'을 LLM 평가에 접목했습니다.
연구진은 100개 LLM을 대상으로 MMLU-Pro, GPQA, MATH, BBH 등 일반 추론 벤치마크 6개와 HarmBench, WildJailbreak, BBQ, WMDP 등 Olmo 3 안전성 제품군 10개를 포함한 총 16개 벤치마크(3만 4,000개 이상 문항) 데이터를 학습시켰습니다. 사전에 벤치마크가 무엇을 측정하는지 알려주지 않았음에도, 데이터 분석 과정에서 '안전성'과 '일반 추론'이라는 두 가지 핵심 차원이 자동으로 분리되어 도출됐습니다.
분석 결과, 안전성 평가로 분류되던 BBQ(사회적 편향 측정)는 안전성보다 일반 추론 능력과 훨씬 강하게 연동되어 있었습니다. 즉, BBQ 점수가 낮은 것은 안전성 결함 때문이 아니라 지문 내 인과관계를 이해하지 못해 발생했을 가능성이 큽니다. 또한 위험 지식 측정을 목표로 하는 WMDP 역시 일반 추론 능력과 밀접했는데, 위험 지식 거부를 정답으로 처리하는 구조 탓에 추론 능력이 뛰어난 모델일수록 오히려 점수가 낮게 나오는 역상관 관계가 나타났습니다.
왜 중요해
지금까지는 벤치마크의 최종 평균 점수만 보고 모델의 안전성이나 추론 성능을 단순 평가하는 경우가 많았습니다. 하지만 같은 벤치마크 내부에서도 HarmBench의 일반 유해 프롬프트는 안전성과, 저작권 관련 프롬프트는 일반 추론과 연동되는 등 여러 신호가 섞여 있다는 점이 구체적인 수치로 드러났습니다. BenchMIRT를 활용하면 개발자와 연구자는 벤치마크가 실제로 무엇을 측정하고 있는지 문항 단위로 분리해 파악하고 모델 평가의 왜곡을 줄일 수 있습니다.
짚고 넘어갈 점
이번 연구는 벤치마크 자체가 결함이 있거나 쓸모없다는 의미는 아니며, 단일 점수 뒤에 가려진 복합적인 신호를 분리해 해석해야 한다는 점을 보여줍니다. 이번 분석에서는 안전성과 일반 추론이라는 두 가지 주요 차원에 집중했기 때문에, 모델의 다른 잠재적 역량이 어떻게 작용하는지는 향후 추가 확장이 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.