[연구]영국 AISI, EvalEval과 손잡고 LLM 벤치마크 결과 투명하게 공개한다
영국 AI 보안 연구소(UK AISI)가 평가 연합체 EvalEval의 인프라를 도입해 주요 프론티어 모델의 벤치마크 결과와 환경 설정을 투명하게 공개합니다. 재현 비용이 크고 형식도 제각각이던 AI 평가 데이터를 표준화된 형태로 공유해 신뢰도를 높이겠다는 취지입니다.
전문 읽기접기
무슨 일이야
영국 AISI와 EvalEval 연합이 협력해 인공지능 평가 결과를 공개하고 검증할 수 있는 공용 인프라를 본격 가동합니다. 두 조직은 NeurIPS 2025 공동 워크숍을 시작으로 협력해 왔으며, 이번에는 EvalEval의 평가 표준 스키마인 'Every Eval Ever(EEE)'와 'Evaluation Cards' 플랫폼을 실무에 적용했습니다.
이번 공개 대상에는 AISI의 연구 논문 관련 5개 벤치마크에 대한 검증 결과, 실행 맥락, 세부 설정 정보가 포함됩니다. 대상 모델은 Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, GPT-5.4 등 총 6개 프론티어 모델이며, 사이버 보안 평가인 Cyber CTFs와 The Last Ones 데이터도 함께 다룹니다.
공개된 데이터는 AISI의 논문 연구와 연계되어 추론 시점의 연산량(inference-time compute)과 평가 프로토콜이 성능 점수에 미치는 영향을 다룹니다. 예컨대 Humanity's Last Exam 벤치마크의 경우 모델이 시도 후 피드백을 받는지 여부나 토큰 사용량에 따라 해결 성공률이 크게 달라지는 점 등이 투명하게 기록되었습니다.
왜 중요해
그동안 대형 언어 모델 평가는 기관마다 보고 방식과 환경 설정이 달라 단순 점수만으로는 실제 성능을 비교하거나 재현하기가 매우 어려웠습니다. 이번 협업으로 프롬프트 설정이나 트랜스크립트 수준의 상세 데이터가 표준 포맷으로 제공되면서, 연구자들은 표면적인 벤치마크 점수 이면에 있는 구체적인 실행 조건을 대조하고 더 정밀하게 메타 분석을 수행할 수 있게 됩니다.
짚고 넘어갈 점
평가 데이터의 재현성을 확보하기 위한 표준화 시도이지만, 연구 생태계 전반의 신뢰성 개선으로 이어지려면 AISI 외에 더 많은 주요 AI 개발사와 독립 평가 기관들이 동일한 스키마를 채택해야 할 것으로 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.