[연구]AI 에이전트로 ICML 논문 2,200편 재현해보니… 23%서 오류 발견
1,200명 이상의 연구자와 개발자가 코딩 에이전트를 활용해 ICML 2026 채택 논문 2,226편의 재현성을 대규모로 검증했습니다. 검증 대상 논문 중 절반가량은 핵심 주장이 확인되었으나, 23%는 수학적 증명 오류나 코드 불일치 등으로 주장이 반증되거나 논란에 휩싸였습니다.
전문 읽기접기
무슨 일이야
ICML 2026에 23,918편의 논문이 제출되고 6,352편이 채택되는 등 제출량이 급증하자, 커뮤니티 주도로 대규모 재현성 검증 해커톤이 열렸습니다. 1,200여 명의 참가자는 Claude Code, Cursor, Codex 등의 코딩 에이전트를 활용해 19일 동안 전체 채택 논문의 약 3분의 1에 해당하는 2,226편을 검증했습니다.
검증 결과, 조사 대상 논문의 51%(1,103편)는 최소 하나 이상의 주장이 독립적으로 검증되었고, 266편은 모든 주장이 완벽하게 재현되었습니다. 반면 23%(496편)는 최소 하나 이상의 주장이 반증되거나 반론이 제기되었습니다. 이 중 49편은 모든 주장이 거짓으로 드러났으며, 242편은 서로 다른 재현 팀 간에 정반대의 검증 결과가 나오는 등 논란이 발생했습니다.
스포트라이트 논문 중에서도 이론적 결함이 다수 발견되었습니다. 증명 오류로 알고리즘의 실제 성능 한계가 주장과 달랐던 논문, 특정 스텝 이후 정리가 깨지는 반례가 나온 논문, 이론은 역방향 KL을 다루었으나 실제 코드는 순방향 KL로 구현되어 핵심 결과를 재현하지 못한 논문 등이 확인되었습니다. 지적을 받은 일부 저자들은 오류를 인정하고 수정본을 게시했습니다.
왜 중요해
AI 에이전트 덕분에 논문 작성과 실험 속도가 빨라지면서 학회 심사위원이 감당하기 힘든 수준으로 논문이 쏟아지고 있습니다. 이번 사례는 심사 인력 부족으로 발생하는 검증 공백을 역으로 코딩 에이전트를 활용해 대규모로 감사하고 보완할 수 있음을 보여줍니다.
짚고 넘어갈 점
데이터셋이 비공개이거나 모델 가중치가 공개되지 않아 완전한 재현 대신 합성 데이터 기반으로만 테스트된 논문이 502편에 달했습니다. 또한 누락된 아티팩트 등으로 인해 참·거짓 여부를 아예 가려내지 못한 논문도 280편 남아 있어 재현성 확보를 위한 오픈소스 공개의 한계도 함께 드러났습니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.