[연구]AI 에이전트 반복 성공률, 평균 점수보다 훨씬 낮다
IBM 리서치가 AI 에이전트의 반복 실행 일관성을 측정하는 새 지표 'Pass^k'와 이를 보완하는 기법을 발표했습니다. 실험 결과 GPT-4.1 기반 에이전트의 5회 평균 성공률은 77.4%였지만, 5번 모두 성공한 비율은 53.0%에 그쳤습니다. 연구팀은 의사결정 시 확률 분포가 평평해지는 지점을 찾아 가이드라인을 주입하는 방식으로 일관성을 개선할 수 있다고 밝혔습니다.
전문 읽기접기
무슨 일이야
기존 에이전트 벤치마크는 주로 평균 성공률(Mean@k)이나 한 번이라도 성공한 비율(Pass@k)을 측정해 성능을 평가했습니다. 하지만 IBM 리서치는 실제 환경에서 똑같은 요청을 다시 수행했을 때 매번 성공하는지가 더 중요하다고 짚었습니다. 이에 연구팀은 k번의 시도 모두 성공해야만 통과로 인정하는 엄격한 지표인 'Pass^k'를 제안했습니다.
AppWorld 벤치마크에서 GPT-4.1을 사용한 ReAct 에이전트를 테스트한 결과, 평균 성공률(Mean@5)은 77.4%로 높게 나타났습니다. 반면 5번의 시도에서 모두 성공한 비율(Pass^5)은 53.0%에 불과해 24.4%포인트에 달하는 '일관성 격차'가 확인됐습니다. 온도(temperature) 설정을 0.0으로 고정했음에도 GPU 부동소수점 연산이나 호스팅 환경의 미세한 변화로 인해 의사결정이 뒤집힌 탓입니다.
연구팀은 의사결정 단계에서 다음 토큰 확률 분포가 평평하게 퍼져 있을 때 작은 노이즈에도 선택이 쉽게 달라진다고 설명했습니다. 이를 해결하기 위해 과거 궤적을 분석해 변동성이 큰 단계를 찾아내고, 추론 시점에 해당 단계에 맞춤형 가이드라인을 주입해 안정성을 높이는 도구(ALTK-Evolve의 일관성 분석 파이프라인)를 함께 공개했습니다.
왜 중요해
금융 거래나 계약 검토 같은 핵심 업무에서는 가끔 대박을 내는 에이전트보다 매번 일정하게 동작하는 에이전트가 필수적입니다. 이번 연구는 단순히 모델 크기를 키우는 것만으로는 에이전트의 신뢰성 문제를 해결하기 어렵다는 점을 수치로 증명했습니다. 앞으로 프로덕션 레벨의 에이전트를 평가하고 배포할 때 평균 성능 대신 엄격한 일관성 지표를 도입하는 기준이 될 수 있습니다.
짚고 넘어갈 점
원문이 중간에 끊겨 있어 분석 도구로 찾아낸 취약 단계에 맞춤형 가이드라인을 적용했을 때 Pass^k 수치가 최종적으로 몇 퍼센트까지 개선되었는지는 구체적으로 확인되지 않았습니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.