[연구]구글, 에이전트 훈련 환경 동적화 도구 'EnvHarness' 공개
구글 클라우드 AI 리서치 팀이 정적인 에이전트 벤치마크 환경을 훈련에 맞춰 적응형으로 바꿔주는 오픈소스 프레임워크 'EnvHarness'를 공개했습니다. 에이전트의 롤아웃 결함을 진단해 LLM 디자이너가 환경 래퍼를 자동으로 생성하는 방식입니다. 이를 통해 5개 벤치마크 전반에서 실행 단계를 줄이면서도 성능을 끌어올렸습니다.
전문 읽기접기
무슨 일이야
구글 클라우드 AI 리서치가 워싱턴 대학교 세인트루이스, UNC 채플힐과 함께 'EnvHarness'를 Apache-2.0 라이선스로 공개했습니다. 이 도구는 기존의 고정된 에이전트 벤치마크를 훈련 중인 정책에 맞춰 동적으로 적응하는 환경으로 전환해 주는 프로그래머블 레이어입니다.
EnvHarness는 표준 reset() 및 step() 인터페이스를 통해 기존 환경을 감싸는 형태로 작동합니다. 따라서 기존 태스크나 사람이 직접 만든 검증기(verifier)를 수정할 필요가 없습니다. 여기에 포함된 LLM 디자이너 'EnvRigger'가 에이전트의 자체 실행 기록(rollout)에서 발견된 결함을 진단하고, 이에 맞춘 래퍼 코드를 자동으로 작성합니다.
연구진에 따르면 5개 벤치마크에서 테스트한 결과, 발굴된 스킬을 바탕으로 미확인 태스크(held-out tasks)에서 최대 9.0점의 성능 향상을 기록했습니다. 동시에 실행 단계(execution steps)는 9.8% 줄어드는 효율을 보였습니다.
왜 중요해
AI 에이전트를 고정된 벤치마크에서 훈련할 때 생기는 한계를 벤치마크 코드 자체를 뜯어고치지 않고도 해결할 수 있게 됐습니다. 기존 검증 체계를 유지한 채 에이전트의 약점을 집중적으로 학습시키는 환경을 자동 생성할 수 있어, 에이전트 훈련 파이프라인의 효율성과 일반화 성능을 동시에 개선할 수 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.