[연구]AI 에이전트 메모리, 무조건 많이 넣는다고 능사 아니다
IBM 리서치가 8개 모델을 대상으로 에이전트 메모리 주입 방식을 실험한 결과, 모델 체급에 따라 최적의 '메모리 투여량'이 완전히 다르다는 점을 확인했습니다. 대형 모델은 전체 가이드라인을 다 넣었을 때 성능이 올랐지만, 중소형 모델은 핵심 요약본과 작업별 검색(Retrieval) 방식을 썼을 때 더 높은 정확도와 비용 절감 효과를 보였습니다.
전문 읽기접기
무슨 일이야
IBM 리서치는 자체 프레임워크인 ALTK-Evolve를 사용해 과거 실행 궤적에서 성공과 실패 경험을 추출하고, 이를 추론 시점에 모델 컨텍스트로 다시 주입하는 '에이전트 메모리' 실험 결과를 공개했습니다. 모델 가중치를 직접 수정하거나 사람이 라벨링하지 않고, 에이전트가 스스로 정제한 행동 지침을 프롬프트에 넣어 성능 변화를 측정한 연구입니다. 30B 밀집(Dense) 모델부터 대형 상용 시스템까지 총 8개 모델을 9개 시뮬레이션 앱 환경인 AppWorld 벤치마크(585개 다단계 작업)에서 평가했습니다.
실험 결과 모델의 반응은 세 가지 패턴으로 나뉘었습니다. 여유 성능이 있는 대형 모델인 DeepSeek-V3.2(671B MoE)는 예외 케이스까지 포함된 전체 가이드라인을 모두 주입했을 때 작업 완료율(TGC)이 9.5%p 올랐습니다. 반면 gpt-oss-120b(117B MoE) 같은 중소형 모델은 전체 지침을 넣으면 성능이 떨어졌고, 핵심 지침과 작업 연관 지침만 선별해 주입하는 '큐레이션 검색' 방식을 썼을 때 작업 완료율이 16.1%p 상승하면서 토큰 사용량은 5% 증가에 그쳤습니다. 한편 GLM-5(745B MoE)처럼 이미 성능이 포화(Saturated)된 모델은 어떤 메모리 주입 방식에서도 유의미한 성능 향상을 보이지 않았습니다.
왜 중요해
에이전트에 무작정 긴 프롬프트와 과거 기록을 쏟아붓는 방식이 최선이 아니라는 점이 수치로 확인됐습니다. 작은 모델일수록 정보 과부하로 인해 오히려 지침을 제대로 따르지 못하기 때문에, 선별적인 검색(Retrieval) 기반 메모리 설계가 비용과 정확도 양면에서 훨씬 효과적입니다. 에이전트 서비스를 구축하는 개발자 입장에서는 사용하는 모델의 체급과 포화도에 맞춰 메모리 주입 방식을 조율(Calibration)해야 토큰 낭비를 줄이고 성공률을 극대화할 수 있습니다.
짚고 넘어갈 점
특정 모델이 왜 특정 패턴을 보이는지(단순 파라미터 크기, 컨텍스트 윈도 크기, 아키텍처, 벤치마크 내 한계치 중 무엇이 핵심 원인인지)는 아직 명확히 분리해 규명하지 못한 상태입니다. GLM-5 같은 포화 패턴 모델의 경우, 작업 자체가 모델 역량 한계에 도달한 것인지 혹은 정제된 가이드라인이 모델의 실패 요인을 제대로 짚지 못한 것인지는 추가 연구가 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.