[연구]퍼플렉시티, 실패 데이터로 컴퓨터 에이전트 성능 개선
퍼플렉시티 리서치가 실제 사용자 세션의 실패 기록을 활용한 새로운 사후 학습(post-training) 연구를 공개했습니다. 힌트 기반 자체 증류(hint-guided self-distillation)와 기각 샘플링 미세조정을 결합해 실제 환경에서 도구 호출 실패율을 20% 이상 낮췄습니다.
전문 읽기접기
무슨 일이야
퍼플렉시티가 자사 서비스인 '퍼플렉시티 컴퓨터(Perplexity Computer)' 내부 모델을 개선하기 위한 연구 결과를 발표했습니다. 이번 연구는 사용자가 실제로 실패했던 세션 데이터를 학습에 적극적으로 활용한 것이 핵심입니다.
연구진은 기각 샘플링 파인튜닝(rejection sampling fine-tuning)과 힌트 기반 자체 증류 기법을 함께 적용했습니다. 실패했던 케이스에 힌트를 주어 올바른 궤적으로 복구하고, 이를 모델이 다시 학습하게 만드는 방식입니다.
실제 환경에서 진행된 A/B 테스트 결과, 두 훈련 체크포인트 사이에서 도구 호출(tool-call) 실패율이 2.24%에서 1.77%로 감소했습니다. 퍼플렉시티 팀은 이를 통계적으로 유의미한 21.2% 수준의 오류 감소라고 보고했습니다.
왜 중요해
에이전트 모델의 신뢰성을 높이기 위해 실제 운영 환경의 실패 로그를 정제해 사후 학습에 반영하는 구체적인 파이프라인을 보여줬습니다. 특히 도구 호출 오류는 에이전트 서비스의 완료율을 직접 깎아먹는 주요 병목인데, 라이브 환경에서 유의미한 수치 개선을 입증했다는 점에서 실무적인 참고 사례가 될 수 있습니다.
짚고 넘어갈 점
연구에서 언급된 '힌트'의 구체적인 생성 방식이나 데이터 정제 비용, 그리고 전체 세션 성공률에 미친 전반적인 영향 등 상세한 기술적 디테일은 추후 공개되는 논문 전문을 더 확인해볼 필요가 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.