[연구]디코더 상태를 유지하는 순환 트랜스포머 RLT 제안
프린스턴 대학교 연구진이 프롬프트와 응답 전반에 걸쳐 디코더 상태를 계속 이어가는 순환 루프 트랜스포머(RLT) 아키텍처를 제안했습니다. 토큰마다 96개의 논리 블록을 실행하면서 시간적 깊이를 무제한으로 확장하는 구조입니다. 하드웨어 인식 실행 및 강화학습(RL) 리플레이 설계도 함께 기술 보고서에 포함되었습니다.
전문 읽기접기
무슨 일이야
프린스턴 대학교의 Yifan Zhang이 '순환 루프 트랜스포머(Recurrent Looped Transformer, RLT)'에 관한 기술 보고서를 발표했습니다. 이 아키텍처는 인과적(causal) 인코더와 순환(recurrent) 디코더를 결합한 형태입니다.
가장 큰 특징은 서빙 경계에서 상태를 리셋하지 않는다는 점입니다. 디코더의 최종 은닉 상태와 레이어별 슬라이딩 윈도우 어텐션 캐시를 프롬프트와 생성 응답의 모든 토큰에 걸쳐 그대로 전달합니다.
참조 구조로는 인코더 48개 레이어와 디코더 48개 레이어를 묶은 설정이 제시되었습니다. 이 구성에서는 토큰당 96개의 논리 블록을 실행하며, t개의 토큰을 거치면 디코더 블록의 상태 경로는 48t개로 늘어납니다. 또한 순환 코어를 중심으로 한 하드웨어 인식 실행 방식과 정확한 현행 정책 기반의 RL 리플레이 규약도 설계에 포함되었습니다.
왜 중요해
기존 트랜스포머는 긴 문맥을 처리할 때 연산량과 메모리 부담이 크게 늘어나는 문제가 있습니다. RLT는 토큰당 고정된 블록을 연산하면서도 상태를 지속적으로 누적하는 순환 방식을 채택해 무제한의 시간적 깊이를 확보하려는 시도입니다. 특히 서빙 단계에서 상태를 초기화하지 않고 이어가는 구조라 장기 기억을 다루는 LLM 서빙 효율화에 새로운 방향을 제시할 수 있습니다.
짚고 넘어갈 점
아직 기술 보고서 형태의 제안 단계이며, 실제 코드나 가중치는 공개되지 않았습니다. 실측된 벤치마크 결과 역시 포함되어 있지 않아, 제안된 구조가 기존 트랜스포머 대비 실제 환경에서 어느 정도의 성능과 효율을 낼지는 향후 검증을 지켜봐야 합니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.