[연구]사카나 AI, 역전파 대체하는 새 학습법 공개
사카나 AI 연구진이 역전파(Backpropagation)를 대체할 수 있는 새로운 레이어 로컬 학습 알고리즘 'PC-ALM'을 발표했습니다. 각 레이어 제약 조건에 라그랑주 승수를 도입해, 선형 네트워크에서 기존 역전파와 동일한 그래디언트를 복원하며 1000개 레이어 네트워크 학습까지 성공했습니다.
전문 읽기접기
무슨 일이야
사카나 AI의 연구원 제프리 실리(Jeffrey Seely)와 줄리안 굴드(Julian Gould)가 '증강 라그랑주 예측 코딩(PC-ALM)'을 선보였습니다. PC-ALM은 기존 예측 코딩의 장점인 레이어 로컬 업데이트 방식을 유지하면서도, 각 레이어 제약 조건에 라그랑주 승수를 결합해 선형 네트워크 환경에서 역전파와 똑같은 그래디언트를 도출해냅니다.
실험 결과에 따르면, 추론 비용 T = 2L 기준에서 너비와 깊이가 8에서 128에 이르는 네트워크 전반에 걸쳐 역전파와 대등한 성능을 보였습니다. 기준 셀(reference cell)에서 역전파와의 그래디언트 코사인 유사도를 기존 0.604에서 0.909까지 크게 끌어올렸습니다.
또한 MNIST 데이터셋을 활용한 1000개 레이어의 잔차 MLP(residual MLP) 학습 실험에서도 기존 역전파와의 성능 격차를 약 2포인트 이내로 좁히며 안정적인 학습 능력을 입증했습니다.
왜 중요해
역전파 알고리즘은 현대 딥러닝의 표준이지만, 전체 네트워크를 거쳐 오차를 역방향으로 전달해야 해 메모리와 하드웨어 구조 면에서 병목이 존재했습니다. 로컬 학습 방식이면서도 대규모 레이어를 역전파 수준으로 안정적으로 학습할 수 있다는 가능성을 보여준 만큼, 향후 하드웨어 친화적인 새로운 학습 프레임워크 연구로 이어질 수 있습니다.
짚고 넘어갈 점
현재 공개된 대규모 레이어 테스트는 비교적 단순한 데이터셋인 MNIST의 잔차 MLP 구조에서 검증된 수준입니다. 대규모 LLM이나 복잡한 비전 모델 같은 최신 실무 아키텍처에서도 역전파를 완전히 대체할 수 있을지는 추가적인 검증이 필요해 보입니다. 관련 JAX 코드는 MIT 라이선스로 공개되어 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.