[연구]350M 초소형 모델, GRPO 100스텝으로 정형 출력 성능 7%p 끌어올렸다
초소형 언어 모델인 LFM2.5-350M을 단 100스텝의 강화학습(GRPO)으로 미세조정한 레시피가 공개됐습니다. 무료 Colab이나 Kaggle GPU에서도 돌아갈 정도로 가벼운 학습만으로 정형 출력 벤치마크 점수가 22.6%에서 29.7%로 상승했습니다.
전문 읽기접기
무슨 일이야
Liquid AI 연구진이 TRL 라이브러리와 GRPO(Group Relative Policy Optimization)를 활용해 350M 크기의 초소형 모델 LFM2.5-350M을 파인튜닝하는 오픈소스 레시피를 공개했습니다. 학습 데이터는 약 500개의 샘플만 사용했고, 100 트레이닝 스텝만에 완료될 정도로 가볍습니다.
성능 평가는 구조화된 출력 준수 능력을 측정하는 IFStruct 벤치마크(2,000개 샘플)로 진행했습니다. 로컬 Mac 환경에서 llama.cpp로 베이스 모델을 서빙해 측정한 점수는 22.6%였으나, LoRA와 GRPO를 적용한 가벼운 튜닝 후에는 29.7%로 7.1%p 개선되었습니다.
학습에는 엔비디아의 Nemotron 정형 출력 데이터셋(nvidia/Nemotron-RL-instruction_following-structured_outputs)을 활용했습니다. LFM2.5는 어텐션과 합성곱(Convolution)이 섞인 하이브리드 아키텍처를 쓰기 때문에, LoRA 설정 시 모델 전용 모듈 이름을 타깃으로 지정해 학습을 진행했습니다.
왜 중요해
실무에서 LLM을 애플리케이션 파이프라인에 붙일 때 가장 중요한 요소 중 하나는 JSON이나 YAML 같은 스키마를 깨뜨리지 않고 반환하는 능력입니다. 이번 사례는 수백억 파라미터의 거대 모델을 쓰지 않고도, 무료 GPU 환경에서 단 몇백 개의 샘플과 짧은 강화학습만으로 소형 모델의 스키마 준수율을 유의미하게 끌어올릴 수 있음을 보여줍니다.
짚고 넘어갈 점
성능이 29.7%로 올랐지만 절대적인 기준에서는 여전히 10번 중 7번꼴로 포맷 검증에 실패하는 수준입니다. 실 서비스 환경에서 단독으로 쓰기에는 아직 한계가 있으며, 더 높은 신뢰도를 얻기 위한 추가 학습이나 제약 생성(constrained decoding) 기법과의 병행 검토가 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.