[연구]AI 안전 정렬, 주제 전체 대신 위험한 영역만 거부하는 법
기존 LLM 안전 가드레일은 정치나 무기처럼 특정 주제 전체를 뭉뚱그려 거부해 정상적인 질문까지 차단하는 한계가 있었습니다. Multiverse Computing 연구진은 위험한 하위 의도만 정교하게 거부하고 정상 요청은 유지하는 '경계 인식 자기 증류' 연구를 공개했습니다.
전문 읽기접기
무슨 일이야
기존의 LlamaGuard-3 같은 가드 모델은 특정 주제(토픽) 단위로 유해성을 판단하도록 설계되어 있습니다. 이 방식은 실제 서비스 배포 환경에서 심각한 문제를 일으킵니다. 예를 들어 선거에 대한 객관적인 정보 제공은 허용해야 하지만, 표적 정치 조작이나 선동 요청은 거부해야 하는 식의 세밀한 구분이 불가능합니다.
연구진은 주제 전체를 차단하는 대신 해로운 하위 집합만 골라내는 '좁은 경계 안전(Narrow-boundary safety)' 문제를 다뤘습니다. 연구진은 정치적 설득 영역을 테스트베드로 삼아, 모델이 거부해야 할 요청과 정상 응답해야 할 요청을 쌍으로 묶어 경계면을 학습하도록 파이프라인을 개선했습니다.
이 과정에서 자체 생성 안전 튜닝의 커버리지 누락 문제도 해결했습니다. 단일 시도로 거부 답변을 생성하지 못해 버려지던 프롬프트 8,009개(19.88%)를 점진적 스티어링 재시도 전략으로 복구해 탈락률을 0.20%(79개)까지 낮추고, 겉보기에만 위험해 보이는 안전 프롬프트 데이터 11,955개를 함께 학습에 투입했습니다.
왜 중요해
무조건적인 안전성 강화가 정상 응답률을 망가뜨리는 트레이드오프의 민낯을 데이터로 확인했다는 점이 핵심입니다. Qwen3-8B 모델에 단순 정렬을 적용했을 때 광범위한 유해성 벤치마크 점수는 크게 개선되었지만, XSTest 기준 과잉 거부(over-refusal) 비율이 2.00%에서 74.00%까지 치솟는 함정이 확인되었습니다. 서비스 목적에 맞춰 허용과 차단의 경계를 촘촘히 튜닝해야 실서비스 배포가 가능하다는 점을 시사합니다.
짚고 넘어갈 점
과잉 거부 급증 문제를 완화하기 위해 표면상 위험해 보이는 정상 데이터를 대거 포함했으나, 모델이 경계면에서 확률을 학습하는 과정에서 발생하는 의도치 않은 거부 누출을 완전히 제어할 수 있을지는 추가적인 평가가 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.