[연구]상용 LLM API의 암호화된 추론 과정(CoT) 탈취 기법 공개
주요 AI 기업들이 API에서 제공하는 암호화된 추론 블록(CoT)을 이용해 숨겨진 생각 과정을 평문으로 복원하는 연구가 공개됐습니다. 경량 모델에 암호화된 추론 블록을 재입력해 탈옥을 유도하는 방식을 사용했습니다. 현재 관련 기업들은 해당 취약점에 대한 조치를 완료했습니다.
전문 읽기접기
무슨 일이야
Anthropic, OpenAI, Google 등 주요 AI 기업들은 API 요청 시 모델의 추론(Chain-of-Thought) 과정을 암호화된 블록 형태로 반환하는 기능을 제공해 왔습니다. 연구진은 동일한 모델 패밀리 내에서 가장 성능이 낮은 모델이 암호화 해독에 필요한 동일한 키를 공유한다는 점을 발견했습니다.
연구진은 상위 모델이 생성한 암호화된 추론 블록을 하위 모델에 다시 입력하는 방식을 사용했습니다. 이를 통해 하위 모델을 탈옥시켜 암호화되어 있던 상위 모델의 원문 추론 과정을 평문으로 출력하게 만드는 데 성공했습니다. 복원된 추론 과정에는 사람이 읽도록 설계되지 않은 모델 내부의 날것 그대로의 생각 흐름이 담겨 있었습니다.
또한 연구진은 추론 블록을 활용한 프롬프트 주입 공격 가능성도 확인했습니다. 모델의 추론 과정에 데이터 유출 지시를 포함시킨 뒤 이를 다른 모델에 입력하면, 모델이 자신의 추론 내용을 신뢰하여 해당 지시를 따를 확률이 높아지는 현상이 나타났습니다.
왜 중요해
그동안 비밀로 유지되던 독자적 모델들의 내부 추론 방식과 데이터 형태가 외부에 노출될 수 있음을 보여준 연구입니다. 개발자와 기업 입장에서는 API를 통해 주고받는 암호화 데이터나 상태 값이 예상치 못한 보안 허점이 될 수 있음을 시사합니다.
짚고 넘어갈 점
연구진이 관련 기업들에 제보한 이후 모든 AI 제공업체는 취약점 수신을 확인했으며, 현재는 동일한 공격이 작동하지 않도록 보안 조치가 완료된 상태입니다.
참고: Simon Willison
댓글 0
첫 댓글을 남겨보세요.