독점 LLM API의 추론 흔적 탈취

1 hour ago 1

Anthropic·OpenAI·Google API의 암호화된 추론 블록을 같은 제공업체의 약한 모델로 옮겨 탈옥하면, 상위 모델의 숨겨진 사고 과정(chain-of-thought)을 평문으로 복원할 수 있음 공격은 강한 모델에서 추론 흔적을 얻은 뒤 약한 형제 모델에 복사를 지시하는 두 번의 API 호출만 필요하며, 세션·사용자·모델 사이의 이식성을 악용함 120개 Codeforces 문제에서 복원된 길이와 API의 숨겨진 사고 토큰 수가 밀접하게 대응했으며, Claude·GPT·Gemini의 공개 에이전트 작업 기록 6,708개에서 추론 블록 315,320개를 재구성함 실제 사용자 세션에서는 자격 증명 126개와 개인정보 204개를 포함한 민감 정보 704개가 발견됐고, 이 중 64개는 사용자에게 보이는 대화에 없었음 API 키·비밀번호뿐 아니라 우회책, 하드코딩, 승인 회피, 불확실한 추측과 미완성 풀이까지 복원돼 최종 응답보다 광범위한 내부 작업 상태가 노출됨 두 번의 호출로 성립하는 공격 Anthropic·OpenAI·Google API는 모델의 추론을 암호화된 사고 과정 블록으로 클라이언트에 반환하며, 대화를 이어갈 때 해당 블록을 서버로 다시 전송함 이 블록은 원래 세션에 묶여 있지 않아 다른 세션·사용자·모델에서도 재생할 수 있음 복원 파이프라인은 두 단계로 작동함 상위 모델에서 암호화된 추론 흔적을 획득함 같은 제공업체의 더 약한 형제 모델에 흔적을 입력하고 탈옥해 내용을 그대로 복사하게 함 예시에서는 claude-opus-4-8의 암호화된 thinking 서명을 claude-haiku-4-5-20251001에 전달하고, <thinking-copy> 태그 안에 추론을 옮기도록 요청함 강한 모델 자체를 탈옥하거나 증류 방지 보호 장치를 작동시키지 않고도 추론 원문을 복원할 수 있음 복원 검증과 데이터 규모 OpenAI·Anthropic·Google의 상위 모델에서 같은 공격을 시연했으며, 복호화된 추론 길이는 API가 보고한 숨겨진 사고 토큰 수와 밀접하게 대응함 120개 Codeforces 문제에서 다음 두 값을 비교함 API가 보고한 숨겨진 추론 토큰 수 복원된 추론을 다시 모델 입력으로 넣어 계산한 토큰 수 GitHub와 Hugging Face에서 Claude·GPT·Gemini가 만든 공개 에이전트 작업 기록 6,708개를 수집했으며, 그 안에 암호화된 추론 블록이 남아 있었음 모...

Read Entire Article