인간은 AI 에이전트 명령 승인 과정에서 위협 3개 중 1개를 놓침

3 days ago 10

AI 코딩 에이전트 명령을 승인·거부하는 게임의 4만 회 이상 실행과 40만9천 건의 결정을 분석한 결과, 평균 위협 탐지 정확도는 66.3% 에 그쳐 인간 승인을 최후의 보안 경계로 삼기 어려웠음 명백한 파괴 명령의 누락률은 11.7%였지만 자격 증명 접근 같은 범위 위반은 35.0%였고, 익숙한 npm run 뒤에 숨긴 공격은 절반 이상 승인됨 모든 위협을 잡은 플레이어는 35.2%였으나 안전한 명령을 20% 이하로 차단하면서 달성한 비율은 20.8% 였으며, 세션의 32.9%는 오탐과 위협 승인으로 음수 점수를 기록함 세션 후반에는 위협 누락률이 다시 높아졌고, 안전한 npm config set registry도 59%가 차단되는 등 승인 피로와 과잉 차단이 함께 나타남 실제 환경보다 위협 비율과 시간 압박이 큰 게임이라는 한계가 있지만, 명령만으로 위험을 판단하기보다 샌드박싱과 엄격한 컨텍스트 격리를 먼저 갖춘 뒤 넓은 권한을 부여해야 함 4만 회 게임에서 드러난 승인 성능 브라우저 게임은 플레이어가 시간 압박 속에서 AI 코딩 에이전트의 명령을 승인하거나 거부하도록 구성됨 git status, npm test 같은 일상적 명령과 cat ~/.aws/credentials처럼 비밀을 외부로 보낼 수 있는 명령이 섞여 있음 통계 추가 이후 수집된 4만 회 이상의 실행과 40만9천 건의 승인·거부 결정을 분석함 평균 플레이어는 위협 3개 중 1개를 놓쳐 66.3%의 탐지 정확도를 기록함 전체 세션의 32.9% 는 승인한 위협과 차단한 안전 명령의 벌점이 올바른 판단의 점수를 넘어 음수로 끝남 플레이어의 35.2%가 모든 위협을 탐지했지만, 안전한 명령을 20% 이하로 차단하면서 모든 위협을 잡은 비율은 20.8% 에 불과함 나머지는 모든 명령을 막는 방식으로 목표를 달성해 Human Bottleneck 칭호를 받음 플레이어의 7% 는 모든 프롬프트를 승인함 실험 결과를 해석할 때의 제약 게임에서 플레이어가 본 명령 중 약 34%가 위협이었지만, 일상 업무에서 이런 위협은 현재까지 훨씬 드물게 나타남 플레이어는 인위적인 시간 압박을 받았으나, 실제 개발에서도 빠른 출시 압력이 성급한 승인 습관으로 이어질 수 있음 학술 연구가 아닌 짧은 게임이므로 결과를 실제 환경의 정확한 위험률로 해석할 수 없음 다만 위협 유형별 인식 차이와 인간 개입(human-in-the-loop) 을 보안 장치로 의존할 때의 문제를 비교...

Read Entire Article