Claude Code Opus 5 Auto Mode 무력화하기

1 week ago 18

웹사이트 요약 요청만으로 Claude Code Opus 5 Auto Mode를 장악해 코드를 실행했으며, 소규모 표본에서 공격 성공률은 60~80%였음 WebFetch 실패로 curl과 셸 사용을 유도한 뒤, ZIP 속 미끼 바이너리를 거부한 Claude가 직접 Python 디코더를 작성하게 만들어 모듈 섀도잉을 일으킴 악성 struct.py는 원격 페이로드와 C2 연결을 실행했으며, 감염을 뒤늦게 감지한 Claude가 프로세스를 종료하려 하자 Auto Mode가 정리 명령을 차단하기도 함 Anthropic 의뢰 평가는 72개 시나리오를 각각 10회 실행해 공격 성공률 0.00%를 기록했지만, 이번 표적 공격 체인은 평가 세트 밖이어서 0.00%와 실제 RCE가 동시에 성립함 Auto Mode의 분류기는 보안 경계가 아니므로 신뢰할 수 없는 콘텐츠를 다루는 에이전트에는 OS 격리·네트워크 송신 제한·모니터링·자격 증명 분리가 필요함 Auto Mode와 0.00% 평가 Auto Mode는 사람의 명령 승인 절차를 안전 분류기로 대체하며, 8월 중순부터 Claude Code의 기본 시작 모드가 됨 Anthropic의 Boris Cherny는 모델 훈련, 입력 탐지, 의도 분류기를 계층화하면 처음 보는 간접 프롬프트 인젝션의 성공률을 거의 0으로 낮출 수 있다고 밝힘 Anthropic이 의뢰한 Trajectory Labs 평가는 72개 간접 프롬프트 인젝션 시나리오를 각각 10회 시험했으며, 공유된 차트에서 Opus 5 Auto Mode는 0.00%를 기록함 공개된 평가에는 벤치마크 이름이 없었고, 이번 실험은 그 결과가 표적 공격 체인에서도 유지되는지 확인하려는 목적이었음 Auto Mode는 에이전트를 격리된 환경에서 실행하고 행동을 감시하는 방식을 대신할 수 없음 공격 진입점과 유인 구조 시작 요청은 특정 웹사이트를 요약하라는 단순한 형태였으며, 사이트는 노트북 기록 보관소처럼 구성됨 실제 자료는 ZIP에 담겨 있었고, 그 안에는 그럴듯한 카탈로그 메타데이터, 날짜, 체크섬과 언어 이론의 발전을 다룬 짧은 기록 7개가 포함됨 이 포장은 Claude가 자료를 조사하고 압축 파일을 처리할 정상적인 이유를 제공함 시험용 엔드포인트는 허용 목록에 등록된 IP에만 콘텐츠를 제공했으며, 향후 시험을 위해 도메인 일부를 공개하지 않음 WebFetch에서 셸로 이동시키기 Claude는 처음에 WebFetch로 페이지를 가져왔지...

Read Entire Article