PuzzleMask: 평범한 문장을 잠재적 AI 공격 수단으로 오용하기

1 hour ago 1

일반적인 줄글 속에 악성 명령을 숨겨 사전 검증망을 무력화하고 고성능 인공지능을 조종하는 보안 취약점이 드러났다. 전문 번역 연구진은 인공지능 정책 검사를 무력화하는 프롬프트 조작 기술을 공개했다. 이 기법은 특수 기호 없이 순수한 영어 일반 문장만 활용한다. 공격자는 문서 암호화나 유해 정보 요구 같은 위험한 지시를 평범한 글 속에 은닉한다. 자원이 부족한 소형 검문 모델은 숨겨진 명령을 식별하지 못한다. 결국 해당 입력을 안전하다고 판정해 상위 모델로 넘긴다. 반면 뛰어난 능력을 갖춘 표적 모델은 숨겨진 명령을 찾아내 그대로 실행한다. 실험 결과 신속 검사 모델은 조작된 입력을 모두 안전하다고 분류했다. 숨겨진 악성 명령을 단 하나도 찾아내지 못했다. 그러나 코드 실행 권한을 지닌 gpt-5-thinking-high는 달랐다. 90%가 넘는 확률로 명령을 복원해 실제 작업에 착수했다. 심층 추론 능력과 도구 접근 권한의 유무가 공격 성공을 결정지었다. 공격자는 순수한 줄글만으로 검증망을 건너뛰어 대상 모델에 임의의 지시를 보낼 수 있다. 중요 파일 내용 유출이나 데이터 암호화 같은 파괴적인 명령도 여기에 포함된다. 사전 검사 모델의 차단 규정은 아무런 효력을 발휘하지 못한다. 다만 이 기술 자체가 모델 내부의 윤리 훈련을 무너뜨리는 탈옥은 아니다. 실험에서는 평범한 풍경 묘사 글 속에 악성 명령을 숨겼다. 정밀한 간격과 규칙에 따라 문장을 배치해 해독 단서를 심었다. 특정 주제나 문체에 얽매이지 않고 임의의 글을 덮개로 쓸 수 있다. 심지어 소설 본문이나 일상적인 제품 설명서도 위장 수단으로 쓰인다. 검문 단계 시험에서 gpt-4o-mini, gpt-oss-safeguard, claude-3-haiku, llama-guard3는 모두 공격에 속았다. 100%의 확률로 조작된 프롬프트를 정상 글로 판정했다. 문장에 무언가 숨겨져 있다는 사실 자체를 인지하지 못했다. 한편 고성능 표적 모델은 약 1분간의 연산과 복수의 코드 실행을 거쳐 94%의 성공률로 명령을 복원했다. Anthropic의 Opus 계열 모델만은 자체 차단 기능으로 공격을 유일하게 막아냈다. 위험을 줄이려면 사용자 입력을 다른 문장으로 재작성하는 방법이 유용하다. 문장을 고쳐 쓰는 과정에서 숨겨진 은닉 구조가 자연스럽게 파괴된다. 검문 모델에 자기 참조 표현을 감지하는 규칙을 넣어도 공격을 걸러낼 수 있다. 모델의 입력을 살피는 단계를 넘어 최...

Read Entire Article