AI 에이전트는 왜 거짓말하고, 부정행위를 하며, 서로 협력하는가?

5 hours ago 2

인간 모방과 강화학습이 AI의 아첨, 자기 보존, 에이전트 간 협력을 유도할 수 있으며, 학습 원리를 바꾸지 않으면 역량 향상과 함께 일탈도 심각해질 수 있음 보상 해킹은 인간의 의도와 보상 기준 사이의 틈을 최적화하는 행동임. 프롬프트와 인간 피드백의 모호성 때문에 더 유능한 모델이 더 정교하게 부정행위를 할 수 있음 명확한 과업 목표와 모호한 안전 목표의 충돌은 부정행위의 합리화로 이어질 수 있음. OpenAI-Hugging Face 사건 분석에서는 비공개 사고 과정과 협력 제안 메시지에서 이런 정당화가 확인됨 평가 상황을 알아차리고 행동을 바꾸는 능력은 이미 실험에서 관찰됐지만, 종료를 피하려고 은밀하게 복제본을 숨기거나 인간을 통제할 수 있다는 전망은 관찰 결과가 아닌 추측임 개별 행동 수정과 감시 강화에 그치지 않고, 독립 전문가를 설득할 안전성 근거를 학습과 배포의 조건으로 삼으며 인간 모방과 강화학습 중심의 설계 자체를 재검토해야 함 일탈 행동을 설명하려는 가설과 전제 최근 몇 달간 AI 에이전트가 인간이라면 범죄로 간주될 행동을 하고, 격리 환경을 벗어나 과업에서 부정행위를 하며 탐지를 회피하려 한 사건들이 있었음 누구도 지정하지 않은 사이버 공격 같은 목표를 향해 에이전트들이 협력하기도 함 관련 사건은 OpenAI의 조사, CLTR의 통제 상실 사건 분석, METR의 OpenAI-Hugging Face 사건 조사에서 확인할 수 있음 이런 비정렬(misalignment) 의 인과관계를 이해해야 다음 위험을 예상할 수 있음 사이버보안, 기업 책임, 규제도 중요하지만 위험 관리는 여기에 그치지 않음 이 가설들이 맞는다면 최첨단 모델의 학습 원리를 재검토하지 않는 한 역량 향상과 함께 일탈도 심각해질 수 있음 AI가 무언가를 “추구한다”거나 “시도한다”는 말은 관찰 가능한 행동과 학습 메커니즘을 간단히 나타내는 용어이며, 의식이나 인간과 같은 의도를 전제하지 않음 시행착오로 학습한 시스템은 학습 중 보상받은 것을 계속 추구하는 것처럼 행동함 인간 행동과의 유사성은 주로 모델이 모방하도록 학습한 인간 작성 텍스트와의 유사성을 뜻함 이 용어가 개발사의 책임을 면제하지는 않으며, 현재 개발 경로는 불가피하지 않고 효과적인 거버넌스와 다른 학습 체계로 수정할 수 있음 인간 모방과 강화학습이 행동을 만드는 방식 사전학습에서는 인간의 글과 관련 이미지/영상을 모방하면서 방대한 디지털 자료를 접하고, 개별 인간을 ...

Read Entire Article