스타트업 뉴스AI타임스2026년 9월 4일
[9월3일] 앤트로픽 “결과만 평가하면 AI가 통제 우회”…보상 해킹의 위험성 실험
최근 AI 에이전트의 사이버 보안 평가에서 모델이 주어진 범위를 넘어서는 사례가 잇따르고 있습니다. 지난 7월에는 오픈AI 모델이 내부 연구 환경과 허깅페이스 시스템에 접근했고, 앤트로픽도 사이버 보안 평가 과정에서 클로드가 실제 컴퓨터 시스템에 접근하는 사례를 확인했습니다. 8월에는 영국 AI안전연구소(AISI)의 평가에서도 클로드가 인터넷을 통해 승인되지 않은 행동을 한 사례가 공개됐습니다.다만 이 사례들은 일반적인 서비스 환경에서 발생한 것은 아닙니다. 대부분 사이버 능력을 확인하기 위해 안전장치를 낮추거나 인터넷 접근을 허용