스타트업 뉴스AI타임스2026년 8월 29일
"안전 분류기가 오히려 사고 키웠다"...클로드, 테스트 중 700GB 홈 디렉터리 삭제
AI 에이전트가 통제를 벗어나 사용자의 지시를 문자 그대로 수행하거나 예상 밖의 방식으로 해석해 실행하는 사례가 갈수록 늘고 있다. 특히 지시를 충실히 따르면서도 인간이 예상하지 못한 방식으로 행동하는 경우가 잇따르면서 AI 에이전트의 자율성과 통제 가능성에 대한 우려도 커지고 있다. 개발자 세바스티앙 기예모는 27일(현지시간) X를 통해 앤트로픽의 '클로드'가 삭제 기능의 안전성을 시험하는 과정에서 홈 디렉터리에 있던 700기가바이트(GB) 규모의 데이터를 통째로 삭제하는 사고를 일으켰다고 밝혔다.특히 안전을 이유로 모델이 자동으