“가상훈련인 줄” 클로드, 실제 인터넷까지 공격…앤트로픽 “AI 판단 오류”
[블록미디어 양원모 기자] 인공지능(AI) 개발사 앤트로픽(Anthropic, 앤스로픽)의 AI 모델 클로드(Claude)가 사이버 보안 평가 과정에서 실제 인터넷에 접속해 외부 시스템을 공격한 것으로 나타났다. 앤트로픽은 평가 환경의 설정 오류뿐 아니라 모델의 ‘편향 추론(biased reasoning)’과 ‘무모함(recklessness)’이 사고를 키웠다고 분석했다. 앤트로픽은 9일(현지시각) 공식 홈페이지에 ‘최근 사이버보안 사고에 대한 정렬 평가’ 보고서를 공개하고, 4억8000만건의 트랜스크립트를 자체 분석한 결과 실제