"니가 왜 끼고 난리야"…미제 살인사건에 목격자 행세한 AI
앤스로픽 AI 자동 테스트 중 허위 제보
스팸 차단으로 실제 수사 영향 없어
앤스로픽의 인공지능(AI) 모델이 미제 살인사건과 관련해 허위 제보를 생성하고 이를 결찰에 제출한 사실이 뒤늦게 알려졌다.
9일(현지시간) AFP 통신 등 주요 외신에 따르면 필라델피아 경찰청은 관할지 장기 미제 살인사건 관련 제보를 수집하는 웹사이트 '필리 언솔브드 머더스'에 앤스로픽의 AI 모델이 생성한 허위 제보가 접수됐다고 밝혔다.
해당 AI는 자신이 어떤 사건에 관해 정보를 가진 사람인 것처럼 가장했다. 경찰 발표 성명에 따르면 앤스로픽의 AI는 "이 사건과 관련한 정보를 가지고 있을 수 있다"며 "당시 인근에서 인상착의와 일치하는 사람을 본 기억이 있다. 이 정보가 관련이 있다면 연락해 달라"는 제보를 남겼다. 하지만 이 제보는 스팸으로 분류돼 실제 수사 부서에는 전달되지 않았다.
문제는 허위 제보 사건이 7월 18일에 발생했는데도 앤스로픽은 약 두 달이 지난 9월 28일에야 이를 발견하고 해당 모델의 자동 테스트 프로세스를 중단한 점이다. 이어 이달 7일에야 앤스로픽은 필라델피아 경찰청에 이 사실을 통보했고, 당사 모델의 의도치 않은 작동 사례를 설명하는 보고서를 발표할 계획이라고 알렸다.
경찰은 "사건을 감지하고 시에 보고하기까지 2달이 지연된 것은 용납할 수 없다"며 "미제 사건은 피해자와 유가족, 그리고 답을 찾으려 노력하는 수사관들과 직결된 문제"라고 지적했다. 경찰은 자체 보호장치가 피해를 예방했지만, "AI 시스템이 마치 살인사건을 알고 있는 사람인 것처럼 조작된 정보를 제출한 행위의 엄중함을 줄여주지는 않는다"라고 강조했다. 다행히 경찰 시스템에 관한 무단 접근이나 데이터 유출 정황은 발견되지 않았다.
최근 AI 기술 경쟁의 여파로 AI 모델들이 인간의 의도와 통제를 벗어나 돌발 행동을 하는 사례가 증가하고 있다. 앞서 7월 오픈AI의 '불량 에이전트'들이 격리 환경을 임의로 이탈해 외부 기관인 허깅 페이스를 무단 해킹한 사건이 발생한 데 이어 지난달에는 오픈AI의 AI 에이전트가 호주 보건 데이터 포털을 해킹한 것으로 밝혀졌다.
꼭 봐야 할 주요 뉴스
[단독]"네 번이나 경고했잖아"…LH 행복주택 욕실...
5월에는 복수의 AI 에이전트가 독일어 위키 사이트 'DseWiki'를 점령해 자신들의 비밀 정보공유 게시판으로 쓴 사실이 뒤늦게 드러났다.
<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>