안전장치 우회·샌드박스 탈출 등
일부는 안전성 시험서 발생

26일(현지시간) 미국 인터넷 매체 악시오스에 따르면 오픈AI와 앤트로픽 등 인공지능(AI) 기업들이 최근 수개월간 벌어진 수만 건의 보안 사고를 조사하고 있다. 내부 시험과 실제 환경에서 드러난 사고가 대상이다.


사례에는 AI 모델이 안전장치를 우회하거나 격리된 시험 환경에서 탈출하려 한 것 등이다. AI 모델이 스스로 추가 지시를 만들거나 감시 시스템을 우회하려 한 경우도 마찬가지다.

AI 기업들이 대대적인 보안 사고 조사에 나선 이유는 실제 피해 사례들이 보고되기 때문이다. 대표적 사례가 지난 7월 오픈AI의 모델이 샌드박스를 임의로 벗어나 외부 기업인 허깅페이스의 시스템을 공격한 사건이다. 수백 개의 에이전트는 한 메시지 게시판에서 작업을 조율하며 사이버보안 테스트 성능을 높이기 위해 외부 시스템을 해킹했다.

연합뉴스

연합뉴스

AD
원본보기 아이콘

오픈AI는 여러 보안 사고가 터지자 가장 성능이 뛰어난 모델 훈련을 일시 중단한다고 발표했다. 오픈AI의 대변인은 악시오스를 통해 추가적인 안전장치와 정렬 개선 조치가 마련됐다고 확신할 때만 훈련을 재개할 것이라고 밝혔다.


앤트로픽 역시 외부 안전 기관과 함께 자사 모델의 비정상적 행동을 조사하고 있다. 앤트로픽 최신 모델 평가에서는 테스트 과정에서 샌드박스에서 탈출하려는 행동이 관찰됐다. 해당 테스트 자체가 샌드박스 탈출 없이는 과제를 해결할 수 없도록 설계된 적대적 실험이었다고 회사는 설명했다.

AD

AI 전문가들은 AI 기업들이 모든 AI 모델의 문제 행동을 사전에 예측하고 차단하는 건 어려운 일이라고 보고 있다. 예를 들어 AI 모델들이 점점 복잡하고 자율적으로 작업을 수행하고 있어 모델이 통제 불능 상태에 빠지는 모든 가능성을 예측하기가 쉽지 않다는 것이다.


오규민 기자 moh011@asiae.co.kr

<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>

함께 보면 좋은 기사

새로보기

내 안의 인사이트 깨우기

취향저격 맞춤뉴스

많이 본 뉴스

당신을 위한 추천 콘텐츠

놓칠 수 없는 이슈