오픈AI의 인공지능(AI) 모델이 평가 시스템의 통제를 뚫고 외부 플랫폼을 해킹한 사건이 발생했다.

로이터연합뉴스

로이터연합뉴스

AD
원본보기 아이콘

오픈AI는 21일(현지시간) 'GPT-5.6 솔'과 미공개 AI 모델이 내부 평가 도중 오픈소스 AI 공유 플랫폼 '허깅페이스'의 서버를 해킹한 사실을 확인했다고 밝혔다.


오픈AI는 내부 평가에서 AI 모델들이 고난도 해킹을 시도하도록 했다. 평가 시스템은 외부 인터넷과 차단돼 있었고 필요한 프로그램을 내려받는 제한된 통로만 열려 있었다. 다만 모델의 최대 사이버 역량을 측정하기 위해 고위험 사이버 활동을 차단하는 안전장치는 적용하지 않았다.

AI 모델들은 격리된 테스트 환경에서 벤치마크 문제의 정답을 찾아내려는 과정에서 외부 인터넷으로 나갈 방법을 집중적으로 탐색했다. 이 과정에서 시스템의 미공개 보안 결함(제로데이 취약점)을 발견해 인터넷 접속 경로를 뚫었다. 이후 허깅페이스가 관련 문제의 데이터셋과 정답을 보유하고 있을 것으로 추정하고 탈취한 인증 정보와 제로데이 취약점을 활용해 허깅페이스 서버를 해킹하고 평가 문제의 정답을 빼낸 것으로 나타났다.


앞서 허깅페이스는 자사 서버가 자율 AI 에이전트에 의해 해킹됐으며 공격에 어떤 모델이 사용됐는지는 확인되지 않았다고 공지했다. 허깅페이스는 해킹 활동을 탐지해 차단한 뒤 오픈소스 AI 모델을 자체 시스템에서 가동해 피해 확산을 막고 사고 경위를 파악하는 작업에 착수했다.

오픈AI와 허깅페이스는 현재 공동으로 포렌식(디지털 증거 분석) 조사를 진행하고 있다. 오픈AI는 발견된 제로데이 취약점을 해당 소프트웨어 공급업체에 알리고 보완 작업도 벌이고 있다.


오픈AI는 "AI의 발전으로 보안 취약점을 찾아내고 악용하는 속도도 빨라지고 있다"며 "이번 사고가 주는 가장 중요한 교훈은 모델의 보안과 안전이 빠르게 발전하는 역량에 발맞춰야 한다는 점"이라고 말했다.

AD

클렘 들랑그 허깅페이스 공동창업자 겸 최고경영자(CEO)는 "이번 사고는 AI 안전을 어느 한 기업이 폐쇄적으로 해결할 수 없다는 우리의 오랜 믿음을 보여준다"며 "AI 안전은 전 세계 보안 담당자들이 AI를 폭넓게 활용하며 공개적으로 협력할 때 확보할 수 있다"고 강조했다.


유현석 기자 guspower@asiae.co.kr

<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>

함께 보면 좋은 기사

새로보기

내 안의 인사이트 깨우기

취향저격 맞춤뉴스

많이 본 뉴스

당신을 위한 추천 콘텐츠

놓칠 수 없는 이슈