고양이에 코끼리 피부 입혀 시각 AI 평가하는 표준 방식 허점 찾아
유재준 교수팀, 표준 AI 시각 인식평가 문제 개선 새 벤치마크 제시
국내 연구진이 글로벌 학계에서 쓰이던 인공지능(AI) 시각 평가 기준의 치명적 오류를 찾아냈다.
7년 넘게 AI 인지 능력을 평가해 온 표준 시험지가 사실상 제 기능을 못 하고 있던 것으로 드러났다.
국내 연구진이 AI의 사물 인식 방식을 측정하던 세계 표준 평가법의 허점을 찾아내고 새 기준을 제시했다.
UNIST 인공지능대학원 유재준 교수팀은 기존 AI 평가 지표인 '큐 컨플릭트'의 문제점을 밝히고, 새 벤치마크 '리파인드 바이어스'를 개발했다고 1일 전했다.
연구 논문은 국제 학회 '유럽 컴퓨터 비전 학회(ECCV 2026)'에서 상위 1.3% 수준인 스포트라이트에 선정됐다.
학계는 2019년부터 고양이 형상에 코끼리 피부 질감을 섞은 합성 이미지로 AI를 테스트했다. 그간 AI가 인간과 달리 질감에 의존한다는 결과가 나왔고, 이를 바로잡아야 한다는 연구가 주를 이뤘다.
하지만 연구팀 조사 결과 기존 시험지 자체가 잘못됐다. 기존 지표는 형상과 질감 정답의 단순 비율만 계산했다. AI가 질감을 못 알아봐서 상대적으로 형상 비율이 올라간 경우를 구별하지 못했다. 이미지는 형상과 질감이 깔끔히 분리되지 않았고, 객관식 선택지 범위도 제한적이어서 채점 착시를 일으켰다.
연구팀은 평가 방식을 '비율'에서 각각의 정확도를 측정하는 '점수'로 바꿨다. 형상과 질감이 뚜렷한 사물 이미지 6000장을 새로 구축하고 정답 선택지 제약도 없앴다.
새 기준으로 재시험한 결과, 성능이 뛰어난 최신 AI일수록 형상과 질감 정보를 모두 적극 활용했다. AI가 단순히 한쪽에 치우친 것이 아니라 두 정보를 쓰는 총량이 성능을 결정했다. 최신 트랜스포머 모델이나 멀티모달 AI가 실제 모양을 훨씬 잘 알아보는 사실도 확인됐다.
유재준 교수는 "벤치마크는 AI의 성능을 평가하고 개발 방향까지 제시하는 만큼, 제대로 된 평가 기준을 마련하는 것이 중요하다. 이번 벤치마크가 AI의 형상과 질감 인식 능력을 정확히 진단해 모델 구조와 학습 방법을 개선하는 데 도움이 될 것으로 기대한다"고 말했다.
꼭 봐야 할 주요 뉴스
"진짜 승자는 '열' 잡는 자"…LG전자의 1500억 승...
이번 연구는 UNIST 인공지능대학원 김범준·이승아 연구원이 공동 제1저자로 참여했으며, 과학기술정보통신부 재원으로 한국연구재단, 정보통신기획평가원, 울산과학기술원과 InnoCORE 사업의 지원을 받아 수행됐다.
<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>