"말은 사람보다 자연스러운데…" AI, 사진 속 변화 이해는 인간에 못 미쳤다[과학을읽다]
GIST, 4996개 이미지로 AI '변화 이해력' 평가…GPT-5.2 5.72점·인간 7.45점
인공지능(AI)은 사람보다 자연스러운 문장을 만들어냈지만, 두 사진 사이에서 무엇이 달라졌고 어떤 변화가 중요한지를 파악하는 능력은 여전히 인간에 크게 못 미치는 것으로 나타났다. 재난 감시나 자율주행처럼 단순히 사물을 알아보는 것을 넘어 '상황에 맞는 변화'를 판단해야 하는 AI의 한계를 측정할 새로운 평가 기준도 나왔다.
C3-Bench 개요. 자연 장면, 원격탐사 영상, 이미지 편집, 이상 탐지의 4개 분야 아래 도로·건설·재난·자원 개발·제품 결함 등 51개 변화 맥락을 구성하고, 각 맥락에 맞는 변화 설명 능력을 종합적으로 평가한다. 연구팀 제공
광주과학기술원(GIST)은 김의환 AI학과 교수 연구팀이 AI가 두 장의 이미지를 비교해 주어진 상황에서 중요한 변화를 찾아 정확하게 설명하는지를 평가하는 'C3-Bench(Context-Aware Change Captioning Benchmark)'를 개발했다고 14일 밝혔다.
C3-Bench는 AI가 이미지에서 얼마나 많은 차이를 찾아냈는지가 아니라 '지금 무엇을 살펴봐야 하는지'를 이해하고 그에 맞는 변화를 골라냈는지 평가하는 일종의 'AI 변화 이해력 시험'이다.
예컨대 같은 철도 사진 두 장을 비교하더라도 목적에 따라 정답은 달라진다. 날씨 변화를 살피는 상황이라면 눈이 쌓이거나 구름이 줄어든 것이 중요하다. 반면 철도 안전을 점검한다면 선로에 새로 나타난 열차가 핵심이고 날씨 변화는 중요하지 않을 수 있다.
맥락에 따라 달라지는 ‘정답 변화’의 예. 같은 철도 이미지 쌍에서도 날씨 관점에서는 눈과 구름의 변화가, 철도 안전 관점에서는 선로에 나타난 열차가 핵심 변화가 된다. 연구팀 제공
원본보기 아이콘기존 평가 데이터는 특정 장면이나 변화에 집중하거나 상황별로 무엇을 중요하게 봐야 하는지가 명확하지 않아, 특정 시험에서 높은 점수를 받은 AI가 실제 환경에서도 필요한 변화를 제대로 찾아낼 수 있는지 판단하는 데 한계가 있었다.
51개 상황으로 AI '진짜 이해력' 시험
연구팀은 자연 장면과 위성·항공 등 원격탐사 영상, 이미지 편집, 이상 탐지 등 4개 분야에서 51개 현실적인 상황을 선정했다. 사람이 직접 변화 내용을 설명한 4996개의 이미지 쌍을 모아 C3-Bench를 구성했다.
각 상황에는 AI가 찾아야 할 변화와 무시해야 할 차이, 변화를 설명할 때 지켜야 할 기준을 따로 정했다. 같은 사진을 보고 눈에 띄는 차이를 무작정 나열하는 것이 아니라 주어진 목적에 맞는 변화를 제대로 골라냈는지를 따지는 방식이다.
평가 방법도 바꿨다. 기존처럼 AI의 답과 정답 문장에 같은 단어가 얼마나 포함됐는지를 비교하는 데 그치지 않고 내용의 정확성과 구체성, 문장의 자연스러움, 상황 관련성을 종합적으로 평가했다. 연구팀이 개발한 평가 방식은 기존 자동 평가 방식보다 사람이 직접 내린 평가와 더 가까운 결과를 보였다.
최신 AI(GPT-5.2)의 대표 오류 사례. 왼쪽부터 물체나 속성을 놓치는 지각 오류, 위치 관계를 잘못 이해하는 공간 오류, 이미지 순서를 뒤집었을 때 설명이 서로 맞지 않는 불일치 오류, 한 방향에서만 변화를 인식하는 변화 붕괴 오류를 보여준다. 빨간 글씨는 잘못된 설명 부분이다. 연구팀 제공
원본보기 아이콘글은 자연스러웠지만 '변화 이해력'은 인간에 뒤져
연구팀은 이 기준으로 400개 이미지 쌍을 사람과 GPT-5.2에 각각 보여주고 변화를 설명하도록 했다. 정확성·구체성·자연스러움·상황 관련성을 종합한 10점 만점 평가에서 인간은 평균 7.45점, GPT-5.2는 5.72점을 기록했다. 1.73점 차이다.
흥미로운 점은 문장의 자연스러움이었다. 이 항목에서는 GPT-5.2가 8.53점으로 사람의 8.32점보다 오히려 높았다. AI가 그럴듯하고 자연스럽게 설명하는 능력과 실제 장면에서 중요한 변화를 제대로 이해하는 능력은 별개일 수 있다는 의미다.
사진 순서를 뒤집는 실험에서는 격차가 더 벌어졌다. 첫 번째 사진에서 없던 물체가 두 번째 사진에 나타났다면 AI는 '물체가 생겼다'고 설명해야 한다. 두 사진의 순서를 바꾸면 같은 변화를 '물체가 사라졌다'고 표현해야 한다.
연구팀이 이를 '가역성(Reversibility)'이라는 지표로 측정한 결과 인간은 93%를 기록했지만 GPT-5.2는 61%에 그쳤다. AI가 사진 속 변화를 찾아내더라도 변화의 방향까지 일관되게 이해하는 데는 한계가 있다는 것이다.
AI가 틀리는 가장 큰 원인은 기본적인 시각 인식이었다. 전체 오류의 63.3%가 사진 속 물체를 제대로 알아보지 못하거나 종류와 특성을 잘못 파악한 데서 발생했다. 중요하지 않은 차이를 중요한 변화로 판단하거나 변화의 의미와 위치 관계를 잘못 설명하는 경우도 있었다.
김 교수는 "이번 연구는 AI가 '자연스럽게 설명하는 능력'과 '상황에 맞는 변화를 정확하게 이해하는 능력'이 반드시 같지는 않다는 점을 체계적으로 보여줬다"며 "C3-Bench가 재난·사고 현장의 변화 감시와 위성·항공 영상을 활용한 원격탐사, 자율주행, 이상 탐지 등 다양한 현실 환경에서 AI의 변화 이해 능력을 평가하고 개선하는 공통 기반으로 활용되기를 기대한다"고 말했다.
꼭 봐야 할 주요 뉴스
"혼자 먹는다고 대충 먹을 순 없지" 한 끼 10만원 ...
김 교수의 지도로 김재우 석·박사통합과정생이 제1저자로 참여한 이번 연구는 컴퓨터비전·머신러닝 분야 주요 국제학술대회인 '유럽컴퓨터비전학회(ECCV) 2026'에 채택됐다.
<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>