article detail
AI, ‘틀린그림찾기’는 인간에 완패
2026. 9. 14. 오후 8:51

AI 요약
GIST 김의환 교수팀은 두 장의 이미지를 비교해 AI의 변화 이해력을 평가하는 C3-벤치를 개발하고 51가지 변화 상황에 대해 이미지 4996쌍을 수집해 AI 32종을 평가했습니다. 사람은 400개 이미지 쌍 테스트에서 종합점수 7.45/10과 가역성 정답률 93%를 기록했지만 GPT-5.2는 5.72점과 61%에 그쳤고, AI 오류의 63.3%가 시각적 인식 오류였으며 GPT-5.2의 문장 유창성은 사람의 8.32보다 높은 8.53점을 기록했습니다.