article detail
악마의 게임 '문명 6'에 무릎 꿇은 AI…"23전 20패" 뒷심 부족 탓? - 머니투데이
2026. 9. 12. 오전 10:00
AI 요약
영국 옥스퍼드대 등이 참여한 연구진은 논문 사전 공개 사이트 arXiv에 'CivBench: 문명 6에서 도구를 사용하는 에이전트의 장기 수행 능력을 평가하는 벤치마크'를 공개하고 앤트로픽의 클로드 오퍼스 4.6, 오픈AI의 GPT-5.4, 구글의 제미나이 3.1 프로, 문샷 AI의 키미 K2.5 등 주요 모델을 문명 6에 투입해 내장 컴퓨터와의 23경기에서 총 3승 20패(왕자 난이도 19경기 중 3승, 왕 난이도 4경기 중 0승)를 기록했다고 분석했습니다. 연구진은 AI들이 연구진의 20턴마다 상황 점검 지침을 지키지 않고 실제로는 30~75턴마다만 조회했으며 계획을 세워도 10턴 내 실행하지 않는 등 실행력과 모니터링에서 공통적인 약점을 보여 계획 이행 점수 48.2~65.8점에 그쳤다고 밝혔습니다. 연구진은 추론 능력 개선만으로는 장기 작업의 신뢰성·완결성을 확보하기 어렵다며 정기 상태 조회 강제화나 모니터링 도구 우선순위 부여 등 보완이 필요하다고 결론지었습니다.