IT뉴스모아news terminal

article detail

[기자수첩] 오픈AI 아스트라가 '독파모'에 던지는 질문…'일 잘하는 AI' 어떻게 가릴까

v.daum.net
2026. 9. 10. 오후 5:15
[기자수첩] 오픈AI 아스트라가 '독파모'에 던지는 질문…'일 잘하는 AI' 어떻게 가릴까

AI 요약

그레그 브록먼 오픈AI 사장이 공개한 새 AI 모델 'GPT-6 아스트라'는 코딩과 장기 업무 수행, 외부 도구 활용 등에서 성능이 개선됐다는 평가를 받았지만 AAII v4.1.1 벤치마크에서는 최대 추론 설정 기준 61점으로 202개 모델 가운데 공동 5위에 그쳤고 전작 'GPT-5.6 Sol'과 같은 점수였습니다. 정부의 '독자 AI 파운데이션 모델'(독파모) 2차 평가는 AAII 등 정량 벤치마크를 주요 잣대로 활용했으나 기사에서는 이러한 지표가 웹 탐색·도구 활용·장기 업무 수행 등 에이전트 능력을 충분히 반영하지 못하고 벤치마크 맞춤 사후학습(벤치맥싱) 논란을 낳을 수 있다고 지적했습니다. 기사에서는 독파모의 다음 평가에서 장시간 업무 안정성, 외부 도구 활용 능력, 여러 단계를 거쳐 결과물을 완성하는지 등을 적극적으로 평가해 '시험 잘 보는 AI'가 아니라 '실제로 일 잘하는 AI'를 가려내야 한다고 주장했습니다.

원문보기