IT뉴스모아news terminal

article detail

[기자수첩] 오픈AI 아스트라가 '독파모'에 던지는 질문…'일 잘하는 AI' 어떻게 가릴까

아이뉴스24
2026. 9. 10. 오후 5:13
[기자수첩] 오픈AI 아스트라가 '독파모'에 던지는 질문…'일 잘하는 AI' 어떻게 가릴까

AI 요약

그레그 브록먼 오픈AI 사장은 GPT-6 아스트라 공개 브리핑을 범용인공지능(AGI) 시대 도래를 환영하는 말로 마쳤고, 아스트라는 코딩과 장기 업무 수행, 컴퓨터 사용, 외부 도구 활용 등 실제 일을 수행하는 능력이 전작보다 크게 개선됐다는 평가를 받았습니다. 그러나 AAII v4.1.1 벤치마크에서 아스트라는 최대 추론 설정 기준 61점으로 202개 모델 가운데 공동 5위에 그쳤고 전작인 GPT-5.6 Sol과 같은 점수여서 에이전트형 능력이 기존 평가 항목에 충분히 반영되지 않았습니다. 정부의 '독자 AI 파운데이션 모델' 2차 평가에서 AAII 등 정량 벤치마크가 주요 잣대로 활용된 가운데 벤치마크 맞춤 사후학습(벤치맥싱) 논란이 제기됐고, 평가 방식이 웹 탐색·도구 활용·장기 업무 수행 등 실제 업무 능력을 보다 적극적으로 평가하도록 개선될 필요가 제기되고 있습니다.

원문보기