article detail
‘모두의 인공지능’과 데이터
2026. 9. 21. 오후 8:03

AI 요약
과학기술정보통신부와 한국지능정보사회진흥원은 8월 27일 독자 AI 파운데이션 모델 학습데이터 29종 약 3544만건·약 1조5600억 토큰을 개방했고, 8월 28일에는 ‘모두의 인공지능’ 서비스를 맡을 컨소시엄으로 SKT·카카오·KT가 선정되어 10월 베타 출시와 연내 공개 서비스를 목표로 했습니다. 기사에서는 현재 학습 데이터가 지역 역사·민속·설화·축제, 개인 생활사·직업 경험, 문학·음악·대중문화 등 '한국의 삶'을 충분히 포괄하는지 의문을 제기하며, 2026년 연구에서 27개국의 100B 넘는 대형 모델군의 평균 문화 인지 성능이 세계 최고 수준의 약 4분의 1에 불과하고, 경쟁에 참여한 다섯 개 팀의 연간 데이터 예산이 약 150억원에 불과하며 한국어 공공데이터 비중은 전체의 약 10분의 1, 실제 흡수되는 한국어 말뭉치 비중은 5%에도 못 미친다고 지적합니다. 따라서 기사에서는 국가가 공식 기록뿐 아니라 지역 설화·축제·세대별 생활 경험·구술 등 역사·사회·문화 데이터를 공공이 수집·정제해야 한다고 제안하며, 인도·뉴질랜드(Te Hiku Media의 마오리어 음성 AI 92% 인식 정확도)·네덜란드(GPT-NL) 등의 선례를 제시합니다.