IT뉴스모아news terminal

article detail

[홍기빈의 두 번째 의견]‘모두의 인공지능’과 데이터

v.daum.net
2026. 9. 21. 오후 8:16
[홍기빈의 두 번째 의견]‘모두의 인공지능’과 데이터

AI 요약

과학기술정보통신부와 한국지능정보사회진흥원이 8월27일 독자 AI 파운데이션 모델의 학습데이터 29종 약 3544만건, 약 1조5600억 토큰을 개방했고, 8월28일에는 ‘모두의 인공지능’ 서비스 컨소시엄으로 SKT·카카오·KT가 선정되어 10월 베타 출시 및 연내 공개 서비스를 목표로 하고 있습니다. 저자는 데이터 구성(범용 텍스트·멀티모달·수학·과학·법률·제조업 기술문서·민원 상담 음성 등)만으로는 지역 역사·민속·설화·축제·개인의 생활사·문학·음악·대중문화 등 ‘한국의 삶’을 충분히 반영하기 어렵다고 지적하며, 2026년 연구에서 100B급 모델군의 문화 인지 성능이 세계 최고 수준의 약 4분의 1에 불과하다는 점을 제시했습니다. 문화 데이터 수집·정제는 막대한 고정비용의 공공재적 성격을 띠어 개별 기업의 유인이 약하고 정부 지원이 하드웨어 중심으로 편중되어 있으며(2026년 상반기 B200 768장에서 하반기 1000장 수준), 다섯 개 팀의 데이터 예산은 연간 약 150억원에 그치고 한국어 공공데이터 비중은 전체의 10분의 1 남짓, 실제 흡수하는 한국어 말뭉치 비��은 5%에도 못 미칠 것이라며 국가가 나서 데이터를 모아야 한다고 주장했습니다.

원문보기