IT뉴스모아news terminal

article detail

서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

미주중앙일보
2026. 9. 14. 오후 4:20
서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

AI 요약

서강대학교 인공지능학과 장두성 교수 연구팀은 박현빈 석사과정생 등이 참여한 논문 Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO가 COLM 2026에 채택됐습니다. 연구팀은 과거 경험의 추가 학습 가치를 뜻하는 Headroom과 현재 모델에서의 안정적 활용 가능성을 뜻하는 Policy Drift를 함께 고려해 재사용할 데이터를 선별하는 Headroom-Drift Replay 기법을 제안했고, 수학·멀티모달 추론과 에이전틱 검색 환경에서 기존 단순 재사용 방식보다 높은 성능을 보였으며 에이전틱 검색에서는 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄였다고 설명했습니다. 이번 연구는 과학기술정보통신부와 정보통신산업진흥원(NIPA)의 Sovereign AI Foundation Model Project, 정보통신기획평가원(IITP)의 Top-Tier AI Global HRD Invitation Program 지원을 받아 수행됐으며 논문은 10월 6일~9일 미국 샌프란시스코에서 열리는 COLM 2026에서 발표될 예정입니다.

원문보기