IT뉴스모아news terminal

article detail

서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

중앙일보
2026. 9. 14. 오후 4:20
서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

AI 요약

서강대학교 인공지능학과 장두성 교수 연구팀이 대규모언어모델 강화학습에서 기존 학습 경험을 선별적으로 재활용하는 Headroom-Drift Replay 기법을 개발했으며 박현빈 석사과정생이 참여한 논문 Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO가 COLM 2026에 채택됐습니다. 이 기법은 과거 경험의 Headroom과 Policy Drift를 함께 고려해 재사용할 데이터를 선별하며 수학·멀티모달 추론과 에이전틱 검색 환경에서 단순 재사용 방식보다 높은 성능을 보였고, 특히 에이전틱 검색에서는 새로운 데이터를 추가 생성하는 방식보다 성능이 높으면서 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄였습니다.

원문보기