article detail
서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발
2026. 9. 14. 오후 4:20

AI 요약
서강대학교 인공지능학과 장두성 교수 연구팀이 대규모언어모델 강화학습에서 기존 학습 경험을 선별적으로 재활용하는 Headroom-Drift Replay 기법을 개발했으며 박현빈 석사과정생이 참여한 논문 Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO가 COLM 2026에 채택됐습니다. 이 기법은 과거 경험의 Headroom과 Policy Drift를 함께 고려해 재사용할 데이터를 선별하며 수학·멀티모달 추론과 에이전틱 검색 환경에서 단순 재사용 방식보다 높은 성능을 보였고, 특히 에이전틱 검색에서는 새로운 데이터를 추가 생성하는 방식보다 성능이 높으면서 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄였습니다.