IT뉴스모아news terminal

article detail

서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

v.daum.net
2026. 9. 14. 오후 4:22
서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

AI 요약

서강대학교 인공지능학과 장두성 교수 연구팀이 대규모언어모델(LLM) 강화학습에서 기존 학습 경험을 선별적으로 재활용하는 Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO 기법을 개발했으며 박현빈 석사과정생이 참여한 해당 논문이 COLM 2026에 채택되었습니다. 연구팀은 수학·멀티모달 추론과 에이전틱 검색 환경에서 해당 기법이 기존 단순 데이터 재사용보다 성능이 높고, 에이전틱 검색에서는 새로운 데이터 추가 생성보다 우수하면서 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄였다고 밝혔으며 본 연구는 과학기술정보통신부·정보통신산업진흥원(NIPA) Sovereign AI Foundation Model Project와 정보통신기획평가원(IITP) Top-Tier AI Global HRD Invitation Program의 지원을 받아 수행되었고 논문은 10월 6일부터 9일까지 미국 샌프란시스코에서 열리는 COLM 2026에서 발표될 예정입니다.

원문보기