article detail
KAIST, AI 숨은 취약점 7배 더 찾는 안전성 검증 기술 개발
2026. 7. 30. 오후 3:20
AI 요약
한국과학기술원(KAIST) 김준모 전기및전자공학부 교수 연구팀이 거대언어모델(LLM) 안전성을 검증하는 레드팀 기술의 한계를 개선한 새로운 프레임워크 스테이블-지플로우넷(Stable-GFlowNet)을 개발했습니다. 연구팀은 대조 궤적 균형(CTB), 노이즈 경사 가지치기(NGP), 유창성 안정화 장치(MKS) 등 세 가지 핵심 기술을 적용해 기존이 찾아낸 17개의 고유 공격 유형보다 약 7배 많은 134개의 공격 유형을 발굴하면서도 92%의 공격 성공률을 유지했고, 이 기술로 학습한 방어 모델은 교차 공격 평가에서 높은 일반화 성능을 보였습니다.