article detail
'해킹법 알려줘' 명령 거부한 中 AI…작업 형태에선 중단 없어
2026. 7. 21. 오전 6:02
AI 요약
미국 국립표준기술연구소(NIST) 산하 AI표준혁신센터(CAISI) 보고서에 따르면 중국 지푸AI의 GLM-5.2는 '해킹을 도와달라'는 악의적 의도를 명시한 질문에는 대부분 거부해 요청대로 완전히 답한 비율이 2%였고 탈옥 문구를 붙였을 때는 8%였으나, 결함 있는 프로그램과 수정본을 제시해 차이를 분석해 공격 코드를 만들도록 한 10개 과제에서는 작업을 거부하지 않아 과제당 최대 300개의 응답을 내놓는 동안 중단하지 않았습니다. 전반적 성능은 오픈웨이트 모델 중 가장 뛰어나 오픈AI의 GPT-5.2와 비슷한 수준으로 평가됐으나, 취약점 공격 개발 능력을 평가한 '익스플로잇벤치'에서는 21.4%로 앤트로픽 오퍼스 4.8(38.1%), 오픈AI GPT-5.5(40.7%)보다 낮았습니다. CAISI는 GLM-5.2를 직접 내려받아 자체 서버에서 기본 거부 기능만 유지한 상태로 평가했고 미국 모델은 서비스에 붙은 추가 차단 기능을 켠 상태였기 때문에 실제 온라인 서비스나 사용자가 오픈웨이트 모델을 수정한 경우 결과가 달라질 수 있습니다.