article detail
애피어, LLM 28종 실험…"정답 없음"이 답일 때 정확도 30~50% 하락
2026. 9. 10. 오전 11:51

AI 요약
애피어는 거대언어모델의 한계 인식과 추론 언어 선택을 다룬 두 편의 연구 논문을 발표했으며, 첫 번째 연구에서는 객관식에 ‘해당 사항 없음’ 선택지를 추가해 규모가 다른 거대언어모델 28종을 실험한 결과 해당 항목이 정답일 때 모델 정확도가 30~50% 하락했다고 보고했습니다. 연구팀은 지도 미세조정과 직접 선호 최적화를 적용해 정답이 없는 문항을 식별하는 정확도를 직접 선호 최적화 적용 시 약 30%포인트 향상시켰고, 이 방식은 정답이 명확히 정의되고 선택지가 독립적인 경우에 가장 효과적이라고 밝혔습니다. 두 번째 연구에서는 모델이 내부적으로 영어 등 고자원 언어로 추론하는 경향이 있어 일부 모델은 내부 추론 언어와 최종 답변 언어가 일치하지 않는 비율이 90%를 넘었고, 텍스트 프리필링으로 언어별 성능을 비교한 결과 고자원 언어는 수학·지식 과업에서, 현지 언어는 문화적 이해와 안전성 시험에서 더 우수해 애피어는 과업과 지역에 따라 추론 언어를 선택하는 추론 언어 라우팅을 제안했습니다.