IT뉴스모아news terminal

article detail

AI가 하네스를 만들 수 있을까...바이트댄스, 평가 프레임워크 '하네스데브' 공개

AI타임스
2026. 9. 12. 오전 11:56
AI가 하네스를 만들 수 있을까...바이트댄스, 평가 프레임워크 '하네스데브' 공개

AI 요약

바이트댄스 연구진은 대형언어모델(LLM)이 에이전트 실행 시스템인 하네스(harness)를 스스로 구축하고 개선할 수 있는 능력을 평가하는 프레임워크 ‘하네스데브(HarnessDev)’를 공개했으며, 생성 단계(약한 시드로 완전한 하네스 구축)와 진화 단계(실행 피드백으로 지속 개선)로 구성해 모델이 작성한 실행 가능한 구축 코드를 평가하고 SWE-벤치 프로·터미널-벤치 2.1 등 여러 벤치마크와 2207개 고유 과제를 사용해 실험을 진행했습니다. 실험에는 클로드 오퍼스 4.8, GPT-5.5, 제미나이 3.1 프로 등 6개 모델이 참여했으며 일부 모델은 부분적 개선과 성과를 보였으나 최고 점수(오퍼스 4.8의 Self-Eval 67.8)는 성숙한 인간 설계 하네스 기준점 86.2에 미치지 못했고 자체 개선 효과는 평균 3.11점에 그치는 등 전반적으로 안정적이고 범용적인 인간 수준의 하네스 개발 능력 확보에는 이르지 못했다고 연구진은 결론지었습니다.

원문보기