IT뉴스모아news terminal

article detail

퍼플렉시티, 연구 에이전트 벤치마크 'WANDR' 출시…"최고 AI도 실무는 한계"

AI타임스
2026. 7. 20. 오후 5:39
퍼플렉시티, 연구 에이전트 벤치마크 'WANDR' 출시…"최고 AI도 실무는 한계"

AI 요약

퍼플렉시티는 14일(현지시간) AI 연구 에이전트의 실제 지식 노동 수행 능력을 평가하기 위한 오픈 벤치마크 WANDR를 공개했습니다. WANDR는 경쟁사 분석·기업 실사·시장 조사·문헌 조사·제품 비교·인재 발굴 등 실제 업무 500개 과제로 설계돼 전체 17만495개의 출처 기반 레코드를 요구하며, 예로 2026년 3월1일부터 4월30일 사이 CEO 또는 CFO를 새로 선임한 미국 기업 최소 70곳과 총 140개의 검증 가능한 기록을 찾는 과제를 제시합니다. 동일 조건 평가에서 퍼플렉시티 SaC가 소프트 F1 0.363·하드 F1 0.133으로 최고 성능을 기록했고, 최고 설정 xhigh에서 소프트 F1 0.447·하드 F1 0.224까지 올랐으나 대부분 시스템은 전체 요구량을 채우지 못해 소프트 리콜이 소프트 정확도보다 낮고 비용 대비 성능이 비례하지 않는 등 실무 수준의 완전한 리서치 수행에는 미치지 못한다고 나타났습니다.

원문보기