article detail
24개 조합 중 21개 최고·공동 최고…구글 연구진 절차 그래프 제안

AI 요약
Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık 연구진은 9월 8일 arXiv에 공개한 논문에서 프로시저럴 그래프를 제안했으며, 이 구조는 절차-관계-절차 형태로 작업 순서와 조건을 표현하고 노드는 도구 호출·추론 단계·작업 상태를, 연결선에는 전환 조건·실행 지침·피해야 할 오류를 기록하며 guidance 모델이 주변 2단계 범위의 구조를 지침으로 바꿔 solver에 제공하되 최종 행동은 강제하지 않고 그래프는 실행 결과에 따라 LLM 기반 refiner로 스스로 수정됩니다. 연구진은 HotpotQA, MultiChallenge, GDPval, ALFWorld, τ-bench, BFCL v3, EnterpriseArena 등 7개 벤치마크와 Claude Sonnet 4.6, Gemini 3.1 Pro, Gemini 3.5 Flash, Grok 4.1 Fast 등 4개 LLM을 평가해 24개 모델·벤치마크 조합 중 21개에서 최고 또는 공동 최고 성능을 기록했고, EnterpriseArena에서는 Gemini 3.1 Pro의 전체 생존율이 기존 6%에서 그래프 적용 후 34%로 28%포인트 상승했으며 자기진화 실험의 검증 세트 생존율은 0%에서 90%로, 최종 반환 그래프의 테스트 생존율은 85%였습니다. 논문은 arXiv 프리프린트로 동료심사나 독립 재현 결과가 없고 구글의 ���식 제품 적용이나 상용화 일정은 확인되지 않으며 연구진도 그래프 검색과 guidance 생성으로 인한 추가 추론·토큰 사용, 운영 비용·지연 증가와 잘못된 그래프 수정 누적 위험 등을 과제로 지적했습니다.