IT뉴스모아news terminal

article detail

"AI는 왜 ‘정답 데이터’보다 ‘보상’을 배워야 하는가"...김용덕 변리사, 구글의 컴퓨터 비전 강화학습 특허 분석

인공지능신문
2026. 9. 14. 오후 6:05
"AI는 왜 ‘정답 데이터’보다 ‘보상’을 배워야 하는가"...김용덕 변리사, 구글의 컴퓨터 비전 강화학습 특허 분석

AI 요약

구글은 미국 특허 제12731392호 '태스크 보상을 이용한 컴퓨터 비전 신경망 미세 조정'에서 사전학습된 컴퓨터 비전 신경망을 실제 컴퓨터 비전 작업에서 얻어지는 '태스크 보상(Task Reward)'으로 강화학습을 통해 다시 미세 조정하는 방법을 다루고 있습니다. 이 특허는 기존의 정답 데이터 모방 중심 학습 방식의 한계를 지적하고, 대규모 데이터로 사전학습한 뒤 재현율(Recall), 평균 정밀도(mAP), Panoptic Quality 등 실제 평가 지표를 보상으로 설정해 강화학습으로 미세 조정하는 두 단계 학습 구조를 제안합니다. 또한 보상 함수가 반드시 미분 가능할 필요가 없어 사람의 평가 등 비미분적 평가 지표도 보상으로 활용할 수 있어 실제 서비스에서의 성능을 직접 목표로 최적화할 수 있다고 밝힙니다.

원문보기