ChatGPT프로덕트
"AI는 왜 ‘정답 데이터’보다 ‘보상’을 배워야 하는가"...김용덕 변리사, 구글의 컴퓨터 비전 강화학습 특허 분석
인공지능(AI) 분야에서 강화학습(RL)이라고 하면 많은 사람들이 챗GPT와 같은 생성형 AI를 먼저 떠올린다. 사람이 생성된 답변을 평가하고, 그 평가를 이용해 AI가 더 좋은 답변을 생성하도록 학습시키는 인간 피드백 기반 강화학습, 즉 RLHF(Reinforcement Learning from Human Feedback)가 생성형 AI의 핵심 기술로 알려져 있기 때문이다.그러나 강화학습의 활용 범위는 언어모델에만 국한되지 않는다. 구글은 최근 컴퓨터 비전 영역에서도 기존의 학습 방식에 강화학습을 결합하는 기술을 특허로 확보했다.
인공지능신문 · 2026. 09. 15. 오전 03:05