연구진이 LLM과 강화학습을 결합한 하이브리드 에이전트 구조를 Goal-Augmented Markov Decision Process로 공식화했어요. LLM의 상태별 진행 점수를 bounded potential function으로 사용할 경우, 보상 성형은 최적 정책 집합을 보존해요. 이는 일반적인 LLM-as-reward 접근 방식보다 강력한 보장입니다.
작은 MDP 환경에서 네 가지 잠재적 구성, 심지어 보상 크기를 20배까지 늘린 adversarial 환경에서도 수치적으로 검증했어요. LLM 점수가 부정확하더라도 최적 정책을 유지하는 것을 확인했습니다.
이 연구는 LLM 기반 보상 신호의 이론적 지위를 명확히 하고, 하이브리드 강화학습 에이전트 설계에 대한 새로운 통찰력을 제공합니다.