Pulse · AI 뉴스

LLM 피드백 기반 정책 불변형 보상 성형: 하이브리드 강화학습 에이전트 프레임워크

arXiv cs.AI · 2026-08-19

연구진이 LLM과 강화학습을 결합한 하이브리드 에이전트 구조를 Goal-Augmented Markov Decision Process로 공식화했어요. LLM의 상태별 진행 점수를 bounded potential function으로 사용할 경우, 보상 성형은 최적 정책 집합을 보존해요. 이는 일반적인 LLM-as-reward 접근 방식보다 강력한 보장입니다.

작은 MDP 환경에서 네 가지 잠재적 구성, 심지어 보상 크기를 20배까지 늘린 adversarial 환경에서도 수치적으로 검증했어요. LLM 점수가 부정확하더라도 최적 정책을 유지하는 것을 확인했습니다.

이 연구는 LLM 기반 보상 신호의 이론적 지위를 명확히 하고, 하이브리드 강화학습 에이전트 설계에 대한 새로운 통찰력을 제공합니다.

##강화학습##LLM##보상성형##하이브리드에이전트
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기