연구진은 금융 기록에서 실행 가능한 금융 자문을 생성하는 모델을 개발했어요. 모델은 GRPO(Group Relative Policy Optimization)를 활용해 오픈 웨이트 언어 모델을 파인튜닝했어요.
모델의 보상은 LLM이 평가하는 척도(rubric)로, 자문 품질의 이분법적 차원을 점수화하고, 안전 장치를 통해 피해 방지를 강화해요.
CATE(Conditional Average Treatment Effect) 추정기를 활용한 독립적인 감사 결과, GRPO 모델은 가장 강력한 상용 LLM의 순이익 증가폭을 약 두 배로 끌어올렸어요.
연구 결과는 금융 분야 NLP에서 LLM-as-a-judge 평가를 보완하는 독립적인 인과 감사(causal audit)의 가치를 입증했어요.