No_Cauliflower7923 사용자가 지연 및 확률적 요인으로 인한 제약 RL의 문제를 해결하기 위한 CCPL(Causal Consequence-Penalized Learning) 연구를 발표했어요.
CCPL은 지연된 결과를 반영하는 적응형 효과 할인율을 학습하는 Bellman 연산자를 사용하고, 불확실한 지연 하에서도 수축 증명을 가능하게 해요.
현재 ICN은 환경의 구조적 인과 모델에 대한 접근이 필요하지만, 제약/안전 RL 또는 인과 추론 분야에 관심 있는 사람들의 기여와 협업을 환영해요.