2. Bellman Equation벨만 방정식이 필요한 이유와 가치 함수, 최적 정책, Known MDP와 Unknown MDP의 차이를 정리한다. 2025/08/28 RL, Study
1. MDP (Markov Decision Process)강화학습의 뼈대가 되는 MDP의 구성 요소, 마르코프 속성, 최적 정책의 의미를 정리한다. 2025/08/27 RL, Study