검색 결과

"어드밴티지"에 대한 검색 결과 (총 2개)

REINFORCE

기술 > 인공지능 > 강화학습 | 익명 | 2026-08-17 | 조회수 3

REINFORCE (Monte Carlo Policy Gradient) 개요 REINFORCE는 강화학습의 정책 경사(Policy Gradient) 방법론 중 가장 기본적인 알고리즘으로, 가치 함수(Value Function)를 추정하지 않고 정책 파라미터를 직접 최적화하여 기대 보상을 최대화하는 몬테카를로(Monte Carlo) 방식의 알고리즘이다. 강화…

정책 기반 방법

기술 > 인공지능 > 강화학습 | 익명 | 2026-01-30 | 조회수 51

정책 기반 방법 개요 정책 기반 방법(Policy-Based Methods)은 강화학습(Reinforcement Learning, RL)의 주요 접근 방식 중 하나로, 에이전트(Agent)가 환경(Environment)과 상호작용하면서 최적의 행동을 선택하기 위해 직접 정책(Policy)을 학습하는 방법입니다. 이는 가치 기반 방법(Value-Based M…