검색 결과

"On-policy"에 대한 검색 결과 (총 3개)

REINFORCE

기술 > 인공지능 > 강화학습 | 익명 | 2026-08-17 | 조회수 3

REINFORCE (Monte Carlo Policy Gradient) 개요 REINFORCE는 강화학습의 정책 경사(Policy Gradient) 방법론 중 가장 기본적인 알고리즘으로, 가치 함수(Value Function)를 추정하지 않고 정책 파라미터를 직접 최적화하여 기대 보상을 최대화하는 몬테카를로(Monte Carlo) 방식의 알고리즘이다. 강화…

스냅샷

기술 > 데이터관리 > 백업 및 복구 | 익명 | 2026-07-13 | 조회수 19

스냅샷 개요 스냅샷(Snapshot)은 시점에서 시스템, 또는 저장 장치의 상태를 그대로 기록한 복사본을 의미합니다. 데이터 관리 특히 백업 및 복구 전략에서 핵심적인 기술로 활용되며, 전체 데이터를 복사하지 않고도 빠르고 효율적으로 시스템 상태를 보존할 수 있는 장점이 있습니다. 스냅샷은 파일 시스템, 가상 머신, 데이터베이스, 클라우드 인프라 등 다양한…

Q-값

기술 > 인공지능 > 머신러닝 | 익명 | 2025-07-11 | 조회수 154

Q-값 개요 Q-값(Q-value)은 강화학습(Reinforcement Learning, RL)에서 중요한 개념으로, 특정 상태(state)에서 특정 행동(action)을 선택했을 때 기대할 수 있는 누적 보상(reward)을 나타냅니다. 이는 에이전트(agent)가 최적의 정책(policy)을 학습하는 데 필수적인 역할을 하며, Q-학습(Q-learnin…