검색 결과

검색어를 입력하세요.

RLHF

기술 > 인공지능 > 강화학습 | 익명 | 2025-09-20 | 조회수 86

RLHF 개요 RLHF(Reinforcement Learning from Human Feedback, 인간의 피드백을 통한 강학습)은 인공지능, 특히 자연어 처리(NLP) 분야에서 모델의 출력 품질을 향상시키기 위해 사용되는 학습 기법입니다. 이은 인간이 모델의 출력 결과에 대해 선호도를 평가하고, 그 피드백을 기반으로 강화학습 알고리즘을 통해 모델을 보정…