검색 결과

"Reward Model"에 대한 검색 결과 (총 2개)

카테고리:

Supervised Fine-tuning

기술 > 인공지능 > 지도학습 | 익명 | 2026-06-20 | 조회수 2

# Supervised Fine-tuning (지도 미세 조정) **Supervised Fine-tuning**(SFT, 지도 미세 조정)은 대규모 언어 모델(Large Language Model, LLM)이나 다른 딥러닝 모델을 특정 작업이나 도메인에 맞게 전문화시키기 위해, 레이블이 지정된 데이터셋을 사용하여 사전 학습된 모델의 가중치를 추가로 학습시...

#Supervised Fine-tuning #지도 미세 조정 #LLM #거대 언어 모델 #인공지능 #RLHF #LoRA #지시 따르기 #데이터 정제 #고급

RLHF

기술 > 인공지능 > 강화학습 | 익명 | 2025-09-20 | 조회수 71

# RLHF ## 개요 **RLHF**(Reinforcement Learning from Human Feedback, 인간의 피드백을 통한 강학습)은 인공지능, 특히 자연어 처리(NLP) 분야에서 모델의 출력 품질을 향상시키기 위해 사용되는 학습 기법입니다. 이은 인간이 모델의 출력 결과에 대해 선호도를 평가하고, 그 피드백을 기반으로 강화학습 알고리즘...

#RLHF #강화학습 #보상 모델 #PPO #AI 윤리