어휘 사전 (Vocabulary) 1. 개요 어휘 사전(Vocabulary)이란 자연어 처리(NLP)에서 모델이 처리할 수 있는 모든 고유한 토큰(Token, 텍스트의 최소 의미 단위)의 집합을 의미하며, 텍스트 데이터를 컴퓨터가 이해할 수 있는 수치형 벡터로 변환하기 위한 기초 매핑 테이블 역할을 한다. 2. 어휘 사전 구축 과정 어휘 사전 구축은 원시 …
검색 결과
"학습 부족"에 대한 검색 결과 (총 8개)
모델 일반화 (Model Generalization) 1. 개요 모델 일반화(Model Generalization)란 머신러닝 모델이 학습 과정에서 사용되지 않은 새로운 데이터(Unseen Data)에 대해 얼마나 정확하게 예측하거나 분류할 수 있는지를 나타내는 능력이다. 머신러닝의 궁극적인 목표는 단순히 학습 데이터셋의 정답을 맞히는 것이 아니라, 데이터…
과적합 (Overfitting) 1. 개요 과적합(Overfitting)이란 머신러닝 모델이 학습 데이터(Training Data)에 지나치게 최적화되어, 새로운 데이터나 실제 환경의 데이터(Unseen Data)에 대해서는 예측 성능이 현저히 떨어지는 현상을 말한다. 모델이 데이터의 일반적인 패턴을 학습하는 것이 아니라, 학습 데이터에 포함된 무작위한 노…
어휘 크기 (Vocabulary Size) 1. 개요 어휘 크기(Vocabulary Size)란 자연어 처리(NLP) 모델이 텍스트 데이터를 처리하기 위해 정의한 고유한 토큰(Token)의 총 개수를 의미한다. 언어 모델은 텍스트를 직접 이해할 수 없으므로, 텍스트를 숫자 형태의 벡터로 변환하는 과정이 필요하다. 이때 모델이 인식할 수 있는 '단어 사전'의…
편향 개요 머신러닝 모델의 성능을 평가할 때 중요한 요소 중 하나는 편향(Bias)입니다. 편향은 모델이 학습 데이터의 패턴을 얼마나 잘 반영하는지를 나타내는 지표로, 일반적으로 예측값과 실제값 사이의 평균적인 차이를 의미합니다. 낮은 편향은 모델이 데이터의 진짜 관계를 잘 포착하고 있음을, 높은 편향은 모델이 너무 단순하거나 학습 부족으로 인해 중요한 패…
train_size 개요 train_size는 머신러닝 및 데이터 과학 분야에서 모델 학습을 위한 데이터 분할 과정에서 사용되는 하이퍼파라미터 중 하나로, 전체 데이터셋 중 학습 데이터(training set)로 사용할 비율 또는 개수를 지정하는 파라미터입니다. 이 파라미터는 모델의 학습 성능과 일반화 능력에 직접적인 영향을 미치며, 적절한 설정이 중요합니…
num_leaves num_leaves는 그래디언트 부스팅 머신 러닝 알고리즘 중 하나인 LightGBM(Light Gradient Boosting Machine)에서 중요한 하이퍼파라터로, 각각의 결정 트리(decision tree) 가질 수 있는 최대 잎 노드 수(maximum number of leaf nodes)를 지정합니다. 이 파라미터는 모델의 …
smoothing parameter 개요 Smoothing parameter(스무딩 파라터)는 머신러닝 및계 모델링에서 데이터의 노이즈ise)를 줄 모델의 일반화능을 향상시키기 위해 사용되는 중요한 하이퍼파라미터입니다. 이 파라미터 모델이 데이터에 과적합overfitting)되는 것을 방지하고, 관측된 데이터의 불확실성이나 변동성을 완화하여 더 부드러운 예…