목표 기반 인코딩 목표 기반 인코딩(Target-based Encoding)은 범주형 변수(Categorical Variable)를 수치형 변수로 변환 데이터 인코딩법 중 하나로, 특히 지도 학습(Supervised Learning)에서 목표 변수(Target Variable)와의 관계를 활용하여 인코딩을하는 방법입니다. 이 방은 단순한 레이블 인코딩(La…
검색 결과
"overfitting"에 대한 검색 결과 (총 185개)
조정 결정계수 (Adjusted R-squared) 조정 결정계수(Adjusted R-squared)는 회귀 분석에서 모델의 설명력을 나타내는 결정계수( )가 독립 변수의 개수가 증가함에 따라 무조건적으로 상승하는 단점을 보완하기 위해, 변수 개수에 따른 페널티를 부여하여 계산한 지표이다. 1. 개요 회귀 분석의 목적은 독립 변수( )들이 종속 변수( )의…
이진 분류 (Binary Classification) 1. 개요 이진 분류(Binary Classification)란 주어진 데이터를 두 개의 서로 배타적인 클래스(Class) 중 하나로 분류하는 [[지도 학습]](Supervised Learning)의 한 형태이다. 일반적으로 정답 레이블은 0과 1, 혹은 'Positive(긍정/참)'와 'Negative…
보간 가능성 (Interpolatability) 1. 개요 보간 가능성(Interpolatability)이란 주어진 일련의 데이터 점(Data points)들을 모두 정확하게 통과하는 연속 함수가 수학적으로 존재하며, 그 함수를 유일하게 결정할 수 있는 성질을 의미한다. 수치해석 및 함수 근사 이론에서 보간 가능성은 단순히 함수를 찾는 문제를 넘어, 선택한…
편향 요 머신러닝에서 편향(Bias)은 모델이 학습 데이터에서 실제 패턴을 얼마나 정확하게영하는지를 나타내는 중요한 개념이다. 일반적으로 편향은 모델의 예측 값과 관측 값 사이의 평균적인 차이를 의미하며, 낮은 편향은 모델이 데이터를 잘 학습하고 있음을, 높은 편향은 모델이 데이터의 실제 구조를 간과하고 있다는 것을 나타낸다. 편향은 머신러닝 모델의 성능을…
Embedding Layer (임베딩 층) 1. 개요 임베딩 층(Embedding Layer)은 자연어 처리(NLP) 및 딥러닝 모델에서 정수 형태로 인코딩된 범주형 데이터(주로 단어 인덱스)를 고정된 크기의 연속적인 수치형 벡터로 변환하는 신경망 층이다. 컴퓨터는 텍스트를 직접 처리할 수 없으므로 수치화 과정이 필수적이다. 초기에는 단어의 존재 여부만을 …
범주형 변수 개요 범주형 변수(Categorical Variable)는 데이터 과학과 통계학에서 중요한 데이터 유형 중 하나로, 특정 범주나 그룹에 속하는 값을 가지는 변수를 의미합니다. 이 변수는 정량적인 수치가 아닌 정성적인 속성을 표현하며, 데이터 분석, 머신러닝 모델링, 데이터 시각화 등 다양한 과정에서 핵심적인 역할을 합니다. 예를 들어, 사람의 …
Denoising Autoencoders (DAE) 본 문서는 수식을 사용하여 작성되었습니다. 1. 개요 Denoising Autoencoder (DAE)는 입력 데이터에 의도적으로 노이즈(Noise)를 추가한 뒤, 이를 다시 원본 데이터로 복원하도록 학습함으로써 데이터의 강건한(Robust) 특징을 추출하는 비지도 학습 기반의 신경망 구조이다. 일반적인 …
자기지도학습 (Self-Supervised Learning) 자기지도학습(Self-Supervised Learning, SSL)은 데이터 자체에서 정답(Label)을 생성하여 모델을 학습시키는 머신러닝 기법으로, 명시적인 외부 레이블 없이 데이터의 내재적 구조를 통해 표현 학습(Representation Learning)을 수행하는 방법론이다. 1. 개요 …
대출 심사 모델 (Loan Underwriting Model) 1. 개요 대출 심사 모델이란 금융기관이 대출 신청자의 신용도와 상환 능력을 평가하여 대출 승인 여부, 대출 한도, 그리고 적용 금리를 결정하기 위해 사용하는 정량적·정성적 분석 체계를 의미한다. 금융기관의 핵심 목적은 리스크 관리(Risk Management)와 운영 효율화(Automation…
모델 평가 (Model Evaluation) 1. 개요 모델 평가란 학습된 머신러닝 모델이 새로운 데이터에 대해 얼마나 정확하고 일반화된 예측 성능을 보이는지를 정량적으로 측정하는 과정이다. 모델 평가의 핵심 목적은 모델의 일반화 성능(Generalization Performance)을 확인하는 것이다. 모델이 학습 데이터에만 지나치게 최적화되어 새로운 데…
모델 훈련 개요 모델 훈련(Model)은 머신닝(Machine Learning) 핵심 과정, 주어진 데이터를 기반으로 모델이 특정 작업을 수행할 수 있도록 학습시키는 절차를 의미합니다. 이 과정에서 알고리즘은 입력 데이터와 정답(라벨) 사이의 관계를 학습하여, 새로운 데이터에 대해 정확한 예측이나 판단을 내릴 수 있는 능력을 획득하게 됩니다. 모델 훈련은 …
VC 이론 VC 이론(Vapnik-Chervonenkis Theory)은 통계적 학습 이론의 핵심 기반 중 하나로, 머신러닝 모델의 일반화 능력을 수학적으로 분석하는 데 중요한 역할을. 이 이론 블라드미르 바프니크(Vladimir Vapnik)와 알세이 체르보넨키스lexey Chervonenkis가 190년대 초반에 제안하였으며, 특히 모델의 복잡성과 학습…
불규칙성 (시계열 분석) 1. 개요 본 문서는 시계열 분석(Time Series Analysis) 관점에서의 불규칙성(Irregularity)을 다룬다. 시계열 분석에서 불규칙성이란 데이터의 전체적인 흐름을 결정하는 추세(Trend)나 일정한 주기로 반복되는 계절성(Seasonality)으로 설명되지 않는 무작위적인 변동 성분을 의미한다. 시계열 데이터는 …
결함 검출 개요 결함 검출(Def Detection)은 산업 생산정에서 제품이나 자재에 존재하는 물리적, 구조적 또는 기능적 이상을 식하는 핵심적인 품질 관리 활동입니다. 이는 제조업 전반에서 제품의 신뢰성, 안전성, 일관성을 보장하기 위한 필수 절차로, 자동차, 반도체, 항공우주, 금속 가공, 전자기기 등 다양한 산업 분야에서 활용됩니다. 결함 검출 기술…
정규화 개요 정규화(Normalization) 자연어 처리(Natural Language Processing, N)에서 텍스트 전처리의 핵심 단계 중 하나로, 다양한 형태의 텍스트를 일관된 형식으로 변환하여 분석의 정확도 효율성을 높이는 과정을 의미합니다. 원시 텍스트는 사용자 입력, 웹 크롤링, 문서 스캔 등 다양한 경로를 통해 수집되며, 이 과정에서 오…
MSE 개요 MSE(Mean Squared Error, 평균 제곱 오차)는 회귀(regression) 문제에서 예측 모델의 성능을 평가하는 데 널리 사용되는 지표입니다. 이는 예측과 실제 관측값 사이의 차이(오차)를 제곱한 후, 그 평균을 계산함으로써 모델의 정확도를 수치화합니다. MSE는 인공지능, 특히 머신러닝 및 딥러닝 모델의 학습 과정에서 손실 함수…
편향-분산 트레이드오프 (Bias-Variance Tradeoff) 1. 개요 편향-분산 트레이드오프(Bias-Variance Tradeoff)란 머신러닝 모델의 예측 성능을 결정하는 두 가지 핵심 요소인 편향(Bias)과 분산(Variance) 사이의 상충 관계를 의미하며, 모델의 복잡도를 조절하여 전체 오차(Total Error)를 최소화하는 최적의 지…
드롭아웃 (Dropout) 개요 드롭아웃(Dropout)은 인공지능(AI) 분야에서 네트워크 과적합(overfitting)을 방지하기 위한 정규화 기법으로, 신경망의 훈련 중 일부 뉴런을 무작위로 비활성화하는 방법이다. 이 기법은 2014년 제프리 힌턴(Jeffrey Hinton) 등이 발표한 논문에서 처음 소개되었으며, 현재 딥러닝 모델의 일반적인 성능 …
사전 학습 (Pre-training) 사전 학습(Pre-training)은 머신러닝, 특히 딥러닝 분야에서 방대한 양의 데이터로부터 모델의 초기 가중치(Weight)와 편향(Bias)을 학습하는 과정을 의미합니다. 이는 주로 전이 학습(Transfer Learning)의 핵심 단계로 활용되며, 특정 태스크(Task)에 대한 미세 조정(Fine-tuning)…