잠재 요인 (Latent Factor) 1. 개요 잠재 요인(Latent Factor)이란 데이터 세트에서 직접적으로 관찰되지는 않지만, 관찰 가능한 변수들 간의 관계를 통해 추론할 수 있는 숨겨진 특성을 의미한다. 이 개념은 통계학의 요인 분석(Factor Analysis)에서 유래하였으며, 추천 시스템 외에도 심리 측정, 유전자 분석 등 다양한 분야에서…
검색 결과
"FIT"에 대한 검색 결과 (총 333개)
빌드-측정-학습 (Build-Measure-Learn) 빌드-측정-학습(Build-Measure-Learn)은 [[린 스타트업]](Lean Startup) 방법론의 핵심으로, 가설 설정과 실험을 통해 [[제품-시장 적합성]](Product-Market Fit)을 빠르게 찾아내기 위한 반복적인 피드백 루프 프로세스이다. 1. 개요 현대의 제품 개발, 특히 스…
합성 데이터 (Synthetic Data) 1. 개요 합성 데이터(Synthetic Data, 가상 데이터라고도 함)란 실제 세계에서 수집된 데이터가 아니라, 알고리즘이나 통계적 모델을 통해 인위적으로 생성된 데이터를 의미한다. 실제 데이터(Real-world Data)가 관찰된 사실의 기록이라면, 합성 데이터는 실제 데이터의 통계적 특성, 상관관계, 분포…
대표성 편향 (Representativeness Bias) 1. 개요 대표성 편향(Representativeness Bias)이란 어떤 대상이 특정 집단의 전형적인 특성과 유사하다는 이유만으로, 그 대상이 해당 집단에 속할 확률이 높다고 판단하는 인지적 오류를 의미한다. 이는 사람들이 확률적 판단을 내릴 때 수학적인 확률 계산보다는 직관적인 '유사성'이나 …
예측 불확실성 (Predictive Uncertainty) 1. 개요 예측 불확실성(Predictive Uncertainty)이란 통계적 모델이나 머신러닝 알고리즘이 특정 입력값에 대해 출력값을 예측할 때, 그 예측 결과가 얼마나 불확실한지를 나타내는 척도이다. 일반적으로 '예측 오차(Prediction Error)'가 실제 정답과 예측값 사이의 거리라는 …
가중치 평균 개요 가중치 평균(Weighted Average)은 단순 평균(Arithmetic Mean)과 달리 각 신뢰도를 반영하기 위해 가중치(Weight)를 부여하여 계산하는 평균 방식입니다. 특히 데이터과학과 모델 평가 분야에서 다양한 지표를 종합하거나, 클래스 불균형이 있는 분류 문제에서 성능을 평가할 때 널리 사용됩니다. 단순 평균은 모든 데이터…
단일 활성화 개요 단일 활성화(One-Hot Encoding)는 범주형 데이터(categorical data)를 기계학습 모델이 처리할 수 있도록 수치형 형태로 변환하는 대적인 데이터 인코딩 기 중 하나입니다.주형 변수는 특정한 카테고리나 레이블을 가지는 데이터로, 예를 들어 "성별(남, 여)", "지역(서울, 부산, 대구)" 등이 있습니다. 그러나 대부분…
데이터 마이닝 개요 데이터 마이닝(Data Mining)은 대량의 데이터에서 숨겨진 패턴, 상관관계, 추세 및 유용한 정보를 추출하는 데이터 분석 기술의 한 분야입니다. 이는 데이터베이스 지식 발견(Knowledge Discovery in Databases KDD) 프로세스의 핵심 단계로, 통계학, 기계학습, 데이터베이스 기술 등이 융합된 다학제적 접근을 …
Term Frequency (단어 빈도) 1. 개요 Term Frequency(TF, 단어 빈도)란 특정 문서 내에서 특정 단어가 등장하는 횟수를 측정하는 지표로, 텍스트 마이닝과 정보 검색(Information Retrieval)에서 문서의 주제나 특징을 파악하기 위해 사용하는 가장 기본적인 통계적 수치이다. TF의 핵심 목적은 "특정 단어가 문서 내에서…
라이선스 (License) 1. 개요 라이선스란 저작권자(권리자)가 타인에게 자신의 저작물을 특정 조건하에 사용할 수 있도록 허락하는 법적 권한 부여 계약을 의미한다. 많은 이들이 저작권(Copyright)과 라이선스를 혼동하지만, 저작권은 창작물에 대해 법적으로 당연히 부여되는 '배타적 권리'인 반면, 라이선스는 그 권리를 가진 사람이 타인에게 '사용 허…
Z-score 표준화 Z-score 표준화(Z-score Standardization)란 데이터의 평균을 0, 표준편차를 1이 되도록 변환하는 데이터 전처리 과정입니다. 서로 다른 척도(Scale)를 가진 변수들을 동일한 기준으로 비교하거나, 특정 값이 전체 데이터 분포에서 어느 정도 위치에 있는지 파악하는 것을 목적으로 합니다. 수식 및 원리 Z-scor…
ARIMA (자기회귀 누적 이동평균 모델) 1. 개요 ARIMA(AutoRegressive Integrated Moving Average) 모델은 시계열 데이터의 과거 값과 예측 오차를 이용하여 미래의 값을 예측하는 통계적 분석 모델이다. 특히 비정상 시계열을 차분을 통해 정상 시계열로 변환하여 분석하는 모델이라는 점이 핵심적인 정체성이다. 시계열 데이터가…
UMAP (Uniform Manifold Approximation and Projection) 1. 개요 UMAP(Uniform Manifold Approximation and Projection)은 위상수학적 구조를 기반으로 하는 비선형 차원 축소(Dimension Reduction) 알고리즘으로, 고차원 데이터를 저차원(주로 2차원 또는 3차원)으로 투…
EJN (사기 수법) 1. 개요 EJN은 최근 특정 사기 조직이나 커뮤니티 사이에서 명명되어 알려진 수법으로, SNS, 메신저, 데이팅 앱 등을 통해 접근하여 고수익 알바나 투자 기회를 제공한다고 속인 뒤 가짜 거래 플랫폼 가입을 유도해 금전을 갈취하는 전형적인 사회공학적(Social Engineering) 금융 사기 수법이다. 이는 기술적 취약점이 아닌 …
SARIMA (Seasonal AutoRegressive Integrated Moving Average) 1. 개요 SARIMA는 시계열 데이터의 추세(Trend)뿐만 아니라 주기적으로 반복되는 계절성(Seasonality) 패턴을 동시에 모델링하기 위해 설계된 통계적 예측 모델이다. 기존의 [[ARIMA]](AutoRegressive Integrated …
후면 문구 (Back Cover Copy) 1. 개요 후면 문구란 도서의 뒷표지에 배치되는 홍보용 텍스트로, 잠재적 독자에게 책의 핵심 내용과 가치를 전달하여 최종적인 구매 결정을 유도하는 마케팅 도구이다. 출판물에서 후면 문구는 단순한 요약본이 아니라, 앞표지가 시각적 호기심을 자극했다면 후면 문구는 논리적·감성적 설득을 통해 구매라는 행동으로 연결하는 …
목표 기반 인코딩 목표 기반 인코딩(Target-based Encoding)은 범주형 변수(Categorical Variable)를 수치형 변수로 변환 데이터 인코딩법 중 하나로, 특히 지도 학습(Supervised Learning)에서 목표 변수(Target Variable)와의 관계를 활용하여 인코딩을하는 방법입니다. 이 방은 단순한 레이블 인코딩(La…
스터지스 규칙 (Sturges' rule) 스터지스 규칙은 연속형 데이터의 도수분포표를 작성하거나 히스토그램을 그릴 때, 데이터의 총 개수를 바탕으로 최적의 계급(Bin) 수를 결정하기 위해 사용되는 통계적 공식이다. 1. 개요 데이터 분석 과정에서 원시 데이터를 구간별로 나누어 빈도를 측정하는 도수분포표(Frequency Distribution Table…
파리 협정 (Paris Agreement) 1. 개요 [[파리 협정]](Paris Agreement)은 지구 온난화로 인한 기후 위기에 대응하기 위해 2015년 제21차 [[유엔기후변화협약]] 당사국 총회([[COP21]])에서 채택된 역사적인 국제 환경 협약이다. 이 협정의 핵심 목표는 산업화 이전 수준 대비 지구 평균 기온 상승폭을 2°C보다 훨씬 낮게…
파리 협정 (Paris Agreement) 개요 파리 협정(Paris Agreement)은 2015년 12월 12일 프랑스 파리에서 열린 제21차 유엔 기후 변화 협약 당사국 총회(COP21)에서 채택된 국제적 기후 변화 대응 협정입니다. 이 협정은 교토 의정서를 대체하며, 전 세계 모든 국가가 참여하여 지구 평균 기온 상승을 산업화 이전 대비 1.5°C …