가중치 평균 개요 가중치 평균(Weighted Average)은 단순 평균(Arithmetic Mean)과 달리 각 신뢰도를 반영하기 위해 가중치(Weight)를 부여하여 계산하는 평균 방식입니다. 특히 데이터과학과 모델 평가 분야에서 다양한 지표를 종합하거나, 클래스 불균형이 있는 분류 문제에서 성능을 평가할 때 널리 사용됩니다. 단순 평균은 모든 데이터…
검색 결과
"DataFrame"에 대한 검색 결과 (총 73개)
제2사분위수 (Second Quartile) 제2사분위수(Second Quartile, )는 데이터를 4등분 하는 세 개의 지점 중 두 번째 지점으로, 전체 데이터의 정확히 50%가 이 값보다 작거나 같고 나머지 50%가 이 값보다 크거나 같은 지점을 의미한다. 1. 정의 및 개념 분위수(Quantile)란 전체 데이터를 크기 순으로 나열했을 때 특정 비율…
단일 활성화 개요 단일 활성화(One-Hot Encoding)는 범주형 데이터(categorical data)를 기계학습 모델이 처리할 수 있도록 수치형 형태로 변환하는 대적인 데이터 인코딩 기 중 하나입니다.주형 변수는 특정한 카테고리나 레이블을 가지는 데이터로, 예를 들어 "성별(남, 여)", "지역(서울, 부산, 대구)" 등이 있습니다. 그러나 대부분…
데이터 형식 변환 (Data Format Conversion) 1. 개요 데이터 형식 변환이란 특정 소프트웨어나 시스템에서 생성된 데이터의 구조와 표현 방식(Format)을 다른 시스템이나 애플리케이션에서 인식하고 처리할 수 있는 다른 형식으로 변경하는 과정을 의미한다. 현대의 데이터 생태계는 다양한 언어와 플랫폼으로 구성되어 있어, 서로 다른 시스템 간의…
목표 기반 인코딩 목표 기반 인코딩(Target-based Encoding)은 범주형 변수(Categorical Variable)를 수치형 변수로 변환 데이터 인코딩법 중 하나로, 특히 지도 학습(Supervised Learning)에서 목표 변수(Target Variable)와의 관계를 활용하여 인코딩을하는 방법입니다. 이 방은 단순한 레이블 인코딩(La…
반복 측정 (Repeated Measures) 1. 개요 반복 측정(Repeated Measures)이란 동일한 실험 대상(Subject)에 대하여 서로 다른 조건이나 시간적 간격을 두고 동일한 변수를 두 번 이상 측정하는 연구 설계 방식이다. 일반적인 독립 표본 설계(Between-subjects design)가 서로 다른 집단 간의 평균 차이를 비교하는…
설계행렬 (Design Matrix) 1. 개요 설계행렬(Design Matrix)란 통계학 및 선형 모델에서 독립 변수(Independent Variables, Features)들을 행렬 형태로 구조화하여 모델의 파라미터를 효율적으로 추정하기 위해 사용하는 행렬이다. 2. 수학적 정의 및 구조 설계행렬 는 개의 관측치(Observation)와 개의 특성(…
조정 결정계수 (Adjusted R-squared) 조정 결정계수(Adjusted R-squared)는 회귀 분석에서 모델의 설명력을 나타내는 결정계수( )가 독립 변수의 개수가 증가함에 따라 무조건적으로 상승하는 단점을 보완하기 위해, 변수 개수에 따른 페널티를 부여하여 계산한 지표이다. 1. 개요 회귀 분석의 목적은 독립 변수( )들이 종속 변수( )의…
Plotly 1. 개요 Plotly는 데이터 분석 및 시각화를 위해 설계된 오픈 소스 인터랙티브 그래프 라이브러리로, 웹 브라우저 기반의 동적인 시각화 결과물을 생성하는 도구입니다. 정적인 이미지를 생성하는 기존 라이브러리와 달리, 사용자가 그래프와 직접 상호작용할 수 있는 인터랙티브(Interactive) 기능을 제공하는 것이 핵심입니다. Plotly는 …
범주형 변수 개요 범주형 변수(Categorical Variable)는 데이터 과학과 통계학에서 중요한 데이터 유형 중 하나로, 특정 범주나 그룹에 속하는 값을 가지는 변수를 의미합니다. 이 변수는 정량적인 수치가 아닌 정성적인 속성을 표현하며, 데이터 분석, 머신러닝 모델링, 데이터 시각화 등 다양한 과정에서 핵심적인 역할을 합니다. 예를 들어, 사람의 …
불규칙성 (시계열 분석) 1. 개요 본 문서는 시계열 분석(Time Series Analysis) 관점에서의 불규칙성(Irregularity)을 다룬다. 시계열 분석에서 불규칙성이란 데이터의 전체적인 흐름을 결정하는 추세(Trend)나 일정한 주기로 반복되는 계절성(Seasonality)으로 설명되지 않는 무작위적인 변동 성분을 의미한다. 시계열 데이터는 …
AI Fairness 360 (AIF360) Toolkit 1. 개요 AI Fairness 360 (AIF360)은 IBM에서 개발한 오픈소스 라이브러리로, 머신러닝 모델의 학습 및 추론 과정에서 발생할 수 있는 편향성(Bias)을 탐지하고 이를 완화(Mitigation)하기 위한 포괄적인 도구 모음이다. 현대 인공지능 시스템은 학습 데이터에 포함된 인간의…
AI 모델 규제 (AI Model Regulation) 1. 개요 및 정의 AI 모델 규제란 인공지능 기술이 사회 전반에 미치는 영향력을 고려하여, AI 시스템의 개발, 배포 및 사용 과정에서 발생할 수 있는 위험을 관리하고 법적·윤리적 기준을 준수하도록 강제하는 일련의 제도적 장치를 의미한다. 인공지능 기술은 데이터 기반의 의사결정 능력을 통해 산업 혁신…
Pandas Pandas는 파이썬 기반의 강력한 데이터 분석 및 조작 라이브러리로, 데이터학, 통계 분석, 머신러닝 등 다양한 분야에서 널리 사용됩니다. 특히 구조화된 데이터(예: 테이블 형태의 데이터)를 효율적으로 처리하고 분석할 수 있도록 설계되어 있으며, R의 데이터프레임(data.frame) 개념에서 영감을 받아 개발되었습니다. Pandas는 Num…
numpy 개요 NumPy(Numerical Python의 약자)는 파이썬에서 과학적 계산과 데이터 분석을 위한 핵심 라이브러리 중 하나로, 고성능의 다차 배열 객체(nd)와 이를 효율 다루기 위한 수학적 함수 제공합니다. NumPy는 Python의 기본보다 훨씬 빠르고 메모리 효율적인 배열 연산을 가능하게 하며, 데이터과학, 기계학습, 물리학, 공학 등 …
데이터 변환 (Data Transformation) 1. 개요 데이터 변환(Data Transformation)이란 수집된 원시 데이터(Raw Data)를 분석, 모델링 또는 저장 목적에 적합한 형식이나 구조로 변경하는 과정을 의미합니다. 데이터 과학의 전처리(Preprocessing) 단계에서 핵심적인 역할을 하며, 데이터의 품질을 높이고 머신러닝 알고리…
Shapefile Shapefile(또는 SHP)은 지리정보시스템(GIS) 분야에서 가장 널리 사용되는 벡터 데이터 형식 중 하나입니다. 마이크로소프트社의 소프트웨어 기업인 ESRI(Environmental Systems Research Institute)가 개발하였으며, 1990년대 초에 처음 소개되었습니다. Shapefile은 지리적 공간 데이터(점, …
산점도 (Scatter Plot) 산점도(Scatter Plot)는 데이터 과학 및 통계학에서 두 변수 간의 관계를 시각화하기 위해 가장 널리 사용되는 차트 유형 중 하나입니다. 이 차트는 수평축(X축)과 수직축(Y축)으로 구성된 직교 좌표계에 데이터 포인트를 산점(산포)시켜 표시함으로써, 변수들 사이의 상관관계, 분포 패턴, 이상치(Outlier) 등을 …
파이썬(Python) 파이썬은 높은 가독성과 간결한 문법을 지향하는 인터프리터 방식의 고급 프로그래밍 언어로, 다양한 도메인에서 널리 사용되는 범용 프로그래밍 환경입니다. > 참고: 본 문서는 Python 3.x 시리즈를 기준으로 작성되었습니다. Python 2는 공식 지원이 종료되었으므로 새로운 프로젝트에서는 Python 3를 사용해야 합니다. 파이썬 개…
Series 개요 데이터 과학 및 분석 분야에서 Series는 주로 파이썬의 pandas 라이브러리에서 제공하는 1 차원 라벨링된 배열을 의미합니다. R 언어의 데이터 구조에서 영감을 받아 설계되었으며, 시계열 데이터, 카테고리 데이터, 수치형 데이터 등 다양한 유형의 데이터를 효율적으로 저장하고 처리하는 데 핵심적으로 사용됩니다. 데이터 과학 워크플로우에…