단일 활성화 개요 단일 활성화(One-Hot Encoding)는 범주형 데이터(categorical data)를 기계학습 모델이 처리할 수 있도록 수치형 형태로 변환하는 대적인 데이터 인코딩 기 중 하나입니다.주형 변수는 특정한 카테고리나 레이블을 가지는 데이터로, 예를 들어 "성별(남, 여)", "지역(서울, 부산, 대구)" 등이 있습니다. 그러나 대부분…
검색 결과
"레이블"에 대한 검색 결과 (총 168개)
Web Content Accessibility Guidelines (WCAG) Web Content Accessibility Guidelines (WCAG)는 장애인, 고령자 등 모든 사용자가 웹 콘텐츠에 동등하게 접근하고 이용할 수 있도록 W3C(World Wide Web Consortium)에서 제정한 국제 웹 콘텐츠 접근성 지침이다. 1. 개요 WCA…
인공지능의 편향과 차별 (AI Bias and Discrimination) 1. 개요 인공지능의 편향과 차별이란 AI 모델이 학습 데이터의 불균형이나 알고리즘의 설계 결함으로 인해 특정 보호 집단(Protected Group, 인종, 성별, 연령, 종교 등)에 대해 체계적으로 불리하거나 왜곡된 결과를 출력하는 현상을 의미한다. 현대 사회에서 AI는 채용, …
목표 기반 인코딩 목표 기반 인코딩(Target-based Encoding)은 범주형 변수(Categorical Variable)를 수치형 변수로 변환 데이터 인코딩법 중 하나로, 특히 지도 학습(Supervised Learning)에서 목표 변수(Target Variable)와의 관계를 활용하여 인코딩을하는 방법입니다. 이 방은 단순한 레이블 인코딩(La…
선호도 학습 (Preference Learning) 1. 개요 선호도 학습(Preference Learning)이란 개별 항목에 대한 절대적인 수치(Score)를 예측하는 대신, 두 개 이상의 항목 간의 상대적인 우선순위나 선호 관계를 학습하는 머신러닝의 한 분야이다. 일반적인 회귀(Regression) 모델이 "이 항목의 점수는 85점이다"라는 절대값을 …
이진 분류 (Binary Classification) 1. 개요 이진 분류(Binary Classification)란 주어진 데이터를 두 개의 서로 배타적인 클래스(Class) 중 하나로 분류하는 [[지도 학습]](Supervised Learning)의 한 형태이다. 일반적으로 정답 레이블은 0과 1, 혹은 'Positive(긍정/참)'와 'Negative…
편향 요 머신러닝에서 편향(Bias)은 모델이 학습 데이터에서 실제 패턴을 얼마나 정확하게영하는지를 나타내는 중요한 개념이다. 일반적으로 편향은 모델의 예측 값과 관측 값 사이의 평균적인 차이를 의미하며, 낮은 편향은 모델이 데이터를 잘 학습하고 있음을, 높은 편향은 모델이 데이터의 실제 구조를 간과하고 있다는 것을 나타낸다. 편향은 머신러닝 모델의 성능을…
범주형 변수 개요 범주형 변수(Categorical Variable)는 데이터 과학과 통계학에서 중요한 데이터 유형 중 하나로, 특정 범주나 그룹에 속하는 값을 가지는 변수를 의미합니다. 이 변수는 정량적인 수치가 아닌 정성적인 속성을 표현하며, 데이터 분석, 머신러닝 모델링, 데이터 시각화 등 다양한 과정에서 핵심적인 역할을 합니다. 예를 들어, 사람의 …
민감 속성 (Sensitive Attributes) 1. 개요 민감 속성(Sensitive Attributes)이란 인종, 성별, 종교, 정치적 견해 등 개인의 정체성과 밀접하게 연관되어 있으며, 이를 근거로 차별이나 편견이 발생할 가능성이 높은 데이터 특성을 의미한다. 인공지능(AI) 및 데이터 분석 맥락에서 민감 속성은 모델의 예측 결과가 특정 집단에 …
BERT (Bidirectional Encoder Representations from Transformers) BERT(Bidirectional Encoder Representations from Transformers)는 Google AI Language 팀에서 개발한 언어 이해를 위한 양방향 사전 학습 모델입니다. 기존의 언어 모델들이 텍스트를 왼쪽에…
요약 개요 자연어처리(Natural Language, NLP)에서 요약ummarization)은 긴 텍스트의 핵심 정보를 간결하고 이해하기 쉬 형태로 재구하는 기술을 의미. 이는 문서,스 기사,고서, 연구 논문 등 다양한 텍스트 자료의 정보를 효율적으로 전달하는 데 중요한 역할을 하며, 정보 폭증 시대에 사용자들이 빠르게 주요 내용을 파악할 수 있도록 돕습…
자기지도학습 (Self-Supervised Learning) 자기지도학습(Self-Supervised Learning, SSL)은 데이터 자체에서 정답(Label)을 생성하여 모델을 학습시키는 머신러닝 기법으로, 명시적인 외부 레이블 없이 데이터의 내재적 구조를 통해 표현 학습(Representation Learning)을 수행하는 방법론이다. 1. 개요 …
DataFrame 개요 DataFrame(데이터프레임)은 데이터 과학 및 분석 분야에서 널리 사용되는 2차원 레이블이 붙은 표 형식 데이터 구조입니다. 행(Row)과 열(Column)로 구성되며, 각 열은 서로 다른 데이터 타입(정수, 실수, 문자열, 불리언, 날짜 등)을 가질 수 있습니다. DataFrame은 R 언어의 data.frame에서 유래했으며,…
VC 이론 VC 이론(Vapnik-Chervonenkis Theory)은 통계적 학습 이론의 핵심 기반 중 하나로, 머신러닝 모델의 일반화 능력을 수학적으로 분석하는 데 중요한 역할을. 이 이론 블라드미르 바프니크(Vladimir Vapnik)와 알세이 체르보넨키스lexey Chervonenkis가 190년대 초반에 제안하였으며, 특히 모델의 복잡성과 학습…
품사 태깅 (Part-of-Speech Tagging) 1. 개요 품사 태깅(Part-of-Speech Tagging, POS Tagging)이란 자연어 처리(NLP) 과정에서 텍스트의 각 단어(또는 형태소)에 대해 문법적 범주인 품사를 할당하는 과정을 말한다. 이는 텍스트 분석의 가장 기초적인 단계 중 하나로, 단어의 표면적인 형태뿐만 아니라 문맥 내에서…
정규화 개요 정규화(Normalization) 자연어 처리(Natural Language Processing, N)에서 텍스트 전처리의 핵심 단계 중 하나로, 다양한 형태의 텍스트를 일관된 형식으로 변환하여 분석의 정확도 효율성을 높이는 과정을 의미합니다. 원시 텍스트는 사용자 입력, 웹 크롤링, 문서 스캔 등 다양한 경로를 통해 수집되며, 이 과정에서 오…
대화 상태 추적 (Dialogue State Tracking, DST) 1. 개요 대화 상태 추적(Dialogue State Tracking, DST)은 목적 지향 대화 시스템(Task-oriented Dialogue System)에서 사용자의 입력과 이전 대화 이력을 분석하여, 사용자의 현재 의도와 요구사항을 정형화된 상태(State)로 유지하고 업데이트…
AI Fairness 360 (AIF360) Toolkit 1. 개요 AI Fairness 360 (AIF360)은 IBM에서 개발한 오픈소스 라이브러리로, 머신러닝 모델의 학습 및 추론 과정에서 발생할 수 있는 편향성(Bias)을 탐지하고 이를 완화(Mitigation)하기 위한 포괄적인 도구 모음이다. 현대 인공지능 시스템은 학습 데이터에 포함된 인간의…
데이터 변환 (Data Transformation) 1. 개요 데이터 변환(Data Transformation)이란 수집된 원시 데이터(Raw Data)를 분석, 모델링 또는 저장 목적에 적합한 형식이나 구조로 변경하는 과정을 의미합니다. 데이터 과학의 전처리(Preprocessing) 단계에서 핵심적인 역할을 하며, 데이터의 품질을 높이고 머신러닝 알고리…
WCAG (Web Content Accessibility Guidelines) WCAG(Web Content Accessibility Guidelines)는 웹 콘텐츠와 웹 애플리케이션의 접근성을 높이기 위해 W3C 산하 웹 접근성 이니셔티브(WAI)가 개발한 국제 표준 가이드라인으로, 장애가 있는 사용자도 웹 정보를 인지하고 조작하며 이해할 수 있도록 하…