검색 결과

"Deduplication"에 대한 검색 결과 (총 10개)

중복 데이터 제거

기술 > 데이터과학 > 데이터 정제 | 익명 | 2026-08-04 | 조회수 1

중복 데이터 제 개요데이터 정제(Data Cleaning)는 데이터 분석 및 머신러닝 모델 개발 과정에서 매우 중요한 전처리 단계입니다. 과정에서 데이터의 품질을 높이고, 분석 결과의 신뢰성을 확보하기 위해 다양한 문제를 해결합니다. 그중 중복 데이터 제거(Deduplication)는 동일하거나 매우 유사한 데이터 레코드가 여러 번 존재하는 현상을 식별하고…

Prometheus

기술 > 소프트웨어 > 모니터링 | 익명 | 2026-08-03 | 조회수 14

Prometheus (프로메테우스) 1. 개요 [[Prometheus]]는 SoundCloud에서 개발하여 현재는 [[CNCF]](Cloud Native Computing Foundation)의 졸업(Graduated) 프로젝트로 관리되고 있는 오픈소스 시스템 모니터링 및 알림 툴킷입니다. 주로 시계열 데이터([[TSDB]])를 수집하고 저장하며, 강력한 …

유사도 분석

기술 > 데이터과학 > 데이터 분석 | 익명 | 2026-07-31 | 조회수 7

유사도 분석 개요 유사도 분석(Similarity Analysis)은 두 개 이상의 데이터 객체 간의 유사한 정도를 정량적으로 측정하고 평가하는 데이터 분석 기법입니다.는 데이터 과학, 머신러닝, 검색, 텍스트 마이닝, 추천 시스템 등 다양한 분야에서 핵심적인 역할을 수행합니다. 유사도 분석의 목적은 객체 간의 공통점이나 차이점을 파악하여 군집화, 분류, …

ZFS

기술 > 데이터관리 > 파일시스템 | 익명 | 2026-07-28 | 조회수 3

ZFS (Zettabyte File System) ZFS는 Sun Microsystems에서 개발한 통합 파일 시스템이자 논리 볼륨 관리자(LVM)로, 대규모 데이터 저장소의 무결성 보장과 확장성, 관리 편의성을 극대화하기 위해 설계된 차세대 스토리지 솔루션입니다. 현재는 오픈 소스 프로젝트인 OpenZFS를 통해 리눅스, FreeBSD 등 다양한 OS에서…

NexStorage SDS (소프트웨어 정의 스토리지 솔루션) 1. 개요 NexStorage SDS는 하드웨어 종속성을 제거하고 소프트웨어 계층에서 스토리지 자원을 관리 및 제어하는 엔터프라이즈급 소프트웨어 정의 스토리지([[소프트웨어 정의 스토리지|Software-Defined Storage]], SDS) 솔루션입니다. 본 솔루션은 기존의 전용 스토리지 …

우선순위 기반 알림 (Priority-based Notification) 1. 개요 우선순위 기반 알림이란 시스템 모니터링 중 발생하는 수많은 이벤트 중 중요도와 긴급도에 따라 등급을 부여하고, 각 등급에 최적화된 전달 경로와 대응 방식을 차등 적용하는 알림 관리 체계이다. 현대적인 마이크로서비스 아키텍처(MSA) 환경에서는 수천 개의 메트릭이 실시간으로 …

데이터 품질 개선

기술 > 데이터과학 > 데이터 정제 | 익명 | 2026-06-20 | 조회수 12

데이터 품질 개선 (Data Quality Improvement) 개요 데이터 품질 개선(Data Quality Improvement)은 데이터의 정확성, 일관성, 완전성, 적시성 및 신뢰성을 높이기 위해 수행되는 체계적인 프로세스입니다. 현대 데이터 과학 및 비즈니스 인텔리전스(BI) 환경에서 '쓰레기 입력, 쓰레기 출력(Garbage In, Garbag…

가상 스토리지

기술 > 가상화 > 가상 하드웨어 | 익명 | 2026-06-20 | 조회수 11

가상 스토리지 (Virtual Storage) 개요 가상 스토리지(Virtual Storage)는 물리적인 저장 장치의 자원을 논리적으로 통합하고 추상화하여, 소프트웨어 정의된 단일 저장 풀로 제공하는 기술입니다. 전통적인 스토리지 아키텍처에서 각 서버나 애플리케이션이 전용 물 disks에 직접 접근하는 방식과 달리, 가상 스토리지는 물리적 하드웨어의 세부…

CityHash

기술 > 데이터구조 > 해시 함수 | 익명 | 2026-06-20 | 조회수 20

CityHash CityHash는 Google에서 개발한 해시 함수의 계열로, 특히 메모리 내 데이터 구조(예: 해시 테이블)에서의 빠른 연산 속도와 높은 품질의 분산 성능을 목표로 설계되었습니다. 이 함수는 64비트 및 128비트 해시 값을 생성할 수 있으며, 특히 짧은 문자열에 대해 뛰어난 성능을 보입니다. CityHash는 MurmurHash와 함께 …

해시

기술 > 데이터과학 > 분석 | 익명 | 2025-07-14 | 조회수 155

해시 개요 해시는 데이터를 고정된 길이의 숫자 또는 문자열로 변환하는 알고리즘입니다. 이 과정은 입력값에 관계없이 일관된 출력을 생성하며, 주로 데이터 검증, 인덱싱, 보안 등 다양한 분야에서 활용됩니다. 특히 데이터 과학에서는 해시를 통해 데이터 무결성 확인, 중복 제거, 효율적인 저장/검색 등을 수행합니다. 해시의 정의와 특징 1. 기본 개념 해시는 입…