레벤슈타인 거리 개요 레벤슈타인 거리Levenshtein)는 두 문자열 간의 유사도를 측정하는 편집 거리(Edit Distance)의 형태로, 러시아 수학자 블라디미르 레벤슈타인(Vladimir Levenshtein)이 1965년에 제안한 개념이다. 이 거리는 한 문자열을 다른 문자열로 변환하기 위해 필요한 최소 편집 연산 횟수를 계산함으로써 두 문자열의 …
검색 결과
"레벤슈타인 거리"에 대한 검색 결과 (총 12개)
중복 데이터 제 개요데이터 정제(Data Cleaning)는 데이터 분석 및 머신러닝 모델 개발 과정에서 매우 중요한 전처리 단계입니다. 과정에서 데이터의 품질을 높이고, 분석 결과의 신뢰성을 확보하기 위해 다양한 문제를 해결합니다. 그중 중복 데이터 제거(Deduplication)는 동일하거나 매우 유사한 데이터 레코드가 여러 번 존재하는 현상을 식별하고…
WER (Word Error Rate, 단어 오류율) 1. 개요 WER(Word Error Rate, 단어 오류율)은 자동 음성 인식(ASR, Automatic Speech Recognition) 및 기계 번역 시스템의 성능을 측정하기 위해 사용되는 표준 지표로, 정답(Reference)과 결과(Hypothesis) 사이의 단어 단위 차이를 수치화한 것입니…
편집 채널 (Editing Channel) 1. 개요 편집 채널(Editing Channel)이란 전송된 데이터 시퀀스에서 심볼의 값이 변하거나, 일부가 누락되거나, 혹은 임의의 심볼이 추가되어 입력 시퀀스와 출력 시퀀스의 길이가 달라질 수 있는 통신 채널 모델을 의미한다. 일반적인 통신 채널이 심볼의 값 변화(Bit Flip)만을 다루는 것과 달리, 편집…
해밍 거리 (Hamming Distance) 1. 개요 해밍 거리(Hamming Distance)란 길이가 동일한 두 문자열 또는 이진 시퀀스 사이에서 서로 다른 위치에 있는 요소의 개수를 측정하는 거리 함수이다. 1950년 리처드 해밍(Richard Hamming)에 의해 제안되었으며, 두 데이터가 얼마나 다른지를 수치화하여 데이터 전송 과정에서의 오류 …
Levenshtein Distance 개요 레벤슈타인 거리(Levenshtein Distance)는 두 문자열 간의 유사도를 측정하는 데 사용되는 편집 거리(Edit Distance)의 한 형태로, 한 문자열을 다른 문자열로 변환하는 데 필요한 최소한의 편집 연산 횟수를 나타냅니다. 이 개념은 러시아 수학자 블라디미르 레벤슈타인(Vladimir Levens…
블라디미 레벤슈타인 블라디미르 레벤슈인(Vladimir Levenshtein, 935년5월 20일 – 201년 9월2일)은 소련 및 러시아의 유명한 수학자이자 정보 이론 및 오류 정정 코드 분야의 선구자 중 명이다. 그 특히 레벤슈타인 거리(Levenshtein Distance) 널리 알려져, 이 개념은 문자열 간의 유사도를 측정하는 데 핵심적인 역할을 한…
오타 수정 오타 수정(Typographical Error Correction)은 자연어처리(Natural Language, NLP) 분야에서 정규화 기 중 하나로, 입력 텍스트 내에 존재하는 철자 오류나 입력 실수를 자동으로 인식하고 올바른 형태로 교하는 기술을 말. 사용자가 키보드 입력, 음성 인식 오류, 혹은어 능력 부족 등 인해 작성한 텍스트에서 발생…
Damerau-Levenshtein 거리 개요 amerau-Levenshtein 거리(Damerau-Levenshtein Distance)는 두 문자열 간의 유사도를 측정하는 편집 거리(Edit Distance)의 일종으로, 문자열을 서로 변환하기 위해 필요한 최소 편집 연산의 수를 계산한다. 이 거리는 러시아 수학자 블라디미르 레벤슈타인(Vladimir …
삽입 요 자연처리(Natural Language Processing NLP) 분야에서 삽입(Insertion)은 텍스트의 특정 위치 새로운 토큰(token),어, 문장 또는 단위를 추가 편집 연산의 한 형태입니다. 이는계번역,스트 생성, 문장 보완, 오류 수정, 그리고 요약 등 다양한 NLP 작업에서 핵심적인 역할을 하며, 언어의 유창성과 의미의 완전성을 …
Levenshtein 거리 Levenshtein 거리(LD, 레벤슈타인 거리)는 두 문자열 간의 유사도를정하는 데 사용 편집 거리Edit Distance)의 형태로, 하나 문자열을 다른 문자로 변환하는 필요한 최소 편집 연산수를 나타냅니다. 이 개념 1965년 러시아 수학자블라디미르 레슈타인(ladimir Levenshtein)에 의해 제안되었으며, 자연어…
STT 후처리 개요 STT(음성식, Speech-toText)는 인간의 음성을 기계가 인식하여 텍스트로 변환하는 기술입니다. 이 과정에서 음성 신호는 전처리, 특징 추출, 음소 인식, 언어 모델 기반 디코딩 등을 거쳐 최종적으로 텍스트로 출력됩니다. 그러나 이러한 과정에서 발생할 수 있는 오류(예: 발음 유사 단어 오인, 배경 잡음으로 인한 인식 실패, 문…