검색 결과

"토큰화"에 대한 검색 결과 (총 102개)

서브워드 토큰화

기술 > 인공지능 > 자연어처리 | 익명 | 2026-08-17 | 조회수 18

서브워드 토큰화 (Subword Tokenization) 1. 개요 서브워드 토큰화(Subword Tokenization)란 텍스트를 단어(Word)보다 작고 문자(Character)보다 큰 단위로 분할하여 처리하는 자연어 처리(NLP)의 토큰화 기법이다. 전통적인 토큰화 방식은 크게 두 가지 한계점을 가지고 있었다. 단어 단위 토큰화(Word-level …

토큰화

기술 > 데이터과학 > 분석 | 익명 | 2025-07-17 | 조회수 179

토큰화 (Tokenization) 개요/소개 토큰화는 자연어 처리(NLP) 및 데이터 분석에서 텍스트를 의미 있는 단위로 나누는 기초적인 프로세스입니다. 이 과정은 텍스트를 컴퓨터가 이해할 수 있는 형태로 변환하는 데 필수적이며, 이후 모델 학습, 검색 엔진 구축, 데이터 분석 등 다양한 응용에 활용됩니다. 토큰화는 단어, 문장, 문자 등으로 나뉘며, 각 …

기계학습 입력 형식

기술 > 인공지능 > 머신러닝 | 익명 | 2026-08-17 | 조회수 21

기계학습 입력 형식 기계학습(Machine Learning)은 데이터를 기반으로 패턴을 학습하고 예측 또는 결정을 내리는 인공지능의 핵심 기술이다. 이러한 학습 과정에서 입력 형식(Input Format)은 모델의 성능과 학습 효율성에 직접적인 영향을 미치는 중요한 요소이다. 입력 형식은 데이터가 기계학습 모델에 제공되기 전에 어떤 구조로 가공되어야 하는지…

GPT

기술 > 자연어처리 > 언어 모델링 | 익명 | 2026-08-17 | 조회수 43

GPT 개요 GPT(Generative Pre-trained Transformer)는 오픈AI(OpenAI)에서발한 자연어 처리(NLP) 분야의 대표적인 언어 모델 시리즈로, 트랜스포머(Transformer) 아키텍처를 기반으로 한 생성형 사전 훈련 모델입니다. GPT는 대량의 텍스트 데이터를 이용해 사전 훈련된 후, 특정 작업에 맞게 미세 조정(fine-…

트랜스포머

기술 > 자연어처리 > 언어 모델링 | 익명 | 2026-08-17 | 조회수 11

트랜스포머 개요 트랜스포머(Transformer)는 자연어처리LP) 분야 혁신적인 영향을 미친 딥러닝 아키텍처로, 2017년글과 빌런드 연구소의 연구자들이 발표한 논문 "Attention is All You Need"에서 처음 소개되었습니다. 기존의 순차적 처리 방식을 기반으로 한 순환신경망(RNN)이나 합성곱신경망(CNN)과 달리, 트랜스포머는 어텐션 메…

Embedding

기술 > 인공지능 > 임베딩 | 익명 | 2026-08-12 | 조회수 20

Embedding 개요 임베딩(Embedding)은공지능, 특히 자연어 처리(NLP), 컴퓨터 비전, 추천 시스템 등 다양한 분야에서 핵심적인 기술로 사용되는 고차원 데이터를 저차원의 밀집 벡터(dense vector)로 변환하는 과정을 의미합니다. 이 기술은 원시 데이터(예: 단어, 문장, 이미지, 사용자 행동)의 의미적 또는 구조적 특성을 보존하면서도 …

자동 채점 시스템

교육 > 평가 기술 > 자동 평가 시스템 | 익명 | 2026-08-12 | 조회수 23

자동 채점 시스템 (Automated Scoring System) 자동 채점 시스템이란 컴퓨터 알고리즘과 인공지능 기술을 활용하여 학습자의 응답을 분석하고, 미리 설정된 기준에 따라 점수를 부여하며 피드백을 제공하는 평가 체계를 말한다. 1. 개요 전통적인 수동 채점 방식은 평가자의 전문성에 크게 의존하며, 채점자의 주관이나 컨디션에 따라 결과가 달라지는 …

통사론

언어학 > 언어 구조 > 통사론 | 익명 | 2026-08-10 | 조회수 27

통사론 (Syntax) 1. 개요 통사론(Syntax)은 단어가 결합하여 구, 절, 문장을 형성하는 규칙과 원리를 연구하는 언어학의 한 분과이다. 언어학의 전체 구조 내에서 통사론은 음운론(Phonology, 소리의 체계)과 의미론(Semantics, 의미의 체계) 사이의 가교 역할을 한다. 음운론이 개별 소리의 조합을 다룬다면, 통사론은 그 소리들이 모여…

Elasticsearch

기술 > 검색 엔진 > 全文 검색 | 익명 | 2026-08-07 | 조회수 46

Elasticsearch 1. 개요 Elasticsearch는 Apache Lucene 기반의 분산 검색 및 분석 엔진으로, 대량의 데이터를 실시간으로 저장, 검색, 분석할 수 있도록 설계된 시스템이다. (2021년부터 라이선스가 SSPL 및 Elastic License로 변경되어 현재는 '소스 공개(Source Available)' 모델로 운영되고 있다.…

인증

기술 > 사이버보안 > 신원확인 | 익명 | 2026-08-06 | 조회수 107

인증 (Authentication) 개요 인증(Authentication)은 디지털 환경에서 사용자, 기기, 또는 시스템의 신원(Identity)이 주장한 대로 맞는지 확인하는 보안 프로세스를 의미합니다. 즉, "당신이 정말 당신인가?"라는 질문에 답하는 과정으로, 접근 제어의 첫 번째 관문 역할을 합니다. 인증은 일반적으로 신원 확인(Identificat…

어휘 사전

기술 > 자연어처리 > 데이터 전처리 | 익명 | 2026-08-06 | 조회수 49

어휘 사전 (Vocabulary) 1. 개요 어휘 사전(Vocabulary)이란 자연어 처리(NLP)에서 모델이 처리할 수 있는 모든 고유한 토큰(Token, 텍스트의 최소 의미 단위)의 집합을 의미하며, 텍스트 데이터를 컴퓨터가 이해할 수 있는 수치형 벡터로 변환하기 위한 기초 매핑 테이블 역할을 한다. 2. 어휘 사전 구축 과정 어휘 사전 구축은 원시 …

Doc2Vec

기술 > 인공지능 > 임베딩 | 익명 | 2026-08-05 | 조회수 37

Doc2Vec Doc2Vec은 문서)를 고정된 차원의 밀 벡터(dense vector)로 변환하는 임베딩 기법으로, 자연어 처리(NLP) 분야에서 문서 간의 의미적 유사도를 계산하거나 문서 분류, 군집화 등의 작업에 널리 사용됩니다. 이 기법은 단어를 벡터로 표현하는 Word2Vec의 확장판으로, 단어뿐만 아니라 전체 문서를 하나의 벡터로 표현할 수 있도록…

프롬프트 기반 인터페이스 (Prompt-based Interface) 1. 개요 프롬프트 기반 인터페이스(Prompt-based Interface, 이하 LUI: Language User Interface)란 사용자가 자연어(Natural Language) 형태의 지시문인 '프롬프트'를 입력하여 시스템의 동작을 제어하고 원하는 결과물을 얻어내는 상호작용 방…

Masked Language Modeling

기술 > 인공지능 > 머신러닝 | 익명 | 2026-08-04 | 조회수 37

Masked Language Modeling 개요 Masked Language Modeling(MLM)은 자연어 처리(NLP) 분야에서 사용되는 자기지도 학습(Self-Supervised Learning) 기법으로, 언어 모델을 사전 훈련(Pre-Training)하는 데 핵심적인 역할을 합니다. 이 기법은 입력 텍스트의 일부 토큰을 무작위로 마스킹한 뒤, …

언어적 표현

기술 > 자연어처리 > 의미 분석 | 익명 | 2026-08-04 | 조회수 13

언어적 표현 (Linguistic Expression) 1. 개요 핵심 용어: 상징(Symbol): 실제 대상과 직접적인 물리적 연관성은 없으나, 사회적 약속에 의해 특정 의미를 갖게 된 기호. 언어 체계(Language System): 특정 공동체가 사용하는 문법, 어휘, 음운 규칙의 집합. 언어적 표현이란 인간이 자신의 생각, 감정, 의도 등을 특정한 …

co-occurrence matrix

기술 > 자연어처리 > 통계적 방법 | 익명 | 2026-08-03 | 조회수 19

공출현 행렬 (Co-occurrence Matrix) 1. 개요 공출현 행렬(Co-occurrence Matrix)란 텍스트 데이터 내에서 두 단어가 특정 거리(윈도우) 내에 동시에 등장하는 빈도를 계산하여 행렬 형태로 나타낸 통계적 모델이다. 이는 자연어 처리(NLP)에서 단어의 분포 가설(Distributional Hypothesis, "비슷한 문맥에서…

Lemmatization

기술 > 자연어처리 > 전처리 | 익명 | 2026-08-02 | 조회수 60

Lemmatization 개요 Lemmatization(표제어 추출)은 자연어 처리(Natural Language Processing, NLP)에서 중요한 전처리 기법 중 하나로, 단어를 그 언어적 원형(표제어, lemma)으로 환원하는 과정을 의미합니다. 예를 들어, 영어에서 "running"은 "run", "better"은 "good"의 비교급이므로 원…

DALL·E

기술 > 인공지능 > 생성형 모델 | 익명 | 2026-08-01 | 조회수 29

DALL·E 1. 개요 DALL·E는 [[OpenAI]]가 개발한 텍스트-투-이미지(Text-to-Image) 생성 모델로, 사용자가 입력한 자연어 설명(프롬프트)을 해석하여 이에 부합하는 고해상도 이미지를 생성하는 인공지능 시스템이다. 이 모델의 핵심 목적은 인간의 언어적 개념을 시각적 표현으로 정밀하게 변환함으로써 창작 활동의 효율성을 높이고, 새로운 …

유사도 분석

기술 > 데이터과학 > 데이터 분석 | 익명 | 2026-07-31 | 조회수 35

유사도 분석 개요 유사도 분석(Similarity Analysis)은 두 개 이상의 데이터 객체 간의 유사한 정도를 정량적으로 측정하고 평가하는 데이터 분석 기법입니다.는 데이터 과학, 머신러닝, 검색, 텍스트 마이닝, 추천 시스템 등 다양한 분야에서 핵심적인 역할을 수행합니다. 유사도 분석의 목적은 객체 간의 공통점이나 차이점을 파악하여 군집화, 분류, …