검색 결과

"Common Crawl"에 대한 검색 결과 (총 8개)

사전 훈련된 모델

기술 > 인공지능 > 모델 재사용 | 익명 | 2026-07-28 | 조회수 4

사전 훈련된 모델 (Pre-trained Model) 1. 개요 사전 훈련된 모델(Pre-trained Model)이란 방대한 양의 데이터셋을 사용하여 특정 작업(Task)을 수행하도록 미리 학습된 머신러닝 모델을 의미한다. 일반적으로 딥러닝 모델을 처음부터 학습시키는 스크래치 학습(Training from scratch)은 막대한 양의 레이블링된 데이터와…

코퍼스

기술 > 자연어처리 > 기본 개념 | 익명 | 2026-07-26 | 조회수 9

코퍼스 개요 코퍼스(Corpus)는 자연어(NLP, Natural Language Processing) 분에서 핵심적인 자료로, 특정 목적을 위해 체계적으로 수집·정리된 대규모 텍스트 데이터의 집합을 의미한다.수형은 '코퍼스(corpus)', 복수형은 '코퍼스(corpora)'로 사용된다. 자연어처리 시스템은 언어의 구조, 의미, 사용 패턴을 학습하기 위해…

Embedding Layer

기술 > 자연어처리 > 임베딩 | 익명 | 2026-07-14 | 조회수 10

Embedding Layer (임베딩 층) 1. 개요 임베딩 층(Embedding Layer)은 자연어 처리(NLP) 및 딥러닝 모델에서 정수 형태로 인코딩된 범주형 데이터(주로 단어 인덱스)를 고정된 크기의 연속적인 수치형 벡터로 변환하는 신경망 층이다. 컴퓨터는 텍스트를 직접 처리할 수 없으므로 수치화 과정이 필수적이다. 초기에는 단어의 존재 여부만을 …

GPT-3.5

기술 > 인공지능 > 대규모 언어 모델 | 익명 | 2026-01-22 | 조회수 34

GPT-3.5 개요 GPT-3.5는 OpenAI에서 개발한 대규모 언어 모델(Large Language Model, LLM)로, GPT-3 이후의 개선 버전에 해당하는 모델군을 지칭합니다. 정식 명칭은 공개되지 않았으나, OpenAI의 API 및 제품에서 사용되는 모델 중 하나로, 특히 ChatGPT의 초기 버전에 기반을 두고 있습니다. GPT-3.5는 자…

WebText2

기술 > 데이터과학 > 데이터 수집 | 익명 | 2025-09-04 | 조회수 86

WebText2 개요 WebText2는 대규모 텍스트 데이터셋 중 하나로, 주로 자연어(NLP) 및 언어 모델 훈련을 위한 목적으로 개발된 데이터 수집 프로젝트의 결과물입니다. 이 데이터셋은 인터넷 상의 다양한 공개 텍스트 자원을 크롤링하여 구축되었으며, 특히 GPT-2(Generative Pre-trained Transformer 2) 모델의 훈련에 사용…

GPT-3

기술 > 인공지능 > 대규모 언어 모델 | 익명 | 2025-09-02 | 조회수 88

GPT-3 개요 GPT-3Generative Pre-trained Transformer 3는 미국의 인공지 연구 기관인 OpenAI가 2020년 6월에 발표한 대규모 언어 모델arge Language Model, LLM)입니다. GPT-3은 자연어 처리(NLP) 분야에서 획기적인 성능을 보이며, 기존의 언어 모델들과는 차별화된 규모와 능력을 갖추고 있습니다…