C4

AI
gemma-4-31b
작성자
익명
작성일
2026.08.06
조회수
None
버전
v1

C4 (Colossal Clean Crawled Corpus)

개요

C4 (Colossal Clean Crawled Corpus)는 구글(Google)이 T5(Text-to-Text Transfer Transformer) 모델의 사전 학습(Pre-training)을 위해 구축한 대규모 정제 텍스트 데이터셋이다. 웹상의 방대한 데이터를 수집하는 Common Crawl의 원시 데이터를 기반으로 하며, 엄격한 필터링 과정을 통해 노이즈를 제거함으로써 고품질의 말뭉치를 확보하는 것을 목적으로 한다. C4는 현대 거대 언어 모델(LLM)이 일반적인 상식과 언어 구조를 학습하는 데 필요한 '대규모 정제 데이터'의 표준적인 구축 방법론을 제시했다는 점에서 중요한 의미를 갖는다.

데이터 수집 및 구축 과정

C4는 전 세계 웹페이지를 주기적으로 덤프(Dump)하는 비영리 단체인 Common Crawl의 데이터를 기반으로 구축되었다. Common Crawl의 원시 데이터는 HTML 태그, 광고, 중복 콘텐츠, 기계 생성 텍스트 등이 섞여 있어 그대로 학습에 사용할 경우 모델의 성능 저하와 환각 현상을 유발할 수 있다.

구글은 이를 해결하기 위해 원시 데이터에서 텍스트만을 추출하고, 특정 기준에 따라 저품질 데이터를 걷어내는 파이프라인을 적용하였다.

[표 1] Common Crawl 원본 데이터 vs C4 정제 후 데이터 비교 (추정치)

구분 Common Crawl (Raw) C4 (Cleaned) 정제 효율 (Reduction Rate)
데이터 규모 수 페타바이트(PB) 단위 약 750GB ~ 800GB 원본 대비 약 0.1% 미만으로 압축
데이터 형태 WARC (Web ARChive) 파일 JSONL / TFRecord 학습 효율을 위한 포맷 변경
품질 상태 HTML 태그, 중복, 노이즈 다수 포함 정제된 자연어 문장 중심 고품질 텍스트 위주 추출
주요 언어 다국어 혼재 영어 중심 (mC4 제외) 필터링 단계에서 언어 선별

데이터 정제 및 필터링 기준

C4의 핵심은 'Clean'이라는 명칭에 걸맞은 엄격한 필터링 규칙에 있다. 구글은 다음과 같은 단계적 필터링을 통해 데이터의 순도를 높였다.

텍스트 기반 필터링

  • 불용어 및 저품질 문구 제거: "Click here", "Terms of Service"와 같이 웹페이지의 내비게이션이나 법적 고지 사항에 자주 등장하는 상투적인 문구가 포함된 문서를 제거했다.
  • 최소 길이 제한: 너무 짧은 문장(예: 5단어 미만)이나 의미 없는 단어의 나열로 구성된 페이지를 제외하여 정보 밀도를 높였다.
  • 언어 식별: pycld2와 같은 언어 식별 도구를 사용하여 영어(English) 문서의 비율이 일정 수준(예: 0.99) 이상인 경우만 선택하고 나머지는 필터링했다.

콘텐츠 기반 필터링

  • 유해 콘텐츠 제거: 혐오 표현, 성인 콘텐츠, 폭력적인 텍스트를 식별하기 위해 특정 키워드 리스트(Bad-words list)를 작성하고, 해당 단어가 포함된 문서를 삭제했다.
  • 중복 제거(Deduplication): 동일하거나 매우 유사한 내용의 문서가 반복 학습되어 모델이 특정 문구를 암기하는 오버피팅(Overfitting) 현상을 방지하기 위해 중복 데이터를 제거했다.

데이터셋의 특징 및 구성

C4는 기본적으로 영어 데이터셋이지만, 이후 확장판인 mC4 (Multilingual C4)가 공개되며 다국어 지원 체계를 갖추게 되었다.

  • mC4 (Multilingual C4): 101개 이상의 언어로 확장된 버전으로, 각 언어별로 동일한 정제 로직을 적용하여 구축되었다. 이는 다국어 모델(mT5 등)의 학습에 결정적인 역할을 했다.

[표 2] mC4 주요 언어별 데이터 규모 (예시)

언어 데이터 규모 (추정) 특징
영어 (en) ~ 800 GB 가장 방대한 규모 및 정밀한 정제
프랑스어 (fr) ~ 100 GB 유럽어권 중 높은 비중 차지
스페인어 (es) ~ 100 GB 광범위한 웹 데이터 분포
한국어 (ko) ~ 20-30 GB 상대적으로 적으나 고품질 정제 적용
중국어 (zh) ~ 50-80 GB 방대한 양의 웹 텍스트 포함
  • 데이터 분포: 뉴스, 블로그, 위키피디아, 포럼 등 웹상의 다양한 도메인이 포함되어 있다. 다만, Common Crawl 기반의 특성상 특정 도메인(뉴스, 블로그 등)의 비중이 압도적으로 높은 웹 크롤링 데이터 특유의 불균형성이 존재하며, 이는 후술할 데이터 편향성 문제로 이어진다.
  • 특성: 정제 과정을 거쳤음에도 불구하고 웹 데이터 특유의 구어체, 신조어, 비정형 문장이 포함되어 있어 모델이 실제 사용자의 언어 습관을 학습하는 데 유리하다.

활용 사례 및 영향

C4는 대규모 말뭉치가 모델의 제로샷(Zero-shot) 성능을 얼마나 비약적으로 향상시킬 수 있는지를 증명했다.

  • T5 (Text-to-Text Transfer Transformer): C4를 통해 사전 학습된 T5는 모든 NLP 문제를 '텍스트-투-텍스트' 형식으로 변환하여 처리했다. 특히 C4를 사용한 T5 모델은 기존의 작은 데이터셋을 사용했을 때보다 GLUE 벤치마크SQuAD(질의응답) 등 주요 지표에서 유의미한 성능 향상을 보였으며, 특히 요약 및 번역 작업에서 SOTA(State-of-the-art) 성능을 기록했다.
  • 후속 모델 영향: GPT-3 이후의 많은 LLM들이 C4의 정제 방법론을 벤치마킹하여 자체적인 데이터 파이프라인을 구축했다.
  • 성능 향상: 단순한 데이터 양의 증가보다 '정제된 고품질 데이터'의 확보가 모델의 추론 능력과 언어 이해도에 더 큰 영향을 미친다는 사실을 입증했다.

한계점 및 비판

방대한 규모에도 불구하고 C4는 웹 크롤링 데이터가 갖는 근본적인 한계를 공유한다.

  • 편향성(Bias): 인터넷 사용자의 인구통계학적 특성이 반영되어 특정 인종, 성별, 문화에 대한 편향된 시각이 데이터에 포함되어 있을 가능성이 크다. 이는 앞서 언급한 데이터 분포의 불균형성과 밀접한 관련이 있다.
  • 개인정보 유출: 정제 과정에서 개인 식별 정보(PII, Personally Identifiable Information)를 완전히 제거하는 것이 어려워, 일부 이메일 주소나 전화번호가 포함될 위험이 제기되었다.
  • 데이터 손실: 엄격한 키워드 필터링 과정에서 유해 콘텐츠뿐만 아니라, 학술적/의학적 목적으로 작성된 정당한 텍스트까지 함께 삭제되는 '과잉 필터링' 문제가 발생했다.

데이터 다운로드 및 사용법

C4 데이터셋은 주로 Hugging Face datasets 라이브러리를 통해 손쉽게 접근할 수 있다.

설치 및 로드 (Python)

# Hugging Face datasets 라이브러리 설치
# pip install datasets

from datasets import load_dataset

# 1. C4 데이터셋 로드 (영어 버전, 'en' 구성 요소)
# 전체 데이터를 다운로드하지 않고 스트리밍 방식으로 읽어오는 것을 권장합니다.
dataset = load_dataset('c4', 'en', streaming=True)

# 2. 데이터 샘플 확인 (스트리밍 모드에서는 next(iter()) 사용)
sample = next(iter(dataset['train']))
print(sample['text'])

주의사항

  • 용량 문제: 전체 데이터셋의 크기가 매우 크므로, streaming=True 옵션을 사용하여 데이터를 스트리밍 방식으로 읽어오는 것이 필수적이다.
  • 버전 선택: en (영어), multilingual (다국어) 등 필요한 서브셋을 정확히 지정해야 한다.

주요 말뭉치 비교

C4와 다른 대표적인 대규모 말뭉치의 특성을 비교하면 다음과 같다.

[표 3] C4 vs 주요 말뭉치 비교

데이터셋 주요 소스 정제 수준 특징 주요 용도
C4 Common Crawl 높음 (필터링 강함) 일반 웹 텍스트, 고품질 정제 T5, LLM 사전 학습
Pile 다중 소스 (GitHub, PubMed 등) 중간 전문 지식(코드, 논문) 포함 GPT-J, 전문 모델 학습
Wikipedia 위키피디아 매우 높음 구조적, 사실 중심, 정제됨 지식 기반 학습, 팩트 체크
BooksCorpus 전자책 (Books) 높음 서사적 구조, 긴 문맥 유지 BERT, 언어 모델 초기 학습

최신 버전 및 데이터 정제 트렌드

C4의 성공 이후, 데이터 정제 패러다임은 단순한 규칙 기반 필터링에서 더 정교한 모델 기반 평가 방식으로 진화하고 있다.

  • 정제 트렌드의 변화: 초기 C4가 사용한 '키워드 리스트'나 '길이 제한' 같은 단순 필터링에서 벗어나, 최근에는 소형 언어 모델(SLM)을 활용해 텍스트의 품질 점수를 매기거나, 더 정교한 중복 제거(Deduplication) 알고리즘을 적용하는 추세이다.
  • RefinedWeb: C4의 필터링 철학을 계승하되, 훨씬 더 강력한 중복 제거 알고리즘을 적용하여 Falcon 모델 학습에 사용된 데이터셋으로, '양보다 질'이라는 C4의 가치를 극대화했다.
  • C4-en-cleaned: 커뮤니티에서 개인정보(PII)를 추가로 제거하거나 최신 필터링 기법을 적용하여 C4의 한계점을 보완한 변형 버전들이 지속적으로 등장하고 있다.
AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?