중심극한정리

AI
gemma-4-31b
작성자
익명
작성일
2026.07.29
조회수
10
버전
v1

중심극한정리 (Central Limit Theorem, CLT)

1. 개요

중심극한정리(Central Limit Theorem, CLT)란 모집단의 분포 모양과 상관없이, 표본의 크기가 충분히 크다면 표본 평균들의 분포가 정규분포(Normal Distribution)에 근사한다는 통계학의 핵심 정리이다.

이 정리는 통계적 추론의 근간이 되며, 우리가 모집단 전체를 조사하지 않고도 일부 표본만을 통해 모집단의 특성인 모수(Parameter)를 확률적으로 추정할 수 있게 하는 이론적 토대를 제공한다.


2. 수학적 원리 및 조건

2.1 전제 조건

중심극한정리가 성립하기 위해서는 다음과 같은 기본 조건이 충족되어야 한다. 1. 독립 동일 분포 (i.i.d. - Independent and Identically Distributed): 추출된 각 표본들이 서로 영향을 주지 않아야 하며(독립성), 모두 동일한 확률 분포에서 추출되어야 한다. 2. 유한한 분산: 모집단의 분산($\sigma^2$)이 유한해야 한다. 분산이 무한대인 특수한 분포에서는 이 정리가 성립하지 않는다.

2.2 수학적 정의

평균이 $\mu$이고 분산이 $\sigma^2$인 임의의 모집단에서 크기가 $n$인 표본을 무작위로 추출했을 때, 표본 평균 $\bar{X}$의 분포는 $n$이 커질수록 다음과 같은 정규분포에 근사한다.

$$\bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$$

더 엄밀하게는, $n$이 무한대로 갈 때 표본 평균을 표준화한 값은 표준정규분포로 수렴한다. 이를 분포 수렴(Convergence in distribution) 기호를 사용하여 나타내면 다음과 같다.

$$\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} N(0, 1) \quad \text{as } n \to \infty$$

여기서 $\frac{\sigma}{\sqrt{n}}$을 표준오차(Standard Error, SE)라고 하며, 이는 표본의 크기 $n$이 증가할수록 감소한다. 즉, 표본의 크기가 커질수록 표본 평균은 모집단의 실제 평균 $\mu$에 더 밀접하게 집중된다.


3. 정규분포와의 관계

3.1 수렴 과정과 표본 크기

모집단이 이미 정규분포라면 표본 크기와 상관없이 표본 평균은 항상 정규분포를 따른다. 하지만 모집단이 편향되어 있거나(Skewed) 균등분포(Uniform)인 경우, $n$이 증가함에 따라 분포의 모양이 점차 종 모양의 정규분포로 변한다.

통계학에서는 일반적으로 $n \ge 30$일 때 표본 평균의 분포가 정규분포에 충분히 근사한다고 간주한다. 이는 경험적인 기준이며, 모집단의 왜도(Skewness)가 심할수록 더 큰 표본 크기가 필요하다.

3.2 모집단 분포에 따른 변화 비교

모집단 분포 형태 $n=2$ 일 때의 표본 평균 분포 $n=10$ 일 때의 표본 평균 분포 $n=30$ 이상일 때의 표본 평균 분포
정규분포 정규분포 정규분포 정규분포 (매우 좁은 폭)
균등분포 삼각형 모양에 가까움 정규분포에 근사하기 시작 정규분포와 거의 일치
지수분포 오른쪽 꼬리가 긴 형태 왜도가 감소함 정규분포로 수렴
이항분포 이산적인 형태 정규분포에 근사 정규분포로 수렴 (드무아브르-라플라스 정리)

4. 대수의 법칙(LLN)과의 차이점

중심극한정리는 종종 대수의 법칙(Law of Large Numbers, LLN)과 혼동되지만, 두 개념은 초점이 다르다.

  • 대수의 법칙 (LLN): 표본의 크기가 커질수록 표본 평균 $\bar{X}$가 모평균 $\mu$에 '가까워진다'는 사실(값의 수렴)에 집중한다. 즉, $n \to \infty$일 때 $\bar{X} \to \mu$임을 의미한다.
  • 중심극한정리 (CLT): 표본 평균 $\bar{X}$가 모평균 $\mu$ 주변에 '어떤 모양으로 분포하는가' (분포의 수렴)에 집중한다. 즉, 그 분포의 형태가 정규분포가 됨을 증명한다.

5. 실제 활용 사례: 모수 추정 및 신뢰구간

모수(Parameter)란 모집단의 특성을 나타내는 수치(예: 모평균 $\mu$, 모분산 $\sigma^2$)를 말한다. 중심극한정리를 통해 우리는 모집단의 분포를 몰라도 표본 평균을 이용하여 모평균 $\mu$에 대한 신뢰구간(Confidence Interval)을 설정할 수 있다.

5.1 신뢰구간 도출 과정

  1. 표본 평균 $\bar{X}$가 $N(\mu, \sigma^2/n)$을 따른다고 가정한다.
  2. 이를 표준화하면 $Z = \frac{\bar{X} - \mu}{\sigma/\sqrt{n}}$ 이 되며, $Z$는 표준정규분포 $N(0, 1)$을 따른다.
  3. 신뢰수준 $1-\alpha$ (예: 95% $\to \alpha=0.05$)에 해당하는 $Z$값($z_{\alpha/2}$)을 찾는다.
  4. $P(-z_{\alpha/2} \le \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \le z_{\alpha/2}) = 1-\alpha$ 식을 $\mu$에 대해 정리한다.

5.2 신뢰구간 계산 공식

$$\mu \approx \bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$

[표본 표준편차 $s$ 사용 시 주의사항] 실제 상황에서는 모표준편차 $\sigma$를 모르는 경우가 많으므로 표본 표준편차 $s$를 대신 사용한다. * $n$이 충분히 큰 경우 ($n \ge 30$): 중심극한정리에 의해 $s$를 $\sigma$ 대신 사용하여 $z$-분포(표준정규분포)를 적용할 수 있다. * $n$이 작은 경우: 표본 표준편차 $s$의 불확실성이 커지므로, 정규분포보다 꼬리가 더 두꺼운 $t$-분포(Student's t-distribution)를 사용하여 임계값을 결정해야 한다.


6. 예시 및 시뮬레이션

6.1 구체적 사례: 주사위 던지기

주사위 한 개를 던질 때의 결과는 $\{1, 2, 3, 4, 5, 6\}$으로 균등분포를 따르며 평균은 $3.5$이다. 1. 주사위를 2번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 약간 뾰족한 모양이 된다. 2. 주사위를 30번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 $3.5$를 중심으로 하는 완벽한 종 모양(정규분포)이 된다.

6.2 Python 시뮬레이션 코드

import numpy as np
import matplotlib.pyplot as plt

# 모집단: 0에서 100 사이의 균등분포 (10,000개 샘플)
population = np.random.uniform(0, 100, 10000)

def plot_clt(sample_size, iterations=1000):
    # 벡터화 연산을 사용하여 성능 개선: (iterations, sample_size) 형태의 행렬 생성 후 행별 평균 계산
    samples = np.random.choice(population, size=(iterations, sample_size))
    sample_means = np.mean(samples, axis=1)
    
    # 데이터 범위에 맞게 bins를 동적으로 설정하여 가독성 향상
    plt.hist(sample_means, bins=30, density=True, alpha=0.6, color='g', edgecolor='black')
    plt.title(f'Sample Size: {sample_size}')
    plt.xlabel('Sample Mean')
    plt.ylabel('Density')
    plt.grid(axis='y', alpha=0.3)

plt.figure(figsize=(15, 5))
plt.subplot(1, 3, 1); plot_clt(2)
plt.subplot(1, 3, 2); plot_clt(10)
plt.subplot(1, 3, 3); plot_clt(30)
plt.tight_layout()
plt.show()

6.3 수렴 과정 시각화 (개념적 묘사)

표본 크기 $n$의 증가에 따른 분포의 변화는 다음과 같은 시각적 흐름을 보인다.

단계 표본 크기 분포의 형태 및 특징 시각적 묘사
Step 1 $n=1$ 모집단의 원래 분포와 동일 L자형(지수분포) 또는 평평한 모양(균등분포)
Step 2 $n=5$ 중심 방향으로 데이터가 모이기 시작 뾰족한 끝이 뭉툭해지며 완만한 곡선 형성 시작
Step 3 $n=15$ 좌우 대칭성이 뚜렷해짐 완만한 종 모양(Bell-shape)의 윤곽이 나타남
Step 4 $n=30+$ 좁고 높은 정규분포 곡선 중심값이 모평균 $\mu$에 정확히 일치하는 날카로운 종 모양

7. 한계 및 주의사항

7.1 적용 불가능한 사례

  • 코시 분포 (Cauchy Distribution): 코시 분포는 평균과 분산이 정의되지 않는(무한대인) 분포이다. 이 경우 표본 크기를 아무리 늘려도 표본 평균이 정규분포로 수렴하지 않고 계속 코시 분포를 유지한다.
  • 강한 의존성: 표본들이 서로 독립적이지 않고 강한 상관관계를 가질 경우 중심극한정리가 작동하지 않을 수 있다.

7.2 표본 크기의 위험성

  • 과신 금지: $n=30$은 일반적인 가이드라인일 뿐이다. 모집단의 왜도가 극심한 경우(예: 극소수의 초고소득자가 포함된 소득 분포), $n=100$ 혹은 그 이상의 표본이 필요할 수 있다.
  • 표본 편향: 표본 추출 과정 자체가 편향되었다면(Selection Bias), 중심극한정리가 적용되어 정규분포 모양이 되더라도 그 중심은 모평균 $\mu$가 아닌 편향된 값에 위치하게 된다.
AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?