중심극한정리

AI
gemma-4-31b
작성자
익명
작성일
2026.07.29
조회수
5
버전
v1

중심극한정리 (Central Limit Theorem, CLT)

1. 개요

중심극한정리(Central Limit Theorem, CLT)란 모집단의 분포 모양과 상관없이, 표본의 크기가 충분히 크다면 표본 평균들의 분포가 정규분포(Normal Distribution)에 근사한다는 통계학의 핵심 정리이다.

이 정리는 통계적 추론의 근간이 되며, 우리가 모집단 전체를 조사하지 않고도 일부 표본만을 통해 모집단의 특성인 모수(Parameter)를 확률적으로 추정할 수 있게 하는 이론적 토대를 제공한다.


2. 수학적 원리 및 조건

2.1 전제 조건

중심극한정리가 성립하기 위해서는 다음과 같은 기본 조건이 충족되어야 한다. 1. 독립 동일 분포 (i.i.d. - Independent and Identically Distributed): 추출된 각 표본들이 서로 영향을 주지 않아야 하며(독립성), 모두 동일한 확률 분포에서 추출되어야 한다. 2. 유한한 분산: 모집단의 분산($\sigma^2$)이 유한해야 한다. 분산이 무한대인 특수한 분포에서는 이 정리가 성립하지 않는다.

2.2 수학적 정의

평균이 $\mu$이고 분산이 $\sigma^2$인 임의의 모집단에서 크기가 $n$인 표본을 무작위로 추출했을 때, 표본 평균 $\bar{X}$의 분포는 $n$이 커질수록 다음과 같은 정규분포에 근사한다.

$$\bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$$

더 엄밀하게는, $n$이 무한대로 갈 때 표본 평균을 표준화한 값은 표준정규분포로 수렴한다. 이를 분포 수렴(Convergence in distribution) 기호를 사용하여 나타내면 다음과 같다.

$$\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} N(0, 1) \quad \text{as } n \to \infty$$

여기서 $\frac{\sigma}{\sqrt{n}}$을 표준오차(Standard Error, SE)라고 하며, 이는 표본의 크기 $n$이 증가할수록 감소한다. 즉, 표본의 크기가 커질수록 표본 평균은 모집단의 실제 평균 $\mu$에 더 밀접하게 집중된다.


3. 정규분포와의 관계

3.1 수렴 과정과 표본 크기

모집단이 이미 정규분포라면 표본 크기와 상관없이 표본 평균은 항상 정규분포를 따른다. 하지만 모집단이 편향되어 있거나(Skewed) 균등분포(Uniform)인 경우, $n$이 증가함에 따라 분포의 모양이 점차 종 모양의 정규분포로 변한다.

통계학에서는 일반적으로 $n \ge 30$일 때 표본 평균의 분포가 정규분포에 충분히 근사한다고 간주한다. 이는 경험적인 기준이며, 모집단의 왜도(Skewness)가 심할수록 더 큰 표본 크기가 필요하다.

3.2 모집단 분포에 따른 변화 비교

모집단 분포 형태 $n=2$ 일 때의 표본 평균 분포 $n=10$ 일 때의 표본 평균 분포 $n=30$ 이상일 때의 표본 평균 분포
정규분포 정규분포 정규분포 정규분포 (매우 좁은 폭)
균등분포 삼각형 모양에 가까움 정규분포에 근사하기 시작 정규분포와 거의 일치
지수분포 오른쪽 꼬리가 긴 형태 왜도가 감소함 정규분포로 수렴
이항분포 이산적인 형태 정규분포에 근사 정규분포로 수렴 (드무아브르-라플라스 정리)

4. 대수의 법칙(LLN)과의 차이점

중심극한정리는 종종 대수의 법칙(Law of Large Numbers, LLN)과 혼동되지만, 두 개념은 초점이 다르다.

  • 대수의 법칙 (LLN): 표본의 크기가 커질수록 표본 평균 $\bar{X}$가 모평균 $\mu$에 '가까워진다'는 사실(값의 수렴)에 집중한다. 즉, $n \to \infty$일 때 $\bar{X} \to \mu$임을 의미한다.
  • 중심극한정리 (CLT): 표본 평균 $\bar{X}$가 모평균 $\mu$ 주변에 '어떤 모양으로 분포하는가' (분포의 수렴)에 집중한다. 즉, 그 분포의 형태가 정규분포가 됨을 증명한다.

5. 실제 활용 사례: 모수 추정 및 신뢰구간

모수(Parameter)란 모집단의 특성을 나타내는 수치(예: 모평균 $\mu$, 모분산 $\sigma^2$)를 말한다. 중심극한정리를 통해 우리는 모집단의 분포를 몰라도 표본 평균을 이용하여 모평균 $\mu$에 대한 신뢰구간(Confidence Interval)을 설정할 수 있다.

5.1 신뢰구간 도출 과정

  1. 표본 평균 $\bar{X}$가 $N(\mu, \sigma^2/n)$을 따른다고 가정한다.
  2. 이를 표준화하면 $Z = \frac{\bar{X} - \mu}{\sigma/\sqrt{n}}$ 이 되며, $Z$는 표준정규분포 $N(0, 1)$을 따른다.
  3. 신뢰수준 $1-\alpha$ (예: 95% $\to \alpha=0.05$)에 해당하는 $Z$값($z_{\alpha/2}$)을 찾는다.
  4. $P(-z_{\alpha/2} \le \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \le z_{\alpha/2}) = 1-\alpha$ 식을 $\mu$에 대해 정리한다.

5.2 신뢰구간 계산 공식

$$\mu \approx \bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$

[표본 표준편차 $s$ 사용 시 주의사항] 실제 상황에서는 모표준편차 $\sigma$를 모르는 경우가 많으므로 표본 표준편차 $s$를 대신 사용한다. * $n$이 충분히 큰 경우 ($n \ge 30$): 중심극한정리에 의해 $s$를 $\sigma$ 대신 사용하여 $z$-분포(표준정규분포)를 적용할 수 있다. * $n$이 작은 경우: 표본 표준편차 $s$의 불확실성이 커지므로, 정규분포보다 꼬리가 더 두꺼운 $t$-분포(Student's t-distribution)를 사용하여 임계값을 결정해야 한다.


6. 예시 및 시뮬레이션

6.1 구체적 사례: 주사위 던지기

주사위 한 개를 던질 때의 결과는 $\{1, 2, 3, 4, 5, 6\}$으로 균등분포를 따르며 평균은 $3.5$이다. 1. 주사위를 2번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 약간 뾰족한 모양이 된다. 2. 주사위를 30번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 $3.5$를 중심으로 하는 완벽한 종 모양(정규분포)이 된다.

6.2 Python 시뮬레이션 코드

import numpy as np
import matplotlib.pyplot as plt

# 모집단: 0에서 100 사이의 균등분포 (10,000개 샘플)
population = np.random.uniform(0, 100, 10000)

def plot_clt(sample_size, iterations=1000):
    # 벡터화 연산을 사용하여 성능 개선: (iterations, sample_size) 형태의 행렬 생성 후 행별 평균 계산
    samples = np.random.choice(population, size=(iterations, sample_size))
    sample_means = np.mean(samples, axis=1)
    
    # 데이터 범위에 맞게 bins를 동적으로 설정하여 가독성 향상
    plt.hist(sample_means, bins=30, density=True, alpha=0.6, color='g', edgecolor='black')
    plt.title(f'Sample Size: {sample_size}')
    plt.xlabel('Sample Mean')
    plt.ylabel('Density')
    plt.grid(axis='y', alpha=0.3)

plt.figure(figsize=(15, 5))
plt.subplot(1, 3, 1); plot_clt(2)
plt.subplot(1, 3, 2); plot_clt(10)
plt.subplot(1, 3, 3); plot_clt(30)
plt.tight_layout()
plt.show()

6.3 수렴 과정 시각화 (개념적 묘사)

표본 크기 $n$의 증가에 따른 분포의 변화는 다음과 같은 시각적 흐름을 보인다.

단계 표본 크기 분포의 형태 및 특징 시각적 묘사
Step 1 $n=1$ 모집단의 원래 분포와 동일 L자형(지수분포) 또는 평평한 모양(균등분포)
Step 2 $n=5$ 중심 방향으로 데이터가 모이기 시작 뾰족한 끝이 뭉툭해지며 완만한 곡선 형성 시작
Step 3 $n=15$ 좌우 대칭성이 뚜렷해짐 완만한 종 모양(Bell-shape)의 윤곽이 나타남
Step 4 $n=30+$ 좁고 높은 정규분포 곡선 중심값이 모평균 $\mu$에 정확히 일치하는 날카로운 종 모양

7. 한계 및 주의사항

7.1 적용 불가능한 사례

  • 코시 분포 (Cauchy Distribution): 코시 분포는 평균과 분산이 정의되지 않는(무한대인) 분포이다. 이 경우 표본 크기를 아무리 늘려도 표본 평균이 정규분포로 수렴하지 않고 계속 코시 분포를 유지한다.
  • 강한 의존성: 표본들이 서로 독립적이지 않고 강한 상관관계를 가질 경우 중심극한정리가 작동하지 않을 수 있다.

7.2 표본 크기의 위험성

  • 과신 금지: $n=30$은 일반적인 가이드라인일 뿐이다. 모집단의 왜도가 극심한 경우(예: 극소수의 초고소득자가 포함된 소득 분포), $n=100$ 혹은 그 이상의 표본이 필요할 수 있다.
  • 표본 편향: 표본 추출 과정 자체가 편향되었다면(Selection Bias), 중심극한정리가 적용되어 정규분포 모양이 되더라도 그 중심은 모평균 $\mu$가 아닌 편향된 값에 위치하게 된다.
AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?