중심극한정리 (Central Limit Theorem, CLT)
1. 개요
중심극한정리(Central Limit Theorem, CLT)란 모집단의 분포 모양과 상관없이, 표본의 크기가 충분히 크다면 표본 평균들의 분포가 정규분포(Normal Distribution)에 근사한다는 통계학의 핵심 정리이다.
이 정리는 통계적 추론의 근간이 되며, 우리가 모집단 전체를 조사하지 않고도 일부 표본만을 통해 모집단의 특성인 모수(Parameter)를 확률적으로 추정할 수 있게 하는 이론적 토대를 제공한다.
2. 수학적 원리 및 조건
2.1 전제 조건
중심극한정리가 성립하기 위해서는 다음과 같은 기본 조건이 충족되어야 한다.
1. 독립 동일 분포 (i.i.d. - Independent and Identically Distributed): 추출된 각 표본들이 서로 영향을 주지 않아야 하며(독립성), 모두 동일한 확률 분포에서 추출되어야 한다.
2. 유한한 분산: 모집단의 분산($\sigma^2$)이 유한해야 한다. 분산이 무한대인 특수한 분포에서는 이 정리가 성립하지 않는다.
2.2 수학적 정의
평균이 $\mu$이고 분산이 $\sigma^2$인 임의의 모집단에서 크기가 $n$인 표본을 무작위로 추출했을 때, 표본 평균 $\bar{X}$의 분포는 $n$이 커질수록 다음과 같은 정규분포에 근사한다.
$$\bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$$
더 엄밀하게는, $n$이 무한대로 갈 때 표본 평균을 표준화한 값은 표준정규분포로 수렴한다. 이를 분포 수렴(Convergence in distribution) 기호를 사용하여 나타내면 다음과 같다.
$$\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} N(0, 1) \quad \text{as } n \to \infty$$
여기서 $\frac{\sigma}{\sqrt{n}}$을 표준오차(Standard Error, SE)라고 하며, 이는 표본의 크기 $n$이 증가할수록 감소한다. 즉, 표본의 크기가 커질수록 표본 평균은 모집단의 실제 평균 $\mu$에 더 밀접하게 집중된다.
3. 정규분포와의 관계
3.1 수렴 과정과 표본 크기
모집단이 이미 정규분포라면 표본 크기와 상관없이 표본 평균은 항상 정규분포를 따른다. 하지만 모집단이 편향되어 있거나(Skewed) 균등분포(Uniform)인 경우, $n$이 증가함에 따라 분포의 모양이 점차 종 모양의 정규분포로 변한다.
통계학에서는 일반적으로 $n \ge 30$일 때 표본 평균의 분포가 정규분포에 충분히 근사한다고 간주한다. 이는 경험적인 기준이며, 모집단의 왜도(Skewness)가 심할수록 더 큰 표본 크기가 필요하다.
3.2 모집단 분포에 따른 변화 비교
| 모집단 분포 형태 |
$n=2$ 일 때의 표본 평균 분포 |
$n=10$ 일 때의 표본 평균 분포 |
$n=30$ 이상일 때의 표본 평균 분포 |
| 정규분포 |
정규분포 |
정규분포 |
정규분포 (매우 좁은 폭) |
| 균등분포 |
삼각형 모양에 가까움 |
정규분포에 근사하기 시작 |
정규분포와 거의 일치 |
| 지수분포 |
오른쪽 꼬리가 긴 형태 |
왜도가 감소함 |
정규분포로 수렴 |
| 이항분포 |
이산적인 형태 |
정규분포에 근사 |
정규분포로 수렴 (드무아브르-라플라스 정리) |
4. 대수의 법칙(LLN)과의 차이점
중심극한정리는 종종 대수의 법칙(Law of Large Numbers, LLN)과 혼동되지만, 두 개념은 초점이 다르다.
- 대수의 법칙 (LLN): 표본의 크기가 커질수록 표본 평균 $\bar{X}$가 모평균 $\mu$에 '가까워진다'는 사실(값의 수렴)에 집중한다. 즉, $n \to \infty$일 때 $\bar{X} \to \mu$임을 의미한다.
- 중심극한정리 (CLT): 표본 평균 $\bar{X}$가 모평균 $\mu$ 주변에 '어떤 모양으로 분포하는가' (분포의 수렴)에 집중한다. 즉, 그 분포의 형태가 정규분포가 됨을 증명한다.
5. 실제 활용 사례: 모수 추정 및 신뢰구간
모수(Parameter)란 모집단의 특성을 나타내는 수치(예: 모평균 $\mu$, 모분산 $\sigma^2$)를 말한다. 중심극한정리를 통해 우리는 모집단의 분포를 몰라도 표본 평균을 이용하여 모평균 $\mu$에 대한 신뢰구간(Confidence Interval)을 설정할 수 있다.
5.1 신뢰구간 도출 과정
- 표본 평균 $\bar{X}$가 $N(\mu, \sigma^2/n)$을 따른다고 가정한다.
- 이를 표준화하면 $Z = \frac{\bar{X} - \mu}{\sigma/\sqrt{n}}$ 이 되며, $Z$는 표준정규분포 $N(0, 1)$을 따른다.
- 신뢰수준 $1-\alpha$ (예: 95% $\to \alpha=0.05$)에 해당하는 $Z$값($z_{\alpha/2}$)을 찾는다.
- $P(-z_{\alpha/2} \le \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \le z_{\alpha/2}) = 1-\alpha$ 식을 $\mu$에 대해 정리한다.
5.2 신뢰구간 계산 공식
$$\mu \approx \bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$
[표본 표준편차 $s$ 사용 시 주의사항]
실제 상황에서는 모표준편차 $\sigma$를 모르는 경우가 많으므로 표본 표준편차 $s$를 대신 사용한다.
* $n$이 충분히 큰 경우 ($n \ge 30$): 중심극한정리에 의해 $s$를 $\sigma$ 대신 사용하여 $z$-분포(표준정규분포)를 적용할 수 있다.
* $n$이 작은 경우: 표본 표준편차 $s$의 불확실성이 커지므로, 정규분포보다 꼬리가 더 두꺼운 $t$-분포(Student's t-distribution)를 사용하여 임계값을 결정해야 한다.
6. 예시 및 시뮬레이션
6.1 구체적 사례: 주사위 던지기
주사위 한 개를 던질 때의 결과는 $\{1, 2, 3, 4, 5, 6\}$으로 균등분포를 따르며 평균은 $3.5$이다.
1. 주사위를 2번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 약간 뾰족한 모양이 된다.
2. 주사위를 30번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 $3.5$를 중심으로 하는 완벽한 종 모양(정규분포)이 된다.
6.2 Python 시뮬레이션 코드
import numpy as np
import matplotlib.pyplot as plt
# 모집단: 0에서 100 사이의 균등분포 (10,000개 샘플)
population = np.random.uniform(0, 100, 10000)
def plot_clt(sample_size, iterations=1000):
# 벡터화 연산을 사용하여 성능 개선: (iterations, sample_size) 형태의 행렬 생성 후 행별 평균 계산
samples = np.random.choice(population, size=(iterations, sample_size))
sample_means = np.mean(samples, axis=1)
# 데이터 범위에 맞게 bins를 동적으로 설정하여 가독성 향상
plt.hist(sample_means, bins=30, density=True, alpha=0.6, color='g', edgecolor='black')
plt.title(f'Sample Size: {sample_size}')
plt.xlabel('Sample Mean')
plt.ylabel('Density')
plt.grid(axis='y', alpha=0.3)
plt.figure(figsize=(15, 5))
plt.subplot(1, 3, 1); plot_clt(2)
plt.subplot(1, 3, 2); plot_clt(10)
plt.subplot(1, 3, 3); plot_clt(30)
plt.tight_layout()
plt.show()
6.3 수렴 과정 시각화 (개념적 묘사)
표본 크기 $n$의 증가에 따른 분포의 변화는 다음과 같은 시각적 흐름을 보인다.
| 단계 |
표본 크기 |
분포의 형태 및 특징 |
시각적 묘사 |
| Step 1 |
$n=1$ |
모집단의 원래 분포와 동일 |
L자형(지수분포) 또는 평평한 모양(균등분포) |
| Step 2 |
$n=5$ |
중심 방향으로 데이터가 모이기 시작 |
뾰족한 끝이 뭉툭해지며 완만한 곡선 형성 시작 |
| Step 3 |
$n=15$ |
좌우 대칭성이 뚜렷해짐 |
완만한 종 모양(Bell-shape)의 윤곽이 나타남 |
| Step 4 |
$n=30+$ |
좁고 높은 정규분포 곡선 |
중심값이 모평균 $\mu$에 정확히 일치하는 날카로운 종 모양 |
7. 한계 및 주의사항
7.1 적용 불가능한 사례
- 코시 분포 (Cauchy Distribution): 코시 분포는 평균과 분산이 정의되지 않는(무한대인) 분포이다. 이 경우 표본 크기를 아무리 늘려도 표본 평균이 정규분포로 수렴하지 않고 계속 코시 분포를 유지한다.
- 강한 의존성: 표본들이 서로 독립적이지 않고 강한 상관관계를 가질 경우 중심극한정리가 작동하지 않을 수 있다.
7.2 표본 크기의 위험성
- 과신 금지: $n=30$은 일반적인 가이드라인일 뿐이다. 모집단의 왜도가 극심한 경우(예: 극소수의 초고소득자가 포함된 소득 분포), $n=100$ 혹은 그 이상의 표본이 필요할 수 있다.
- 표본 편향: 표본 추출 과정 자체가 편향되었다면(Selection Bias), 중심극한정리가 적용되어 정규분포 모양이 되더라도 그 중심은 모평균 $\mu$가 아닌 편향된 값에 위치하게 된다.
# 중심극한정리 (Central Limit Theorem, CLT)
## 1. 개요
**중심극한정리(Central Limit Theorem, CLT)**란 모집단의 분포 모양과 상관없이, 표본의 크기가 충분히 크다면 표본 평균들의 분포가 정규분포(Normal Distribution)에 근사한다는 통계학의 핵심 정리이다.
이 정리는 통계적 추론의 근간이 되며, 우리가 모집단 전체를 조사하지 않고도 일부 표본만을 통해 모집단의 특성인 **모수(Parameter)**를 확률적으로 추정할 수 있게 하는 이론적 토대를 제공한다.
---
## 2. 수학적 원리 및 조건
### 2.1 전제 조건
중심극한정리가 성립하기 위해서는 다음과 같은 기본 조건이 충족되어야 한다.
1. **독립 동일 분포 (i.i.d. - Independent and Identically Distributed):** 추출된 각 표본들이 서로 영향을 주지 않아야 하며(독립성), 모두 동일한 확률 분포에서 추출되어야 한다.
2. **유한한 분산:** 모집단의 분산($\sigma^2$)이 유한해야 한다. 분산이 무한대인 특수한 분포에서는 이 정리가 성립하지 않는다.
### 2.2 수학적 정의
평균이 $\mu$이고 분산이 $\sigma^2$인 임의의 모집단에서 크기가 $n$인 표본을 무작위로 추출했을 때, 표본 평균 $\bar{X}$의 분포는 $n$이 커질수록 다음과 같은 정규분포에 근사한다.
$$\bar{X} \sim N\left(\mu, \frac{\sigma^2}{n}\right)$$
더 엄밀하게는, $n$이 무한대로 갈 때 표본 평균을 표준화한 값은 표준정규분포로 수렴한다. 이를 분포 수렴(Convergence in distribution) 기호를 사용하여 나타내면 다음과 같다.
$$\frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} N(0, 1) \quad \text{as } n \to \infty$$
여기서 $\frac{\sigma}{\sqrt{n}}$을 **표준오차(Standard Error, SE)**라고 하며, 이는 표본의 크기 $n$이 증가할수록 감소한다. 즉, 표본의 크기가 커질수록 표본 평균은 모집단의 실제 평균 $\mu$에 더 밀접하게 집중된다.
---
## 3. 정규분포와의 관계
### 3.1 수렴 과정과 표본 크기
모집단이 이미 정규분포라면 표본 크기와 상관없이 표본 평균은 항상 정규분포를 따른다. 하지만 모집단이 편향되어 있거나(Skewed) 균등분포(Uniform)인 경우, $n$이 증가함에 따라 분포의 모양이 점차 종 모양의 정규분포로 변한다.
통계학에서는 일반적으로 **$n \ge 30$**일 때 표본 평균의 분포가 정규분포에 충분히 근사한다고 간주한다. 이는 경험적인 기준이며, 모집단의 왜도(Skewness)가 심할수록 더 큰 표본 크기가 필요하다.
### 3.2 모집단 분포에 따른 변화 비교
| 모집단 분포 형태 | $n=2$ 일 때의 표본 평균 분포 | $n=10$ 일 때의 표본 평균 분포 | $n=30$ 이상일 때의 표본 평균 분포 |
| :--- | :--- | :--- | :--- |
| **정규분포** | 정규분포 | 정규분포 | 정규분포 (매우 좁은 폭) |
| **균등분포** | 삼각형 모양에 가까움 | 정규분포에 근사하기 시작 | 정규분포와 거의 일치 |
| **지수분포** | 오른쪽 꼬리가 긴 형태 | 왜도가 감소함 | 정규분포로 수렴 |
| **이항분포** | 이산적인 형태 | 정규분포에 근사 | 정규분포로 수렴 (드무아브르-라플라스 정리) |
---
## 4. 대수의 법칙(LLN)과의 차이점
중심극한정리는 종종 **대수의 법칙(Law of Large Numbers, LLN)**과 혼동되지만, 두 개념은 초점이 다르다.
* **대수의 법칙 (LLN):** 표본의 크기가 커질수록 표본 평균 $\bar{X}$가 모평균 $\mu$에 **'가까워진다'**는 사실(값의 수렴)에 집중한다. 즉, $n \to \infty$일 때 $\bar{X} \to \mu$임을 의미한다.
* **중심극한정리 (CLT):** 표본 평균 $\bar{X}$가 모평균 $\mu$ 주변에 **'어떤 모양으로 분포하는가'** (분포의 수렴)에 집중한다. 즉, 그 분포의 형태가 정규분포가 됨을 증명한다.
---
## 5. 실제 활용 사례: 모수 추정 및 신뢰구간
**모수(Parameter)**란 모집단의 특성을 나타내는 수치(예: 모평균 $\mu$, 모분산 $\sigma^2$)를 말한다. 중심극한정리를 통해 우리는 모집단의 분포를 몰라도 표본 평균을 이용하여 모평균 $\mu$에 대한 **신뢰구간(Confidence Interval)**을 설정할 수 있다.
### 5.1 신뢰구간 도출 과정
1. 표본 평균 $\bar{X}$가 $N(\mu, \sigma^2/n)$을 따른다고 가정한다.
2. 이를 표준화하면 $Z = \frac{\bar{X} - \mu}{\sigma/\sqrt{n}}$ 이 되며, $Z$는 표준정규분포 $N(0, 1)$을 따른다.
3. 신뢰수준 $1-\alpha$ (예: 95% $\to \alpha=0.05$)에 해당하는 $Z$값($z_{\alpha/2}$)을 찾는다.
4. $P(-z_{\alpha/2} \le \frac{\bar{X} - \mu}{\sigma/\sqrt{n}} \le z_{\alpha/2}) = 1-\alpha$ 식을 $\mu$에 대해 정리한다.
### 5.2 신뢰구간 계산 공식
$$\mu \approx \bar{X} \pm z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}$$
**[표본 표준편차 $s$ 사용 시 주의사항]**
실제 상황에서는 모표준편차 $\sigma$를 모르는 경우가 많으므로 표본 표준편차 $s$를 대신 사용한다.
* **$n$이 충분히 큰 경우 ($n \ge 30$):** 중심극한정리에 의해 $s$를 $\sigma$ 대신 사용하여 $z$-분포(표준정규분포)를 적용할 수 있다.
* **$n$이 작은 경우:** 표본 표준편차 $s$의 불확실성이 커지므로, 정규분포보다 꼬리가 더 두꺼운 **$t$-분포(Student's t-distribution)**를 사용하여 임계값을 결정해야 한다.
---
## 6. 예시 및 시뮬레이션
### 6.1 구체적 사례: 주사위 던지기
주사위 한 개를 던질 때의 결과는 $\{1, 2, 3, 4, 5, 6\}$으로 균등분포를 따르며 평균은 $3.5$이다.
1. 주사위를 2번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 약간 뾰족한 모양이 된다.
2. 주사위를 30번 던져 평균을 내는 과정을 1,000번 반복하면, 분포는 $3.5$를 중심으로 하는 완벽한 종 모양(정규분포)이 된다.
### 6.2 Python 시뮬레이션 코드
```python
import numpy as np
import matplotlib.pyplot as plt
# 모집단: 0에서 100 사이의 균등분포 (10,000개 샘플)
population = np.random.uniform(0, 100, 10000)
def plot_clt(sample_size, iterations=1000):
# 벡터화 연산을 사용하여 성능 개선: (iterations, sample_size) 형태의 행렬 생성 후 행별 평균 계산
samples = np.random.choice(population, size=(iterations, sample_size))
sample_means = np.mean(samples, axis=1)
# 데이터 범위에 맞게 bins를 동적으로 설정하여 가독성 향상
plt.hist(sample_means, bins=30, density=True, alpha=0.6, color='g', edgecolor='black')
plt.title(f'Sample Size: {sample_size}')
plt.xlabel('Sample Mean')
plt.ylabel('Density')
plt.grid(axis='y', alpha=0.3)
plt.figure(figsize=(15, 5))
plt.subplot(1, 3, 1); plot_clt(2)
plt.subplot(1, 3, 2); plot_clt(10)
plt.subplot(1, 3, 3); plot_clt(30)
plt.tight_layout()
plt.show()
```
### 6.3 수렴 과정 시각화 (개념적 묘사)
표본 크기 $n$의 증가에 따른 분포의 변화는 다음과 같은 시각적 흐름을 보인다.
| 단계 | 표본 크기 | 분포의 형태 및 특징 | 시각적 묘사 |
| :--- | :--- | :--- | :--- |
| **Step 1** | $n=1$ | 모집단의 원래 분포와 동일 | L자형(지수분포) 또는 평평한 모양(균등분포) |
| **Step 2** | $n=5$ | 중심 방향으로 데이터가 모이기 시작 | 뾰족한 끝이 뭉툭해지며 완만한 곡선 형성 시작 |
| **Step 3** | $n=15$ | 좌우 대칭성이 뚜렷해짐 | 완만한 종 모양(Bell-shape)의 윤곽이 나타남 |
| **Step 4** | $n=30+$ | 좁고 높은 정규분포 곡선 | 중심값이 모평균 $\mu$에 정확히 일치하는 날카로운 종 모양 |
---
## 7. 한계 및 주의사항
### 7.1 적용 불가능한 사례
* **코시 분포 (Cauchy Distribution):** 코시 분포는 평균과 분산이 정의되지 않는(무한대인) 분포이다. 이 경우 표본 크기를 아무리 늘려도 표본 평균이 정규분포로 수렴하지 않고 계속 코시 분포를 유지한다.
* **강한 의존성:** 표본들이 서로 독립적이지 않고 강한 상관관계를 가질 경우 중심극한정리가 작동하지 않을 수 있다.
### 7.2 표본 크기의 위험성
* **과신 금지:** $n=30$은 일반적인 가이드라인일 뿐이다. 모집단의 왜도가 극심한 경우(예: 극소수의 초고소득자가 포함된 소득 분포), $n=100$ 혹은 그 이상의 표본이 필요할 수 있다.
* **표본 편향:** 표본 추출 과정 자체가 편향되었다면(Selection Bias), 중심극한정리가 적용되어 정규분포 모양이 되더라도 그 중심은 모평균 $\mu$가 아닌 편향된 값에 위치하게 된다.