이항분포
이항분포 (Binomial Distribution)
1. 개요
이항분포는 결과가 오직 두 가지(성공 또는 실패)로만 나타나는 [[베르누이 시행]](Bernoulli trial)을 독립적으로 $n$번 반복했을 때, 성공한 횟수의 확률 분포를 나타내는 이산 확률 분포이다.
베르누이 시행이란 동전 던지기처럼 결과가 '앞면' 혹은 '뒷면'과 같이 상호 배타적인 두 가지 상태로만 결정되는 실험을 의미한다. 이항분포는 이러한 단순한 시행이 여러 번 반복될 때, 전체 시행 중 특정 횟수만큼 성공이 발생할 확률을 수학적으로 모델링한다.
2. 성립 조건 및 특징
이항분포가 성립하기 위해서는 다음과 같은 전제 조건이 충족되어야 한다.
- 고정된 시행 횟수: 전체 시행 횟수 $n$이 미리 정해져 있어야 한다.
- 이분법적 결과: 각 시행의 결과는 오직 두 가지(성공/실패, 예/아니오, 합격/불합격 등)로만 구분되어야 한다.
- 독립 시행: 각 시행의 결과는 다른 시행의
- 일정한 확률: 매 시행 시 성공 확률 $p$는 항상 일정하게 유지되어야 한다.
베르누이 시행과 이항분포의 비교
| 구분) | | :--- | :--- | :--- | | 시행 횟수 | 1회 | $n$회 (반복 시행) | | 관심 대상 | 단일 시행의 성공 여부 | $n$번 중 성공한 총 횟수 ($k$) | | 확률 변수 | $X \in \{0, 1\}$ | $X \in \{0, 1, 2, \dots, n\}$ | | 관계 | 이항분포의 기본 단위 | 베르누이 시행의 합으로 정의됨 |
3. 확률질량함수 (PMF)
이항분포를 따르는 확률 변수 $X$가 $k$번 성공할 확률은 다음과 같은 [[확률질량함수]](Probability Mass Function, PMF)로 계산한다.
$$P(X = k) = \binom{n}{k} p^k q^{n-k} \quad (\text{단, } q = 1-p)$$
변수 설명
- $n$: 전체 시행 횟수
- $k$: 성공 횟수 ($0 \le k \le n$)
- $p$: 한 번의 시행에서 성공할 확률
- $q$ (또는 $1-p$): 한 번의 시행에서 실패할 확률
- $\binom{n}{k}$: 조합(Combination) 기호로, $n$번 중 $k$번의 성공이 발생하는 모든 가능한 경우의 수를 의미한다. $\binom{n}{k} = \frac{n!}{k!(n-k)!}$
단계별 풀이 예제
문제: 성공 확률이 $p=0.3$인 어떤 실험을 $n=5$번 반복했을 때, 정확히 $k=2$번 성공할 확률을 구하시오.
- 변수 식별: $n=5, k=2, p=0.3, q=0.7$
- 조합 계산: $\binom{5}{2} = \frac{5 \times 4}{2 \times 1} = 10$
- 성공 및 실패 확률 계산:
- 성공 확률 부분: $0.3^2 = 0.09$
- 실패 확률 부분: $0.7^{5-2} = 0.7^3 = 0.343$
- 최종 확률 계산: $10 \times 0.09 \times 0.343 = 0.3087$ 결과: 약 30.87%의 확률로 2번 성공한다.
4. 기댓값과 분산
이항분포 $B(n, p)$의 통계적 특성은 다음과 같다.
기댓값 (Expectation)
$$E(X) = np$$ - 의미: $n$번 시행했을 때 평균적으로 기대할 수 있는 성공 횟수이다. - 증명: $X$를 $n$개의 독립적인 베르누이 확률 변수 $X_1, X_2, \dots, X_n$의 합이라고 하자 ($X = \sum_{i=1}^{n} X_i$). 각 베르누이 시행의 기댓값은 $E(X_i) = 1 \cdot p + 0 \cdot (1-p) = p$이다. 기댓값의 선형성에 의해: $$E(X) = E\left(\sum_{i=1}^{n} X_i\right) = \sum_{i=1}^{n} E(X_i) = \sum_{i=1}^{n} p = np$$
분산 (Variance) 및 표준편차 (Standard Deviation)
$$Var(X) = np(1-p) = npq$$ $$\sigma = \sqrt{npq}$$ - 의미: 성공 횟수가 기댓값으로부터 얼마나 떨어져 분포하는지를 나타낸다. - 증명: 각 베르누이 시행의 분산은 $Var(X_i) = E(X_i^2) - \{E(X_i)\}^2 = (1^2 \cdot p + 0^2 \cdot q) - p^2 = p - p^2 = p(1-p)$이다. 각 시행이 독립적이므로 분산의 합 성질에 의해: $$Var(X) = Var\left(\sum_{i=1}^{n} X_i\right) = \sum_{i=1}^{n} Var(X_i) = \sum_{i=1}^{n} p(1-p) = np(1-p)$$
5. 분포의 형태와 성질
이항분포의 모양은 $n$과 $p$의 값에 따라 결정된다.
$p$의 변화에 따른 형태
- $p = 0.5$: 분포가 $np$를 중심으로 완벽한 좌우 대칭 형태를 띤다.
- $p < 0.5$: 분포가 오른쪽으로 긴 꼬리를 가지는 [[왜도]](Right-skewed, 양의 왜도) 형태를 띤다. (성공 횟수가 적은 쪽에 밀집)
- $p > 0.5$: 분포가 왼쪽으로 긴 꼬리를 가지는 [[왜도]](Left-skewed, 음의 왜도) 형태를 띤다. (성공 횟수가 많은 쪽에 밀집)
$n$의 변화에 따른 형태
- $n$이 작을 때는 이산적인 막대 그래프 형태가 뚜렷하지만, $n$이 커질수록 분포의 곡선이 매끄러워지며 종 모양에 가까워진다.
[그래프 시각화 가이드] - X축: 성공 횟수 $k$, Y축: 확률 $P(X=k)$ - Case 1 ($n=10, p=0.2$): 왼쪽으로 치우친 비대칭 분포 - Case 2 ($n=10, p=0.5$): 중앙을 중심으로 한 대칭 분포 - Case 3 ($n=10, p=0.8$): 오른쪽으로 치우친 비대칭 분포 - Case 4 ($n=100, p=0.5$): 매우 좁고 높은 종 모양의 정규분포 근사 형태
6. 관련 분포와의 관계
[[정규분포]] (Normal Distribution)와의 관계
일반적으로 $np \ge 5$ 및 $n(1-p) \ge 5$ 조건을 만족할 때(보수적인 기준으로는 $np \ge 10$ 및 $n(1-p) \ge 10$), 이항분포 $B(n, p)$는 정규분포 $N(np, npq)$에 근사한다. 이를 드 무아브르-라플라스 정리라고 하며, 계산이 복잡한 이항분포의 확률을 정규분포의 표준화($Z$-score)를 통해 쉽게 계산할 수 있게 한다.
[[포아송 분포]] (Poisson Distribution)와의 관계
$n$이 매우 크고($n \to \infty$), $p$가 매우 작을 때($p \to 0$), 그리고 $np = \lambda$ (일정한 상수)를 유지할 때, 이항분포는 포아송 분포로 수렴한다. 이는 희귀 사건(Rare events)의 발생 횟수를 모델링할 때 유용하다.
7. 활용 사례 및 예제
이항분포는 실무에서 '합격/불합격' 혹은 '전환/미전환'과 같은 이분법적 데이터를 분석할 때 필수적으로 사용된다.
- 품질 관리: 제품의 불량률이 $p$일 때, 샘플 $n$개를 추출하여 불량품이 $k$개 이하로 나올 확률을 계산한다. 만약 이 확률이 매우 낮음에도 불구하고 실제로 $k$개 이상의 불량품이 발견된다면, 현재 공정의 불량률이 $p$보다 높아졌다고 판단하여 공정 개선 조치를 취할 수 있다.
- 마케팅 A/B 테스트: 광고 A안과 B안의 클릭률(CTR)을 비교하여, 특정 횟수 이상의 클릭이 발생할 확률이 통계적으로 유의미한지 분석한다.
- 여론 조사: 지지율 $p$인 후보에 대해 $n$명의 응답자를 조사했을 때, 실제 지지자와의 오차 범위를 계산한다.
Python을 이용한 확률 계산 예시
Python의 <a href="/doc/%EA%B8%B0%EC%88%A0/%ED%94%84%EB%A1%9C%EA%B7%B8%EB%9E%98%EB%B0%8D/Python/scipy.stats" class="wiki-link wiki-link-missing">scipy.stats</a> 라이브러리를 사용하면 이항분포의 확률을 쉽게 계산할 수 있다.
from scipy.stats import binom
# 설정값
n = 10 # 시행 횟수
p = 0.5 # 성공 확률
k = 5 # 성공 횟수
# 1. 정확히 k번 성공할 확률 (PMF: 확률질량함수)
prob_k = binom.pmf(k, n, p)
print(f"정확히 {k}번 성공할 확률: {prob_k:.4f}")
# 2. k번 이하로 성공할 누적 확률 (CDF: 누적분포함수, Cumulative Distribution Function)
prob_le_k = binom.cdf(k, n, p)
print(f"{k}번 이하로 성공할 누적 확률: {prob_le_k:.4f}")
이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.
주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.