확률 질량 함수 (Probability Mass Function, PMF)
확률 질량 함수(Probability Mass Function, 이하 PMF)는 [[이산 확률 변수]]가 특정 값을 가질 확률을 직접적으로 나타내는 함수이다.
1. 정의 및 개념
확률 질량 함수(PMF)는 [이산 확률 변수]의 확률 분포를 설명하는 함수이다. 여기서 이산 확률 변수란 변수가 가질 수 있는 값들이 가산 집합(Countable set)에 속하거나, 유한한 집합으로 떨어져 존재하는 변수를 의미한다. (예: 동전 던지기의 앞면 횟수, 주사위 눈금, 특정 시간 동안 도착한 고객 수 등)
PMF는 확률 변수 $X$가 특정한 값 $x$를 가질 확률을 다음과 같이 정의한다.
$$f(x) = P(X = x)$$
즉, PMF는 입력값 $x$에 대해 그 값이 나타날 확률을 직접적으로 대응시키는 함수이며, 함수값이 곧 해당 사건의 발생 확률이 된다.
2. 수학적 성질
함수 $f(x)$가 확률 질량 함수가 되기 위해서는 다음의 두 가지 기본 조건을 반드시 만족해야 한다.
- 비음수성 (Non-negativity): 모든 가능한 값 $x$에 대하여 확률은 0보다 크거나 같아야 한다.
$$f(x) \ge 0 \quad \text{for all } x$$
- 총합의 법칙 (Normalization): 확률 변수가 가질 수 있는 모든 가능한 값들에 대한 확률의 합은 반드시 1이 되어야 한다.
$$\sum_{x \in S} f(x) = 1 \quad (\text{단, } S\text{는 확률 변수 } X\text{가 가질 수 있는 모든 값의 집합})$$
PMF는 이산형 변수를, PDF(Probability Density Function, [[확률 밀도 함수]])는 연속형 변수를 다룬다는 점에서 근본적인 차이가 있다. 가장 큰 차이는 '함수값이 확률인가' 하는 점이다.
| 구분 |
확률 질량 함수 (PMF) |
확률 밀도 함수 (PDF) |
| 대상 변수 |
[[이산 확률 변수]] (Discrete) |
연속 확률 변수 (Continuous) |
| 함수값의 의미 |
$f(x)$ 자체가 해당 값의 확률 $P(X=x)$ |
$f(x)$는 밀도이며, 그 자체로 확률이 아님 |
| 확률 계산 방식 |
특정 값의 함수값을 그대로 사용 |
특정 구간에 대해 적분하여 계산 |
| 연산 도구 |
합산 ($\sum$) |
적분 ($\int$) |
| 특이점 |
$f(x) \le 1$ 이어야 함 |
$f(x)$가 1보다 클 수 있음 |
[누적 분포 함수]는 확률 변수 $X$가 특정 값 $x$보다 작거나 같을 확률을 나타내는 함수로, PMF의 누적 합으로 정의된다.
$$F(x) = P(X \le x) = \sum_{x_i \le x} f(x_i)$$
- PMF $\rightarrow$ CDF: PMF를 가능한 모든 값에 대해 누적하여 더하면 CDF가 된다.
- CDF $\rightarrow$ PMF: CDF의 차이를 통해 특정 지점의 PMF를 구할 수 있다.
$$f(x_i) = F(x_i) - F(x_{i-1})$$
5. 대표적인 확률 질량 함수 예시
5.1 베르누이 분포 (Bernoulli Distribution)
결과가 '성공' 또는 '실패' 두 가지뿐인 단일 시행의 분포이다.
- PMF: $f(k; p) = p^k(1-p)^{1-k} \quad (k \in \{0, 1\})$
- 기호 설명: $k$는 결과(성공=1, 실패=0), $p$는 성공 확률을 의미한다.
- 적용 사례: 동전 던지기(앞/뒤), 시험 합격 여부(합격/불합격).
5.2 이항 분포 (Binomial Distribution)
성공 확률이 $p$인 베르누이 시행을 $n$번 독립적으로 반복했을 때, 성공 횟수의 분포이다.
- PMF: $f(k; n, p) = \binom{n}{k} p^k (1-p)^{n-k}$
- 기호 설명: $n$은 총 시행 횟수, $k$는 성공 횟수, $p$는 단일 시행의 성공 확률, $\binom{n}{k}$는 조합(Combination) 기호를 의미한다.
- 적용 사례: 10번의 자유투 중 성공 횟수, 불량률이 $p$인 공정에서 샘플 $n$개 중 불량품 수.
5.3 포아송 분포 (Poisson Distribution)
단위 시간 또는 단위 공간에서 발생하는 희귀 사건의 횟수에 대한 분포이다.
- PMF: $f(k; \lambda) = \frac{\lambda^k e^{-\lambda}}{k!}$
- 기호 설명: $k$는 발생 횟수($k=0, 1, 2, \dots$), $\lambda$는 단위 시간/공간당 평균 발생 횟수를 의미한다.
- 적용 사례: 1시간 동안 콜센터에 걸려오는 전화 수, 특정 도로의 하루 평균 교통사고 건수.
5.4 기하 분포 (Geometric Distribution)
첫 번째 성공이 일어날 때까지 필요한 시행 횟수의 분포이다.
- PMF: $f(k; p) = (1-p)^{k-1}p \quad (k = 1, 2, 3, \dots)$
- 기호 설명: $k$는 첫 성공이 나타날 때까지의 총 시행 횟수, $p$는 단일 시행의 성공 확률을 의미한다.
- 적용 사례: 처음으로 당첨될 때까지 구매한 복권의 수, 기계가 고장 날 때까지의 작동 주기.
6. PMF 그래프의 시각적 특징
PMF를 시각화하면 연속적인 곡선이 아닌 이산적인 막대나 점의 형태로 나타난다.
![PMF 시각적 예시: x축의 특정 지점에서만 수직선이 솟아오른 Stem Plot 형태의 그래프]
- 막대 그래프(Bar Chart) 형태: 각 $x$ 값 위로 확률 $f(x)$만큼의 높이를 가진 막대를 세워 표현한다.
- 스파이크(Spike) 형태: 특정 값에서만 수직선이 솟아오른 형태로 표현하며, 선의 높이가 곧 확률을 의미한다.
- 특징: $x$축 상의 값들 사이에는 확률값이 존재하지 않으므로(0), 그래프가 끊어져 있는 불연속적인 모습을 띤다.
7. 활용 및 계산 예제
7.1 기댓값과 분산 계산
주어진 PMF를 통해 확률 변수의 대표값인 기댓값(Expectation)과 산포도를 나타내는 분산(Variance)을 계산할 수 있다.
- 기댓값: $E[X] = \sum_{all \, x} x f(x)$
- 분산: $Var(X) = E[X^2] - (E[X])^2$
예제: 주사위 한 개를 던질 때 눈금 $X$의 PMF는 모든 $x \in \{1, \dots, 6\}$에 대해 $f(x) = 1/6$이다.
- $E[X] = (1 \cdot \frac{1}{6}) + (2 \cdot \frac{1}{6}) + (3 \cdot \frac{1}{6}) + (4 \cdot \frac{1}{6}) + (5 \cdot \frac{1}{6}) + (6 \cdot \frac{1}{6}) = \frac{21}{6} = 3.5$
7.2 Python을 이용한 구현 및 시각화
scipy.stats 라이브러리를 사용하여 이항 분포의 PMF를 계산하고 시각화하는 예제 코드이다.
import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import binom
# 설정: 시행 횟수 n=10, 성공 확률 p=0.5
n, p = 10, 0.5
x = np.arange(0, n + 1)
pmf_values = binom.pmf(x, n, p)
# 시각화
plt.stem(x, pmf_values)
plt.title(f"Binomial PMF (n={n}, p={p})")
plt.xlabel("Number of Successes")
plt.ylabel("Probability")
plt.xticks(x)
plt.grid(True, axis='y', linestyle='--')
plt.show()
이 코드는 $n=10, p=0.5$인 이항 분포의 각 성공 횟수별 확률을 계산하여 stem 그래프(이산 분포 시각화에 적합)로 출력한다.
# 확률 질량 함수 (Probability Mass Function, PMF)
확률 질량 함수(Probability Mass Function, 이하 PMF)는 [[이산 확률 변수]]가 특정 값을 가질 확률을 직접적으로 나타내는 함수이다.
## 1. 정의 및 개념
**확률 질량 함수(PMF)**는 [[이산 확률 변수]](Discrete Random Variable)의 확률 분포를 설명하는 함수이다. 여기서 **이산 확률 변수**란 변수가 가질 수 있는 값들이 가산 집합(Countable set)에 속하거나, 유한한 집합으로 떨어져 존재하는 변수를 의미한다. (예: 동전 던지기의 앞면 횟수, 주사위 눈금, 특정 시간 동안 도착한 고객 수 등)
PMF는 확률 변수 $X$가 특정한 값 $x$를 가질 확률을 다음과 같이 정의한다.
$$f(x) = P(X = x)$$
즉, PMF는 입력값 $x$에 대해 그 값이 나타날 확률을 직접적으로 대응시키는 함수이며, 함수값이 곧 해당 사건의 발생 확률이 된다.
## 2. 수학적 성질
함수 $f(x)$가 확률 질량 함수가 되기 위해서는 다음의 두 가지 기본 조건을 반드시 만족해야 한다.
1. **비음수성 (Non-negativity)**: 모든 가능한 값 $x$에 대하여 확률은 0보다 크거나 같아야 한다.
$$f(x) \ge 0 \quad \text{for all } x$$
2. **총합의 법칙 (Normalization)**: 확률 변수가 가질 수 있는 모든 가능한 값들에 대한 확률의 합은 반드시 1이 되어야 한다.
$$\sum_{x \in S} f(x) = 1 \quad (\text{단, } S\text{는 확률 변수 } X\text{가 가질 수 있는 모든 값의 집합})$$
## 3. [[확률 밀도 함수]](PDF)와의 차이점
PMF는 이산형 변수를, PDF(Probability Density Function, [[확률 밀도 함수]])는 연속형 변수를 다룬다는 점에서 근본적인 차이가 있다. 가장 큰 차이는 **'함수값이 확률인가'** 하는 점이다.
| 구분 | 확률 질량 함수 (PMF) | 확률 밀도 함수 (PDF) |
| :--- | :--- | :--- |
| **대상 변수** | [[이산 확률 변수]] (Discrete) | 연속 확률 변수 (Continuous) |
| **함수값의 의미** | $f(x)$ 자체가 해당 값의 확률 $P(X=x)$ | $f(x)$는 밀도이며, 그 자체로 확률이 아님 |
| **확률 계산 방식** | 특정 값의 함수값을 그대로 사용 | 특정 구간에 대해 적분하여 계산 |
| **연산 도구** | 합산 ($\sum$) | 적분 ($\int$) |
| **특이점** | $f(x) \le 1$ 이어야 함 | $f(x)$가 1보다 클 수 있음 |
## 4. [[누적 분포 함수]](CDF)와의 관계
**[[누적 분포 함수]](Cumulative Distribution Function, CDF)**는 확률 변수 $X$가 특정 값 $x$보다 작거나 같을 확률을 나타내는 함수로, PMF의 누적 합으로 정의된다.
$$F(x) = P(X \le x) = \sum_{x_i \le x} f(x_i)$$
- **PMF $\rightarrow$ CDF**: PMF를 가능한 모든 값에 대해 누적하여 더하면 CDF가 된다.
- **CDF $\rightarrow$ PMF**: CDF의 차이를 통해 특정 지점의 PMF를 구할 수 있다.
$$f(x_i) = F(x_i) - F(x_{i-1})$$
## 5. 대표적인 확률 질량 함수 예시
### 5.1 베르누이 분포 (Bernoulli Distribution)
결과가 '성공' 또는 '실패' 두 가지뿐인 단일 시행의 분포이다.
- **PMF**: $f(k; p) = p^k(1-p)^{1-k} \quad (k \in \{0, 1\})$
- **기호 설명**: $k$는 결과(성공=1, 실패=0), $p$는 성공 확률을 의미한다.
- **적용 사례**: 동전 던지기(앞/뒤), 시험 합격 여부(합격/불합격).
### 5.2 이항 분포 (Binomial Distribution)
성공 확률이 $p$인 베르누이 시행을 $n$번 독립적으로 반복했을 때, 성공 횟수의 분포이다.
- **PMF**: $f(k; n, p) = \binom{n}{k} p^k (1-p)^{n-k}$
- **기호 설명**: $n$은 총 시행 횟수, $k$는 성공 횟수, $p$는 단일 시행의 성공 확률, $\binom{n}{k}$는 조합(Combination) 기호를 의미한다.
- **적용 사례**: 10번의 자유투 중 성공 횟수, 불량률이 $p$인 공정에서 샘플 $n$개 중 불량품 수.
### 5.3 포아송 분포 (Poisson Distribution)
단위 시간 또는 단위 공간에서 발생하는 희귀 사건의 횟수에 대한 분포이다.
- **PMF**: $f(k; \lambda) = \frac{\lambda^k e^{-\lambda}}{k!}$
- **기호 설명**: $k$는 발생 횟수($k=0, 1, 2, \dots$), $\lambda$는 단위 시간/공간당 평균 발생 횟수를 의미한다.
- **적용 사례**: 1시간 동안 콜센터에 걸려오는 전화 수, 특정 도로의 하루 평균 교통사고 건수.
### 5.4 기하 분포 (Geometric Distribution)
첫 번째 성공이 일어날 때까지 필요한 시행 횟수의 분포이다.
- **PMF**: $f(k; p) = (1-p)^{k-1}p \quad (k = 1, 2, 3, \dots)$
- **기호 설명**: $k$는 첫 성공이 나타날 때까지의 총 시행 횟수, $p$는 단일 시행의 성공 확률을 의미한다.
- **적용 사례**: 처음으로 당첨될 때까지 구매한 복권의 수, 기계가 고장 날 때까지의 작동 주기.
## 6. PMF 그래프의 시각적 특징
PMF를 시각화하면 연속적인 곡선이 아닌 **이산적인 막대나 점**의 형태로 나타난다.
![PMF 시각적 예시: x축의 특정 지점에서만 수직선이 솟아오른 Stem Plot 형태의 그래프]
- **막대 그래프(Bar Chart) 형태**: 각 $x$ 값 위로 확률 $f(x)$만큼의 높이를 가진 막대를 세워 표현한다.
- **스파이크(Spike) 형태**: 특정 값에서만 수직선이 솟아오른 형태로 표현하며, 선의 높이가 곧 확률을 의미한다.
- **특징**: $x$축 상의 값들 사이에는 확률값이 존재하지 않으므로(0), 그래프가 끊어져 있는 불연속적인 모습을 띤다.
## 7. 활용 및 계산 예제
### 7.1 기댓값과 분산 계산
주어진 PMF를 통해 확률 변수의 대표값인 기댓값(Expectation)과 산포도를 나타내는 분산(Variance)을 계산할 수 있다.
- **기댓값**: $E[X] = \sum_{all \, x} x f(x)$
- **분산**: $Var(X) = E[X^2] - (E[X])^2$
**예제**: 주사위 한 개를 던질 때 눈금 $X$의 PMF는 모든 $x \in \{1, \dots, 6\}$에 대해 $f(x) = 1/6$이다.
- $E[X] = (1 \cdot \frac{1}{6}) + (2 \cdot \frac{1}{6}) + (3 \cdot \frac{1}{6}) + (4 \cdot \frac{1}{6}) + (5 \cdot \frac{1}{6}) + (6 \cdot \frac{1}{6}) = \frac{21}{6} = 3.5$
### 7.2 Python을 이용한 구현 및 시각화
`scipy.stats` 라이브러리를 사용하여 이항 분포의 PMF를 계산하고 시각화하는 예제 코드이다.
```python
import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import binom
# 설정: 시행 횟수 n=10, 성공 확률 p=0.5
n, p = 10, 0.5
x = np.arange(0, n + 1)
pmf_values = binom.pmf(x, n, p)
# 시각화
plt.stem(x, pmf_values)
plt.title(f"Binomial PMF (n={n}, p={p})")
plt.xlabel("Number of Successes")
plt.ylabel("Probability")
plt.xticks(x)
plt.grid(True, axis='y', linestyle='--')
plt.show()
```
이 코드는 $n=10, p=0.5$인 이항 분포의 각 성공 횟수별 확률을 계산하여 `stem` 그래프(이산 분포 시각화에 적합)로 출력한다.