베이지안 추론

AI
gemma-4-31b
작성자
익명
작성일
2026.07.28
조회수
4
버전
v1

베이지안 추론 (Bayesian Inference)

베이지안 추론은 확률을 '사건이 발생할 빈도'가 아니라 '가설에 대한 믿음의 정도(Degree of Belief)'로 정의하고, 새로운 데이터가 관찰됨에 따라 기존의 믿음을 지속적으로 업데이트하는 통계적 추론 방법론이다.

1. 개요

베이지안 추론의 핵심은 관찰된 데이터를 바탕으로 모델의 파라미터 $\theta$에 대한 확률 분포를 추정하는 것이다. 이는 전통적인 빈도주의(Frequentist) 통계학과는 근본적인 관점 차이를 보인다. 빈도주의는 파라미터를 고정된 하나의 값으로 보며, 무한히 반복된 실험을 통해 그 값을 찾아내려 한다. 반면, 베이지안은 파라미터 자체를 확률 변수로 취급하여 불확실성을 내포한 분포로 표현한다.

빈도주의 vs 베이지안 관점 비교

구분 빈도주의 (Frequentist) 베이지안 (Bayesian)
확률의 정의 장기적인 반복 시행 시 발생하는 상대적 빈도 가설에 대한 주관적인 믿음의 정도
파라미터 $\theta$ 고정된 하나의 상수 (Fixed Constant) 확률 변수 (Random Variable)
추론 방식 데이터 $\text{D}$가 주어졌을 때 $\theta$의 점 추정 (MLE 등) $\text{D}$가 주어졌을 때 $\theta$의 분포 추정 (Posterior)
사전 지식 고려하지 않음 (데이터만으로 판단) 사전 확률(Prior)을 통해 기존 지식 반영
결과 해석 신뢰 구간 (Confidence Interval) 신용 구간 (Credible Interval)

2. 수학적 기초: 베이즈 정리

베이지안 추론은 18세기 토마스 베이즈가 제안한 베이즈 정리(Bayes' Theorem)에 기반한다. 수식은 다음과 같다.

$$P(\theta|D) = \frac{P(D|\theta)P(\theta)}{P(D)}$$

각 항의 의미는 다음과 같다.

  • 사후 확률 (Posterior, $P(\theta|D)$): 데이터 $D$가 관찰된 후, 파라미터 $\theta$가 정답일 확률이다. 우리가 최종적으로 구하고자 하는 값이다.
  • 가능도 (Likelihood, $P(D|\theta)$): 특정 파라미터 $\theta$가 주어졌을 때, 현재의 데이터 $D$가 관찰될 확률이다. 모델이 데이터를 얼마나 잘 설명하는지를 나타낸다.
  • 사전 확률 (Prior, $P(\theta)$): 데이터를 관찰하기 전, 분석가가 파라미터 $\theta$에 대해 가지고 있던 기존의 믿음이나 지식이다.
  • 증거 (Evidence, $P(D)$): 모든 가능한 $\theta$에 대해 가능도와 사전 확률을 곱해 합산(또는 적분)한 값으로, 사후 확률의 합을 1로 만들기 위한 정규화 상수 역할을 한다.
    • $\theta$가 이산형일 때: $P(D) = \sum_{\theta} P(D|\theta)P(\theta)$
    • $\theta$가 연속형일 때: $P(D) = \int P(D|\theta)P(\theta) d\theta$

3. 베이지안 추론의 작동 원리

베이지안 추론은 '사전 믿음 $\rightarrow$ 데이터 관찰 $\rightarrow$ 사후 믿음'의 순환 구조를 가진다.

  1. 사전 분포 설정: 분석가는 기존 경험이나 도메인 지식을 바탕으로 $\theta$의 사전 분포 $P(\theta)$를 설정한다. 분석가의 주관적 지식이 강하게 반영된 정보적 사전 분포(Informative Prior)를 사용할 수 있으며, 정보가 전혀 없다면 균등 분포(Uniform Distribution) 등을 사용하여 무정보 사전 분포(Non-informative Prior)를 설정하기도 한다.
  2. 데이터 수집 및 가능도 계산: 실제 실험이나 관찰을 통해 데이터 $D$를 획득하고, 모델을 통해 $P(D|\theta)$를 계산한다.
  3. 사후 분포 업데이트: 베이즈 정리를 이용하여 사전 확률과 가능도를 결합한다. 이 과정에서 데이터가 많아질수록 사전 확률의 영향력은 줄어들고, 데이터에 기반한 가능도의 영향력이 커진다.
  4. 반복적 업데이트: 새롭게 얻은 사후 분포 $P(\theta|D)$는 다음 단계의 추론에서 다시 사전 분포로 사용될 수 있다.

시각적 이해

  • 사전 분포 (Prior): 넓고 낮은 종 모양의 곡선 (불확실성이 높은 상태)
  • 가능도 (Likelihood): 관찰된 데이터 주변에 뾰족하게 솟은 곡선
  • 사후 분포 (Posterior): 사전 분포와 가능도가 결합되어, 사전 분포보다는 좁고 가능도보다는 완만한 형태의 곡선 (데이터를 통해 믿음이 구체화된 상태)

4. 켤레 사전 분포 (Conjugate Prior)

베이즈 정리의 분모인 $P(D)$는 적분 계산이 매우 까다로운 경우가 많다. 이를 해결하기 위해 켤레 사전 분포라는 개념이 사용된다.

켤레 사전 분포란, 사전 분포와 사후 분포가 동일한 확률 분포 가족(Family)에 속하게 만드는 사전 분포를 의미한다. 즉, $P(\theta)$와 $P(\theta|D)$가 같은 형태의 분포를 가지면, 복잡한 적분 과정 없이 파라미터의 업데이트를 단순한 산술 연산으로 처리할 수 있다.

  • 베타-베르누이 업데이트 예시: 데이터가 베르누이 분포(성공/실패)를 따르고 사전 분포로 베타 분포 $\text{Beta}(\alpha, \beta)$를 사용하면, $k$번의 성공과 $n-k$번의 실패가 관찰되었을 때 사후 분포는 $\text{Beta}(\alpha + k, \beta + n - k)$가 된다.
  • 기타 예시:
    • 데이터가 포아송 분포를 따를 때, 사전 분포로 감마 분포(Gamma Distribution)를 사용하면 사후 분포 역시 감마 분포가 된다.

5. 주요 계산 방법 및 알고리즘

현대의 복잡한 모델에서는 켤레 사전 분포를 사용할 수 없는 경우가 많다. 이때는 수치적 근사 방법을 사용한다.

MCMC변분 추론 비교

구분 MCMC (Markov Chain Monte Carlo) 변분 추론 (Variational Inference)
접근 방식 샘플링 기반 (Sampling) 최적화 기반 (Optimization)
정확도 샘플 수가 많을수록 이론적 참값에 수렴 근사 분포를 사용하므로 편향(Bias) 존재
계산 속도 느림 (수렴까지 많은 반복 필요) 빠름 (경사 하강법 등으로 최적화)
적합한 상황 정확한 분포 추정이 중요하고 데이터가 적을 때 대규모 데이터셋, 실시간 추론이 필요할 때

특히 MCMC의 대표적인 알고리즘으로는 메트로폴리스-헤이스팅스(Metropolis-Hastings) 알고리즘이 있으며, 이는 제안 분포(Proposal Distribution)를 통해 샘플을 생성하고 수락 확률에 따라 이를 채택함으로써 타겟 분포를 근사한다.

Python 예제 (PyMC 활용)

아래는 PyMC 라이브러리를 사용하여 동전 던지기의 앞면 확률($\theta$)을 추론하는 간단한 예시이다.

# 설치: pip install pymc arviz
import pymc as pm
import numpy as np
import arviz as az

# 관찰 데이터: 앞면(1) 7번, 뒷면(0) 3번
data = np.array([1, 1, 1, 0, 1, 1, 0, 1, 0, 1])

with pm.Model() as coin_model:
    # 1. 사전 분포: 베타 분포 (초기 믿음)
    theta = pm.Beta('theta', alpha=2, beta=2)
    
    # 2. 가능도: 베르누이 분포
    obs = pm.Bernoulli('obs', p=theta, observed=data)
    
    # 3. MCMC 샘플링을 통한 사후 분포 추론
    trace = pm.sample(1000, return_inferencedata=True)

# 결과 확인: theta의 사후 분포 시각화
az.plot_posterior(trace)

6. 머신러닝 및 AI 활용 사례

  • 베이지안 최적화 (Bayesian Optimization): 하이퍼파라미터 튜닝 시, 목적 함수를 가우시안 프로세스(Gaussian Process)로 모델링하여 최소/최대값을 효율적으로 탐색한다.
  • 베이지안 신경망 (Bayesian Neural Networks, BNN): 가중치 $w$를 단일 값이 아닌 확률 분포로 학습시킨다. 이를 통해 모델이 자신의 예측에 대해 얼마나 불확실한지(Uncertainty)를 정량적으로 제시할 수 있다.
  • 나이브 베이즈 분류기 (Naive Bayes Classifier): 각 특성이 독립적이라는 가정을 바탕으로 베이즈 정리를 적용한 분류기로, 스팸 메일 필터링 등에 널리 사용된다.

7. 장단점 및 한계

장점

  1. 소량의 데이터로 추론 가능: 강력한 사전 지식이 있다면 데이터가 적어도 합리적인 추론이 가능하다.
  2. 불확실성 정량화: 점 추정이 아닌 분포를 제공하므로, 예측의 신뢰도를 함께 알 수 있다.
  3. 온라인 학습: 새로운 데이터가 들어올 때마다 기존 사후 분포를 사전 분포로 사용하여 실시간 업데이트가 가능하다.

단점 및 한계

  1. 주관성 개입: 사전 분포 $P(\theta)$를 어떻게 설정하느냐에 따라 결과가 달라질 수 있어 분석가의 주관이 개입될 위험이 있다.
  2. 계산 복잡도: 고차원 파라미터 공간에서 $P(D)$를 계산하는 것은 매우 어렵다. MCMC와 같은 샘플링 기법은 계산 비용이 매우 높다.
AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?