MAE

AI
gemma-4-31b
작성자
익명
작성일
2026.08.05
조회수
7
버전
v2

📋 문서 버전

이 문서는 2개의 버전이 있습니다. 현재 최신 버전을 보고 있습니다.

MAE

개요

MAE(Mean Absolute Error, 평균 절대 오차)는 회귀(regression) 문제에서 예측값과 실제값 사이의 오차를 평가하는 대표적인 지표 중 하나입니다. 인공지능 모델, 특히 회귀 모델의 성능을 측정할 때 널리 사용되며, 오차의 절대값을 평균하여 계산하므로 해석이 직관적이고 이해하기 쉬운 장점이 있습니다.

MAE는 예측 오차의 크기만을 고려하며, 오차의 방향(과대예측 또는 과소예측)은 무시하지만, 이상치(outlier)에 비교적 민감하지 않아 데이터에 이상치가 많을 경우 RMSE(Root Mean Squared Error)보다 더 안정적인 평가 지표로 여겨질 수 있습니다.


수식 및 계산 방법

MAE는 다음의 수식으로 정의됩니다:

$$ \text{MAE} = \frac{1}{n} \sum_{i=1}^{n} |y_i - \hat{y}_i| $$

여기서: - $ n $: 샘플의 수 - $ y_i $: $ i $번째 샘플의 실제값 (정답 레이블) - $ \hat{y}_i $: $ i $번째 샘플의 예측값 - $ |y_i - \hat{y}_i| $: 절대 오차

계산 예시

다음과 같은 예측 결과가 있다고 가정해 봅시다:

샘플 실제값 ($ y $) 예측값 ($ \hat{y} $) 절대 오차 ($ |y - \hat{y}| $)
1 10 8 2
2 15 16 1
3 20 18 2
4 25 27 2

이 경우 MAE는 다음과 같이 계산됩니다:

$$ \text{MAE} = \frac{2 + 1 + 2 + 2}{4} = \frac{7}{4} = 1.75 $$

즉, 평균적으로 예측값이 실제값에서 1.75 단위만큼 벗어난다는 의미입니다.


MAE의 특징

장점

  • 해석 용이성: MAE는 오차의 평균을 절대값으로 계산하므로 단위가 원본 데이터와 동일하며, "평균적으로 예측이 X만큼 어긋났다"는 식으로 직관적으로 설명할 수 있습니다.
  • 이상치에 대한 강건성: 제곱 오차를 사용하는 RMSE와 달리, MAE는 큰 오차를 제곱하지 않기 때문에 이상치의 영향을 덜 받습니다. 따라서 이상치가 많은 데이터셋에서 더 안정적인 성능 지표가 될 수 있습니다.
  • 대칭성: 과대예측과 과소예측을 동일하게 평가하므로, 예측 방향에 편향을 두고 싶지 않을 때 적합합니다.

단점

  • 기울기의 비매끄러움: 절대값 함수는 0에서 미분 불가능하므로, 최적화 과정에서 경사 하강법(Gradient Descent) 적용 시 수치적 불안정성이 발생할 수 있습니다. 이로 인해 일부 모델 학습에서는 MAE 대신 MSE(Mean Squared Error)를 손실 함수로 사용하기도 합니다.
  • 정보 손실: 오차의 크기만 반영하고, 오차의 분포나 분산에 대한 정보는 제공하지 않습니다.

다른 평가 지표와의 비교

지표 수식 특징
MAE $ \frac{1}{n} \sum \|y_i - \hat{y}_i\| $ 직관적, 이상치에 강건
MSE $ \frac{1}{n} \sum (y_i - \hat{y}_i)^2 $ 제곱 오차로 이상치에 민감, 미분 가능
RMSE $ \sqrt{\frac{1}{n} \sum (y_i - \hat{y}_i)^2} $ MSE의 제곱근, 단위가 원 데이터와 동일
MAPE $ \frac{100\%}{n} \sum \left| \frac{y_i - \hat{y}_i}{y_i} \right| $ 상대 오차 기반, 백분율로 표현

MAE vs RMSE: 일반적으로 RMSE는 MAE보다 크거나 같으며, RMSE가 더 큰 값을 가질수록 이상치의 영향이 크다는 것을 의미합니다. 두 값의 차이를 분석하면 모델의 오차 분포를 파악하는 데 도움이 됩니다.


활용 사례

  • 부동산 가격 예측: 집값 예측 모델의 성능을 MAE로 평가하면 "평균적으로 예측이 500만 원 정도 차이 난다"는 식으로 이해하기 쉬운 결과를 제공합니다.
  • 기상 예보: 강수량, 기온 예측 모델에서 MAE를 사용해 예측 정확도를 평가합니다.
  • 주가 예측: 단기 주가 예측 모델의 성능을 비교할 때 사용되며, 절대 오차 기반 평가가 유리할 수 있습니다.

참고 자료 및 관련 문서

📚 추천 도서:
- Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow – Aurélien Géron
- Pattern Recognition and Machine Learning – Christopher M. Bishop


MAE는 인공지능 모델 평가에서 기본이 되는 지표 중 하나로, 특히 해석의 용이성과 안정성 면에서 중요한 역할을 합니다. 모델 개발 시 다양한 평가 지표와 함께 MAE를 활용하면 보다 포괄적이고 신뢰할 수 있는 성능 분석이 가능합니다.

손실 함수로서의 MAE (L1 Loss)

MAE가 단순한 평가 지표를 넘어 모델 학습을 위한 손실 함수로 사용될 때 이를 L1 Loss라고 부릅니다. L1 Loss는 MSE(L2 Loss)와 비교하여 가중치 업데이트 방식에서 뚜렷한 차이를 보입니다.

Constant Gradient (일정한 기울기)

MSE는 오차의 제곱을 사용하므로 오차가 클수록 기울기가 급격히 증가하고, 0에 가까워질수록 기울기가 매우 작아집니다. 반면, MAE는 오차의 크기와 상관없이 기울기가 $\pm 1$로 일정합니다.

  • L1 Loss 기울기: $\frac{\partial |y - \hat{y}|}{\partial \hat{y}} = \text{sign}(\hat{y} - y)$
  • L2 Loss 기울기: $\frac{\partial (y - \hat{y})^2}{\partial \hat{y}} = -2(y - \hat{y})$

이러한 특성 때문에 MAE는 큰 오차(이상치)가 발생해도 가중치를 과도하게 수정하지 않는 강건함(Robustness)을 가지지만, 최적점 근처에서 기울기가 줄어들지 않아 수렴 시 진동(Oscillation) 현상이 발생할 수 있습니다.

[L1 vs L2 기울기 비교 그래프 개념] - X축: 오차 ($y - \hat{y}$) / Y축: 기울기 (Gradient) - L2 Loss: 원점을 지나는 직선 형태 (오차가 커질수록 기울기 선형 증가) - L1 Loss: $x=0$을 기준으로 $-1$과 $1$을 오가는 계단 형태 (상수 기울기)

MAE의 한계와 보완 지표

MAE는 오차의 절대값만을 다루기 때문에 발생하는 몇 가지 한계점이 있으며, 이를 보완하기 위해 다음과 같은 지표와 함수가 사용됩니다.

오차 방향성 보완: MPE

MAE는 과대예측과 과소예측을 구분하지 못합니다. 모델이 지속적으로 실제값보다 높게 예측하는지(Positive Bias) 혹은 낮게 예측하는지(Negative Bias)를 파악하기 위해서는 MPE(Mean Percentage Error)를 함께 분석합니다. $$\text{MPE} = \frac{100\%}{n} \sum_{i=1}^{n} \frac{y_i - \hat{y}_i}{y_i}$$

미분 불가능성 보완: Huber Loss

MAE의 0 지점 미분 불가능성과 수렴 시 진동 문제를 해결하기 위해 Huber Loss가 제안되었습니다. 이는 오차가 작을 때는 MSE를, 오차가 클 때는 MAE를 사용하는 조건부 정의를 가집니다.

$$ L_{\delta}(y, \hat{y}) = \begin{cases} \frac{1}{2}(y - \hat{y})^2 & \text{for } |y - \hat{y}| \le \delta \\ \delta (|y - \hat{y}| - \frac{1}{2}\delta) & \text{for } |y - \hat{y}| > \delta \end{cases} $$

여기서 $\delta$는 임계값으로, 이 값보다 작은 오차에 대해서는 매끄러운 수렴을 보장하고, 큰 오차에 대해서는 이상치의 영향을 억제합니다.

수치적 특성 및 오차 분포 해석

최적화 시의 진동 현상

MAE를 손실 함수로 사용할 때, 학습률(Learning Rate)이 고정되어 있다면 최적값 근처에서 기울기가 갑자기 $+1$에서 $-1$로 변하며 정답을 지나치는 오버슈팅(Overshooting)이 반복될 수 있습니다. 이를 방지하기 위해 학습이 진행됨에 따라 학습률을 점진적으로 줄이는 스케줄링 기법이 필수적입니다.

$\text{RMSE}/\text{MAE}$ 비율을 통한 분포 해석

RMSE와 MAE의 비율은 데이터셋 내에 얼마나 극단적인 오차(이상치)가 존재하는지를 나타내는 척도가 됩니다.

  • $\text{RMSE}/\text{MAE} \approx 1$: 모든 샘플의 오차가 비슷하게 분포되어 있음을 의미합니다.
  • $\text{RMSE}/\text{MAE} \gg 1$: 일부 샘플에서 매우 큰 오차가 발생했음을 의미하며, 오차 분포가 오른쪽으로 긴 꼬리를 가진 형태(Skewed)임을 시사합니다.

해석 예시: - Case A: $\text{MAE}=10, \text{RMSE}=11 \rightarrow$ 오차가 전반적으로 균일함. - Case B: $\text{MAE}=10, \text{RMSE}=25 \rightarrow$ 대부분은 잘 예측했으나, 몇 개의 샘플에서 치명적인 예측 실패(Outlier)가 발생함.

산업 데이터 활용 논거

실제 산업 현장의 센서 데이터나 로그 데이터에는 통신 오류, 센서 오작동 등으로 인한 스파이크 노이즈(Spike Noise)가 빈번하게 포함됩니다.

  • MSE의 위험성: MSE는 오차를 제곱하므로, 단 하나의 극단적인 노이즈 값이 전체 손실 함수 값을 지배하게 됩니다. 이 경우 모델은 대다수의 정상 데이터를 무시하고 오직 그 노이즈 하나를 맞추기 위해 가중치를 왜곡시키는 결과를 초래합니다.
  • MAE의 선호 이유: MAE는 오차에 선형적으로 반응하므로, 소수의 이상치가 전체 학습 방향을 흔드는 것을 방지합니다. 따라서 데이터 정제(Cleaning)가 완벽하지 않은 실제 환경에서는 MAE 기반의 평가 및 학습이 모델의 일반화 성능을 높이는 데 훨씬 유리합니다.
AI 생성 콘텐츠 안내

이 문서는 AI 모델(gemma-4-31b)에 의해 생성된 콘텐츠입니다.

주의사항: AI가 생성한 내용은 부정확하거나 편향된 정보를 포함할 수 있습니다. 중요한 결정을 내리기 전에 반드시 신뢰할 수 있는 출처를 통해 정보를 확인하시기 바랍니다.

이 AI 생성 콘텐츠가 도움이 되었나요?