모델 평가는 왜 필요한가?
학습이 끝난 모델도 새로운 데이터에서 항상 정답을 맞히는 것은 아닙니다. 따라서 모델의 예측과 실제 정답을 비교하여 오류의 종류와 성능 수준을 객관적으로 확인해야 합니다.
예측 결과 비교표(Confusion Matrix, 혼동 행렬)
혼동 행렬은 실제 정답과 모델의 예측을 비교하여 네 가지 경우로 구분한 표입니다. 여기서는 이해를 돕기 위해 양성과 음성의 두 범주를 가정합니다.
FP와 FN 중 무엇이 더 중요한가?
평가 지표 계산 실습
실제 양성·음성 개수와 모델이 맞힌 개수(TP, TN)를 입력하면 FN과 FP, 주요 평가 지표가 자동으로 계산됩니다.
80
20
10
90
전체 데이터 중 올바르게 예측한 비율입니다.
양성이라고 예측한 것 중 실제 양성의 비율입니다.
실제 양성 중 모델이 찾아낸 비율입니다.
정밀도와 재현율의 균형을 나타냅니다.
지표 해석 시 주의점
정확도만으로 충분하지 않은 경우
전체의 99%가 정상 데이터인 상황에서 모든 데이터를 정상으로 예측해도 정확도는 99%입니다. 그러나 중요한 이상 데이터를 전혀 찾지 못하므로 좋은 모델이라고 보기 어렵습니다.
정밀도와 재현율의 선택
잘못된 경보를 줄이는 것이 중요하면 정밀도를, 중요한 대상을 놓치지 않는 것이 중요하면 재현율을 더 중시합니다.
NER 평가의 특징
NER은 개별 토큰의 태그가 맞는지 보는 토큰 수준 평가와 개체의 시작·끝·유형이 모두 정확한지 보는 엔터티 수준 평가가 다릅니다.
학습 내용 정리
- 혼동 행렬은 예측 결과를 TP, FP, FN, TN으로 구분합니다.
- 정확도는 전체 정답 비율, 정밀도는 양성 예측의 신뢰도, 재현율은 실제 양성의 탐지율입니다.
- F1 점수는 정밀도와 재현율을 함께 고려합니다.
- 적절한 평가 지표는 데이터 분포와 실제 업무 목적에 따라 달라집니다.