모던지 / 빅데이터분석기사 / 결과 해석 1강. 분류 모형 평가

결과 해석 1강. 분류 모형 평가

정확도 99퍼센트의 검사에서 양성이 나왔는데 실제로 병에 걸렸을 확률이 50퍼센트인 상황이 있습니다. 평가 지표를 하나만 보면 이런 일이 벌어집니다.

풀고 시작

문제 1. 실제로 양성인 사람 중에서 모델이 양성이라고 맞힌 비율을 뜻하는 지표는?
분모가 실제 양성이면 재현율이고, 분모가 모델이 양성이라고 예측한 것이면 정밀도입니다. 헷갈릴 때는 분모가 무엇인지부터 보세요. 특이도는 실제 음성 중 음성으로 맞힌 비율입니다.

99퍼센트 정확한 검사의 함정

인구 1만 명 중 100명이 걸리는 병이 있다고 해 보죠. 유병률 1퍼센트입니다. 검사의 민감도와 특이도가 각각 99퍼센트로 아주 훌륭합니다. 당신이 검사를 받았고 양성이 나왔습니다. 실제로 병에 걸렸을 확률은 얼마일까요.

계산해 보면 이렇습니다. 환자 100명 중 99명이 양성으로 나옵니다. 그런데 건강한 9900명 중에서도 1퍼센트인 99명이 양성으로 나옵니다. 양성 판정을 받은 사람은 총 198명이고, 그중 진짜 환자는 99명입니다. 정확히 절반이죠.

이상한 일이 아닙니다. 건강한 사람이 워낙 많아서, 그 작은 오류율에서 나오는 오경보의 절대 수가 진짜 환자 수와 맞먹은 것뿐입니다. 이 계산이 이 강 전체의 요지입니다. 지표 하나로는 모델을 알 수 없고, 어떤 지표가 중요한지는 문제가 정합니다.

혼동행렬에서 다 나옵니다

모든 지표는 네 칸짜리 표 하나에서 유도됩니다. 실제와 예측을 교차시켜 놓은 혼동행렬이죠.

예측 양성 예측 음성
실제 양성 참 양성 (TP) 거짓 음성 (FN)
실제 음성 거짓 양성 (FP) 참 음성 (TN)

여기서 지표들이 나옵니다.

정확도는 전체 중 맞힌 비율입니다. 가장 직관적이지만 불균형 데이터에서는 쓸모가 없죠. 정밀도는 양성이라고 말한 것 중 진짜 양성의 비율이고, 재현율은 진짜 양성 중 잡아낸 비율입니다. 특이도는 진짜 음성 중 음성이라고 맞힌 비율이고요.

정밀도와 재현율은 서로 밀고 당깁니다. 판정 기준을 느슨하게 하면 더 많이 잡아내니 재현율이 오르지만 헛다리도 늘어 정밀도가 떨어집니다. 반대로 기준을 빡빡하게 하면 정밀도는 오르고 재현율이 떨어지죠. 그래서 둘을 하나로 합친 F1 점수를 씁니다. 산술평균이 아니라 조화평균인 이유는, 한쪽이 아주 나쁘면 평균도 함께 나빠지게 하려는 것입니다. 정밀도 1.0에 재현율 0.02인 모델의 산술평균은 0.51로 그럴듯해 보이지만 조화평균은 0.04로 정직하게 나쁩니다.

어느 쪽이 중요한지는 놓쳤을 때와 헛짚었을 때 중 무엇이 더 비싼가로 정합니다. 암 검진은 놓치면 사람이 죽으니 재현율이 우선이고, 스팸 필터는 중요한 메일을 스팸함에 넣으면 곤란하니 정밀도가 우선입니다.

임곗값을 바꿔 가며 보기

대부분의 분류 모델은 곧바로 양성과 음성을 내놓지 않고 확률을 내놓습니다. 0.5를 넘으면 양성이라고 부르는 것은 우리가 정한 약속일 뿐이죠. 이 임곗값을 0에서 1까지 움직이면 재현율과 특이도가 함께 변합니다.

ROC 곡선은 그 궤적을 그린 것입니다. 가로축은 거짓 양성률, 즉 1에서 특이도를 뺀 값이고 세로축은 재현율입니다. 곡선이 왼쪽 위 모서리에 붙을수록 좋은 모델이죠. 그 아래 면적이 AUC이고, 0.5는 동전 던지기, 1은 완벽한 분류입니다. AUC의 장점은 특정 임곗값에 얽매이지 않고 모델 자체의 변별력을 잰다는 것입니다.

다만 극단적인 불균형에서는 ROC도 낙관적으로 보일 수 있습니다. 음성이 압도적으로 많으면 거짓 양성이 좀 늘어도 거짓 양성률이 거의 안 움직이거든요. 이럴 때는 정밀도와 재현율을 축으로 하는 곡선을 함께 봅니다. 마케팅에서는 상위 몇 퍼센트를 골랐을 때 얼마나 이득인지를 보여 주는 향상도 곡선과 이익 도표도 씁니다.

인출 문제

문제 1. F1 점수가 산술평균이 아니라 조화평균을 쓰는 이유는?
조화평균은 작은 값에 끌려가는 성질이 있습니다. 정밀도가 완벽해도 재현율이 바닥이면 F1은 바닥에 가깝게 나오므로, 한쪽만 좋은 모델이 좋아 보이는 일을 막습니다.
문제 2. ROC 곡선의 가로축과 세로축은 각각 무엇인가요?
ROC는 임곗값을 움직이며 거짓 양성률과 참 양성률의 관계를 그립니다. 정밀도와 재현율을 축으로 하는 곡선은 별도의 PR 곡선이며, 불균형이 심할 때 ROC보다 유용할 수 있습니다.
문제 3. AUC가 0.5라는 것은 무엇을 뜻하나요?
AUC는 무작위로 뽑은 양성 사례가 음성 사례보다 높은 점수를 받을 확률로 해석됩니다. 0.5면 순서를 매기는 능력이 동전 던지기와 같다는 뜻이며, 정확도 50퍼센트와는 다른 개념입니다.
문제 4. 희귀 질환 검진 모델을 만들 때 재현율을 정밀도보다 우선하는 이유로 가장 적절한 것은?
지표 선택은 통계가 아니라 오류의 비용이 정합니다. 놓친 환자는 치료 시기를 잃지만 위양성은 추가 검사로 걸러낼 수 있으므로, 이 상황에서는 재현율을 우선하고 정밀도 하락을 감수합니다.

더 풀기

출제기준의 세세항목을 따라 이 강의 범위에서 새로 낸 문제입니다. 모의고사도 여기에서 뽑습니다.

묶음 1

문제 1. 혼동행렬에서 실제는 양성인데 음성으로 예측한 칸을 가리키는 말은?
놓친 양성이 거짓 음성입니다. 암 검진에서 가장 피하고 싶은 오류입니다.
문제 2. 정밀도의 정의로 옳은 것은?
예측을 분모로 하는 지표입니다. 실제 양성을 분모로 하면 재현율이 됩니다.
문제 3. 재현율과 같은 뜻으로 쓰이는 용어는?
실제 양성을 얼마나 잡아냈는지를 재는 값입니다. 특이도는 실제 음성을 얼마나 걸러 냈는지입니다.
문제 4. 특이도의 정의로 옳은 것은?
참 음성을 실제 음성 전체로 나눈 값입니다.
문제 5. F1 점수에 대한 설명으로 옳은 것은?
조화평균이라 한쪽이 매우 낮으면 값이 크게 떨어집니다.
문제 6. 100건 가운데 양성이 5건인 데이터에서 모두 음성으로 예측했을 때 정확도는?
음성 95건을 맞히므로 정확도는 95퍼센트지만 재현율은 0입니다. 불균형에서 정확도가 위험한 이유입니다.
문제 7. ROC 곡선의 두 축으로 옳은 것은?
임계값을 옮겨 가며 두 비율의 변화를 그린 곡선입니다.
문제 8. AUC 값이 0.5라는 것의 의미로 옳은 것은?
0.5는 동전 던지기 수준입니다. 0.5보다 작으면 예측을 뒤집는 편이 낫다는 뜻입니다.
문제 9. 불균형이 심할 때 ROC 곡선보다 더 정보를 주는 곡선은?
음성이 압도적으로 많으면 거짓 양성 비율이 잘 오르지 않아 ROC가 낙관적으로 보입니다.
문제 10. 임계값을 높였을 때의 일반적 변화로 옳은 것은?
확신이 높은 것만 양성으로 판정하므로 잡는 수는 줄고 정확도는 올라갑니다.
문제 11. 코헨의 카파 계수가 재는 것으로 옳은 것은?
우연에 의한 일치를 걷어 낸 뒤의 일치 정도를 나타냅니다.
문제 12. 다중 분류에서 매크로 평균과 마이크로 평균의 차이로 옳은 것은?
소수 클래스의 성능을 중요하게 보려면 매크로 평균이 적절합니다.

묶음 2

문제 1. 향상도 차트가 보여 주는 것으로 가장 알맞은 것은?
마케팅에서 상위 고객만 접촉할 때의 효율을 가늠하는 데 쓰입니다.
문제 2. 이익 도표를 쓰는 목적으로 가장 알맞은 것은?
접촉 비용과 기대 수익을 함께 반영해 어디까지 접촉할지 결정합니다.
문제 3. 분류 모형 평가에서 시험 데이터를 한 번만 써야 하는 이유로 가장 알맞은 것은?
시험 데이터는 최종 판정을 위한 것이지 개선을 위한 것이 아닙니다.
문제 4. 정확도 대신 비용 기반 평가를 써야 하는 상황으로 가장 알맞은 것은?
오류의 종류마다 값을 매겨 총비용을 최소화하는 임계값을 찾습니다.
문제 5. 매튜 상관계수의 장점으로 가장 알맞은 것은?
마이너스 1에서 1 사이의 값으로 전체 일치도를 나타냅니다.
문제 6. 분류 모형의 성능이 훈련과 시험에서 모두 낮다면 우선 점검할 것은?
과소적합 상태이므로 정보와 표현력을 먼저 늘려야 합니다.
문제 7. 모델 성능을 보고할 때 신뢰구간을 함께 제시하는 이유로 가장 알맞은 것은?
두 모델의 차이가 우연의 범위 안이라면 우열을 말할 수 없습니다.
문제 8. 두 모델의 성능 차이가 유의한지 판단하는 방법으로 가장 알맞은 것은?
우연한 분할 차이를 배제해야 결론이 섭니다.
문제 9. 분류 임계값을 정하는 근거로 가장 알맞은 것은?
임계값은 통계가 아니라 의사결정의 문제입니다.
문제 10. 모델 평가에서 데이터 누출이 의심되는 신호로 가장 알맞은 것은?
결과를 사후에 기록한 변수가 섞이면 이런 모습이 나타납니다.
문제 11. 다중 분류에서 혼동행렬을 보는 이유로 가장 알맞은 것은?
오류의 패턴을 알면 라벨 정의나 변수 보강의 실마리가 보입니다.
문제 12. 확률 예측의 품질을 재는 지표로 가장 알맞은 것은?
예측 확률과 실제 결과의 제곱오차 평균으로, 보정 상태까지 반영합니다.

묶음 3

문제 1. 교차검증 결과를 보고할 때 함께 제시해야 할 값으로 가장 알맞은 것은?
평균이 같아도 흔들림이 크면 신뢰하기 어렵습니다.
문제 2. 시간이 지남에 따라 성능이 떨어지는 현상을 확인하려면 어떤 평가가 필요한가요?
데이터 분포가 변하면 과거 기준의 성능은 유지되지 않습니다.
문제 3. 집단별로 성능을 나누어 보는 이유로 가장 알맞은 것은?
공정성 점검의 기본이자 성능 개선의 단서가 됩니다.
문제 4. 정밀도와 재현율을 동시에 올리기 어려운 이유로 가장 알맞은 것은?
둘을 함께 올리려면 임계값이 아니라 모델 자체의 분별력을 높여야 합니다.
문제 5. ROC 곡선이 대각선 아래로 내려간다면 의심할 것은?
예측을 뒤집으면 대각선 위로 올라옵니다. 라벨 정의를 먼저 확인해야 합니다.
문제 6. 분류 모형 평가에서 정확도만 보고하는 것이 위험한 이유로 가장 알맞은 것은?
어떤 오류를 얼마나 냈는지가 실제 의사결정에 중요합니다.
문제 7. 재현율이 특히 중요한 상황으로 가장 알맞은 것은?
놓치는 비용이 클 때 재현율을 우선합니다.
문제 8. 정밀도가 특히 중요한 상황으로 가장 알맞은 것은?
잘못 잡은 비용이 클 때는 정밀도를 우선합니다.
문제 9. 모델 평가 지표를 하나만 고르라는 요구에 대응하는 방법으로 가장 알맞은 것은?
어떤 지표든 업무 목적과의 연결을 설명할 수 있어야 합니다.
문제 10. 검증 데이터에서 임계값을 정한 뒤 시험 데이터에 적용하는 이유로 가장 알맞은 것은?
선택에 쓰인 데이터는 평가에 쓸 수 없다는 원칙이 여기에도 적용됩니다.
문제 11. 모델의 오분류 사례를 직접 살펴보는 작업의 가치로 가장 알맞은 것은?
지표만 보면 무엇을 고쳐야 할지 알 수 없습니다.
문제 12. 평가 결과를 이해관계자에게 전달할 때 가장 효과적인 방식으로 가장 알맞은 것은?
월 몇 건의 이탈을 미리 잡는다는 식의 표현이 의사결정을 만듭니다.

이전: 3과목 6강 군집, 연관, 시계열 · 다음: 2강 회귀 모형 평가와 적합도 검정

모던지 · 궁금하면 모던지 GitHub · 2026-09-10