모던지 / 빅데이터분석기사 / 모델링 3강. 분류 모형

모델링 3강. 분류 모형

스팸 메일을 걸러 낸 것은 정교한 규칙이 아니라 단어의 빈도를 세는 단순한 확률 계산이었습니다. 그것도 말이 안 되는 가정 하나를 태연히 깔고서요.

풀고 시작

문제 1. 종속변수가 합격과 불합격 두 값뿐인데 일반 선형회귀를 적용하면 생기는 가장 큰 문제는?
직선은 위아래로 끝없이 뻗으므로 확률 범위를 벗어난 값을 내놓습니다. 그래서 결과를 0과 1 사이로 눌러 주는 시그모이드 함수를 씌운 로지스틱 회귀를 씁니다.

확률을 직선으로 만드는 요령

분류 문제에 직선을 그대로 쓸 수 없다면, 직선이 살 수 있는 곳으로 문제를 옮기면 됩니다. 로지스틱 회귀가 하는 일이 그것입니다.

먼저 확률 대신 오즈를 봅니다. 일어날 확률을 일어나지 않을 확률로 나눈 값이죠. 확률 0.8이면 오즈는 4입니다. 오즈는 0부터 무한대까지 갈 수 있어 위쪽 한계는 사라졌지만 아래는 여전히 0에서 막힙니다. 여기에 로그를 씌우면 로짓이 되고, 이제 마이너스 무한대에서 플러스 무한대까지 자유로워집니다. 이 로짓을 독립변수의 선형결합으로 놓는 것이 로지스틱 회귀입니다. 거꾸로 풀면 우리가 아는 S자 모양의 시그모이드 곡선이 나오죠.

계수 해석이 시험 단골입니다. 로지스틱 회귀의 계수는 로그 오즈의 변화량이고, 그 지수를 취한 값이 오즈비입니다. 오즈비가 2라면 그 변수가 1단위 늘 때 사건이 일어날 오즈가 두 배가 된다는 뜻입니다. 확률이 두 배가 된다는 뜻이 아닙니다. 추정은 최소제곱이 아니라 최대우도추정으로 합니다.

말이 안 되는 가정으로 잘 되는 모델

2002년, 프로그래머 폴 그레이엄이 스팸 필터에 관한 짧은 글을 씁니다. 규칙을 손으로 짜는 대신 단어의 빈도로 확률을 계산하자는 제안이었죠. 이 방식이 순식간에 퍼지면서 메일함의 풍경을 바꿔 놓습니다.

나이브 베이즈의 뼈대는 베이즈 정리입니다. 어떤 메일에 특정 단어들이 있을 때 그것이 스팸일 확률을, 스팸 메일에서 그 단어들이 나타날 확률로부터 뒤집어 구하죠. 문제는 단어 조합의 경우의 수가 폭발한다는 것입니다. 그래서 모든 단어가 서로 독립이라고 가정해 버립니다. 무료와 당첨이 함께 나오는 경향 따위는 없다고 치는 것이죠. 명백히 틀린 가정이라 "순진한(naive)"이라는 이름이 붙었습니다.

그런데도 잘 됩니다. 확률의 절댓값은 엉망이어도 어느 쪽이 더 큰지의 순서는 대체로 맞기 때문입니다. 분류는 순서만 맞으면 되니까요. 학습이 매우 빠르고 변수가 많은 텍스트 분류에서 여전히 강력합니다.

이웃에게 물어보기와 경계선 긋기

최근접 이웃(KNN)은 학습이라 할 것이 거의 없습니다. 데이터를 그냥 저장해 두었다가, 새 점이 들어오면 가장 가까운 k개의 이웃을 찾아 다수결로 정합니다. 그래서 게으른 학습이라 불리죠. 주의할 점은 둘입니다. 거리를 쓰므로 스케일 조정이 필수이고, k가 작으면 이상값에 휘둘리고 크면 경계가 뭉개집니다.

서포트 벡터 머신(SVM)은 반대로 경계선에 집착합니다. 두 클래스를 가르는 직선은 무수히 많은데, 그중 양쪽 가장 가까운 점까지의 거리(마진)가 최대가 되는 직선을 고릅니다. 이때 경계를 결정하는 데 실제로 쓰이는 몇 개의 점을 서포트 벡터라고 부르고, 나머지 점들은 있으나 없으나 결과가 같습니다.

직선으로 못 가르는 데이터는 어떻게 할까요. 커널 트릭을 씁니다. 데이터를 더 높은 차원으로 올리면 직선으로 갈라지는 경우가 많다는 사실을 이용하는데, 실제로 좌표를 계산해 올리지 않고 거리 계산만 바꿔치기해서 같은 효과를 냅니다. 계산량을 아끼는 영리한 우회로죠. 완벽히 가르는 대신 몇 개의 오분류를 허용하는 소프트 마진도 있고, 그 관대함의 정도를 정하는 값이 C입니다.

인출 문제

문제 1. 로지스틱 회귀에서 어떤 변수의 회귀계수에 지수를 취한 값이 1.5로 나왔습니다. 옳은 해석은?
계수는 로그 오즈의 변화량이므로 지수를 취하면 오즈비가 됩니다. 오즈는 확률을 그 여집합으로 나눈 값이라, 오즈가 1.5배가 된다는 것과 확률이 1.5배가 된다는 것은 다른 진술입니다.
문제 2. 나이브 베이즈 분류기가 두는 순진한 가정은?
변수들 사이의 조건부 독립을 가정해 계산량을 크게 줄입니다. 현실에서는 거의 성립하지 않는 가정이지만, 클래스 간 확률의 대소 관계는 유지되는 경우가 많아 분류 성능은 좋게 나옵니다.
문제 3. KNN을 적용하기 전에 변수 스케일을 반드시 맞춰야 하는 이유는?
연 소득처럼 수천만 단위의 변수와 나이처럼 두 자리 변수를 같이 쓰면 거리의 거의 전부를 소득이 결정합니다. 거리에 기반한 알고리즘에서 스케일 조정이 선택이 아닌 이유입니다.
문제 4. 서포트 벡터 머신에서 서포트 벡터란?
경계에서 먼 점들은 빼도 결과가 같고, 경계에 가장 가까운 소수의 점이 마진을 결정합니다. 이 점들만이 모델을 정의한다는 성질 덕분에 SVM은 데이터가 많아도 모델이 간결합니다.

더 풀기

출제기준의 세세항목을 따라 이 강의 범위에서 새로 낸 문제입니다. 베이지안 기법도 여기에 함께 담았습니다.

묶음 1

문제 1. 로지스틱 회귀에서 사용하는 연결함수는?
성공 확률의 로그 오즈를 선형식과 연결합니다. 그래서 예측값이 0과 1 사이에 머뭅니다.
문제 2. 로지스틱 회귀의 계수 추정에 쓰이는 방법은?
관측된 결과가 나올 확률을 최대로 만드는 계수를 찾습니다. 수치적으로는 반복 최적화를 씁니다.
문제 3. 나이브 베이즈가 하는 가정으로 옳은 것은?
현실에서 거의 성립하지 않는 강한 가정이지만 실제 성능은 자주 좋습니다.
문제 4. 나이브 베이즈에서 학습 데이터에 없던 조합 때문에 확률이 0이 되는 문제를 막는 방법은?
모든 빈도에 작은 값을 더해 0 확률을 없앱니다.
문제 5. 베이즈 정리에서 사후확률을 구성하는 요소로 옳은 것은?
사전 믿음에 데이터가 주는 가능도를 곱해 갱신한 것이 사후확률입니다.
문제 6. 질병 유병률이 매우 낮을 때 양성 판정의 사후확률이 낮아지는 이유로 가장 알맞은 것은?
기저율을 무시하면 판정 확률을 크게 착각하게 됩니다.
문제 7. K-최근접 이웃 알고리즘의 특징으로 옳은 것은?
게으른 학습기라고 부릅니다. 예측할 때마다 이웃을 찾아야 하므로 데이터가 크면 느립니다.
문제 8. K-최근접 이웃에서 K를 크게 하면 나타나는 변화로 옳은 것은?
K가 1이면 잡음까지 따라가고, 너무 크면 지역 구조를 뭉갭니다.
문제 9. 서포트 벡터 머신이 찾는 결정 경계로 옳은 것은?
경계에 가장 가까운 점들과의 거리를 최대로 만드는 것이 핵심입니다.
문제 10. 서포트 벡터의 의미로 옳은 것은?
이 점들만 바뀌어도 경계가 달라집니다. 나머지 점은 경계에 영향을 주지 않습니다.
문제 11. 커널 기법의 목적으로 가장 알맞은 것은?
내적만 계산하면 되므로 실제 고차원 좌표를 만들지 않아도 됩니다.
문제 12. 서포트 벡터 머신에서 비용 모수를 크게 하면 나타나는 경향은?
여백의 크기와 오분류 허용 사이의 맞바꿈을 조절하는 값입니다.

묶음 2

문제 1. 다중 클래스 분류를 이진 분류기로 처리하는 방식으로 옳은 것은?
클래스마다 하나씩 만들거나 쌍마다 하나씩 만들어 투표로 결정합니다.
문제 2. 판별분석이 가정하는 것으로 옳은 것은?
공분산이 다르다고 보면 이차판별분석이 됩니다.
문제 3. 로지스틱 회귀의 장점으로 가장 알맞은 것은?
해석 가능성이 큰 장점이라 규제 산업에서 널리 쓰입니다.
문제 4. 분류 모형의 출력이 확률일 때 얻는 이점으로 가장 알맞은 것은?
확률이 있으면 의사결정 단계에서 유연하게 대응할 수 있습니다.
문제 5. 확률 보정이 필요한 이유로 가장 알맞은 것은?
부스팅이나 서포트 벡터 머신의 점수는 확률로 바로 읽기 어렵습니다. 보정 곡선으로 점검합니다.
문제 6. 나이브 베이즈가 텍스트 분류에서 잘 작동하는 이유로 가장 알맞은 것은?
확률값 자체는 부정확해도 어느 쪽이 큰지는 잘 맞히는 경우가 많습니다.
문제 7. 분류에서 결정 임계값을 0.5로 고정하는 것이 부적절한 경우로 가장 알맞은 것은?
암 검진처럼 놓치는 비용이 큰 문제에서는 임계값을 낮춥니다.
문제 8. 로지스틱 회귀에서 완전분리가 일어나면 나타나는 현상은?
벌점을 주는 규제 로지스틱 회귀로 완화합니다.
문제 9. 분류 모형에서 클래스 사전 확률을 조정해야 하는 상황으로 가장 알맞은 것은?
표본 설계상 비율이 왜곡되었다면 운영 환경의 비율로 보정해야 합니다.
문제 10. 커널 서포트 벡터 머신의 단점으로 가장 알맞은 것은?
표본 수에 대해 계산이 급격히 늘어 대용량에는 부담이 됩니다.
문제 11. 분류 모형을 고를 때 해석 가능성이 특히 중요한 분야로 가장 알맞은 것은?
거절 사유를 설명해야 하는 규제 영역에서는 성능만으로 모델을 고를 수 없습니다.
문제 12. 두 클래스의 분포가 크게 겹칠 때 성능을 올리는 방법으로 가장 알맞은 것은?
정보가 없으면 어떤 알고리즘도 경계를 만들 수 없습니다. 변수 확보가 근본 처방입니다.

묶음 3

문제 1. 베이지안 접근에서 사전분포를 정할 때 주의할 점으로 가장 알맞은 것은?
표본이 커지면 데이터가 사전을 압도하지만, 작은 표본에서는 결론이 사전에 좌우됩니다.
문제 2. 베이지안 신용구간과 빈도주의 신뢰구간의 차이로 옳은 것은?
모수를 확률변수로 보기 때문에 해석이 직관적입니다. 대신 사전분포가 필요합니다.
문제 3. 마르코프 연쇄 몬테카를로가 쓰이는 이유로 가장 알맞은 것은?
복잡한 모형에서 적분이 불가능할 때 표본으로 분포를 재구성합니다.
문제 4. 나이브 베이즈에서 연속형 변수를 다루는 방법으로 가장 알맞은 것은?
가우시안 나이브 베이즈가 전자, 구간화가 후자의 방식입니다.
문제 5. K-최근접 이웃에서 거리 가중 투표를 쓰는 이유로 가장 알맞은 것은?
단순 다수결보다 거리에 따라 가중하면 경계 부근의 판정이 안정됩니다.
문제 6. 고차원에서 K-최근접 이웃의 성능이 떨어지는 이유로 가장 알맞은 것은?
차원의 저주의 대표적 사례입니다. 차원 축소가 함께 쓰이는 이유입니다.
문제 7. 로지스틱 회귀에서 변수의 표준화가 도움이 되는 경우로 가장 알맞은 것은?
규제 항이 계수 크기에 걸리므로 단위 차이를 없애야 공평해집니다.
문제 8. 분류 모형에서 범주가 매우 많은 목표변수를 다룰 때의 어려움으로 가장 알맞은 것은?
유사 범주를 묶거나 계층적 분류로 나누는 대응이 필요합니다.
문제 9. 판별분석과 로지스틱 회귀의 차이로 가장 알맞은 것은?
생성 모형과 판별 모형의 차이로 이해하면 정리됩니다.
문제 10. 분류 문제에서 라벨에 오류가 섞여 있을 때의 영향으로 가장 알맞은 것은?
라벨 품질 점검이 모델 개선보다 효과가 큰 경우가 많습니다.
문제 11. 준지도학습이 유용한 상황으로 가장 알맞은 것은?
라벨링 비용이 큰 현장에서 라벨 없는 데이터의 구조를 함께 활용합니다.
문제 12. 분류 모형의 예측 결과를 업무에 적용할 때 함께 정의해야 하는 것은?
예측만 있고 조치가 없으면 성과로 이어지지 않습니다.

이전: 2강 회귀분석 · 다음: 4강 의사결정나무와 앙상블

모던지 · 궁금하면 모던지 GitHub · 2026-09-10