모던지 / 빅데이터분석기사 / 데이터 탐색 1강. 데이터 정제와 결측값

데이터 탐색 1강. 데이터 정제와 결측값

빈칸이 왜 비었는지에 따라 처리 방법이 달라집니다. 이 시험에서 결측값 문항은 거의 언제나 그 "왜"를 묻습니다.

풀고 시작

문제 1. 설문에서 체중이 많이 나가는 사람일수록 체중 문항에 답하지 않았습니다. 이 결측은 어디에 해당하나요?
빠진 이유가 바로 그 값 자체에 달려 있으므로 비무작위 결측입니다. 완전 무작위 결측은 아무 이유 없이 빠진 경우이고, 무작위 결측은 성별처럼 관측된 다른 변수로 결측 여부가 설명되는 경우입니다.

왜 비었는지가 먼저입니다

정제 작업은 세 걸음입니다. 오류의 원인을 파악하고, 정제 대상을 고르고, 방법을 정합니다. 이 순서에서 사람들이 가장 자주 건너뛰는 것이 첫 번째죠. 빈칸을 보자마자 평균으로 채우고 넘어갑니다.

체중 설문 하나로 세 경우를 갈라 보겠습니다.

완전 무작위 결측(MCAR)은 체중계 배터리가 아무 때나 나가서 몇 명의 값이 빠진 경우입니다. 빠진 이유가 데이터와 아무 상관이 없죠. 이때는 결측 행을 지워도 남은 데이터가 여전히 전체를 대표합니다.

무작위 결측(MAR)은 남성 응답자가 유독 체중을 안 적은 경우입니다. 빠진 이유가 체중 자체가 아니라 관측된 다른 변수(성별)로 설명됩니다. 이름이 헷갈리기로 악명 높은데, "무작위"는 성별을 알고 나면 그 안에서는 무작위라는 뜻입니다.

비무작위 결측(MNAR)은 무거운 사람이 안 적은 경우입니다. 빠진 이유가 빠진 값 그 자체에 있습니다. 가장 나쁜 상황이죠. 우리가 못 본 값이 우리가 못 본 이유를 만들었으니, 남은 데이터만으로는 어떤 방법으로도 복구할 수 없습니다. 이럴 때 정직한 대응은 완벽한 대체가 아니라 편향의 방향을 밝히는 것입니다.

지우기와 채우기

방법 하는 일 주의점
완전 제거법 결측이 있는 행을 통째로 삭제 표본이 급격히 줄고, MCAR이 아니면 편향이 생김
단순 대체 평균, 중앙값, 최빈값으로 채움 분산이 실제보다 작아지고 상관도 약해짐
회귀 대체 다른 변수로 결측값을 예측해 채움 관계가 실제보다 강해 보임
다중 대체 대체를 여러 벌 만들어 분석하고 결과를 합침 계산이 무겁지만 불확실성을 반영함

단순 대체가 왜 위험한지는 그림으로 그려 보면 확실합니다. 빈칸 백 개를 전부 평균값으로 채우면, 그 백 개는 평균 자리에 정확히 겹쳐 쌓입니다. 평균은 그대로지만 퍼짐이 사라지죠. 분산이 작아지면 신뢰구간이 좁아지고, 실제로는 유의하지 않은 차이가 유의하게 보일 수 있습니다. 편하다는 이유로 가장 많이 쓰이지만 대가가 분명한 방법입니다.

그래서 통계 쪽에서 권장되는 것이 다중 대체입니다. 빈칸 하나를 값 하나로 못 박는 대신, 그럴듯한 값 여러 개로 채운 데이터셋을 여러 벌 만들어 각각 분석한 뒤 결과를 합칩니다. "우리는 이 칸을 모른다"는 사실이 최종 신뢰구간의 폭에 그대로 남습니다. 그 밖에 관측된 데이터로 우도를 최대화해 추정하는 EM 알고리즘, 비슷한 이웃들의 값을 빌려 오는 KNN 대체가 있고, 비슷한 응답자의 값을 가져오는 핫덱 대체도 이름으로 자주 나옵니다.

노이즈와 잡동사니

결측만 문제가 아닙니다. 값이 있긴 한데 흔들리는 노이즈도 정제 대상이죠. 구간을 나눠 대푯값으로 뭉개는 구간화, 회귀선에 맞춰 매끄럽게 만드는 회귀 평활화, 묶이지 않는 값을 걸러 내는 군집화가 쓰입니다.

여기서 실무 감각 하나를 덧붙이면, 정제는 분석의 준비 운동이 아니라 분석의 일부입니다. 어떤 행을 지우고 어떤 칸을 어떻게 채웠는지가 결과를 바꾸기 때문에, 이 결정들은 기록으로 남아야 합니다. 같은 데이터로 다른 결론이 나오는 사고의 절반은 모델이 아니라 이 단계에서 벌어집니다.

인출 문제

문제 1. 결측값을 모두 해당 변수의 평균으로 대체했을 때 생기는 대표적인 부작용은?
대체된 값들이 평균 한 지점에 겹쳐 쌓이면서 데이터의 퍼짐이 줄어듭니다. 평균 자체는 유지되지만 분산이 축소되어 신뢰구간이 좁아지고, 실제보다 유의해 보이는 결과가 나올 수 있습니다.
문제 2. 결측이 관측된 다른 변수로는 설명되지만 결측값 자체와는 무관한 경우를 뜻하는 것은?
무작위 결측은 성별이나 연령처럼 우리가 가진 변수로 결측 여부가 설명되는 경우입니다. 완전 무작위 결측은 어떤 변수와도 무관하게 빠진 경우이고, 비무작위 결측은 빠진 값 자체가 결측 이유인 경우입니다.
문제 3. 결측이 있는 행을 모두 삭제하는 완전 제거법이 안전하다고 볼 수 있는 조건은?
결측이 데이터와 아무 관련 없이 발생했다면 남은 표본도 여전히 전체를 대표합니다. 반대로 특정 집단에서 결측이 몰려 있다면, 표본이 아무리 커도 그 집단이 통째로 빠져 편향이 남습니다.
문제 4. 다중 대체(multiple imputation)가 단순 대체보다 나은 핵심 이유는?
다중 대체는 빈칸을 값 하나로 확정하지 않고 그럴듯한 여러 값으로 채워 각각 분석한 뒤 결과를 통합합니다. 모른다는 사실이 신뢰구간의 폭에 남는다는 것이 요점이며, 원래 값을 알아내는 방법은 아닙니다.

더 풀기

출제기준의 세세항목을 따라 이 강의 범위에서 새로 낸 문제입니다. 모의고사도 여기에서 뽑습니다.

묶음 1

문제 1. 결측이 다른 어떤 변수와도 무관하게 완전히 우연히 발생한 경우를 가리키는 말은?
결측 여부가 관측값과도 결측값 자체와도 무관하면 완전 무작위 결측입니다. 이 경우에만 행을 지워도 편향이 생기지 않습니다.
문제 2. 소득 문항의 무응답이 응답자의 연령대에 따라 달라진다면 결측 유형은?
다른 관측 변수로 결측 여부를 설명할 수 있으면 무작위 결측입니다. 소득이 높을수록 답하지 않는 경우라면 결측값 자체와 연관되므로 비무작위 결측이 됩니다.
문제 3. 비무작위 결측이 특히 위험한 이유로 가장 알맞은 것은?
관측된 정보만으로 결측 구조를 설명할 수 없으므로 단순 대체로는 바로잡히지 않습니다. 결측 발생 과정 자체를 모형에 넣어야 합니다.
문제 4. 완전 제거법의 단점으로 가장 알맞은 것은?
간단하지만 데이터를 잃고, 결측이 특정 집단에 몰려 있으면 그 집단이 통째로 빠져 편향이 생깁니다.
문제 5. 평균 대체가 데이터에 남기는 대표적 왜곡은?
같은 값을 여러 칸에 채우므로 흩어짐이 줄어듭니다. 평균 자체는 유지되지만 산포와 관계 구조가 훼손됩니다.
문제 6. 다중 대체법의 특징으로 옳은 것은?
여러 벌의 대체 결과를 합치기 때문에 대체에 따르는 불확실성이 추정치의 분산에 반영됩니다.
문제 7. 회귀 대체의 한계로 가장 알맞은 것은?
회귀선 위의 값으로 채우므로 잔차가 사라져 관계가 과장됩니다. 잔차를 더해 채우는 확률적 회귀 대체로 완화합니다.
문제 8. 시계열 데이터의 결측을 채울 때 자주 쓰는 방법으로 가장 알맞은 것은?
시간의 연속성이 있으므로 이웃 시점의 정보를 쓰는 편이 자연스럽습니다. 전체 평균은 추세와 계절성을 뭉갭니다.
문제 9. 범주형 변수의 결측을 채울 때 가장 흔히 쓰는 대푯값은?
범주에는 평균이 정의되지 않으므로 최빈값을 씁니다. 결측 자체를 하나의 범주로 두는 방법도 씁니다.
문제 10. 결측을 표시하는 지시 변수를 따로 만드는 방법의 장점으로 가장 알맞은 것은?
결측 여부가 결과와 관련될 때 유용합니다. 다만 변수가 늘어나므로 남용하면 모형이 복잡해집니다.
문제 11. KNN 대체법의 원리로 가장 알맞은 것은?
거리 기준으로 가까운 이웃의 값을 쓰므로 국소 구조를 살립니다. 다만 거리 계산 때문에 데이터가 크면 느립니다.
문제 12. 결측 처리 전에 반드시 해야 할 일로 가장 알맞은 것은?
발생 이유에 따라 적절한 처리법이 달라집니다. 원인을 보지 않고 채우면 편향을 그대로 굳힙니다.

묶음 2

문제 1. 데이터 정제의 대상으로 보기 어려운 것은?
하이퍼파라미터는 모델 학습의 설정이지 데이터의 오류가 아닙니다.
문제 2. 노이즈에 대한 설명으로 가장 알맞은 것은?
무작위 변동이라는 점에서 이상값과 다릅니다. 평활화나 구간화로 완화하지만 완전히 없앨 수는 없습니다.
문제 3. 구간화를 통해 노이즈를 완화하는 방법으로 옳은 것은?
비슷한 값끼리 묶어 대푯값으로 바꾸면 작은 요동이 눌립니다. 대신 세밀한 정보가 줄어듭니다.
문제 4. 중복 레코드를 판별할 때 완전 일치만으로 부족한 이유로 가장 알맞은 것은?
주소 표기나 띄어쓰기 차이로 같은 사람이 다르게 저장됩니다. 그래서 유사도 기반의 개체 정합이 필요합니다.
문제 5. 데이터 정제에서 표준화 사전을 두는 목적으로 가장 알맞은 것은?
서울시와 서울특별시처럼 흩어진 표기를 하나로 모으는 데 쓰입니다.
문제 6. 결측 비율이 매우 높은 변수를 다루는 방법으로 가장 신중해야 할 것은?
대부분이 결측인 변수를 평균으로 채우면 사실상 상수 변수를 만들면서 있지도 않은 정보를 만들어 냅니다.
문제 7. 결측을 0으로 채우는 것이 타당한 경우로 가장 알맞은 것은?
값이 없다는 사실이 곧 0을 뜻하는 구조적 결측이라면 0이 맞습니다. 나머지는 값이 존재하지만 관측되지 않은 경우입니다.
문제 8. 데이터 정제 결과를 검증하는 방법으로 보기 어려운 것은?
학습률 조정은 정제 검증과 무관합니다. 나머지는 정제가 의도대로 되었는지 확인하는 방법입니다.
문제 9. 이상값과 결측값을 함께 다룰 때 권장되는 순서로 가장 알맞은 것은?
평균으로 채운 값이 이상값 판정 기준인 평균과 표준편차를 흔들면 판정이 왜곡됩니다.
문제 10. 데이터 정제 작업을 자동화할 때 반드시 남겨야 하는 것은?
재현과 검증을 위해 처리 이력이 필요합니다. 무엇이 언제 왜 바뀌었는지 모르면 결과를 신뢰할 수 없습니다.
문제 11. 정제 과정에서 도메인 전문가의 참여가 중요한 이유로 가장 알맞은 것은?
통계적으로 튀는 값이 업무적으로는 정상인 경우가 흔합니다. 그 판단은 도메인 지식에서 나옵니다.
문제 12. 데이터 정제의 목표로 가장 알맞은 것은?
정제는 목적에 맞는 신뢰성 확보가 목표입니다. 양이나 균일함 자체가 목표가 아닙니다.

묶음 3

문제 1. 다중 대체에서 결과를 합칠 때 사용하는 규칙에 대한 설명으로 가장 알맞은 것은?
대체본 안의 분산과 대체본 사이의 분산을 함께 반영하는 것이 핵심입니다. 그래야 불확실성이 과소평가되지 않습니다.
문제 2. 결측 대체 후 성능 평가에서 주의할 점으로 가장 알맞은 것은?
대체 규칙은 훈련 데이터에서 학습해 검증과 시험 데이터에 적용해야 정보 누출이 없습니다.
문제 3. 데이터 통합 과정에서 발생하는 문제로 보기 어려운 것은?
과대적합은 학습 단계의 문제입니다. 나머지는 통합 시 자주 부딪히는 불일치입니다.
문제 4. 데이터 정제에서 규칙 기반 접근의 한계로 가장 알맞은 것은?
규칙은 명시적이고 재현 가능하지만 예상 밖의 오류에는 무력합니다. 그래서 탐색적 점검을 함께 씁니다.
문제 5. 결측 처리 방법을 고를 때 가장 먼저 따져야 할 기준은?
왜 비었는지와 얼마나 비었는지가 방법 선택을 좌우합니다.
문제 6. 관측치의 일부 변수만 결측일 때 그 관측치를 살려 쓰는 접근으로 옳은 것은?
목록별 제거는 행을 통째로 버리지만, 대응별 제거나 대체를 쓰면 가진 정보를 살릴 수 있습니다.
문제 7. 데이터 품질 점검 규칙의 예로 보기 어려운 것은?
모델 성능은 데이터 품질 규칙이 아닙니다. 나머지는 값의 범위, 순서, 유일성에 대한 규칙입니다.
문제 8. 정제 단계에서 원자료를 보존해야 하는 이유로 가장 알맞은 것은?
정제는 판단이 섞이는 작업이라 되돌릴 수 있어야 합니다. 원자료를 덮어쓰면 복구할 길이 없습니다.
문제 9. 결측이 특정 시간대에만 몰려 있을 때 가장 먼저 의심할 것은?
시간에 몰린 결측은 대개 수집 파이프라인의 사고입니다. 통계적 대체보다 원인 복구가 먼저입니다.
문제 10. 데이터 정제 후에도 남는 불확실성을 다루는 태도로 가장 알맞은 것은?
어떻게 처리했고 무엇이 남았는지를 밝히는 것이 지적으로 정직한 방식입니다.
문제 11. 결측 대체가 예측 성능에 늘 도움이 되지는 않는 이유로 가장 알맞은 것은?
채운 값도 데이터로 취급되므로 가정이 틀리면 잡음이 아니라 왜곡된 신호가 됩니다.
문제 12. 트리 기반 모형이 결측을 상대적으로 잘 견디는 이유로 가장 알맞은 것은?
구현에 따라 결측을 하나의 방향으로 몰거나 대리 분기를 학습합니다. 거리 기반 모형보다 결측에 덜 민감한 이유입니다.

이전: 1과목 5강 데이터 수집과 저장 계획 · 다음: 2강 이상값 처리

모던지 · 궁금하면 모던지 GitHub · 2026-09-10