모던지 / 빅데이터분석기사 / 모델링 6강. 군집, 연관, 시계열

모델링 6강. 군집, 연관, 시계열

기저귀를 사는 아빠가 맥주도 같이 산다는 그 유명한 이야기, 사실 출처가 분명하지 않습니다. 그래도 연관분석을 설명하기에 이보다 좋은 예가 없습니다.

풀고 시작

문제 1. 연관규칙에서 향상도(lift)가 1이라는 것은 무엇을 뜻하나요?
향상도는 조건부 확률을 그냥 확률로 나눈 값이라 1이면 아무 관련이 없다는 뜻입니다. 1보다 크면 양의 연관, 작으면 오히려 함께 사지 않는 관계입니다. 신뢰도가 높아도 향상도가 1 근처면 쓸모없는 규칙입니다.

장바구니 속의 규칙

연관분석은 함께 일어나는 일을 찾습니다. 세 숫자만 알면 됩니다.

지지도는 전체 거래 중 두 항목이 함께 등장한 비율입니다. 규칙이 얼마나 흔한지를 재죠. 신뢰도는 A를 산 사람 중 B도 산 비율입니다. 규칙이 얼마나 잘 맞는지를 재고요. 문제는 신뢰도만 보면 속는다는 것입니다. 원래 모두가 사는 물건이라면 무엇을 사든 그것도 같이 사게 되니까요.

그래서 향상도가 필요합니다. 신뢰도를 B의 전체 구매 비율로 나눈 값이죠. 1이면 아무 관계 없음, 1보다 크면 함께 살 확률이 우연보다 높음, 1보다 작으면 오히려 서로를 밀어냄입니다. 예를 들어 A와 B를 함께 산 비율이 0.1이고 A를 산 비율이 0.2라면 신뢰도는 0.5입니다. 여기서 B를 산 비율이 0.25라면 향상도는 2가 되어 쓸 만한 규칙이고, B를 산 비율이 0.5였다면 향상도는 1이라 아무 의미가 없습니다.

계산량은 항목 수에 따라 폭발합니다. 아프리오리 알고리즘은 여기에 영리한 가지치기를 씁니다. 어떤 집합이 드물면 그것을 포함하는 더 큰 집합은 반드시 더 드물다는 성질을 이용해, 가망 없는 조합을 아예 후보에서 지웁니다.

비슷한 것끼리 묶기

방법 원리 성격
K-평균 중심점 k개를 놓고 할당과 이동을 반복 빠르지만 k를 미리 정해야 함
계층적 군집 가까운 것끼리 차례로 병합해 덴드로그램을 만듦 k를 나중에 정할 수 있으나 느림
DBSCAN 밀도가 높은 영역을 군집으로 봄 임의 모양을 잡고 이상값을 자동 분리

K-평균의 절차는 단순합니다. 중심점 k개를 아무 데나 두고, 각 점을 가장 가까운 중심에 배정하고, 배정된 점들의 평균으로 중심을 옮기고, 이 두 단계를 변화가 없을 때까지 반복합니다. 빠르고 직관적이지만 성질이 분명합니다. 초기 중심 위치에 따라 결과가 달라지고, 군집이 둥글고 크기가 비슷하다고 가정하며, 거리 기반이라 스케일 조정이 필요합니다. k는 군집 내 거리 합이 꺾이는 지점을 보는 엘보우 방법이나 실루엣 계수로 정합니다.

계층적 군집은 k를 미리 정하지 않아도 됩니다. 가까운 것부터 차례로 묶어 나무 모양의 덴드로그램을 그린 뒤 원하는 높이에서 자르면 그것이 군집 수가 되죠. 묶을 때 두 군집의 거리를 무엇으로 볼지에 따라 최단, 최장, 평균, 와드 연결법으로 나뉩니다.

DBSCAN은 발상이 다릅니다. 개수를 정하는 대신 일정 반경 안에 최소 몇 개 이상 모여 있으면 조밀한 곳이라고 보고, 그런 점들을 이어 붙여 군집을 만듭니다. 그래서 초승달처럼 휘어진 군집도 잡아내고, 어느 군집에도 못 붙는 점은 자동으로 잡음으로 분류됩니다.

시간이 축인 데이터

시계열은 네 성분으로 쪼개 봅니다. 장기적인 방향인 추세, 일정 주기로 반복되는 계절성, 주기가 일정하지 않은 순환, 나머지 불규칙 변동입니다.

분석의 출발점은 정상성입니다. 평균과 분산이 시간에 따라 변하지 않고 자기공분산이 시차에만 의존하는 상태를 말하죠. 대부분의 모형이 정상성을 전제하므로, 정상이 아니면 만들어 줘야 합니다. 추세가 있으면 차분을 하고, 분산이 시간에 따라 커지면 로그 변환을 하며, 계절성이 있으면 계절 차분을 합니다.

모형의 이름은 조합입니다. 과거 값으로 현재를 설명하면 AR, 과거 오차로 설명하면 MA, 둘을 합치면 ARMA, 여기에 차분을 포함하면 ARIMA입니다. ARIMA의 세 숫자는 각각 자기회귀 차수, 차분 횟수, 이동평균 차수를 뜻합니다. 최근 값에 더 큰 가중치를 주며 예측하는 지수평활법도 실무에서 널리 쓰입니다.

끝으로 비모수 검정을 이름만 정리해 두겠습니다. 정규성 같은 분포 가정을 두지 않고 순위로 검정하는 방법들로, 대응 표본에는 부호검정과 윌콕슨 부호순위검정, 두 독립 표본에는 만위트니 U 검정, 셋 이상에는 크루스칼왈리스 검정을 씁니다.

인출 문제

문제 1. A와 B를 함께 구매한 거래 비율이 0.1, A를 구매한 거래 비율이 0.2, B를 구매한 거래 비율이 0.25일 때 A에서 B로 가는 규칙의 향상도는?
신뢰도는 0.1을 0.2로 나눈 0.5이고, 향상도는 그 신뢰도를 B의 구매 비율 0.25로 나눈 2입니다. 1보다 크므로 A를 산 사람이 B를 살 확률이 우연보다 높다고 볼 수 있습니다.
문제 2. K-평균 군집의 특징으로 옳지 않은 것은?
K-평균은 중심에서의 거리로 배정하므로 둥글고 비슷한 크기의 군집을 가정합니다. 휘어진 모양이나 밀도가 다른 군집은 밀도 기반인 DBSCAN이 더 잘 찾습니다.
문제 3. 시계열 자료에 뚜렷한 상승 추세가 있어 정상성을 만족하지 않습니다. 가장 일반적인 대응은?
평균이 시간에 따라 변하는 추세는 차분으로 제거하는 것이 표준적인 방법입니다. 시간이 갈수록 변동 폭이 커지는 경우에는 로그 변환이, 주기적 반복에는 계절 차분이 쓰입니다.
문제 4. 두 독립 표본의 중심 위치 차이를 정규성 가정 없이 검정하려 할 때 적절한 방법은?
만위트니 U 검정은 값을 순위로 바꿔 두 독립 집단을 비교하는 비모수 방법입니다. 같은 대상을 두 번 측정한 대응 자료라면 윌콕슨 부호순위검정이, 세 집단 이상이라면 크루스칼왈리스 검정이 대응합니다.

더 풀기

출제기준의 세세항목을 따라 이 강의 범위에서 새로 낸 문제입니다. 모의고사도 여기에서 뽑습니다.

묶음 1

문제 1. 연관규칙에서 지지도의 정의로 옳은 것은?
규칙이 얼마나 자주 나타나는지를 재는 값입니다. 두 번째 보기는 신뢰도, 네 번째는 향상도입니다.
문제 2. 신뢰도의 정의로 옳은 것은?
조건부확률의 형태입니다. A를 샀다면 B도 살 가능성을 나타냅니다.
문제 3. 향상도가 1이라는 것의 의미로 옳은 것은?
1보다 크면 양의 연관, 작으면 음의 연관입니다.
문제 4. 신뢰도가 높은데 향상도가 1보다 작은 규칙의 해석으로 옳은 것은?
인기 상품은 무엇과 묶어도 신뢰도가 높게 나오므로 향상도를 함께 봐야 합니다.
문제 5. 아프리오리 알고리즘이 탐색 공간을 줄이는 원리로 옳은 것은?
아래에서 걸러 내면 위를 볼 필요가 없다는 성질이 핵심입니다.
문제 6. FP-그로스가 아프리오리보다 빠른 이유로 가장 알맞은 것은?
데이터베이스를 반복해서 훑는 비용을 크게 줄입니다.
문제 7. 최소 지지도를 너무 낮게 잡으면 나타나는 문제로 가장 알맞은 것은?
임계값 설정이 곧 분석의 질을 좌우합니다.
문제 8. K-평균 군집의 절차로 옳은 것은?
할당 단계와 갱신 단계를 번갈아 수행합니다.
문제 9. K-평균의 한계로 보기 어려운 것은?
K-평균은 오히려 빠른 편입니다. 나머지가 대표적 한계입니다.
문제 10. K-평균의 초기 중심 선택 문제를 완화하는 방법은?
초기값에 따라 지역해에 빠지므로 여러 번 돌려 가장 좋은 결과를 고릅니다.
문제 11. 엘보 기법에서 보는 값으로 옳은 것은?
감소폭이 꺾이는 지점을 적절한 군집 수로 봅니다.
문제 12. 실루엣 계수가 1에 가까울 때의 의미로 옳은 것은?
0에 가까우면 경계에 걸쳐 있고 음수면 잘못 배정되었을 가능성이 큽니다.

묶음 2

문제 1. 계층적 군집에서 덴드로그램의 용도로 가장 알맞은 것은?
미리 군집 수를 정하지 않아도 되는 것이 장점입니다.
문제 2. 계층적 군집의 연결법 가운데 군집 사이 가장 가까운 두 점의 거리를 쓰는 방법은?
사슬 효과가 나타나 길게 늘어진 군집이 생기기 쉽습니다.
문제 3. 와드 연결법의 기준으로 옳은 것은?
크기가 비슷하고 응집된 군집을 만드는 경향이 있습니다.
문제 4. DBSCAN의 주요 매개변수로 옳은 것은?
반경 안에 최소 점 수가 있으면 핵심 점으로 보고 밀도를 따라 군집을 확장합니다.
문제 5. DBSCAN의 장점으로 가장 알맞은 것은?
밀도가 낮은 점은 잡음으로 남깁니다. 다만 밀도가 다양한 데이터에서는 매개변수 잡기가 어렵습니다.
문제 6. 혼합분포 군집의 특징으로 옳은 것은?
여러 정규분포의 혼합으로 보고 기댓값 최대화 알고리즘으로 모수를 추정합니다.
문제 7. 군집분석 전에 표준화가 필요한 이유로 가장 알맞은 것은?
연봉과 나이를 그대로 쓰면 연봉만으로 군집이 결정됩니다.
문제 8. 범주형 변수가 많은 데이터의 군집화에 적합한 방법은?
평균이 정의되지 않으므로 최빈값이나 범주형에 맞는 거리를 씁니다.
문제 9. 군집 결과를 해석할 때 반드시 해야 할 일로 가장 알맞은 것은?
번호만으로는 아무도 쓸 수 없습니다. 프로파일링이 있어야 활용됩니다.
문제 10. 시계열의 정상성이 뜻하는 바로 가장 알맞은 것은?
정상성이 성립해야 자기회귀 계열 모형을 적용할 수 있습니다.
문제 11. 비정상 시계열을 정상화하는 대표적 방법은?
추세가 있으면 차분으로, 분산이 커지면 로그 변환으로 안정화합니다.
문제 12. ARIMA에서 I가 뜻하는 것은?
AR은 자기회귀, MA는 이동평균, I는 정상화를 위한 차분 차수입니다.

묶음 3

문제 1. 시계열 분해에서 얻는 성분으로 보기 어려운 것은?
시계열은 추세와 계절, 순환, 불규칙 성분으로 나눕니다.
문제 2. 지수평활법의 특징으로 옳은 것은?
홀트윈터스 방법으로 추세와 계절성까지 확장할 수 있습니다.
문제 3. 자기상관함수를 보는 목적으로 가장 알맞은 것은?
부분자기상관함수와 함께 보아 AR과 MA의 차수를 가늠합니다.
문제 4. 시계열 예측 모형의 성능 평가에서 주의할 점으로 가장 알맞은 것은?
무작위 분할은 미래 정보를 학습에 넣는 결과가 됩니다.
문제 5. 계절성이 뚜렷한 시계열에서 전년 동월 대비를 보는 이유로 가장 알맞은 것은?
같은 시기끼리 비교하면 계절 요인이 제거됩니다.
문제 6. 백색잡음의 성질로 옳은 것은?
잔차가 백색잡음에 가까우면 모형이 구조를 충분히 담았다는 신호입니다.
문제 7. 연관분석을 상품 진열에 적용할 때 유의할 점으로 가장 알맞은 것은?
개입의 효과는 실험으로 확인해야 합니다.
문제 8. 순차 패턴 분석이 연관분석과 다른 점으로 옳은 것은?
먼저 무엇을 사고 나중에 무엇을 사는지의 시간 순서를 다룹니다.
문제 9. 군집 수를 정할 때 실루엣과 엘보의 결과가 다르면 취할 태도로 가장 알맞은 것은?
내부 지표는 참고일 뿐 정답이 아닙니다. 쓸 수 있는 군집인지가 기준입니다.
문제 10. 협업 필터링과 연관규칙의 차이로 가장 알맞은 것은?
목적과 데이터 구조가 다릅니다. 함께 쓰이기도 합니다.
문제 11. 시계열에 개입 사건이 있었을 때의 대응으로 가장 알맞은 것은?
정책 변경이나 사고 같은 구조 변화는 모형에 명시적으로 담아야 합니다.
문제 12. 군집분석 결과가 실행으로 이어지려면 함께 정의해야 하는 것은?
세분화는 다른 대응을 하기 위해 하는 것입니다. 조치가 같다면 나눌 이유가 없습니다.

이전: 5강 인공신경망과 딥러닝 · 다음: 4과목 1강 분류 모형 평가

모던지 · 궁금하면 모던지 GitHub · 2026-09-10