카테고리 없음

표본 가중치 적용, 설문 결과 보정

그래프 한입 2026. 10. 3. 15:20

표본 구성 차이는 왜 결과를 바꾸는가

설문 응답자 1,000명의 의견을 모았다고 해서 그 결과가 모집단의 의견을 그대로 나타내는 것은 아닙니다. 실제 인구에서 차지하는 비율보다 특정 연령층이 많이 참여하면 그 집단의 응답이 전체 수치에 더 크게 반영됩니다. 특히 연령별 의견 차이가 큰 사안에서는 응답자 구성의 불균형만으로 찬성률이나 만족도가 상당히 달라질 수 있습니다.

표본 가중치는 이미 수집한 응답을 버리거나 응답 내용을 고치는 방법이 아닙니다. 응답 한 건이 모집단에서 몇 명분을 대표하는지 다르게 정해, 알려진 구성 차이를 계산으로 조정하는 절차입니다. 가중치가 0.40인 응답은 0.40명분으로, 2.25인 응답은 2.25명분으로 합산됩니다. 따라서 실제 응답자 수와 가중치를 반영한 추정 인원은 구분해서 읽어야 합니다.

미국 질병통제예방센터의 국민건강영양조사 지침도 조사 가중치가 표본 설계, 무응답, 모집단 보정 등을 반영하며 분석할 때 이를 사용해야 한다고 설명합니다. 다만 여기서 다루는 예시는 원리를 쉽게 보여 주기 위해 연령 구성만 맞춘 단순한 가상 계산입니다. 실제 국가통계 조사처럼 복합표본설계와 무응답 조정을 모두 구현한 사례는 아닙니다. CDC NHANES 조사 가중치 안내

연령별 기본 가중치는 어떻게 계산하는가

가상 모집단의 연령 구성을 청년층 20%, 중년층 35%, 장년층 45%라고 하겠습니다. 그런데 응답자 1,000명 중 청년층이 500명, 중년층이 300명, 장년층이 200명이라면 표본 비율은 각각 50%, 30%, 20%입니다. 이처럼 모집단과 표본의 집단 구분이 같을 때 기본 가중치는 ‘모집단 비율 ÷ 표본 비율’로 계산할 수 있습니다.

연령 집단별 모집단 비율과 기본 가중치
연령 집단모집단 비율표본 비율응답자 수기본 가중치
청년층20%50%500명0.20 ÷ 0.50 = 0.40
중년층35%30%300명0.35 ÷ 0.30 ≈ 1.17
장년층45%20%200명0.45 ÷ 0.20 = 2.25

청년층은 실제 인구 비중보다 많이 응답했으므로 1보다 작은 값을 받습니다. 반대로 표본에서 부족한 장년층은 응답 한 건의 영향이 2.25배로 커집니다. 계산 결과를 점검해 보면 500×0.40, 300×약 1.17, 200×2.25가 각각 200명, 350명, 450명에 대응합니다. 세 집단을 더하면 모집단 비율과 같은 20%, 35%, 45%가 됩니다.

이 예시에서는 가중 후 추정 인원의 합계가 원표본과 같은 1,000명이 되도록 계산되었습니다. 그러나 조사 목적과 산출 방식에 따라 가중치 합이 표본 수나 모집단 규모를 나타낼 수도 있습니다. 비율 추정에서는 가중치의 상대적 크기가 핵심이지만, 가중 인원을 실제 응답자 수처럼 표현해서는 안 됩니다. 분석표에는 정규화 여부와 가중치가 무엇을 합계로 삼는지 밝혀 두는 편이 안전합니다.

청년층 과대표집 설문은 얼마나 달라지는가

같은 설문에서 청년층 찬성률을 70%, 중년층을 50%, 장년층을 30%라고 가정하겠습니다. 가중 전 찬성자는 청년층 350명, 중년층 150명, 장년층 60명으로 모두 560명입니다. 응답자 수만 이용한 단순 찬성률은 56%입니다. 편집 화면에서 이 숫자만 보았다면 과반이 찬성했다고 요약하기 쉽지만, 연령별 응답자 구성을 함께 놓는 순간 판단이 달라집니다.

연령별 찬성 응답의 가중 전후 계산
연령 집단집단별 찬성률가중 전 찬성자가중 후 전체 인원가중 후 찬성 인원
청년층70%350명200명140명
중년층50%150명350명175명
장년층30%60명450명135명
합계가중 평균 45%560명1,000명450명

가중 후 찬성률은 450명 ÷ 1,000명으로 계산한 45%입니다. 적용 전 56%보다 11%포인트 낮습니다. 청년층이 모집단 비중보다 많이 참여했고 그 집단의 찬성률도 높았기 때문에 단순 집계가 위쪽으로 움직였던 것입니다. 이때 변화율을 11%라고 쓰면 상대적 증감과 혼동할 수 있으므로 ‘11%포인트 하락’이라고 표현해야 합니다.

45%가 무조건 참이고 56%가 틀렸다는 뜻은 아닙니다. 45%는 제시된 모집단 비율이 정확하고, 같은 연령층 안에서는 응답자가 해당 집단을 적절히 대표한다는 가정 아래 얻은 추정치입니다. 가중 전후 값을 나란히 제시하면 독자는 구성 보정이 결론에 미친 크기와 방향을 직접 확인할 수 있습니다.

큰 가중치는 왜 유효표본크기를 줄이는가

가중치는 부족한 집단의 정보를 새로 만들어 내지 못합니다. 특정 집단 응답자가 10명뿐인데 각 응답에 20의 가중치를 주면, 계산상 200명분이 되더라도 관찰한 의견은 여전히 10명에게서 나온 것입니다. 그중 한 명의 답이 바뀌거나 제외될 때 전체 추정치가 크게 흔들릴 수 있습니다.

가중치 차이로 줄어든 정보량을 살펴보는 간단한 지표가 키시 방식의 유효표본크기입니다. 응답자별 가중치를 w라고 할 때 ‘가중치 합의 제곱 ÷ 가중치 제곱합’, 즉 (Σw)² ÷ Σw²로 계산합니다. 이 근사식은 가중치가 서로 다를수록 동일한 표본 수에서 분산이 커지는 효과를 요약합니다. 조사 가중과 설계효과의 고전적 근거는 Leslie Kish의 전문서에 정리되어 있습니다. Leslie Kish, Survey Sampling

위 가상 자료에서는 가중치 합이 1,000이고 가중치 제곱합이 약 1,500.83입니다. 따라서 유효표본크기는 1,000² ÷ 1,500.83으로 약 666명입니다. 실제 응답자는 1,000명이지만, 가중치 불균등만 고려한 정보량은 동일 가중치 표본 약 666명에 가까워진다는 의미입니다. 이는 정확한 오차한계를 곧바로 제시하는 계산이 아니며 층화, 군집, 추출확률 같은 설계 요소까지 반영한 분산 추정과도 구별해야 합니다.

실무에서는 큰 가중치의 상한을 두고 절단하거나, 지나치게 세분된 집단을 합쳐 집단별 응답 수를 확보하는 방안을 검토합니다. 가중치를 절단하면 변동성은 줄어들 수 있지만 모집단 구성과 다시 차이가 생기는 편향의 대가가 따릅니다. 어느 기준이든 결과가 유리해 보이도록 사후 선택하기보다 분석 전에 원칙을 정하고, 절단 전후 결과가 얼마나 달라졌는지 확인해야 합니다.

보정 결과를 공개할 때 확인할 항목

연령만 맞췄다면 성별, 지역, 교육 수준처럼 응답 성향과 관련된 다른 구성 차이는 남을 수 있습니다. 같은 연령층 안에서도 설문에 참여한 사람과 참여하지 않은 사람의 의견이 다르면 연령 가중치만으로 비응답 편향을 없앨 수 없습니다. 보정 변수는 모집단 자료가 신뢰할 만하고 조사 결과와 관련될 가능성이 있을 때 선택해야 합니다.

결과표나 조사 방법 설명에는 원표본 수, 집단별 응답자 수, 가중 전후 비율, 가중치의 최솟값과 최댓값, 정규화 여부, 유효표본크기를 적는 것이 좋습니다. 모집단 비율의 기준 시점과 범위도 필요합니다. 전국 성인을 대상으로 해석하면서 특정 지역이나 다른 연도의 인구 구성으로 가중치를 만들었다면 산술 계산이 맞아도 해석 범위는 어긋납니다.

표본 가중치 적용은 틀린 응답을 정답으로 바꾸는 기술이 아니라, 알려진 구성 차이를 제한된 가정 아래 보정하는 절차입니다. 보정값 하나만 제시하기보다 적용 전후 수치와 가중치가 큰 집단의 실제 응답자 수를 함께 보면 변화의 이유와 불안정성을 읽을 수 있습니다. 통계에서 중요한 일은 공식을 외우는 데 그치지 않고, 숫자가 어떤 사람들과 어떤 가정에서 나왔는지 판단하는 것입니다.