목록통계해석 (17)
생활속 기초 통계 이해
기준연도 100은 무엇을 뜻할까요?물가지수에서 100은 가격이 100원이라는 뜻이 아닙니다. 여러 상품과 서비스의 가격을 하나의 흐름으로 묶어 읽기 위해 특정 연도의 수준을 100으로 정한 비교 기준입니다. 쌀은 봉지 가격, 버스는 1회 요금, 월세는 월 지급액처럼 단위가 서로 다르므로 일정한 품목 구성과 가중치, 계산 방법을 거쳐 공통 눈금으로 바꾸는 것입니다.예를 들어 2020년이 100이고 2022년이 112라면, 정해진 품목과 같은 가중치를 적용한 조건에서 2022년의 종합적인 가격 수준이 2020년보다 12% 높다는 의미입니다. 지수 112 자체에는 원이나 퍼센트 같은 단위가 없습니다. 따라서 기준연도가 다른 지수는 숫자의 크기를 곧바로 맞대기보다 어느 시점을 100으로 삼았는지부터 확인해야 합..
지역의 전체 사망률만 비교하면 무엇을 놓칠까요?지역 사망률이 높다는 사실만으로 그 지역 주민의 건강 위험이 더 크다고 단정하기는 어렵습니다. 고령자가 많은 지역은 같은 연령대의 사망 위험이 다른 곳과 같아도 전체 사망률이 높게 나타날 수 있기 때문입니다. 지역 비교에서는 실제 사망 규모를 보여 주는 조사망률과 연령 구성의 영향을 조정한 연령표준화 사망률을 구분해 읽어야 합니다.조사망률은 일정 기간에 발생한 전체 사망자 수를 해당 기간의 인구로 나눈 값입니다. 지역에서 실제로 발생한 사망 부담을 간결하게 보여 주지만, 사망 위험이 연령에 따라 크게 달라진다는 점은 따로 조정하지 않습니다. 고령층 비중이 큰 농촌과 청장년층이 많은 신도시를 조사망률만으로 비교하면 인구 구조와 건강 위험이 한 숫자에 섞입니다...
상관계수의 부호와 절댓값은 무엇을 뜻할까요?피어슨 상관계수는 두 수치형 변수가 함께 움직이는 방향과 그 관계가 얼마나 직선에 가까운지를 -1부터 1 사이의 값으로 요약합니다. 양수이면 한 변수가 커질 때 다른 변수도 커지는 경향, 음수이면 한 변수가 커질 때 다른 변수는 작아지는 경향을 나타냅니다. 0에 가깝다는 말은 뚜렷한 선형 관계가 약하다는 뜻이지, 두 변수 사이에 아무 관계도 없다는 뜻은 아닙니다. 이러한 정의와 해석은 미국 국립표준기술연구소의 NIST/SEMATECH 통계 방법 핸드북에서 다루는 상관 분석의 기본 설명과도 일치합니다.절댓값은 점들이 하나의 직선 주변에 얼마나 가깝게 모이는지를 보여줍니다. 0.8과 -0.8은 선형 관계의 강도는 비슷하지만 방향이 반대입니다. 다만 0.3은 약하고 ..
표본오차와 비표본오차는 어디서 갈리는가조사 결과에서 오차를 읽을 때는 숫자의 크기보다 발생 지점을 먼저 구분해야 한다. 표본오차는 모집단 전체가 아니라 일부를 확률적으로 뽑아 조사하기 때문에 생기는 우연한 차이다. 같은 모집단에서 같은 절차로 표본을 반복해 뽑으면 연령 구성이나 찬성 비율이 조금씩 달라지는 현상이 여기에 해당한다. 표집 방법이 적절하다는 전제 아래 표본 수를 늘리면 이런 변동은 대체로 줄어든다.비표본오차는 조사 명단 작성, 응답, 질문, 기록, 자료 처리 등 표집 이외의 과정에서 발생한다. 연락처가 없는 사람이 처음부터 빠지거나, 특정 집단이 유독 응답하지 않거나, 질문 표현이 답을 유도하거나, 입력 과정에서 값이 바뀌는 경우다. 표본 수를 늘려도 동일한 누락과 잘못된 측정이 반복되면 결..
학과별 합격률과 전체 합격률은 왜 다르게 보일까요?심슨의 역설은 하위 집단에서 관찰된 비교 방향이 자료를 합쳤을 때 약해지거나 반대로 나타나는 현상입니다. 스탠퍼드 철학 백과의 설명처럼, 전체 자료의 연관성과 집단별 연관성이 충돌할 수 있으므로 어떤 변수를 기준으로 자료를 묶었는지 함께 살펴야 합니다. 계산이 틀려서 생기는 현상이 아니라 서로 다른 구성 비율이 전체 결과에 반영된 것입니다.가상의 대학에 합격하기 어려운 A학과와 비교적 합격하기 쉬운 B학과가 있다고 가정하겠습니다. 표의 행은 학과와 성별 조합으로 나누고, 열에는 합격자 수·지원자 수·합격률을 서로 겹치지 않게 배치했습니다. 각 학과 안에서는 남성 지원자의 합격률이 더 높지만, 남성은 A학과에, 여성은 B학과에 훨씬 많이 지원한 상황입니다...
전년 동기 대비는 어느 시점과 비교할까요?전년 동기 대비는 현재 실적을 1년 전의 같은 기간과 비교한 비율입니다. 올해 2분기 매출이라면 지난해 2분기가 기준이고, 올해 7월 자료라면 지난해 7월과 비교합니다. 경제 기사와 기업 실적 자료에서는 보통 YoY(Year over Year)로 표시합니다.계산은 ‘현재 값에서 전년 같은 기간의 값을 뺀 금액’을 ‘전년 같은 기간의 값’으로 나눈 뒤 100을 곱하는 방식입니다. 지난해 2분기 매출이 112억 원이고 올해 2분기가 138억 원이라면 차이는 26억 원입니다. 이를 기준값인 112억 원으로 나누면 약 23.2%가 됩니다. 여기서 분모는 언제나 비교 기준이 되는 과거 값이라는 점이 중요합니다.같은 계절을 비교한다는 데 이 지표의 실용성이 있습니다. 여름에..
전체 건수만으로 지역을 평가하면 왜 문제가 될까요?지역별 교통사고, 범죄, 민원, 환자 수를 비교할 때 가장 눈에 잘 들어오는 숫자는 전체 건수입니다. 건수는 일정 기간에 사건이 몇 번 발생했는지 보여 주므로 처리 인력, 응급 대응, 행정 예산처럼 필요한 자원의 총량을 판단하는 데 유용합니다. 사고가 5,000건 발생한 지역은 1,000건 발생한 지역보다 현장 업무가 많을 가능성이 큽니다.그러나 지역의 상대적인 위험을 묻는다면 분자만 비교해서는 곤란합니다. 인구 500만 명인 지역의 5,000건과 인구 50만 명인 지역의 1,000건은 주민 규모가 크게 다릅니다. 전체 건수만으로 순위를 정하면 ‘사건이 많이 발생한 곳’과 ‘같은 수의 주민을 기준으로 발생 수준이 높은 곳’을 혼동하게 됩니다.따라서 규모가..
계절조정 지표는 무엇을 덜어낸 숫자일까요?월별 취업자 수가 전월보다 줄었다고 해서 곧바로 고용 경기가 나빠졌다고 단정할 수는 없습니다. 방학, 농번기, 명절, 연말처럼 해마다 비슷한 시기에 되풀이되는 변화가 관측값에 섞여 있기 때문입니다. 계절조정 지표는 이런 반복 변동을 통계적으로 추정해 제거함으로써 최근 경기 흐름을 가까운 달끼리 비교할 수 있게 만든 분석값입니다.조정 전 자료는 원계열이라고 합니다. 원계열은 해당 월에 실제로 관측된 취업자 규모를 보여 주고, 계절조정 계열은 반복되는 계절 요인을 분리한 뒤의 흐름을 보여 줍니다. 어느 한쪽이 더 진실한 숫자인 것은 아닙니다. 현재 실제 규모를 알고 싶은지, 직전 달 이후의 방향을 알고 싶은지에 따라 알맞은 계열이 달라집니다.실제 계절조정은 이동평균과..
평균 회귀는 왜 나타날까요?첫 시험에서 40점을 받은 학생이 다음 시험에서 60점을 받으면 보충수업이 효과를 냈다고 생각하기 쉽습니다. 반대로 95점이 85점으로 내려가면 집중력이나 실력이 떨어졌다고 해석하기도 합니다. 그러나 한 번의 시험 점수에는 평소 실력뿐 아니라 당일 컨디션, 문항 구성, 실수, 우연히 익숙한 문제가 나온 정도가 함께 반영됩니다. 극단적인 결과 뒤의 변화를 교육이나 훈련의 성과로 단정하기 전에 이 일시적 변동을 살펴야 합니다.평균 회귀란 한 번의 측정에서 평균보다 유난히 높거나 낮은 값이 관찰됐을 때, 다음 측정값이 이전보다 평균에 가까워지는 경향을 말합니다. 모든 학생의 점수가 결국 같아진다는 뜻은 아닙니다. 첫 결과를 극단적으로 만든 행운이나 불운이 다음 시험에서도 같은 방향과..
생존자 편향은 정확히 무슨 뜻일까요?성공한 사람의 인터뷰는 구체적이고 기억에 잘 남습니다. 반면 같은 방법을 시도했지만 중간에 그만둔 사람은 기사나 강연, 추천 목록에 좀처럼 등장하지 않습니다. 이렇게 관찰 가능한 성공 사례만 보고 전체 집단의 특징이나 성공 가능성을 판단하면 중요한 정보가 빠집니다. 통계는 성공담을 부정하는 기술이 아니라 화면 밖에 어떤 사례가 누락됐는지 묻는 도구입니다.브리태니커의 생존자 편향 설명에 따르면, 생존자 편향은 선택 과정을 통과해 눈에 남은 대상에 주의를 집중하고 그 과정에서 사라진 대상을 간과할 때 생기는 선택 편향입니다. 여기서 ‘생존’은 사람의 생존만 뜻하지 않습니다. 운영을 계속하는 사업체, 졸업한 학생, 성과를 낸 투자자, 끝까지 사용된 제품처럼 결과가 확인 가능..