목록데이터분석 (5)
생활속 기초 통계 이해
상관계수의 부호와 절댓값은 무엇을 뜻할까요?피어슨 상관계수는 두 수치형 변수가 함께 움직이는 방향과 그 관계가 얼마나 직선에 가까운지를 -1부터 1 사이의 값으로 요약합니다. 양수이면 한 변수가 커질 때 다른 변수도 커지는 경향, 음수이면 한 변수가 커질 때 다른 변수는 작아지는 경향을 나타냅니다. 0에 가깝다는 말은 뚜렷한 선형 관계가 약하다는 뜻이지, 두 변수 사이에 아무 관계도 없다는 뜻은 아닙니다. 이러한 정의와 해석은 미국 국립표준기술연구소의 NIST/SEMATECH 통계 방법 핸드북에서 다루는 상관 분석의 기본 설명과도 일치합니다.절댓값은 점들이 하나의 직선 주변에 얼마나 가깝게 모이는지를 보여줍니다. 0.8과 -0.8은 선형 관계의 강도는 비슷하지만 방향이 반대입니다. 다만 0.3은 약하고 ..
명목척도와 서열척도는 무엇이 다른가요?설문지의 숫자를 해석할 때는 숫자의 모양보다 무엇을 대신하는 값인지 살펴야 합니다. 거주 지역의 ‘1’은 범주를 구별하는 이름이고, 만족도의 ‘1’은 순서의 한쪽 끝입니다. 구매 금액 1만 원은 실제 크기와 차이를 나타냅니다. 같은 숫자 형식으로 저장됐더라도 허용되는 계산은 서로 다릅니다.명목척도는 응답을 서로 다른 집단으로 구분할 뿐 범주 사이에 높고 낮은 순서를 두지 않습니다. 거주 지역, 결제 수단, 이용 상품 종류가 여기에 해당합니다. 서울을 1, 부산을 2로 코딩해도 부산이 서울보다 높거나 두 배라는 뜻은 아닙니다. 빈도, 비율, 최빈 범주는 계산할 수 있지만 코드의 평균과 차이는 해석할 수 없습니다.서열척도는 범주의 구분과 순서를 함께 담습니다. ‘매우 불..
빈칸과 0은 왜 다른가조사표나 엑셀 파일에서 빈칸을 발견하면 0을 입력하거나 해당 행을 지우기 쉽습니다. 그러나 0은 실제로 관측된 값이고, 빈칸은 값을 알 수 없다는 표시입니다. 월 지출액 0원은 지출하지 않았다는 뜻이지만 빈칸에는 응답 거부, 기록 누락, 질문 비해당, 장비 오류처럼 서로 다른 사정이 숨어 있을 수 있습니다. 결측치 처리 방법은 계산 편의가 아니라 그 사정과 분석 목적을 기준으로 정해야 합니다.자료를 받으면 빈 셀뿐 아니라 ‘모름’, ‘응답 거부’, 하이픈, 999처럼 결측을 대신한 코드도 찾아야 합니다. 프로그램이 999를 정상적인 큰 수로 읽으면 평균이 엉뚱하게 높아질 수 있습니다. 결측 표시는 하나로 통일하되 원래의 누락 사유는 별도 변수로 보존하는 편이 안전합니다. 원자료는 수..
왜 상품 평점을 단순 평균하면 질문이 달라질까요?상품 세 개의 별점이 각각 4.8점, 4.4점, 4.0점이라면 세 숫자의 단순 평균은 4.4점입니다. 다만 각 상품에 달린 후기 수가 크게 다르면 이 값은 전체 소비자의 평가를 그대로 나타내지 않습니다. 후기 10개로 만든 평균과 후기 140개로 만든 평균을 같은 비중으로 취급하기 때문입니다.여기서 계산법을 고르기 전에 무엇을 하나의 단위로 볼 것인지 정해야 합니다. 상품별 성과를 동등하게 비교하려면 상품 세 개의 평점을 한 번씩 반영한 4.4점이 의미가 있습니다. 반면 전체 후기의 평균적인 평가를 알고 싶다면 후기 하나하나의 영향력을 같게 맞춰야 하므로 후기 수를 가중치로 사용해야 합니다.가중평균은 값마다 서로 다른 비중을 부여해 평균을 구하는 방법입니다..
평균과 중앙값은 무엇이 다른가직원들의 월급을 한 숫자로 요약할 때 가장 익숙한 대표값은 평균입니다. 그러나 일부 직원의 월급이 유난히 높은 조직에서는 평균만 보고 ‘보통 직원이 받는 월급’을 판단하기 어렵습니다. 소득처럼 값이 한쪽으로 쏠리기 쉬운 자료에서는 중앙값을 함께 살펴야 숫자가 보여 주는 의미와 한계를 구분할 수 있습니다.평균은 모든 값을 더한 뒤 자료의 개수로 나눈 값입니다. 월급을 받는 사람 모두의 금액이 계산에 반영되므로 전체 인건비를 인원수 기준으로 파악하거나 집단 간 1인당 비용을 비교할 때 유용합니다. 다만 한두 개의 값이 매우 크거나 작으면 그 방향으로 쉽게 움직입니다.중앙값은 자료를 작은 값부터 큰 값까지 배열했을 때 가운데에 놓이는 값입니다. 자료가 홀수 개라면 중앙의 값 하나를..