생활속 기초 통계 이해

히스토그램 보는 법, 분포 모양 읽기 본문

카테고리 없음

히스토그램 보는 법, 분포 모양 읽기

그래프 한입 2026. 8. 5. 23:20

히스토그램은 막대그래프와 무엇이 다른가

히스토그램은 배달시간, 키, 시험 점수처럼 수치로 측정한 자료를 일정한 구간으로 묶어 분포를 보여 주는 그래프입니다. 개별 값의 정확한 위치는 줄어들지만 값이 어디에 몰리고 얼마나 퍼져 있는지는 한눈에 드러납니다. 통계를 읽는 목적은 모양의 이름을 외우는 데 있지 않습니다. 생활 속 숫자가 무엇을 대표하며 무엇을 감추는지 판단하는 데 있습니다.

일반 막대그래프는 음식 종류나 지역처럼 서로 구별되는 범주의 크기를 비교합니다. 범주의 순서를 바꿀 수 있고 막대 사이를 띄우는 경우가 많습니다. 히스토그램의 가로축은 연속된 수치 구간이므로 순서를 임의로 바꿀 수 없으며 막대도 보통 붙여 그립니다. 높이가 가장 큰 막대는 최빈 구간을 뜻할 뿐, 평균이나 중앙값이 반드시 그 안에 있다는 뜻은 아닙니다.

비교 기준히스토그램일반 막대그래프
가로축배달시간처럼 이어지는 수치 구간메뉴처럼 서로 구별되는 범주
막대 순서수치의 크기 순서로 고정비교 목적에 따라 변경 가능
읽는 목적집중 위치, 퍼짐, 봉우리와 꼬리 확인범주별 크기 비교

막대 높이보다 앞서 확인할 것은 무엇인가

가로축에서 측정 변수와 단위를 읽고, 각 구간의 시작점과 끝점을 확인해야 합니다. 세로축이 주문 건수인지 비율인지도 구분합니다. 조사 대상, 기간, 전체 표본 수도 함께 살펴야 합니다. 주문 20건에서 생긴 작은 굴곡과 주문 2만 건에서 반복된 굴곡은 같은 무게로 해석하기 어렵기 때문입니다.

구간 폭은 분포의 인상을 크게 바꿉니다. 같은 자료도 2분 단위로 자르면 작은 봉우리가 여럿 나타날 수 있고, 10분 단위로 묶으면 하나의 완만한 봉우리처럼 보일 수 있습니다. 두 히스토그램을 비교하려면 가로축 범위와 구간 경계가 같은지 확인해야 합니다. 구간 설정이 다르면 막대 높이를 그대로 견주어서는 안 됩니다.

특히 구간 폭이 서로 다를 때는 세로축을 빈도밀도로 두고, 막대의 넓이가 해당 구간의 빈도 또는 비율을 나타내도록 해야 합니다. 빈도밀도는 빈도를 구간 폭으로 나눈 값입니다. 폭이 10분인 막대가 폭이 5분인 막대보다 높다는 이유만으로 자료가 더 조밀하다고 판단하면 안 됩니다. 이 경우에는 높이가 아니라 ‘폭×높이’인 넓이를 비교해야 합니다.

봉우리와 꼬리는 어떻게 해석하는가

봉우리는 관측값이 많이 모인 구간입니다. 가운데에 봉우리 하나가 있고 양쪽 막대가 비슷하게 낮아지면 비교적 대칭적인 분포로 볼 수 있습니다. 다만 종처럼 보인다는 이유만으로 곧바로 정규분포라고 단정할 수는 없습니다. 표본 수와 구간 설정에 따라 비슷한 모양이 만들어질 수 있습니다.

한쪽으로 낮은 막대가 길게 이어지면 치우친 분포입니다. 배달시간의 오른쪽 꼬리가 길다면 대부분은 평소 범위에 도착했지만 일부 주문이 크게 늦었을 가능성이 있습니다. 큰 값은 평균을 오른쪽으로 끌어당기므로 중앙값과 지연 주문의 비율을 함께 보는 편이 낫습니다. 왼쪽 꼬리가 길다면 유난히 빠른 주문뿐 아니라 측정 하한이나 입력 방식도 점검할 필요가 있습니다.

봉우리가 두 개라면 점심과 저녁, 가까운 지역과 먼 지역처럼 서로 다른 조건의 집단이 섞였는지 의심할 수 있습니다. 그래프만으로 원인을 확정할 수는 없습니다. 주문 시각이나 거리로 자료를 나누어 다시 그렸을 때 봉우리가 유지되는지 확인해야 합니다. 떨어진 막대 하나 역시 이상값일 수 있지만 실제 사고나 기상 악화가 반영된 값일 수도 있으므로 임의로 삭제해서는 안 됩니다.

평균 30분인 세 자료를 직접 비교해 보기

평균이 모두 30분인 세 가상 자료를 같은 구간에 넣어 보면 평균만으로 분포를 설명하기 어려운 이유가 선명해집니다. 아래 배열은 실제 업체 자료가 아니라 계산과 관찰을 위한 예시입니다. 각 배열은 10개 값의 합이 300이므로 평균은 300÷10=30분입니다.

대칭형은 20, 24, 27, 29, 30, 30, 31, 33, 36, 40입니다. 오른쪽 꼬리형은 20, 22, 24, 25, 26, 27, 28, 29, 49, 50입니다. 두 봉우리형은 21, 22, 23, 24, 25, 35, 36, 37, 38, 39입니다. 구간은 20분 이상 25분 미만부터 5분 간격으로 통일하고, 마지막 구간만 45분 이상 50분 이하로 잡았습니다.

배달시간 구간대칭형 빈도오른쪽 꼬리형 빈도두 봉우리형 빈도
20분 이상 25분 미만234
25분 이상 30분 미만251
30분 이상 35분 미만400
35분 이상 40분 미만105
40분 이상 45분 미만100
45분 이상 50분 이하020

표의 빈도를 같은 폭의 막대로 옮겨 그리면 첫 자료는 30분 부근에 집중되고, 둘째 자료는 빠른 주문이 많지만 49분과 50분이 긴 오른쪽 꼬리를 만듭니다. 셋째 자료에서는 30분 부근에 주문이 하나도 없는데도 평균은 30분입니다. 독자는 각 행의 빈도를 직접 세어 합계가 10인지 검산한 뒤, 평균을 가리고 어느 서비스가 일정한지 또는 심한 지연 위험이 있는지 판단해 볼 수 있습니다.

해석 전에 적용할 점검 순서

그래프를 받을 때는 변수와 단위, 조사 대상과 기간을 읽습니다. 이어 구간 경계와 폭, 세로축의 기준을 확인하고 자료가 집중된 위치와 전체 범위를 봅니다. 그다음 봉우리 수, 좌우 대칭 여부, 긴 꼬리와 떨어진 값을 살핍니다. 평균과 중앙값은 이 모양을 확인한 뒤 연결해야 숫자를 과도하게 대표값 하나로 압축하지 않게 됩니다.

표본이 적으면 우연한 굴곡이 특징처럼 보이고, 구간이 너무 넓으면 두 집단이나 이상값이 가려질 수 있습니다. 히스토그램이 보여 주는 것은 관측된 분포의 형태입니다. 왜 그런 형태가 생겼는지는 추가 변수와 수집 과정을 조사해야 알 수 있습니다. 보이는 사실과 원인에 대한 추정을 구분하는 태도가 통계 해석의 핵심입니다.

정의와 해석 원칙을 확인할 자료

히스토그램의 정의와 구간별 빈도 해석은 미국 국립표준기술연구소의 NIST/SEMATECH e-Handbook of Statistical Methods에서 확인할 수 있습니다. 분포의 모양, 중심, 퍼짐을 함께 살피는 기초 원칙은 OpenStax Introductory Statistics의 기술통계 단원과도 연결됩니다. 출처를 확인하더라도 실제 그래프의 구간 폭과 축 표시는 별도로 읽어야 합니다.