이동평균 계산 방법, 방문 추세 찾기
이동평균은 왜 필요한가요?
카페 방문객 수처럼 하루 단위로 크게 출렁이는 자료에서는 숫자가 올랐다는 사실과 실제 추세가 좋아졌다는 판단을 구분해야 합니다. 비, 주말, 단체 예약, 주변 행사 같은 일시적인 요인이 하루 수치를 크게 흔들 수 있기 때문입니다. 이동평균은 일정한 길이의 연속 구간을 정하고 그 안의 값을 평균 내어, 짧은 기간의 우연한 등락을 완화하는 방법입니다.
3일 이동평균이라면 연속된 3일의 값을 더해 3으로 나눕니다. 다음 값을 구할 때는 가장 오래된 하루를 제외하고 새로운 하루를 포함하므로 계산 구간이 날짜를 따라 한 칸씩 움직입니다. 미국 국립표준기술연구소의 통계 공학 안내서도 이동평균을 시계열의 불규칙한 변동을 평활화하는 방법으로 설명합니다. 핵심은 수치를 매끈하게 만드는 데 있지 않고, 원자료에서 반복되는 흐름을 더 쉽게 읽는 데 있습니다.
다만 이동평균선은 원자료를 대체하지 않습니다. 평균 과정에서 하루의 급등과 급락이 주변 날짜에 나뉘어 반영되므로, 날씨나 행사처럼 변동을 일으킨 배경 정보까지 함께 살펴야 숫자의 의미를 놓치지 않습니다.
가상 카페의 3일 이동평균은 어떻게 계산하나요?
날씨에 따라 방문객이 크게 달라지는 가상 카페의 7일 자료를 날짜별 행으로 놓고, 날씨와 상황·방문객 수·해당 날짜까지의 3일 평균을 서로 다른 열로 비교했습니다. 여기서는 과거 2일과 당일을 묶고 평균값을 구간의 마지막 날에 표시하는 후행 방식을 사용합니다.
| 요일 | 날씨와 영업 상황 | 방문객 수 | 3일 후행 이동평균 |
|---|---|---|---|
| 월요일 | 흐림 | 80명 | 자료 부족 |
| 화요일 | 비 | 50명 | 자료 부족 |
| 수요일 | 맑음 | 95명 | 75.0명 |
| 목요일 | 맑음 | 105명 | 83.3명 |
| 금요일 | 맑음·주변 행사 | 140명 | 113.3명 |
| 토요일 | 비 | 90명 | 111.7명 |
| 일요일 | 흐림 | 100명 | 110.0명 |
수요일 값은 (80+50+95)÷3=75.0명입니다. 목요일에는 월요일을 빼고 목요일을 넣어 (50+95+105)÷3=83.3명으로 계산합니다. 금요일도 같은 규칙을 적용하면 (95+105+140)÷3=113.3명입니다. 이동평균 계산 방법의 요점은 매번 새 공식을 만드는 것이 아니라, 동일한 길이와 동일한 날짜 표시 기준을 끝까지 유지하는 데 있습니다.
원자료에서는 비가 온 화요일의 50명과 행사가 있었던 금요일의 140명이 강하게 눈에 들어옵니다. 반면 이동평균은 수요일 75.0명에서 금요일 113.3명까지 올라간 뒤 주말에는 110명 안팎을 유지합니다. 이 결과만으로 장기 성장을 확정할 수는 없지만, 최근 며칠의 평균 수준이 주 초반보다 높아졌다고는 말할 수 있습니다.
특히 토요일은 전날보다 방문객이 50명 줄었는데도 이동평균이 111.7명입니다. 목요일과 금요일의 큰 값이 계산 구간에 남아 있기 때문입니다. 이 장면은 당일 실적의 하락과 최근 3일 수준의 상승이 동시에 성립할 수 있음을 보여 줍니다. 원자료와 평균선을 함께 봐야 하는 이유도 여기에 있습니다.
후행 이동평균은 왜 변화보다 늦게 움직이나요?
후행 이동평균은 오늘 값만 반영하지 않고 앞선 날짜의 값도 함께 사용합니다. 새로운 급등이나 급락이 발생해도 이전 수치가 계산 구간에서 빠져나갈 때까지 영향이 남습니다. 따라서 평균선이 실제 변화보다 늦게 방향을 바꾸는 후행성이 생깁니다. 펜실베이니아주립대학교의 시계열 교육 자료에서도 이동평균을 평활화 방법으로 다루며, 구간 길이에 따라 반응성과 평활 정도가 달라진다는 점을 확인할 수 있습니다.
평균값을 어느 날짜에 놓았는지도 밝혀야 합니다. 후행 3일 평균은 과거 2일과 당일을 묶어 마지막 날에 표시하므로 매일 운영 현황을 갱신하기 편합니다. 중심 3일 평균은 전날·당일·다음 날을 평균 내어 가운데 날에 표시합니다. 시점은 자연스럽지만 다음 날 자료가 필요해 실시간 점검에는 적합하지 않습니다. 두 방식을 한 그래프에서 설명 없이 섞으면 변화가 시작된 날짜를 잘못 읽을 수 있습니다.
3일과 7일 중 어느 기간을 선택해야 하나요?
기간이 짧으면 새 변화에 빠르게 반응하지만 우연한 등락이 충분히 줄지 않을 수 있습니다. 기간을 길게 잡으면 선은 더 부드러워지는 대신 상승과 하락을 늦게 보여 줍니다. 가장 매끈한 선이 언제나 좋은 것은 아닙니다. 분석하려는 시간 범위와 자료의 반복 주기에 맞춰 기간을 선택해야 합니다.
매일 집계한 방문 자료에서 요일 효과가 크다면 7일 이동평균은 한 주 단위의 수준을 비교하는 데 도움이 됩니다. 단기 행사나 날씨 변화에 대한 반응을 보려면 3일 평균이 더 빠르게 움직입니다. 실무적으로는 3일과 7일 결과를 함께 계산한 뒤, 중요한 전환점이 각각 며칠 늦게 나타나는지 확인하는 편이 안전합니다. 기간 선택 자체가 분석자의 판단이라는 사실도 기록해 두어야 합니다.
결측값과 특별한 날은 어떻게 다뤄야 하나요?
3일 후행 평균은 셋째 날부터, 7일 후행 평균은 일곱째 날부터 계산할 수 있습니다. 앞부분의 빈칸은 방문객이 0명이었다는 뜻이 아니라 계산에 필요한 관측일이 부족하다는 뜻입니다. 이를 0으로 채우면 관측되지 않은 날을 실제 영업했지만 손님이 없었던 날로 바꾸게 되어 평균이 낮아집니다.
중간 날짜의 값이 누락된 경우에도 임의로 0을 넣지 않아야 합니다. 휴점, 집계 오류, 기록 누락 가운데 어떤 사유인지 확인하고 처리 규칙을 남겨야 합니다. 세 날짜 중 두 날짜만 평균 낼지, 해당 구간 전체를 결측으로 둘지에 따라 결과가 달라지므로 비교 대상에는 같은 규칙을 적용해야 합니다.
날씨와 행사는 결측값이 아니라 실제 변동의 배경입니다. 금요일의 140명을 이상하다는 이유만으로 삭제하면 주변 행사가 방문에 미친 효과까지 지울 수 있습니다. 원자료 옆에 비, 휴일, 행사, 영업시간 변경을 기록하고 평균선과 함께 읽는 편이 타당합니다. 계산 기간, 후행 또는 중심 여부, 결측 처리 기준을 적어 두면 다른 사람도 같은 결과를 재현할 수 있습니다.
방문 추세는 어떤 순서로 판단해야 하나요?
날짜순 원자료를 확인한 뒤 날씨와 행사 정보를 붙이고, 정한 기간과 표시 기준으로 이동평균을 계산합니다. 그 결과를 원자료와 나란히 보면서 평균선의 방향, 당일 값과 평균의 차이, 변동이 컸던 날의 사유를 함께 점검합니다. 평균이 며칠 연속 상승했더라도 영업 조건이 달라졌다면 같은 기준의 비교인지 다시 살펴야 합니다.
하루의 급등은 중요한 사건일 수 있지만 지속적인 성장의 충분한 증거는 아닙니다. 반대로 하루의 하락만으로 추세가 꺾였다고 단정하기도 어렵습니다. 이동평균은 미래를 보장하는 예측 공식이 아니라, 생활 속 숫자의 우연한 흔들림과 최근 수준을 구분하도록 돕는 요약 도구입니다. 판단은 평균선 하나가 아니라 원자료, 계산 기준, 운영 상황을 함께 검토할 때 비로소 설득력을 갖습니다.
참고한 교육 자료
이 글의 이동평균 정의와 평활화 설명은 미국 국립표준기술연구소의 NIST/SEMATECH e-Handbook of Statistical Methods: Moving Average Smoothing, 기간과 시점 해석은 펜실베이니아주립대학교의 STAT 510: Smoothing Time Series를 참고했습니다. 결측값 부분은 관측되지 않은 값과 실제 0을 구분해야 한다는 통계 자료 처리의 기본 원칙을 사례에 적용해 설명했습니다.