목록신뢰구간 (4)
생활속 기초 통계 이해
p값은 무엇의 확률일까요?p값은 귀무가설이 참이라고 가정했을 때, 실제로 관측한 결과와 같거나 그보다 더 극단적인 결과가 나올 확률입니다. 두 광고 문구의 전환율을 비교한다면 귀무가설은 보통 “두 문구의 실제 전환율 차이는 0이다”로 둡니다. p값은 이 가정과 분석 모형 아래에서 표본의 차이가 얼마나 드문지를 나타냅니다.확률의 대상은 가설이 아니라 자료입니다. p값이 0.03이어도 귀무가설이 참일 확률이 3%라는 뜻이 아니며, 관측된 효과가 우연 때문에 생겼을 확률이 3%라는 뜻도 아닙니다. 미국통계학회(ASA)의 p값 해석 원칙도 p값만으로 가설이 참일 확률이나 결과의 중요성을 판단할 수 없다고 설명합니다.유의수준 0.05를 실험 전에 정했다면 p값이 0.05 미만일 때 “5% 유의수준에서 귀무가설을 ..
비교가 많아지면 왜 우연한 성과도 늘어날까요?광고 문구, 설문 문항, 상품군처럼 여러 대상을 동시에 비교하면 통계적으로 유의한 결과를 하나쯤 발견하기 쉬워집니다. 각 검정의 유의수준을 5%로 유지해도 전체 분석에서 실수할 가능성은 5%에 머물지 않습니다. 이 현상을 다중검정 오류라고 합니다. 결과표의 별표만 보기보다 몇 번 비교한 끝에 나온 별표인지 확인해야 하는 이유입니다.효과가 실제로 없고 각 검정이 서로 독립이라고 가정하겠습니다. 한 번의 검정에서 유의하지 않을 확률은 0.95입니다. 검정을 m번 했는데 유의한 결과가 하나도 없을 확률은 0.95m이므로, 적어도 하나가 우연히 유의할 확률은 1−0.95m, 다시 쓰면 1−(1−0.05)m입니다.독립적인 검정 횟수검정별 유의수준우연한 유의 결과가 하나..
표본오차와 비표본오차는 어디서 갈리는가조사 결과에서 오차를 읽을 때는 숫자의 크기보다 발생 지점을 먼저 구분해야 한다. 표본오차는 모집단 전체가 아니라 일부를 확률적으로 뽑아 조사하기 때문에 생기는 우연한 차이다. 같은 모집단에서 같은 절차로 표본을 반복해 뽑으면 연령 구성이나 찬성 비율이 조금씩 달라지는 현상이 여기에 해당한다. 표집 방법이 적절하다는 전제 아래 표본 수를 늘리면 이런 변동은 대체로 줄어든다.비표본오차는 조사 명단 작성, 응답, 질문, 기록, 자료 처리 등 표집 이외의 과정에서 발생한다. 연락처가 없는 사람이 처음부터 빠지거나, 특정 집단이 유독 응답하지 않거나, 질문 표현이 답을 유도하거나, 입력 과정에서 값이 바뀌는 경우다. 표본 수를 늘려도 동일한 누락과 잘못된 측정이 반복되면 결..
신뢰구간은 숫자의 흔들림을 어떻게 보여줄까요?여론조사에서 후보 지지율 옆에 붙는 ‘95% 신뢰수준에서 ±3%포인트’라는 문구는 결과에 불확실성이 있다는 표시입니다. 후보의 실제 지지율을 정확히 맞혔다는 보증도, 선거 결과가 그 범위 안에서 결정된다는 예측도 아닙니다. 통계는 숫자 하나를 확정하는 공식이라기보다, 생활 속 숫자로 어디까지 판단할 수 있는지 경계를 살피는 도구에 가깝습니다.신뢰구간은 표본에서 계산한 추정치 주변에 범위를 두어 모집단의 값을 추정하는 방법입니다. 후보 A의 조사 지지율이 42%이고 공표된 오차범위를 ±3%포인트로 단순 적용한다면 39~45%라는 구간을 적을 수 있습니다. 42%는 조사에 응답한 표본에서 얻은 점추정치이며, 39~45%는 표본추출에 따른 변동을 고려해 표현한 단순..
