목록전체 글 (41)
생활속 기초 통계 이해
p값은 무엇의 확률일까요?p값은 귀무가설이 참이라고 가정했을 때, 실제로 관측한 결과와 같거나 그보다 더 극단적인 결과가 나올 확률입니다. 두 광고 문구의 전환율을 비교한다면 귀무가설은 보통 “두 문구의 실제 전환율 차이는 0이다”로 둡니다. p값은 이 가정과 분석 모형 아래에서 표본의 차이가 얼마나 드문지를 나타냅니다.확률의 대상은 가설이 아니라 자료입니다. p값이 0.03이어도 귀무가설이 참일 확률이 3%라는 뜻이 아니며, 관측된 효과가 우연 때문에 생겼을 확률이 3%라는 뜻도 아닙니다. 미국통계학회(ASA)의 p값 해석 원칙도 p값만으로 가설이 참일 확률이나 결과의 중요성을 판단할 수 없다고 설명합니다.유의수준 0.05를 실험 전에 정했다면 p값이 0.05 미만일 때 “5% 유의수준에서 귀무가설을 ..
비교가 많아지면 왜 우연한 성과도 늘어날까요?광고 문구, 설문 문항, 상품군처럼 여러 대상을 동시에 비교하면 통계적으로 유의한 결과를 하나쯤 발견하기 쉬워집니다. 각 검정의 유의수준을 5%로 유지해도 전체 분석에서 실수할 가능성은 5%에 머물지 않습니다. 이 현상을 다중검정 오류라고 합니다. 결과표의 별표만 보기보다 몇 번 비교한 끝에 나온 별표인지 확인해야 하는 이유입니다.효과가 실제로 없고 각 검정이 서로 독립이라고 가정하겠습니다. 한 번의 검정에서 유의하지 않을 확률은 0.95입니다. 검정을 m번 했는데 유의한 결과가 하나도 없을 확률은 0.95m이므로, 적어도 하나가 우연히 유의할 확률은 1−0.95m, 다시 쓰면 1−(1−0.05)m입니다.독립적인 검정 횟수검정별 유의수준우연한 유의 결과가 하나..
로그 스케일의 같은 간격은 무엇을 뜻할까요?세로축 숫자가 1, 10, 100, 1,000처럼 커지는데 각 눈금이 같은 간격으로 놓여 있다면 로그축일 가능성이 큽니다. 로그 스케일은 큰 값을 임의로 작게 보이게 만드는 장식이 아니라, 몇 배씩 달라지는 수치를 제한된 공간에 담는 표현 방식입니다. 값의 범위가 수십 배, 수천 배로 벌어질 때 작은 값과 큰 값의 흐름을 한 그래프에서 비교하는 데 유용합니다.선형축에서 같은 간격은 같은 차이를 뜻합니다. 10에서 20으로 이동한 거리와 20에서 30으로 이동한 거리가 같다면 두 구간 모두 10만큼 증가한 것입니다. 밑이 10인 로그축에서는 1에서 10, 10에서 100, 100에서 1,000까지가 같은 거리로 표시됩니다. 증가량은 각각 9, 90, 900으로 서..
