가설 검증(Hypothesis Testing)은 통계학에서 어떤 주장이나 가설이 통계적으로 진짜 맞는지, 아니면 단순한 우연(착시 현상)인지를 데이터 분석을 통해 판정하는 과정입니다.
쉽게 말해, "내 생각이 맞나?"를 증명하기 위해 정해진 규칙에 따라 재판을 여는 것과 같습니다.
1. 가설 설정의 두 가지 축
가설 검증을 할 때는 항상 두 가지 상반된 가설을 세워야 합니다. 법정에서 '무죄 추정의 원칙'이 적용되는 것과 매우 유사합니다.
1) 귀무가설 (Null Hypothesis) : '효과 없다, 차이 없다, 기존과 같다' 법정의 '무죄'에 해당합니다. 기본적으로 참이라고 가정하며, 이를 뒤집으려면 확실한 증거가 필요합니다.
- 예 : "이 신약은 기존 약과 효과 차이가 없다."
2) 대립가설 (Alternative Hypothesis) : '효과 있다, 차이 있다, 내가 증명하고 싶은 것' 법정의 '유죄'에 해당합니다. 연구자가 진짜로 증명하고 싶어 하는 새로운 주장입니다.
- 예 : "이 신약은 기존 약보다 효과가 좋다."
2. 가설 검증의 4단계 절차
1) 가설 수립검증하고자 하는 '귀무가설'과 '대립가설'을 명확히 정의합니다.
2) 유의수준 설정
얼마나 깐깐하게 검사할 것인가를 정하는 기준점입니다. 보통 5%($0.05$)나 1%($0.01$)를 사용합니다.
유의수준이 0.05라는 것은, "우연히 이런 결과가 나올 확률이 5%보다 작다면, 이것은 우연이 아니라 진짜 효과가 있는 것이다"라고 인정하겠다는 뜻입니다.
3) 검정통계량 계산 및 p-value 확인
모아진 데이터를 바탕으로 통계 공식을 공식에 대입해 계산합니다. 이때 가장 중요한 p-value(유의확률)가 나옵니다.
- p-value란? 귀무가설이 맞다는 전제하에, 지금 같은 데이터(또는 더 극단적인 데이터)가 관찰될 확률입니다.
4) 결과 판정 (기각 또는 채택)
$p\text{-value} < \text{유의수준}(0.05)$이면: 우연히 일어날 확률이 너무 희박하다는 뜻입니다. 따라서 귀무가설을 깜빵에 보내고(기각), 내가 주장한 대립가설을 채택합니다. (통계적으로 유의미하다!)
3. 가설 검증 시 주의할 점
두 가지 오류재판에서도 오판이 있듯, 통계에서도 오류가 존재합니다.
1) 제1종 오류 (alpha) : 실제로는 무죄(효과 없음)인데 유죄(효과 있음)라고 잘못 판정하는 것. (멀쩡한 신약을 효과 있다고 출시하는 위험)
2) 제2종 오류 (beta) : 실제로는 유죄(효과 있음)인데 증거 부족으로 무죄(효과 없음)라고 잘못 판정하는 것. (진짜 좋은 신약인데 데이터 부족으로 폐기하는 위험)
💬 의견 나누기 (0)