본문 바로가기
통계/통계 기본

통계 기본 - 2부. t-tset 전 알아야 할 것

by imkus 2024. 10. 24.

01. t-test란 무엇인가?

  • t-test는 두 집단의 평균이 같은지 다른지 비교하는 통계적 가설 검정 방법임
  • 표본이 작을 때도 신뢰성 있는 결과를 도출할 수 있는 방법으로, 데이터가 정규분포를 따른다고 가정함

 

 

02. t-test의 목적

  • t-test의 목적은 두 집단이 같은지 다른지 비교하기 위한 것
  • 두 집단이 동일한 모집단에서 나왔는지, 즉 평균이 같은지 또는 다른지를 확인함
  • 아래 예시와 같은 질문의 답을 찾기 위해 t-test를 진행함
    • A대학 남학생 평균키(178.5cm)와 B대학 남학생 평균키(179.9cm)가 우연히 같을 확률은?

 

 

03. 표본&모집단 그리고 z-test&t-test

01) 표본과 모집단

  • 모집단(population) : 연구하려는 전체 대상
  • 표본(샘플) : 모집단에서 추출한 일부 (t-test는 주로 표본의 데이터를 사용함)

02) z-test & t-tset

  • z-test
    • 모집단의 분산을 알고 있을 때 사용
    • 모집단이 정규분포를 따르는 경우 유리함
  • t-test
    • 표본의 크기가 작거나 모집단 분산을 모를 때 사용
    • t-분포를 따르며, t-분포는 표본 크기가 커질수록 정규분포에 가까워짐

 

 

 

04. 정규분포

01) 정규분포란?

  • 정규분포는 데이터가 평균을 중심으로 좌우 대칭으로 퍼져 있는 종 모양(Bell Curve)의 분포를 의미함
  • 평균은 데이터의 중심, 표준편차는 데이터의 퍼짐 정도를 나타냄
  • 특징
    • 평균과 표준편차가 다르면 서로 다른 무한대의 정규분포가 존재함
    • 정규분포곡선 아래의 면적은 확률을 의미하며, 전체 면적의 합은 1임
    • 평균±1×표준편차의 범위 안에 약 68.2%의 데이터가 포함된다.
    • 평균±2×표준편차 안에는 약 95.4%, ±3×표준편차 안에는 약 99.7%의 데이터가 포함된다.

 

02) p값과 정규분포의 관계

  • p값은 어떤 사건이 우연히 발생할 확률을 나타냄
  • 정규분포에서 p값은 곡선 아래 면적으로 구할 수 있음
  • 이 면적을 계산하기 위해 정규분포의 식을 적분해야 하지만 이는 어렵고 비효율적이므로 정규분포의 표준화를 통해 간단히 계산할 수 있음

 

03) 표준 정규분포

  • 표준 정규분포는 평균이 0, 표준편차가 1인 정규분포로, 모든 정규분포를 이 형태로 변환할 수 있음
  • 표준 정규분포로 변환하는 이유
    • 복잡한 계산을 피할 수 있음
    • 변환 후 z 값을 사용해 확률을 쉽게 구할 수 있음
  • z값을 통해 z-table을 사용하면 정규분포의 특정 구간에 해당하는 확률을 구할 수 있음

 

04) z-socre

  • z-socre는 특정 값이 평균으로부터 얼마나 떨어져 있는지를 표준편차 단위로 나타낸 값
  • 공식

  • : 특정 데이터 값
  • μ : 평균
  • σ : 표준편차
  • z-score는 표준정규분포(평균이 0, 표준편차가 1인 분포)로 데이터를 변환하는 데 사용된다.

 

 

04) 표준 정규분포 사용 예제

ex. A대학생의 신입생 1000명의 영어 점수가 평균 82점, 표준편차 5점으로 나타났을 때82점부터 90점까지의 학생 수는?
👉 90점을 표준화하여 z값을 구한 후z-table을 통해 확률을 확인할 수 있음

정규분포에서 표준 정규분포로 변환

  • 90점에서 평균 82점을 빼고 표준편차 5로 나누면 z 값은 1.6
    • z = (90 - 82) / 5 = 1.6

표준 정규분포를 이용한 z값 찾기

  • z-table에서 z = 1.6에 해당하는 확률값은 0.9452
  • 평균을 기준으로 좌측의 0.5를 제외하면 82점부터 90점까지의 확률은 0.4452 (약 44.52%)
  • 따라서 1000명 중 약 445명이 이 점수 구간에 포함됨

 

 

 

 

05. 양측검정과 단측검정

01) t-test에서 양측검정과 단측검정의 개념

  • 양측검정과 단측검정은 t-test를 수행할 때 가설 검정의 방향을 결정하는 중요한 개념임
  • 양측검정과 단측검정의 차이를 이해하려면 통계적 가설을 명확히 세우는 것이 중요함

 

02) 통계적 가설의 정의

  • 귀무가설과 대립가설은 검정을 진행하기 전 필수로 세우는 가설임
  • 귀무가설 : 두 그룹이 같다는 가설을 의미함
  • 대립가설 : 두 그룹이 다르다는 가설을 의미함

 

03) 가설의 표현 방식

  • A대학과 B대학 남학생의 평균키 비교 예시  (가설1, 가설2)
    • 귀무가설 : A대학과 B대학 남학생의 평균키는 같다
    • 대립가설 : A대학과 B대학 남학생의 평균키는 다르다
    • 같은 내용을 조금 다르게 표현하면 (가설3, 가설4)
      • 귀무가설 : A대학과 B대학 남학생의 평균키 차이는 0이다
      • 대립가설 : A대학과 B대학 남학생의 평균키 차이는 0이 아니다

 

 

04) 양측검정 (Two-tailed Test)

  • 양측검점은 대립가설에서 "다르다"는 표현만 사용하며, 두 그룹의 값이 클 수도 있고, 작을 수도 있다는 두 가지 가능성을 모두 고려함
  • 즉, 평균값의 차이가 어느 쪽으로든 유의미한 차이를 보일 수 있다는 가설을 세움
    • 예시 : "A대학 남학생의 평균키가 B대학 남학생보다 크거나 작을 수 있다."
    • 이를 통해 두 방향(좌우)에서 p값을 구해야 함
  가설 수식 내용
가설1
- 첫번째의 x¯a는 A대학 남학생의 평균키
- x¯b는 B대학 남학생의 평균키
- 여기서 μ를 사용하지 않는 이유는 우리가 사용한 데이터는 샘플 데이터이기 때문
가설2
대립가설에서 다르다는 의미를 크거나 작다로 표현할 수 있음
가설3
만약 A대학과 B대학 남학생의 평균키 차이는 0이다 혹은 아니다를 통계적 가설로 쓴다면 위와 같이 쓸 수 있음
가설4
대립가설에서 평균키 차이를 0보다 크거나 작다로 표현할 수 있음

 

  • 총 4개의 통계적 가설이 사실 같은 내용임
  • 이처럼 대립가설에서 단순히 같지 않다 혹은 다르다 라고 표현되는 경우 우리는 양측검정이라고 함

 

05) 단측검정 (One-tailed Test)

  • 단측검정은 대립가설에서 특정 방향을 명확하게 제시하는 검정 방법임
    • 예시 : "A대학 남학생의 평균키가 B대학 남학생보다 크다"
  • 단측검정은 두 그룹 중 한 그룹이 다른 그룹보다 크거나 작다는 방향성을 명확히 설정함
    • A대학이 더 클 경우 : "A대학 남학생의 평균키는 B대학 남학생의 평균키 보다 크다"
    • B대학이 더 클 경우 : "A대학 남학생의 평균키는 B대학 남학생의 평균키 보다 작다"
  • 한쪽 방향으로만 p값을 구하는 것이 특징
  가설 수식
가설1
가설2
가설3
가설4
  • 위와 같이 크거나 작은 경우 중 한 가지만을 대상으로 p값을 구하는 경우 모두 단측검정

 

 

 

 

05) 양측검정 예시

  • 위 그림은 표준 정규분포를 이용한 양측검정을 설명하고 있음
  • p값이 5%일 때, 양쪽 끝에서 각각 2.5%에 해당하는 영역이 검정에 사용됨
  • z값이 1.96이거나 -1.96일 때 p값은 5% 가 됨
  • 임계값(critical value)인 z = ±1.96을 넘지 않는다면 p값은 5% 보다 커져서 귀무가설이 채택됨
  • 임계값(critical value)인 z = ±1.96을 넘는다면 p값은 5%보다 작아져 대립가설이 채택됨

 

05) 단측검정 예시

(01) 우측검정

  • 위 그림은 표준 정규분포를 이용한 단측검정에서 우측검정을 설명하고 있음
  • p값이 5%일 때, 우측 5%에 해당하는 영역이 검정에 사용됨
  • z값이 1.6일 때 p값은 5% 가 됨
  • 임계값(critical value)인 z = 1.6을 넘지 않는다면 p값은 5% 보다 커져서 귀무가설이 채택됨
  • 임계값(critical value)인 z = 1.6을 넘는다면 p값은 5%보다 작아져 대립가설이 채택됨

 

(02) 좌측검정

  • 위 그림은 표준 정규분포를 이용한 단측검정에서 좌측검정을 설명하고 있음
  • p값이 5%일 때, 좌측 5%에 해당하는 영역이 검정에 사용됨
  • z값이 -1.6일 때 p값은 5% 가 됨
  • 임계값(critical value)인 z = -1.6을 넘지 않는다면 p값은 5% 보다 커져서 귀무가설이 채택됨
  • 임계값(critical value)인 z = -1.6을 넘는다면 p값은 5%보다 작아져 대립가설이 채택됨

 

 

06) 양측검정 vs 단측검정 선택 기준

  • 대립가설이 방향성이 없는 경우
    • 평균값이 클 수도 작을 수도 있으면 양측검정을 사용함
  • 대립가설이 특정 방향성을 갖는 경우
    • 특정 방향으로 평균값이 크거나 작다는 논리가 있으면 단측검정 사용함

 

07) 단측검정에서 우측검정과 좌측검정 선택

  • 확률분포가 좌우대칭이라면
    • 평균값의 차이가 양수이면 우측검정
    • 평균값의 차이가 음수이면 좌측검정

 

 

 

 

 

본 포스팅은 웹 도서 <통알못을 위한 기초통계1>을 참고하여 포스팅하였습니다.

아래 링크에 가시면 더욱 자세하고 좋은 내용이 있습니다.

https://who4u78.github.io/book1/

'통계 > 통계 기본' 카테고리의 다른 글

통계 기본 - 3부. t-tset  (0) 2024.10.24
통계 기본 - 1부. 통계 기초  (5) 2024.10.23