카테고리 없음

[내일배움캠프] 본캠프 4/13

anscodus 2026. 4. 13. 20:57

오늘 한 일

  • 코드카타
  • 통계학 기초 강의 (챕터 1, 2 수강)
더보기

2-1

모집단 : 전체 

표본 : 일부

왜?) 현실적인 제약(비용, 시간, 접근성), 대표성(표본의 대표성), 데이터 관리(데이터 처리의 용이성, 데이터 품질 관리), 모델 검증 용이(모델 적합도 테스트)

전수조사 : 모집단 전체 조사

포본조사 : 표본만 조사 (*표본이 대표성을 가져야 함)

 

2-2

표본오차 : 표본에서 계산된 통계량과 모집단의 진짜 값 간의 차이 -> 표본의 크기가 클수록 표본오차는 작아짐

(표본의 크기는 크게, 표본 추출 방법은 무작위로 하는것이 가장 좋음)

신뢰구간 : 모집단의 특정 파라미터(평균, 비율 ~)에 대해 측정된 값이 포함될것으로 기대되는 범위

[신뢰구간 = 표본평균 ± z x 표준오차]

(z : 선택된 신뢰수준에 해당하는 z값 / 95% 신뢰수준에서 z값 : 1.96)

 

2-3

정규분포 : 가장 대표적인 분포. / 데이터가 평균 주위에 몰려있는 분포

ex) 키, 몸무게, 시험 점수(큰 집단일 경우)

 

2-4

긴 꼬리 분포 : 데이터가 비대칭적으로 꼬리형태로 분포

Head : 비율은 적으나 차지하는 영향은 큼

Long tail : 대다수의 데이터, but 영향 적음

특정 하나의 분포를 말하는게 아님. (파레토분포, 지프의 법칙, 멱함수 등 이 있다)

ex) 소득 분포, 온라인 쇼핑, 도서 판매 등 -> 소수의 인기 제품이 많은 판매 기록

=> 아무리 데이터가 많아져도 정규분포가 되지 않는다!!

 

2-5

스튜던트 t 분포 : 표본이 작을 때 정규분포 대신 사용.

-> 자유도가 커질수록 정규분포에 가까워짐. 정규분포에 비해 두꺼운 꼬리

모집단의 표준편차를 알 수 없고, 표본이 적은 경우에 사용

ex) 작은 표본의 평균 비교, 약물 시험

 

2-6 

카이제곱 검정 : 독립성 검정이나 적합도 검정에 사용

k값 : 자유도 / 자유도에 따라 모양이 달라짐

관계를 판별하고자 하는 원인의 독립변수가 "완벽하게 서로 다른 질적 자료"일 떄 활용

ex) 독립성 검정( 성별에 따른 직업 선택) / 적합도 검정(주사위 눈이 동일한 확률로 나오는지...)

 

2-7

이항분포 : 결과가 2개만 나오는 상황일때 사용

연속된 값 x, 특정한 정수 값만 가질 수 있다(=이산형 분포)

ex) 동전 던지기, 품질 관리(불량/정상)

 

2-8

푸아송 분포 : 희귀한 사건이 발생할 때 사용

람다(발생률) : 특정 공간, 시간에서 발생하는 사건의 수

ex) 콜센터, 교통사고, 문자 메세지, 웹사이트 트래픽