[하운의 R공부] 2일차 - 1%~5%

hawoon(53)
Published in
#kr
Words
371
Reading
2 min
Listen
Play
9y

책의 구성을 살펴보니, 앞부분은 주로 통계에 관한 설명을 담고 있고 마지막 Part.4에 가서야 R에대한 내용이 나오는 구성이었습니다. R을 시작하기 이전에 '통계'라는 기초를 다지는 구성으로 보입니다. 저처럼 통계와 R에 익숙하지 않은 초심자를 위한 배려라고 생각드네요

오늘은 책을 조금씩 읽으면서 워밍업을 했습니다.


  • 1% 줌아웃

데이터란 무엇일까? 데이터는 우리가 해결하고자 하는 문제에 대한 정보이다. 그러나 데이터는 정보일뿐, 문제를 바로 해결해주거나 답을 줄수는 없다. 그렇지만 "요약"을 통해 데이터는 문제해결의 방향성을 제시할 수 있게된다.


  • 5% 날줄과 씨줄

질서없이 모여있는 데이터는, {변수}라는 기준에 의해 나뉘어질 수 있다. 수많은 데이터 속 패턴을 찾기 위해선 '변수'를 적절히 설정하는것이 중요하다.

그래서 데이터 분석은 데이터를 변수 단위로 나눠서 분석하거나 변수관계를 살펴보는 것으로 시작됩니다.

변수의 개수 = p
관측치의 개수 = n
데이터의 크기 = p * n
합계 = ∑

로써 나타낸다. 이렇게 계산된 데이터를 "통계량"이라 일컫는다.

또한 데이터는 연속형(ex-몸무게)와 범주형(ex-성별)로 나니어진다.


PART 1 차이를 확인하는 데이터 요약
1% 줌아웃
5% 날줄과 씨줄
데이터의 구성|데이터와 데이터 공간|알파벳을 활용한 예제 데이터의 표현|기술 통계량과 변수 요약
10% 순서대로 한줄서기
정렬과 순서 통계량|분위수|사분위수와 다섯 숫자 요약|상자그림|히스토그램
15% 더치페이와 N빵
평균|분산|표준편차
20% 물수능과 불수능
표준화|표준화?예제
25% 먹고 싶은 거 먹어, 난 짜장
동전 던지기|파이 차트와 막대그래프
30% 0.000012%의 꿈, 로또
확률|확률을 활용한 당첨 번호 예측|데이터 분석과 확률

PART 2차이를 설명하는 통계 개념
31% 범인은 이 안에 있다
35% 부전자전, 유전 연결고리
산점도|상관관계|상관계수
40% 니가 하면 나도 한다
교차표|행 백분율과 열 백분율|열지도|독립
45% 최저가, 알고 보니 옵션가
조건부 확률과 조건부 평균|심슨의 역설
50% 아낌없이 주는 의사결정나무
모자이크 그림|의사결정나무 모형
55% 점심 뭐 먹지?
ABCDEF 테스트|분산과 분산분석

PART 3차이를 예측하는 통계 모형
56% 우연과 운명 사이
60% 지구는 우주의 티끌
표본과 모집단|통계량과 분포|자연스러운 확률
65% 웬만해선 이길 수 없다
유의수준|필요악과 같은 분포|키의 히스토그램과 정규분포
70% 남자 평균 174.9cm, 여자 평균 162.3cm
표본평균의 표준편차|표본평균의 표준편차 계산| t -값과t -분포 t -분포|p -값과t -테스트
75% 관계 검증을 위한 테스트
t -검정의 활용|카이제곱분포를 활용한 독립성검정 F -분포를 활용한 분산분석
80% 아빠 키 유전 확률, 25%
다시 한번 상관계수|선형회귀모형|부모 맘 같지 않은 자식

PART 4데이터 분석 도구, R
81% 그것이 R고 싶다
85% R 시작하기
R 설치|RStudio 설치|RStudio의 실행
90% 순서대로 살펴보는 BR31
95% R로 분석 다시 보기
하나의 연속형 변수를 요약하기|하나의 범주형 변수를 요약하기|두 개의 범주형 변수의 관계 찾기|두 개의 연속형 변수의 관계 찾기|차이를 설명하는 간단한 통계 모형 살펴보기
0% 대학만 가면 끝일 줄 알았는데
찾아보기