개요
2020년 여름 인천에서 운영된 빅데이터 교육 과정(88시간, R·Hadoop·Spark)에서 R 부분을 맡았다. 대학생과 취업 준비생을 위한 과정이었고, 최종 커리큘럼에서 내 강의는 7월 16일, 17일, 23일, 24일 나흘 동안 24시간이다. 과정 뒷부분의 머신러닝, 하둡, 스파크는 다른 강사가 맡았다. 강의 자료는 “데이터분석과 통계 기초”라는 제목으로 묶은 14개 세션 슬라이드(1~4일차)와 실습 스크립트이고, 커리큘럼과 같은 목차로 교재 틀도 만들었다.
내용
- 1일차: R과 RStudio 설치와 기본 사용법(변수, 함수, 패키지, 자료 유형). 데이터 파악, dplyr 전처리, ggplot2 시각화.
- 2일차: sqldf로 익히는 SQL 기본 문법. 분석의 기초(과학적 연구의 진행 절차, 연구의 유형, 자료와 측정, 자료구조).
- 3일차: 기초 통계량과 표본추출, 가설검증, 카이제곱 검증과 교차분석, 평균에 대한 가설검증(일표본, 독립 이표본), 분산분석, 상관분석, 회귀분석과 로지스틱 회귀.
- 4일차: 군집분석, 연관분석(장바구니 분석), 소셜네트워크분석(네트워크의 표현, 네트워크 수준 지표와 개인 수준 중심성, R 실습).
커리큘럼과 교재 목차에는 R Markdown을 이용한 문서화, 텍스트 마이닝과 토픽모델링도 들어 있다. 대부분의 세션은 연습문제로 끝난다.
도구와 자료
- R과 RStudio.
- 패키지: dplyr, ggplot2, sqldf.
- 세션 1~14 슬라이드와 세션별 R 스크립트.
- R Markdown으로 만든 교재 틀 “빅데이터 교육 과정”.
- 실습 데이터:
mtcars,iris, 시험 점수 예제 파일.