이전

리뷰 (6)

한줄평
평점 분포
  • 리뷰 총점10 67%
  • 리뷰 총점8 33%
  • 리뷰 총점6 0%
  • 리뷰 총점4 0%
  • 리뷰 총점2 0%
연령대별 평균 점수
  • 10대 0.0
  • 20대 0.0
  • 30대 10.0
  • 40대 9.0
  • 50대 7.0

포토/동영상 (2)

리뷰 총점 종이책
『모두의 R 데이터 분석』
"『모두의 R 데이터 분석』" 내용보기
먼저, 『모두의 R 데이터 분석』 리뷰어로 선정해주셔서 감사합니다.1. 책을 받아보기전 기대: 회사에 있다보면 조직 이동을 모집하는 경우를 볼 수 있습니다. 1년 전에는 딥러닝 관련 분야들이 많았다면 요즘에는 데이터 관련 조직들도 많이 보이더라구요.... 이 기회에 데이터 분석을 공부해보고 싶어 서평단에 지원하였습니다.하드웨어 전공이었지만 모두의 딥러닝과 모두의 알고리즘
"『모두의 R 데이터 분석』" 내용보기

먼저, 『모두의 R 데이터 분석 리뷰어로 선정해주셔서 감사합니다.

1. 책을 받아보기전 기대

: 회사에 있다보면 조직 이동을 모집하는 경우를 볼 수 있습니다. 1년 전에는 딥러닝 관련 분야들이 많았다면 요즘에는 데이터 관련 조직들도 많이 보이더라구요.... 이 기회에 데이터 분석을 공부해보고 싶어 서평단에 지원하였습니다.


하드웨어 전공이었지만 모두의 딥러닝과 모두의 알고리즘을 통해 딥러닝과 알고리즘의 기초를 쌓아 현재 딥러닝 관련 직무에 자리할 수 있었습니다.


이번에 근무하면서 관련없다고 생각했지만 데이터 분석과 R 사용법을 필요로 할 때가 많았습니다. 마음의 여유가 없어서 시작 못했던 R에 대한 공부를 '모두의 R 데이터 분석'을 통해 시작하여 기초를 잘 쌓고 싶습니다. 이와 같은 이유로 서평단에 신청하게 되었습니다.


감사합니다.


받은 책이 생각보다 두꺼워 일부만 읽어보고 리뷰를 작성하겠습니다.


2. 두둥! 배송온 책 : )

: 역시 모두의 시리즈는 책이 예뻐서 공부하고 싶은 마음이 많이 들게 해요

a. 앞표지


b. 뒷표지

: 데이터 분석을 요리에 비유한 것이 GOOD!


3. 대략의 리뷰

: 이 책을 총 9개의 Chapter로 구성되어 있습니다.

: 크게 3개의 파트로 나눌 수 있습니다.


a. 데이터 분석 준비 !

데이터 분석을 위한 Tool을 준비하는 과정을 Step By Step 글과 사진으로 설명해주어 처음 해보지만 쉽게 따라갈 수 있었습니다.


b. 데이터 분석 기초!

이 책을 처음 받았을 때, 데이터 분석을 요리에 비유한 것을 알 수 있었습니다. 아래의 사진 역시 데이터 분석의 이론을 요리와 관련된 재료 사진으로 표현해 두었습니다. 그 외에도 깔끔한 그림과 표 , 코드 누구나 쉽게 데이터 분석을 배울 수 있는 것 같습니다.


c. 데이터 분석 실전 프로젝트!

마지막으로 흥미로운 주제들로 구성된 실전 프로젝트 !! 이 책을 따라 공부를 진행하면 재미있고 쉽게 데이터 분석을 배워 ... 새로운 조직에 말단으로 들어갈 실력은 쌓을 수 있을 것 같아요 : )



데이터 분석에 흥미를 가지고 시작하시려는 분들!

데이터 분석 팀으로 조직 이동이나 이직을 준비하시는 분들!

이 책을 추천해 드려요 : )


긴 글 읽어 주셔서 감사합니다.


YES24 리뷰어클럽 서평단 자격으로 작성한 리뷰입니다.

a******9 2020.11.03. 신고 공감 1 댓글 0
리뷰 총점 종이책
R 입문자라면 그냥 이 책으로 시작하시길!
"R 입문자라면 그냥 이 책으로 시작하시길!" 내용보기
먼저, R을 입문하는 사람이라면 이 책을 추천하고 싶습니다.컬러 인쇄와 이해하기 쉽게 구성된 책의 편집은 입문서로 아주 훌륭합니다. 데이터 분석에서 있어서 전체 흐름을 다질 수 있게 해주기에 이 책은 R에 대한 스킬 향상과 데이터 분석 프로세스를 다질 수 있게 해주는 책입니다. R의 개요, 설치, 데이터 분석 의미, 데이터 구조나 변수 및 함수 프로그래밍 등 초보자를 위한 전개
"R 입문자라면 그냥 이 책으로 시작하시길!" 내용보기

먼저, R을 입문하는 사람이라면 이 책을 추천하고 싶습니다.

컬러 인쇄와 이해하기 쉽게 구성된 책의 편집은 입문서로 아주 훌륭합니다. 

데이터 분석에서 있어서 전체 흐름을 다질 수 있게 해주기에 이 책은 R에 대한 스킬 향상과 데이터 분석 프로세스를 다질 수 있게 해주는 책입니다. 


R의 개요, 설치, 데이터 분석 의미, 데이터 구조나 변수 및 함수 프로그래밍 등 초보자를 위한 전개가 아주 훌륭합니다. 7,8장에서는 R에서 정말정말 중요한 dplyr 패키지와 ggplot2 패키지에 대해 설명해줍니다. 시각화에 있어서는 아직 파이썬이 ggplot2를 능가하지 못한다고 생각합니다. 조작과 모델링, 시각화에 장점을 가지고 있는 tidyr, 대용량 데이터를 중요한 data table, 문서 작성을 가능하게 도와주는 R markdown, R로 웹이나 앱 애플리케이션을 만들 수 있게 하는 shiny, ggplot2로 그린 그래프 옵션 설정을 돕는 ggThemeAssist, 엑셀에 있는 데이터를 읽거나 쓸 때 필요한 readxl, writexl 등의 패키지도 소개하고 있습니다.

또한, 기초 통계 이론과 통계적 가설 검정 파트는 데이터 분석가로써의 틀을 다지는데 좋은 챕터도 있습니다. 


R을 2년만에 다시 복습하면서 이 책으로 공부했는데 굉장히 재밌게 공부할 수 있었습니다 :) 






d*****k 2020.11.08. 신고 공감 0 댓글 0
리뷰 총점 종이책
모두의 R 데이터 분석
"모두의 R 데이터 분석" 내용보기
본 도서는 R과 통계를 모르는 입문자들도 쉽게 데이터 분석의 세계에 발을 들여 놓을 수 있도록 도와주는 책으로 R의 기초에서 시작하여 비즈니스 실무에 적용할 수 있을 입문 수준의 지식까지 다룬다.새로운 IT 기술이 등장할 때마다 보통 “모두의 ooo” 시리즈를 즐겨 찾는다. 1999년 PC를 조립하고 컴퓨터 구조를 이해하는데 무작정 따라하기 시리즈의 책이 내게 워낙 강렬한 인상을
"모두의 R 데이터 분석" 내용보기

본 도서는 R과 통계를 모르는 입문자들도 쉽게 데이터 분석의 세계에 발을 들여 놓을 수 있도록 도와주는 책으로 R의 기초에서 시작하여 비즈니스 실무에 적용할 수 있을 입문 수준의 지식까지 다룬다.

새로운 IT 기술이 등장할 때마다 보통 “모두의 ooo” 시리즈를 즐겨 찾는다. 1999년 PC를 조립하고 컴퓨터 구조를 이해하는데 무작정 따라하기 시리즈의 책이 내게 워낙 강렬한 인상을 남겼기에 길벗 출판사 책은 믿고 즐겨보는데 몇년 전 부터는 모두의 시리즈 책이 큰 도움이 되고 있다. 대표적으로 알파고 등장 당시 딥러닝 입문에 큰 도움을 받았던 모두의 딥러닝을 예로 들 수 있다.

프로그래머로 십여년 간 활동을 했기에 상대적으로 Python에는 친숙하지만 R과는 약간 거리가 있었다. 마침 R 데이터 분석이 모두의 시리즈로 등장하였기에 R의 기초를 정리해보고 부족한 부분을 채우고자 본 도서를 읽게 되었다.

전체적인 총평을 먼저 내리자면 모두의 시리즈 답게 매우 만족스러웠고, 책 말미에 언급된 저자가 표현한 가장 쉽게 핵심만이라는 구절과 전체 내용이 일맥 상통했다. AI 및 데이터 분석에 관심이 많은 나로써는 집에 R과 관련된 책을 10권 이상 구매하여 보고 있는데 그 중 입문서로 가장 뛰어난 책이라는 생각이 든다.

다른 서적과 비교해 볼 때 어떤 입문서는 R 함수를 하나씩 전부 소개하는 책도 있다. 실습할 때는 쉽고 따라하기 좋은데 전체 프로젝트를 수행할 땐 파편화된 지식을 엮어내는데 고충을 겪는다.

또 어떤 책은 깊은 통계와 수식이 난무한다. 일정 수준 이상 오르면 그 책은 나름대로의 분명한 가치를 지니겠지만 적어도 입문 서적으로는 정말 도움이 안된다. 읽다보면 숲을 잃고 길을 헤매는 느낌이다.

반면 본 도서는 정말 당장 필요한 것만 알려주는 느낌이 들어 만족스러웠다. 핵심만 다룬다는 것이 어떤 의미인지 각 장별로 간단한 소개를 해볼까 한다.

먼저 1 ~ 5장은 기초 과정이다. R의 개요, 설치, 데이터 분석의 의미, 데이터 구조나 변수 및 함수와 같은 프로그래밍에 필요한 왕초보 지식을 담고 있다. 데이터 분석이나 프로그래밍을 알고 있는 사람이라면 건너뛰어도 좋을 수준인데 앞서 언급했듯 대상 독자를 R을 전혀 모르는 독자를 위해 다루는 부분인 듯 하다.기초


이어지는 6장 ~ 9장이 핵심이라 할 수 있는데 먼저 6장에는 R에서 가장 많이 활용하는 연산자와 함수, 시각화의 기본 등이 등장한다.

7장은 dplyr 패키지를 집중적으로 다루는데 Tabular 구조의 자료를 처리하기에 적합한 패키지이다. Python에 비유하자면 Pandas 패키지를 학습하는 장이라고 생각하면 되겠고 RDBMS와 관련지어 SQL에 해당하는 파트라고 할 수 있다.

데이터 분석의 가장 핵심이 되는 기본을 다루는데 Outer Join을 비롯 처음 접하면 생소한 개념들을 그림으로 굉장히 쉽게 풀어주는 점이 인상적이었다. 특히 SQL을 어느 정도 알고 있는 사람이라면 해당 부분에 1시간 정도만 투자하면 바로 R로 테이블 형태를 조작하는데 전혀 무리가 없을 것이라는 생각이 든다.

8장은 ggplot2를 이용한 시각화 파트이다. 시각화는 정말 R의 꽃이라고 할 수 있다. Python을 주로 활용하는 나로써는 이 부분이 늘 아쉬운 부분이다. Pandas 또한 R의 데이터프레임을 모방했는데 나름대로 약간의 불편함이 있긴 해도 쓸만하다. 반면 시각화를 위한 ggplot2과 Python을 비교하라면 견줄만한 좋은 라이브러리가 딱히 떠오르지 않는다.

때문에 데이터 분석 결과를 실무에 보고하거나 커뮤니케이션 하기 위한 시각화 부분 만큼은 도출된 자료를 토대로 R을 활용하는 일도 종종있다. 다만 ggplot2의 기능이 워낙 방대하고 시각화에 대한 활용 지식이 받쳐주지 않는 다면 이 또한 사용하기 쉽다고 볼 수는 없는데 그간의 경험을 비추어 볼 때 가장 필요한 부분만 적은 분량으로 요약하고 있어 마음에 들었다.

처음으로 데이터 분석을 접하는 사람이라면 이 책이 핵심과 방향을 잡아주는데 큰 도움이 될 것 같다는 생각이 들었다. 또한 어떤 상황에서 어떤 시각화 자료를 이용하는 것이 좋은 방법인지 잘 요약하고 있어 입문자가 빠르게 ggplot2을 익히는 데 이만한 도서도 없겠다는 생각도 들었다.시각화

앞서 언급했던 7~8장에서 배운 지식을 활용하면 탐색적 데이터 분석(EDA)를 수행할 수 있고 이 과정에서 눈여겨 볼 만한 가설과 인사이트를 얻어낼 수 있다.


책의 내용 중 가장 마음에 들었던 파트가 지금 소개할 9장 멤버십 기획 프로젝트와 8장 뒷부분의 기초 통계 이론과 통계적 가설 검정 파트이다.

먼저 기초 통계 이론과 통계적 가설 검정 파트를 소개하자면 다음과 같은 내용으로 요약할 수 있다.

  • 기술통계 : 요약, 묘사 ex) 성적 평균 등
  • 추론통계
    • 어떤 일이 일어날지 여부를 확률로 예측하는 기법
    • 표본으로 전체(모집단)의 특성을 추론하는 기법
    • ex) 사고발생 횟수 예측, 신약 유효성 검증 등
  • 평균
  • 편차 : 평균에서 떨어진 정도. 편차를 모두 더하면 0이 되어 평균을 구할 수 없다.
  • 분산 : 편차를 제곱합 / 데이터 개수
  • 표준편차 : 분산에 루트를 취한 것. 진정한 의미의 편차 평균.
  • 정규분포
    • 평균을 중심으로 좌우 대칭  모양을 이루는 분포. 전부 합하면 1.
    • ex) 몸무게, 키, 성적, 수익률 등
    • 평균을 중심으로 (+-1.96*표준편차) 범위 내 약 95%의 데이터가 존재.
    • ex) 평균 66kg 몸무게, 표준편차5 기준 56.2kg ~ 75.8kg 내에 95%의 데이터가 존재.
  • 가설검정
    • 귀무가설(H0) : 평소 사실. 차이가 없다.
    • 대립가설(H1) : 우리의 새로운 주장. 차이가 있다.
    • 유의수준 : 검정 통계량이 기각역에 들어갈 확룔. 오차 가능성. 보통 5%
    • 유의확률(p-value) : 귀무가설을 지지하는 정도.
      • 유의확률 < 유의수준 : 귀무가설 기각 -> 대립가설 채택 -> 유의(미)하다.
      • 유의확률 > 유의수준 : 귀무가설 기각 불가 -> 귀무가설 채택 -> 유의하지 않다.
    • t분포와 t검정 정규 분포와 비슷한 모양의 t분포를 이용해 검정하고자 하는 귀무가설(“전체 몸무게 평균은 65kg이다.”)의 65값을 mu값으로 활용하면 p-value를 알 수 있다.

연구에 필요한 통계 기초 지식을 단 몇 페이지에 걸쳐 필요한 내용을 모두 소개하고 매우 알기 쉽게 설명한 책은 처음이다. 처음 데이터 분석을 접할 때 p-value가 직관적이지 않아 애를 먹었던 기억이 있는데 이 단 몇 페이지를 먼저 접했다면 얼마나 쉽게 이후의 과정을 수행할 수 있었을지 아쉬울 뿐이다.

물론 검정과 같은 지식은 빅데이터를 분석하는 현 시점에 그리 자주 활용되지는 않는다. 이미 표본이라 칭하는 데이터가 충분히 방대해서 검정에 큰 의미를 두지 않을 뿐더러 투자 시간대비 확실하고 유익한 인사이트를 도출하기 어렵기 때문이다.

하지만 매우 중요한 상황에서 병행하여 쓰이는 기법이기도 하고 각종 연구 결과를 분석하거나 논문을 해석하는데 필요하기 때문에 반드시 알아두어야 하는 기법이라고 생각하는데 이런 점에서 초보자가 쉽게 p-value를 쉽게 정리할 수 있다는 것은 좋은 기회임을 강조하고 싶다.

마지막으로 본 도서의 꽃인 9장 멤버십 기획 프로젝트 파트를 소개하려 한다. 앞서 총평에서 언급했듯 R의 좋은 기능을 배웠다면 이를 실무에서 활용할 수 있을 수준 즉, 구슬을 꿸 수 있는 지식이 필요한데 본 장이 그 역할을 담당하고 있다고 보면 된다.

음식으로 매출을 올리는 직장에서 고객정보, 주문정보, 예약정보, 제품정보 등 4가지의 테이블 형태의 데이터를 가공하여 멤버십 프로그램의 제도를 만드는 과정으로 실무에서 가장 자주 다뤄지는 실제 사례라고 할 수 있다. 비중있게 다뤄지는 분석을 요약하면 다음과 같다.

  • 빈도, 교차 분석 : 예약건과 예약 완료 비율이 비슷하다는 점, 지점별 매출 구성이 유사하다는 점 등을 도출
  • RFM 분석 : 한번 방문한 고객이 대다이고, 우수 등급 이상 고객의 방문 및 매출 기여도가 높음을 도출
  • 상관 분석 : 스테이크와 와인은 높은 상관관계가 존재함을 도출
  • 의사결정나무분석 : 스테이크를 주문한 고객은 높은 매출의 고객이며 전체 평균 방문 횟수보다 낮다 등을 도출의사결정트리

이로써 각 파트의 요약을 마칠까한다.

마지막으로 정리하자면 본 도서의 장점은 각종 데이터 분석 과정을 거치며 앞서 배운 R의 단편 지식들이 어떤 방식의 꿰어지는지 충분히 실습할 수 있다는 점이 매력이라 할 수 있겠다. 더불어 저자가 쌓아온 내공 덕분에 도출 결과를 비즈니스로 어떻게 풀어가는지 슬쩍 엿볼 수 있는 계기가 될 수도 있다.

무엇보다 전체 과정의 파이프 라인 흐름에 대해 감을 잡을 수 있으므로 본인이 비록 미숙한 단계일지라도 프로젝트의 숲을 대강이나마 구성할 수 있는 체계적인 시야를 갖출 수 있다는 점에서 초보자의 자신감을 향상시킬 수 있기에 훌륭한 입문서라 말하고 싶다. R로 데이터 분석을 처음 접하고 싶은 입문자라면 꼭 본 도서를 추천하고 싶다.


YES24 리뷰어클럽 서평단 자격으로 작성한 리뷰입니다.


n********g 2020.10.31. 신고 공감 0 댓글 0
리뷰 총점 종이책
개인적으로는 별 5개 입니다.
"개인적으로는 별 5개 입니다." 내용보기
작년에 출간된 "모두의 SQL"이란 책을 읽은 이후로 R에 대한 관심을 가지던 차에 마침 딱 적당한 책이 있어 한 권 구매했습니다. 그런데 공교롭게도 같은 저자네요. R이란 툴은 데이터를 시각화할 수 있는 대표적인 도구입니다. 하지만 사회과학 계열이나 통계, 수학과 관련된 전공이 아니고서는 쉽게 접하기 어려운 도구이기도 하고요. 비 전공자의 입장에서 그간 몇 권의 R 관련 서적을
"개인적으로는 별 5개 입니다." 내용보기

작년에 출간된 "모두의 SQL"이란 책을 읽은 이후로 R에 대한 관심을 가지던 차에 마침 딱 적당한 책이 있어 한 권 구매했습니다. 그런데 공교롭게도 같은 저자네요. R이란 툴은 데이터를 시각화할 수 있는 대표적인 도구입니다. 하지만 사회과학 계열이나 통계, 수학과 관련된 전공이 아니고서는 쉽게 접하기 어려운 도구이기도 하고요. 비 전공자의 입장에서 그간 몇 권의 R 관련 서적을 읽어봤지만 솔직히 잘 모르겠더군요. 하지만 "모두의 R 데이터 분석"은 실무에 즉시 사용될 수 있는 다양한 카테고리의 사례가 담겨있어서 따라해보며 배우기가 쉬운 느낌입니다. 제게 딱 맞는 컨셉으로 구성된 책이라 전 별 5개를 주고 싶군요. 후속작도 기대하고 싶네요.

l****6 2020.09.29. 신고 공감 0 댓글 0
리뷰 총점 종이책
모두의 R 데이터 분석
"모두의 R 데이터 분석" 내용보기
YES24 리뷰어클럽 서평단 자격으로 작성한 리뷰입니다.R이냐? 파이썬이냐? 좀 더 나아간다면 STATA냐? SAS냐? SPSS냐?사회과학을 공부하면서 통계를 좀 다뤄봤다면 누구나 한번쯤 던져봤을 질문들이다.본인 또한, STATA를 주로 쓰다가 파이썬으로 갈아탄 이후 적응중이다.파이썬으로 갈아타기 전, R로 갈아탈지, 파이썬으로 갈아탈지 고민을 많이 했다.구글에서 COLAB으로 파이썬을 지원
"모두의 R 데이터 분석" 내용보기

YES24 리뷰어클럽 서평단 자격으로 작성한 리뷰입니다.


R이냐? 파이썬이냐? 좀 더 나아간다면 STATA냐? SAS냐? SPSS냐?

사회과학을 공부하면서 통계를 좀 다뤄봤다면 누구나 한번쯤 던져봤을 질문들이다.


본인 또한, STATA를 주로 쓰다가 파이썬으로 갈아탄 이후 적응중이다.

파이썬으로 갈아타기 전, R로 갈아탈지, 파이썬으로 갈아탈지 고민을 많이 했다.


구글에서 COLAB으로 파이썬을 지원하고 있고, 향후 딥러닝과 머신러닝 활용도를 

따져봤을 때 파이썬이 더 유익할 것이라 판단하여 파이썬으로 갈아타기는 했지만


R에 대한 미련은 남아있는 상태에서 이 책을 읽게 되었다.

파이썬이 좀 더 범용적인 느낌이 강한다면, R은 역시 통계에 좀 더 특화된 프로그램이라 할 수 있다.


본서는 이런 독자들의 NEEDS를 정확히 파악하고 쓰여진 책이라 할 수 있다.



사회과학 연구를 진행하며 통계 프로그램을 돌리다보며 길을 잃게될 때가 많다.


저자도 그런 경험이 있었는지 책의 1장에 이런 상황에 대해서 명시하고 있다.


데이터를 처리하고, 그려보고, 이해하고, 다시 처리하는 이 반복의 과정을 통해서

데이터 분석이 이뤄진다는 것을 설명하고 있다. 


이러한 Big picutre 아래에서 각 개론을 한눈에 보기 쉽도록 정리해놓은 내용도 매우 유익하다.


책의 전체 내용에 대한 지도를 한 눈에 볼 수가 있다.


다만 주의해야할 것은 이 책은 'R책'이다. 통계학 책이 아니다.

따라서 통계학의 이론과의 연계성은 낮으며 실질적으로 R을 사용하는 방법에 대한 안내서 개념으로 이해하는 것이 좋을 듯 하다.



위의 사진에서도 볼 수 있듯이,

컴퓨터활용능력 자격증 시험 책처럼, R의 각 메뉴와 기능을 어떻게 사용해야하는지

상세하게 설명하고 있다. 




데이터분석에서 어떻게 보면 화룡점정이라 할 수 있는 시각화 부분도 각 메뉴별로 상세히 설명하여 독자들이 R의 기본적인 기능을 숙지하는데 큰 도움을 주고 있다. 


전체적으로 총평을 한다면

R프로그램 처음 접하려는 독자에게 매우 유익한 책이라 할 수 있다.

다만, 사회과학을 공부하며 통계지식을 필요로 하는 독자라면 이 책 1권만으로는 부족하며,

다른 책을 병행해서 참고해야 할 것으로 판단된다.


h*****6 2020.11.02. 신고 공감 0 댓글 0
리뷰 총점 종이책
R을 처음 배우는 사람들을 위한 교재
"R을 처음 배우는 사람들을 위한 교재" 내용보기
R을 모르는 데이터 분석 입문자와 통계 비전공자를 주요 독자로 보고 아주 쉽게 R 사용법을 설명하고 있는 책이다. R의 한계점도 지적한다. 범용 프로그래밍 언어가 아니기에 프로그램 개발에 사용하기 힘들고, 분석용 데이터를 메모리에 올려놓고 처리하기 때문에 메모리 용량이 작은 컴퓨터는 실행하는 데 한계가 있다는 것이다. 하지만 그 외에는 오픈소스로 만들어진 R의 특성상 다루
"R을 처음 배우는 사람들을 위한 교재" 내용보기

R을 모르는 데이터 분석 입문자와 통계 비전공자를 주요 독자로 보고 아주 쉽게 R 사용법을 설명하고 있는 책이다. R의 한계점도 지적한다. 범용 프로그래밍 언어가 아니기에 프로그램 개발에 사용하기 힘들고, 분석용 데이터를 메모리에 올려놓고 처리하기 때문에 메모리 용량이 작은 컴퓨터는 실행하는 데 한계가 있다는 것이다. 하지만 그 외에는 오픈소스로 만들어진 R의 특성상 다루기 쉽고 추가할 수 있는 패키지도 많다고 한다. 이 책에서는 R의 수많은 패키지 중 데이터 조작과 처리에 특화된 dplyr과 가장 많이 사용하는 그래프 패키지인 ggplot2을 자세히 살펴보고 있으며, 조작과 모델링, 시각화에 장점을 가지고 있는 tidyr, 데이터 처리 속도가 빨라 대용량 데이터를 다룰 때 유용한 data table, 통계 분석에 적합한 유연한 문서 작성을 가능하게 하는 R markdown, R로 웹이나 앱 애플리케이션을 만들 수 있게 하는 shiny, ggplot2로 그린 그래프 옵션 설정을 돕는 ggThemeAssist, 엑셀에 있는 데이터를 읽거나 쓸 때 필요한 readxl, writexl 등의 패키지도 소개하고 있다. 이 책은 RStudio 설치 및 사용법부터 시작해서 벡터, 팩터, 행렬, 배열, 리스트, 데이터 프레임 같은 데이터 구조, 패키지를 설치하고 로드하는 방법, rbind(), sort() 같은 데이터 조작 함수 사용법, pairs() 같은 그리기 함수 사용법 등을 알려주고 있다. 



이 책의 후반부에는 앞서 배운 지식을 총동원하여 맴버십 프로그램을 기획하는 프로젝트를 진행하는 사례를 소개해주고 있는데, 프랜차이즈 레스토랑의 온라인 웹 사이트에 있는 고객 정보, 예약 정보, 주문 정보, 메뉴 정보 데이터를 가지고 기업 매출 증대와 고객 충성도 확보를 위한 맴버십 프로그램을 기획하는 과정을 보여주고 있다. 기본적으로 고객을 구매 최근성, 구매 빈도, 구매 금액으로 나눠 특징을 파악하는 RFM이라는 고객 분류 관리 기법을 활용하고 있으며, 가설을 세우고 추론 통계처럼 굳이 귀무 가설과 대립 가설을 검정하지 않고 빠르게 기술 통계 결과만으로 현상을 확인할 수 있도록 유도하고 있다. 물론 주력 제품과 특정 비주력제품 사이의 상관관계를 파악하고, 데이터 마이닝 기법 중 하나인 의사결정나무를 활용하는 방법도 소개하고 있다. 여기서는 의사결정나무를 깔끔하고 풍부하게 그리는 rpart, 예측 모델과 머신 러닝을 위한 다양한 함수를 제공해주는 caret 패키지 등을 활용하고 있다. 사실 개인적으로 R을 예전에 한 번 배우면서 사용해보기는 했는데, 기본적인 활용법들을 많이 까먹어서 이 책을 통해 다시 공부할 수 있었다. 기본적으로 프로그래밍 언어를 다룰 수 있는 사람들은 이 책을 한 번 읽어보고 R을 다루는 일이 그다지 어렵지 않을 것이다.


YES24 리뷰어클럽 서평단 자격으로 작성한 리뷰입니다.

d****o 2020.10.30. 신고 공감 0 댓글 0