이전

리뷰 (1)

한줄평
평점 분포
  • 리뷰 총점10 100%
  • 리뷰 총점8 0%
  • 리뷰 총점6 0%
  • 리뷰 총점4 0%
  • 리뷰 총점2 0%
연령대별 평균 점수
  • 10대 0.0
  • 20대 0.0
  • 30대 0.0
  • 40대 0.0
  • 50대 10.0
리뷰 총점 종이책 구매
스파크 내부 동작방식이 궁금하면 필독
"스파크 내부 동작방식이 궁금하면 필독" 내용보기
- 실제 업무에서, 스파크로, 실시간에 준하여 대용량의 데이터를 빠르게 분석하여 결과를 만들기는 원한다면 읽어 보기를 권함이 책은 데이터베이스 책으로 말하자면, 테이블 만들고, insert, select 문을 알려주는 것이 아닌, 데이터베이스의 엔진 내부의 동작원리를 설명하는 책입니다. 즉, 대용량으로 데이터를 로딩하고, 이렇게 로딩한 여러 테이터를 조인하고, 원하는 조건을 넣어서
"스파크 내부 동작방식이 궁금하면 필독" 내용보기

- 실제 업무에서, 스파크로, 실시간에 준하여 대용량의 데이터를 빠르게 분석하여 결과를 만들기는 원한다면 읽어 보기를 권함


이 책은 데이터베이스 책으로 말하자면, 테이블 만들고, insert, select 문을 알려주는 것이 아닌, 데이터베이스의 엔진 내부의 동작원리를 설명하는 책입니다. 

즉, 대용량으로 데이터를 로딩하고, 이렇게 로딩한 여러 테이터를 조인하고, 원하는 조건을 넣어서 필터링을 한 뒤, 

해당 결과를 groupby, 통계함수 sum, avg 등으로 가공한 결과를 sorting하여 다시 저장하는 일련의 과정들이 엔진 내에서 어떤 메커니즘으로 동작하는 지를 설명하는 책입니다. 

이 부분을 이해하면, 데이터의 종류에 따라, 추출하고자 하는 결과에 따라 성능 튜닝을 목적에 맞게 할 수 있습니다. 

 

이 책은 단점이라고 생각되는 점 하나는, 저도 자바에 오래 인숙한지라, 스칼라가 그렇게 편하지는 않습니다. 하지만, 책의 후반에서 느낀 생각은, 

스파크를 이러한 용도에 맞게 사용하기 위해서 더 우아한 방법인 스칼라 위주로 설명하는 것이 이해가 되었습니다. 굳이 동일한 설명을 여러 언어로 반복해서 설명할 필요는 없을 듯 합니다. 

기존적인 예제는 스파크 스칼라로 제공합니다. 하지만, 내부적인 동작방식은 동일하니까요. 


그리고, 이 책은 스파크의 설치, 데이터 타입, 기본적인 입력, 연산, 출력과 같은 기본 개념의 설명은 자세하게 제공하지는 않습니다.  

만약 스파크에 대해서 용어나 개념이 익숙하지 않으시다면, "러닝 스파크" 책을 먼저 보기시를 추천해드립니다. 

해당 책은 설명도 자세하고, 예제도 java, python, scala 3가지 방식 모두 해볼 수 있습니다.


좀 특이한 점이 있다면, 번역하신 분이 실제 관련 업무를 하고 계셔서인지, 원 저자의 설명에 추가하여 역자 주를 통해서 자세한 설명을 해주신 부분이 단시간에 경험치를 올리는 데 도움이 되는 팁이 많았습니다.

특히 한국적인 실제 사용하는 표현, 그리고 실제 쓰는 부분, 사용되지 않는 것에 대한 부분은 사용해보면서 차츰 알게 되었는데, 좀 더 해당 부분을 대해서 찾아 보니, 아 이런 부분이 있을 수 있구나 라고 생각할 수 있게 되어 좋았습니다. 

역자의 팁등은 실제 업무에서 장애와 부딪히면서 알게 되거나, 시간이 많이 걸려 디버깅하면서 알게 되는 되는 것들이 많아 도움이 많이 되었습니다.


단순히 유행인 스파크를 한 번 써봐야지 보다는, 정말 실무에서 대용량의 데이터로 통계를 만들어서 빠르게 결과를 받아야 되는데, 기존의 RDBMS는 너무 결과가 느리거나, MapReduce의 배치가 아닌 거의 실시간에 가깝게 결과를 만들어야 하는 부분이 궁금했다면, 이 책을 추천드립니다. 



d******6 2018.06.10. 신고 공감 3 댓글 0