|
빅 데이터 분석을 위해 가장 많이 사용되는 하둡을 배우려는 자바개발자를 위한 책입니다. 대규모 데이터를 분산 저장해서 처리하는 오픈소스 프레임워크인 하둡은 여러가지 분야에서 사용 중입니다. 하둡의 기본 원리부터 실무 응용까지 초보자 및 개발자가 입문서적으로 보기에 좋은 책입니다. 이 책은 하둡을 온프레미스 서버와 AWS 클라우드 상에서 설치하는 방법 부터 시작해서, 핵심 구성요소인 HDFS와 맵 리듀스의 구조에 대해서 설명합니다. 그리고 중반 이후에는 YARN의 아키텍쳐 및 실제 하둡 클러스터를 운영하는 방법에 대해서도 소개합니다. 하둡은 빅데이터 처리를 위해 사용되는 가장 강력한 오픈소스인 만큼 그 생태계도 매우 큽니다. 많은 수의 연관 오픈소스 프로젝트 들이 있는데, 대표적인 하이브, 스쿱, 타조 등에 대해서도 소개합니다. 하둡을 공부하기 위해 구입한 책이었는데 저는 개인적으로 굉장히 많은 도움이 되었습니다. |