이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
★★★ Part 1 하둡 기초 ★★★CHAPTER 1 하둡과의 만남1.1 데이터!1.2 데이터 저장소와 분석1.3 전체 데이터에 질의하기1.4 일괄 처리를 넘어서1.5 다른 시스템과의 비교1.6 아파치 하둡의 간략한 역사1.7 이 책의 내용CHAPTER 2 맵리듀스2.1 기상 데이터셋2.2 유닉스 도구로 데이터 분석하기2.3 하둡으로 데이터 분석하기2.4 분산형으로 확장하기2.5 하둡 스트리밍CHAPTER 3 하둡 분산 파일시스템3.1 HDFS 설계3.2 HDFS 개념3.3 명령행 인터페이스3.4 하둡 파일시스템3.5 자바 인터페이스3.6 데이터 흐름3.7 distcp로 병렬 복사하기CHAPTER 4 YARN4.1 YARN 애플리케이션 수행 해부해보기4.2 YARN과 맵리듀스 1의 차이점4.3 YARN 스케줄링4.4 참고 도서CHAPTER 5 하둡 I/O5.1 데이터 무결성5.2 압축5.3 직렬화5.4 파일 기반 데이터 구조★★★ Part 2 맵리듀스 ★★★CHAPTER 6 맵리듀스 프로그래밍6.1 환경 설정 API6.2 개발환경 설정하기6.3 엠알유닛으로 단위 테스트 작성하기6.4 로컬에서 실행하기6.5 클러스터에서 실행하기6.6 잡 튜닝하기6.7 맵리듀스 작업 흐름CHAPTER 7 맵리듀스 작동 방법7.1 맵리듀스 잡 실행 상세분석7.2 실패7.3 셔플과 정렬7.4 태스크 실행CHAPTER 8 맵리듀스 타입과 포맷8.1 맵리듀스 타입8.2 입력 포맷8.3 출력 포맷CHAPTER 9 맵리듀스 기능9.1 카운터9.2 정렬9.3 조인9.4 사이드 데이터 분배9.5 맵리듀스 라이브러리 클래스★★★ Part 3 하둡 운영 ★★★CHAPTER 10 하둡 클러스터 설정10.1 클러스터 명세10.2 클러스터 설치 및 설정10.3 하둡 환경 설정10.4 보안10.5 하둡 클러스터 벤치마크CHAPTER 11 하둡 관리11.1 HDFS11.2 모니터링11.3 유지 보수★★★ Part 4 관련 프로젝트 ★★★CHAPTER 12 에이브로12.1 에이브로 자료형과 스키마12.2 인메모리 직렬화와 역직렬화12.3 에이브로 데이터파일12.4 상호운영성12.5 스키마 해석12.6 정렬 순서12.7 에이브로 맵리듀스12.8 에이브로 맵리듀스를 이용하여 정렬하기12.9 다양한 언어에서 에이브로 사용하기CHAPTER 13 파케이13.1 데이터 모델13.2 파케이 파일 포맷13.3 파케이 설정13.4 파케이 파일 쓰기와 읽기13.5 파케이 맵리듀스CHAPTER 14 플룸14.1 플룸 설치14.2 예제14.3 트랜잭션과 신뢰성14.4 HDFS 싱크14.5 분기14.6 분배: 에이전트 계층14.7 싱크 그룹14.8 애플리케이션과 플룸의 통합14.9 컴포넌트 목록14.10 참고 도서CHAPTER 15 스쿱15.1 스쿱 얻기15.2 스쿱 커넥터15.3 임포트 예제15.4 생성된 코드15.5 임포트 자세히 살펴보기15.6 불러온 데이터로 작업하기15.7 대용량 객체 임포트하기15.8 익스포트 수행하기15.9 익스포트 자세히 살펴보기15.10 참고 도서CHAPTER 16 피그16.1 피그의 설치 및 실행16.2 예제16.3 데이터베이스와 비교16.4 피그 라틴16.5 사용자 정의 함수16.6 데이터 처리 연산자16.7 피그 실무16.8 참고 도서CHAPTER 17 하이브17.1 하이브 설치하기17.2 예제17.3 하이브 실행하기17.4 전통적인 데이터베이스와의 비교17.5 HiveQL17.6 테이블17.7 데이터 질의하기17.8 사용자 정의 함수17.9 참고 도서CHAPTER 18 크런치18.1 예제18.2 크런치 핵심 API18.3 파이프라인 실행18.4 크런치 라이브러리18.5 참고 도서CHAPTER 19 스파크19.1 스파크 설치19.2 예제19.3 탄력적인 분산 데이터셋 RDD19.4 공유변수19.5 스파크 잡 수행 분석19.6 익스큐터와 클러스터 매니저19.7 참고 도서CHAPTER 20 HBase20.1 HBase 개요20.2 개념20.3 설치20.4 클라이언트20.5 온라인 쿼리 애플리케이션 구축20.6 HBase와 RDBMS의 비교20.7 활용20.8 참고 도서CHAPTER 21 주키퍼21.1 주키퍼 설치와 실행21.2 예제21.3 주키퍼 서비스21.4 주키퍼 애플리케이션 구현21.5 주키퍼 실 서비스21.6 참고 도서★★★ Part 5 사례 연구 ★★★CHAPTER 22 서너의 구조적 데이터22.1 CPU에서 시맨틱 통합까지22.2 아파치 크런치의 도입22.3 완전한 설계도의 제작22.4 헬스케어 데이터 통합22.5 프레임워크를 뛰어넘는 결합성22.6 발전 방향CHAPTER 23 생물학의 데이터 과학: 소프트웨어로 생명 구하기23.1 DNA 구조23.2 유전 암호: DNA 글자의 단백질 전환23.3 DNA를 소스 코드처럼 생각하기23.4 인간 게놈 프로젝트와 표준 게놈23.5 DNA 시퀀싱과 얼라이닝23.6 대규모 게놈 분석 플랫폼 ADAM23.7 개인맞춤광고에서 개인맞춤의학까지23.8 참여하기CHAPTER 24 캐스케이딩24.1 필드, 튜플, 파이프24.2 연산24.3 탭, 스킴, 플로24.4 예제24.5 유연성24.6 쉐어디스에서의 하둡과 캐스케이딩24.7 요약부록 A 아파치 하둡 설치하기부록 B 클라우데라 아파치 하둡 배포판부록 C NCDC 기상 데이터 준비부록 D 예전과 새로운 자바 맵리듀스 API
|
|
★ 개정4판에서 새로워진 내용4판은 하둡 2 버전만을 다룬다. 하둡 2 버전은 현재 가장 활발히 개선되고 있으며 가장 안정된 하둡 버전이다. YARN(4장), 파케이(13장), 플룸(14장), 크런치(18장), 스파크(19장)를 다루는 새로운 장이 추가되었다. 이 책을 읽는 다양한 순서를 독자들에게 알려주는 절도 포함되었다. 또한 새로운 두 가지 사례 연구를 포함한다. 첫 번째는 헬스케어 시스템에서 하둡을 사용하기(22장), 두 번째는 하둡으로 유전체 데이터를 처리하기(23장)다. 하둡 최신 버전과 관련 프로젝트를 반영하고자 기존 내용에 많은 수정을 가해 개선했다. ★ 대상 독자 - 시스템 관리자 - 클라우드 컴퓨팅 분야의 학자, 개발자, 기술 기획자 - 데이터 마이닝 등 데이터 분석 및 알고리즘 학자, 개발자★ 이 책에서 다루는 기술 - 맵리듀스, HDFS, YARN - 애플리케이션 개발 - 피크, 하이브, 크런치, 스파크 - 분산 데이터베이스 HBase - 분산 설정 서비스 주키퍼 - 하둡 클러스터 관리 및 설정 - 에이브로로 데이터 직렬화하기 - 파케이로 중첩 데이터 처리하기 - 플룸으로 데이터 수집하기 - 스쿱으로 데이터 일괄 전송하기
|