이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
1장 아파치 스파크1.1. 개요 1.2. 클러스터 디자인 1.3. 클러스터 관리 1.4. 성능 1.5. 클라우드 1.6. 요약 2장 아파치 스파크 MLlib2.1. 환경 설정 2.2. 나이브 베이즈(Naive Bayes) 분류2.3. K-평균(K-Means) 클러스터링 2.4. ANN - 인공 신경망(Artificial Neural Networks)2.5. 요약 3장 아파치 스파크 스트리밍(Streaming)3.1. 개요3.2. 오류 및 복구3.3. 스트리밍 소스3.4. 요약4장 아파치 스파크 SQL4.1. SQL 콘텍스트 4.2. 데이터 불러오기 및 저장하기4.3. 데이터프레임4.4. SQL 사용하기4.5. 사용자 정의 함수4.6. 하이브 사용하기4.7. 요약5장 아파치 스파크 GraphX5.1. 그래프 개요5.2. GraphX 코딩 5.3. Neo4j용 메이즈러너(Mazerunner)5.4. 요약6장 그래프 기반 스토리지6.1. 타이탄(Titan)6.2. 팅커팝(TinkerPop)6.3. 타이탄 설치6.4. HBase와 함께 타이탄 사용하기6.5. 카산드라(Cassandra)와 함께 타이탄 사용하기6.6. 스파크를 사용하여 타이탄에 접근하기6.7. 요약7장 H2O를 사용한 스파크 확장7.1. 개요7.2. 프로세싱 환경7.3. H2O 설치7.4. 빌드 환경7.5. 아키텍쳐 7.6. 데이터 소싱7.7. 데이터 품질7.8. 성능 튜닝7.9. 딥 러닝(Deep Learning)7.10. H2O FLOW 7.11. 요약 8장 스파크 데이터브릭스(Databricks)8.1. 개요8.2. 데이터브릭스 설치8.3. AWS 과금 8.4. 데이터브릭스 메뉴 8.5. 계정 관리 8.6. 클러스터 관리 8.7. 노트북과 폴더(Notebooks and folders) 8.8. 작업과 라이브러리(Jobs and libraries) 8.9. 개발 환경8.10. 데이터브릭스 테이블8.11. DbUtils 패키지8.12. 요약9장 데이터브릭스 시각화(Visualization)9.1. 데이터 시각화 9.2. REST 인터페이스9.3. 데이터 이동 9.4. 참고 도서9.5. 요약
|
|
아파치 스파크를 이용하여빅데이터 처리 등 고급 스킬 습득을 위한 좋은 지침서!아파치 스파크는 클러스터 기반의 인메모리 병렬 처리 시스템으로, 그래프 처리, 머신 러닝, 스트림 처리, SQL 등 폭넓은 기능을 제공한다.이 책은 스파크의 기능을 어떻게 확장시키는지를 설명하여 스파크에 대한 지식을 한 단계 더 높이는 것을 목표로 하고 있다. 또한, 스파크 생태계를 훑어보는 것부터 시작한다. 그리고 MLlib을 사용하여 완전히 동작하는 신경망을 만들어 손글씨를 판별하도록 할 것이고, 최적의 성능을 올리는 병렬 처리가 가능하도록 스트림 처리를 다루는 방법에 대해 설명할 것이다. 그런 다음 머신 러닝을 위한 H2O, 그래프 기반의 스토리지를 위한 타이탄, 클라우드 기반의 스파크를 위한 데이터브릭스 등을 어떻게 활용하는지를 설명한다. 아울러, CentOS 리눅스 및 데이터브릭스 클라우드 환경에서 아파치 스파크 모듈 프로세싱을 위해 스칼라로 작성한 예제 코드도 제공한다.이 책에서 다루는 내용:- 프로세싱과 스토리지를 위한 확장 툴- MLlib을 사용하여 클러스터링과 분류기법 구현- Flume과 HDFS를 통한 스파크 스트림 프로세싱 이해- 스파크 SQL을 통한 스키마 생성 및 데이터 입력- 스파크 GraphX를 사용한 스파크 기반의 그래프 프로세싱- 스파크와 H2O, 딥 러닝 결합 및 이에 따른 장점- 아파치 스파크의 대표적 그래프 스토리지 - 타이탄, HBase, 카산드라 비교- 아파치 스파크를 클라우드 상에서 구현하기 위해 사용되는 데이터브릭스와 AWS
|