이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
1장. 빅데이터 분석하기1.1 데이터 과학의 어려움1.2 아파치 스파크란1.3 이 책에 관하여1.4 2판에 관하여2장. 스칼라와 스파크를 활용한 데이터 분석2.1 데이터 과학자를 위한 스칼라2.2 스파크 프로그래밍 모델2.3 레코드 링크2.4 스파크 셸과 SparkContext 시작하기2.5 클러스터에서 클라이언트로 데이터 가져오기2.6 클라이언트에서 클러스터로 코드 보내기2.7 RDD에서 Data Frame으로2.8 DataFrame API로 데이터 분석하기2.9 데이터프레임에 대한 빠른 요약 통계2.10 데이터프레임의 축 회전과 형태변환2.11 데이터프레임을 결합하고 특징 선택하기2.12 실제 환경을 위한 모델 준비하기2.13 모델 평가2.14 한 걸음 더 나아가기3장. 음악 추천과 Audioscrobbler 데이터셋3.1 데이터셋3.2 교차 최소 제곱 추천 알고리즘3.3 데이터 준비하기3.4 첫 번째 모델 만들기3.5 추천 결과 추출 검사하기3.6 추천 품질 평가하기3.7 AUC 계산하기3.8 하이퍼파라미터 선택하기3.9 추천 결과 만들기3.10 한 걸음 더 나아가기4장. 의사 결정 나무로 산림 식생 분포 예측하기4.1 회귀로 돌아와서4.2 벡터와 특징4.3 학습 예제4.4 의사 결정 나무와 랜덤 포레스트4.5 Covtype 데이터셋4.6 데이터 준비하기4.7 첫 번째 의사 결정 나무4.8 의사 결정 나무 하이퍼파라미터4.9 의사 결정 나무 튜닝하기4.10 범주형 특징 다시 살펴보기4.11 랜덤 포레스트4.12 예측하기4.13 한 걸음 더 나아가기5장. K-평균 군집화로 네트워크 이상 탐지하기5.1 이상 탐지5.2 K-평균 군집화5.3 네트워크 침입5.4 KDD 컵 1999 데이터셋5.5 첫 번째 군집화하기5.6 k 선정하기5.7 R에서 시각화하기5.8 특징 정규화5.9 범주형 변수5.10 엔트로피와 함께 레이블 활용하기5.11 군집화하기5.12 한 걸음 더 나아가기6장. 숨은 의미 분석으로 위키백과 이해하기6.1 문서-단어 행렬6.2 데이터 구하기6.3 파싱하여 데이터 준비하기6.4 표제어 추출6.5 단어빈도-역문서빈도(TF-IDF) 계산하기6.6 특잇값 분해6.7 중요한 의미 찾기6.8 낮은 차원 표현에 대한 의문과 고찰6.9 단어와 단어 사이의 연관도6.10 문서와 문서 사이의 연관도6.11 문서와 단어 사이의 연관도6.12 여러 개의 단어로 질의하기6.13 한 걸음 더 나아가기7장. 그래프엑스로 동시발생 네트워크 분석하기7.1 네트워크 분석 사례: MEDLINE의 인용 색인7.2 데이터 구하기7.3 스칼라 XML 라이브러리로 XML 문서 파싱하기7.4 MeSH 주요 주제와 주제들의 동시발생 분석하기7.5 그래프엑스로 동시발생 네트워크 구성하기7.6 네트워크의 구조 이해하기7.7 관련성 낮은 관계 필터링하기7.8 작은 세상 네트워크7.9 한 걸음 더 나아가기 8장. 뉴욕 택시 운행 데이터로 위치 및 시간 데이터 분석하기8.1 데이터 얻기8.2 스파크에서 서드파티 라이브러리로 작업하기8.3 지리 데이터와 Esri Geometry API, 그리고 Spray8.4 뉴욕 택시 운행 데이터 준비하기8.5 스파크에서 세션화 작업 수행하기8.6 한 걸음 더 나아가기9장. 몬테카를로 시뮬레이션으로 금융 리스크 추정하기9.1 전문 용어9.2 VaR 계산 방법9.3 우리의 모델9.4 데이터 구하기9.5 전처리하기9.6 요인 가중치 결정하기9.7 표본추출9.8 실험 실행하기9.9 수익 분포 시각화하기9.10 결과 평가하기9.11 한 걸음 더 나아가기10장. BDG 프로젝트와 유전체학 데이터 분석하기10.1 모델링과 저장소를 분리하기10.2 ADAM CLI를 이용한 유전체학 데이터 처리10.3 ENCODE 데이터로부터 전사인자 결합 부위 예측하기10.4 1000 지놈 프로젝트에서 유전자형 질의하기10.5 한 걸음 더 나아가기11장. 파이스파크와 썬더로 신경 영상 데이터 분석하기11.1 파이스파크 소개11.2 썬더 라이브러리 개요와 설치11.3 썬더로 데이터 읽어 들이기11.4 썬더로 신경 세포 유형 분류하기11.5 한 걸음 더 나아가기8. 관련 도서 (제목 ISBN)● 처음 배우는 데이터 과학 / 9791162240472● 파이썬 라이브러리를 활용한 데이터 분석(수정보완판) / 9788968480478● 파이썬 라이브러리를 활용한 머신러닝 / 9788968483394● 파이썬을 활용한 금융 분석 / 9788968482779
|
Sandy Ryza
Uri Laserson
Sean Owen
박상은의 다른 상품
|
스파크 2 실전편! 실무와 가장 가까운 경험을 제공한다. 이 책은 기능과 API를 단조롭게 나열하지 않는다. 현실과 동떨어진, 예제를 위한 예제를 따라 하지도 않는다. 대신 우리 주변에서 찾을 수 있고 우리 삶과 밀접한 실제 데이터를 가져와 함께 분석하고 다듬어본다. 그것도 하나가 아니라 9가지다. 음악 추천부터 이상 탐지, 교통, 금융, 영상 데이터 등 관심 가는 장을 먼저 봐도 좋고, 차례대로 천천히 따라 해도 좋다. 그럼 가장 진보한 분석 도구인 스파크 2로 다 함께 데이터의 바다를 항해해보자!2판에 관하여1판이 출간된 이후 스파크의 메이저 버전이 올라가면서 완전히 새로운 핵심 API가 도입되고 MLlib이나 Spark SQL과 같은 하위 컴포넌트들도 크게 바뀌었다. 이러한 변화들이 반영되다 보니, 이 책 초판의 많은 부분이 의미가 없게 되었다. 이번 2판은 새로운 스파크 API를 사용하기 위해서 모든 장을 수정하였다.주요 내용1. 오디오스크로블러(AudioScrobbler) 데이터셋으로 음악 추천하기2. 의사 결정 나무로 산림 식생 분포 예측하기3. K-평균 군집화로 네트워크 이상 탐지하기4. 숨은 의미 분석으로 위키백과 이해하기5. 그래프엑스(GraphX)로 동시발생 네트워크 분석하기6. 뉴욕 택시 운행 데이터로 위치 및 시간 데이터 분석하기7. 몬테카를로 시뮬레이션으로 금융 리스크 추정하기8. BDG 프로젝트와 유전체학 데이터 분석하기9. 파이스파크(PySpark)와 썬더(Thunder)로 신경 영상 데이터 분석하기6. 추천사버클리에서 스파크 프로젝트를 시작한 이래로, 나는 단순히 빠른 병렬 시스템을 구축한다는 사실보다는 점점 더 많은 사람이 대규모 컴퓨팅을 사용할 수 있게 돕는다는 점에 흥분해왔다. 데이터 과학 전문가 네 명이 스파크 기반의 고급 분석에 대해서 쓴 이 책을 읽는 것이 즐거운 이유가 바로 여기에 있다. 샌디, 유리, 션 그리고 조시는 오랫동안 스파크로 작업해왔으며, 그만큼 충실한 설명과 예제를 이 책에 담아냈다.이 책에서 가장 마음에 드는 부분은 실제 응용 사례와 현실 세계의 데이터셋을 가져와 예제 중심으로 설명한 점이다. 독자의 PC에서 직접 실행해볼 수 있는 아홉 가지 개별 빅데이터 예제를 제공한 책은 흔치 않은데, 저자들은 이런 예제들을 모아서 스파크로 실습할 수 있도록 모든 것을 세팅해두었다. 게다가 핵심 알고리즘만 다룬 것이 아니라, 정말로 좋은 결과를 얻는 데 필요한 데이터 준비와 모듈 튜닝의 복잡한 사항까지 다루고 있다. 독자는 이 예제들에서 터득한 개념을 자신의 문제를 푸는 데 곧바로 적용할 수 있을 것이다.오늘날 빅데이터 처리는 의심할 여지 없이 컴퓨터로 할 수 있는 가장 흥미로운 분야이며, 빠르게 진화하고 새로운 아이디어들이 도입되는 분야이기도 하다. 나는 독자들이 이 흥미로운 새로운 분야로 들어서는 데 이 책이 도움이 될 거라 기대한다._마테이 자하리아, 스파크 창시자, 『러닝 스파크』 저자아파치 스파크는 빅데이터 영역에서 가장 핫한 기술로, 범용적이면서 빠른 대용량 분산 처리를 지원한다. 또한 기초 데이터 분석부터 머신러닝 등의 기능까지 지원하게 되면서 개발자만의 오픈 소스에서 분석가를 위한 오픈 소스로 주목받고 있다. 이 책은 가장 실용적인 데이터를 가져와 스파크로 빅데이터를 분석하는 다양한 방법을 설명한다. 빅데이터에 관심 있거나 관련 분야에 종사하는 개발자와 분석가 모두에게 추천한다._이상훈, 한국 스파크 사용자 모임 운영자, 『실시간 분석의 모든 것』 역자교통, 금융 분야 등의 실제 데이터로 데이터 획득, 전처리, 가중치 결정, 실행, 평가 그리고 시각화까지 해볼 수 있는 스파크 활용서다. 스파크 입문을 넘어 실무에 적용하려 할 때 좋은 참고서다. 자신의 관심 도메인에 맞는 부분만 찾아서 읽어도 좋을 것 같다._최홍용, 현대오토에버
|