이미 소장하고 있다면 판매해 보세요.
|
머리말 viii
베타리더 후기 xi 이 책을 읽는 법 xiv 학습 가이드 xviii 로드맵 xx PART 1 분석 데이터베이스의 떠오르는 샛별, DuckDB CHAPTER 1 DuckDB란? 1.1 DuckDB의 개발 배경과 인기 4 1.2 DuckDB의 장점 9 1.3 DuckDB의 내부 구조 12 1.4 DuckDB의 중요성 18 돌아보기/쪽지시험 23 CHAPTER 2 DuckDB 들어가기 2.1 설치 및 접속과 종료 25 2.2 EPL 데이터베이스를 만들기 위한 준비 34 2.3 스키마로 보는 EPL 데이터베이스 목록 40 2.4 EPL 데이터베이스를 다루는 기능 45 돌아보기/쪽지시험 51 CHAPTER 3 DuckDB CLI로 EPL 데이터 살펴보기 3.1 DuckDB CLI 기초 53 3.2 EPL 데이터베이스 조회 60 3.3 데이터 임포트 71 3.4 데이터베이스 통합 89 3.5 데이터 내보내기 94 돌아보기/쪽지시험 100 PART 2 분석을 위한 SQL CHAPTER 4 DuckDB SQL로 EPL 데이터 조작하기 4.1 DuckDB SQL IDE로 시작하는 ESPN 데이터베이스 104 4.2 DML로 다루는 선수, 팀, 경기 데이터 조회 110 4.3 DDL로 구성하는 EPL, 팀, 선수 테이블과 뷰 133 4.4 조인 연산으로 다루는 EPL 경기, 선수, 팀 데이터 142 4.5 집합 연산으로 다루는 유로파리그/EPL 선수 라인업 153 돌아보기/쪽지시험 159 CHAPTER 5 고급 SQL로 EPL 데이터 분석하기 5.1 날짜와 시간 함수로 분석하는 EPL 경기 결과 161 5.2 서브 쿼리로 분석하는 EPL 순위와 득점 170 5.3 CTE로 구조화하는 EPL 득점, 순위 분석 178 5.4 CASE로 구분하는 EPL 경기 결과와 수익 186 5.5 GROUP BY 확장으로 요약하는 EPL 공격 지표 193 5.6 윈도 함수로 계산하는 EPL 득점, 순위, 누적 기록 198 5.7 피벗으로 변환하는 EPL 팀 로스터 표 215 5.8 고급 SQL로 분류하고 실행하는 EPL 데이터 220 돌아보기/쪽지시험 225 CHAPTER 6 DuckDB 전용 SQL로 EPL 데이터 활용하기 6.1 DuckDB용 데이터 타입 227 6.2 DuckDB용 SQL 문법 232 6.3 DuckDB용 질의 기능 242 돌아보기/쪽지시험 249 PART 3 실전 DuckDB 프로젝트 CHAPTER 7 파이썬으로 DuckDB를 연동하여 EPL 데이터를 분석하고 시각화하기 7.1 파이썬에서의 DuckDB 환경 구성 254 7.2 파이썬에서 DuckDB 쿼리로 다루는 EPL 순위, 경기, 선수 데이터 260 7.3 Plotly와 great_tables로 시각화하는 EPL 선수와 팀 성과 275 돌아보기/쪽지시험 312 CHAPTER 8 DuckDB를 사용한 EPL 대시보드 만들기 8.1 대시보드란? 314 8.2 EPL 데이터 분석 대시보드 만들기 319 돌아보기/쪽지시험 333 CHAPTER 9 DuckDB로 유튜브 인기 영상 분석하기 9.1 유튜브 데이터셋 다운로드 및 불러오기 335 9.2 유튜브 데이터 검토 340 9.3 유튜브 데이터 파생 변수 생성 346 9.4 유튜브 데이터 탐색적 분석 355 9.5 주제별 유튜브 트렌드 분석 377 9.6 〈케이팝 데몬 헌터스〉 유튜브 트렌드 분석 391 돌아보기/쪽지시험 411 용어집 413 찾아보기 416 |
이기준의 다른 상품
|
DuckDB 익스텐션은 DuckDB가 기본적으로 제공하지 않는 추가 기능을 필요할 때만 로드하여 사용할 수 있도록 구성된 플러그인 시스템입니다. DuckDB는 기본 엔진을 최대한 가볍고 빠르게 유지하기 위해 부가적인 다양한 기능은 익스텐션 형태로 제공하여 사용자가 필요에 따라 기능을 확장할 수 있도록 설계되어 있습니다. (...) 현재 DuckDB에 설치 가능한 익스텐션, 이미 설치된 익스텐션, 로딩된 익스텐션의 목록을 확인하려면 DuckDB가 제공하는 메타데이터 함수인 duckdb_extensions()를 사용하면 됩니다. 이 함수는 SQL 쿼리 문장에서 일반 테이블처럼 사용할 수 있으며, 익스텐션 상태를 쉽게 조회할 수 있도록 도와줍니다.
---p.47 DuckDB에서 작업이 끝난 테이블이나 SQL의 결과를 데이터 파일로 저장하는 방법 중 하나는 DuckDB CLI의 .mode로 설정한 출력 형태를 사용하여 저장하는 방법입니다. 이 방법을 사용하여 CSV, 엑셀, JSON 파일 등으로 데이터 처리 결과를 저장할 수 있습니다. / 이 방법을 사용하기 위해서는 먼저 DuckDB CLI의 닷 커맨드인 .mode를 사용하여 저장하고자 하는 포맷으로 출력 형태를 지정해야 합니다. .mode로 지정한 후에는 .once나 .output 명령어를 실행하고, 저장하고자 하는 결과를 조회하는 SQL을 실행하면 SQL 실행 결과가 .mode로 지정된 출력 포맷대로 만들어진 파일이 생성됩니다. ---p.94 다음은 2024/25 EPL의 선수별 통계가 저장된 playerStats_2024_EPL 테이블의 데이터를 사용하여 1위 팀인 리버풀과 손흥민가 소속되어 있던 토트넘 홋스퍼의 공격 효율을 비교해보는 예입니다. (...) 2024/25 EPL의 1위 팀인 리버풀(Liverpool)과 토트넘 홋스퍼(Tottenham Hotspur)의 포지션별 공격 결과를 살펴보면 수비수(Defender)의 경우 리버풀은 7골, 토트넘 홋스퍼는 4골을 기록하여 골이 많지 않습니다. 공격수(Forward)의 경우 리버풀이 토트넘 홋스퍼의 골보다 2배 가까이 기록했는데, 유효슛 대비 골 수와 전체 슛 대비 골 수도 모두 리버풀이 높습니다. 반면 미드필더(Midfielder)의 경우 토트넘 홋스퍼가 리버풀보다 8골 더 많이 기록하고 있고 성공률도 높습니다. 따라서 리버풀은 공격수에 의한 골 성공률이 높고, 토트넘 홋스퍼는 미드필더의 골 성공률이 높습니다. ---pp.194~195 표의 시각화에 사용할 great_tables 패키지는 파이썬에서 표 데이터를 시각적으로 표현할 수 있도록 도와주는 라이브러리로, HTML 환경에서 깔끔한 표 출력을 지원합니다. 이 라이브러리는 R의 gt 패키지에서 개발되었으며, 스타일 지정, 머리말/꼬리말 추가, 열 포맷 설정, 강조 효과 등 다양한 서식 옵션을 직관적인 문법으로 제공합니다. 폴라스 데이터프레임과의 호환성이 높아 기존 분석 작업과 쉽게 통합할 수 있으며, 단순 출력 이상의 고품질 프레젠테이션 표 생성이 가능합니다. ---p.287 〈케이팝 데몬 헌터스〉의 〈Golden〉은 우리나라에서 2025년 6월 25일부터 28일까지 총 4일간 트렌딩 영상으로 순위에 올랐습니다. 처음 순위에 랭킹된 6월 25일에는 이전 일이 없기 때문에 변화량이 모두 NULL로 조회됩니다. 조회 수는 26일 약 137만 회, 27일 약 180만 회, 28일 약 183만 회 증가하였습니다. 반면 좋아요 수는 26일 51,422개에서 27일 50,794회, 28일 43,047회로 감소하는 추세였고, 댓글 수도 26일 1,613개에서 27일 915개, 28일 864개로 줄어들었습니다. ---p.353 우리나라 인기 급상승 동영상에서 주 단위로 1위를 기록했던 영상 중 가장 좋아요 수가 많은 영상은 어떤 영상이 있었는지 살펴보겠습니다. SQL을 만들기 위해 CTE, 서브 쿼리, 윈도 함수를 사용합니다. 먼저 우리나라 영상 중 1위를 기록한 모든 영상을 검색하는 CTE를 ranked_video로 설정합니다. 이 CTE로 서브 쿼리를 만드는 데 윈도 함수인 ROW_NUMBER()를 사용하여 각 주(yearweek)로 분할하고 재생 수로 정렬한 행 번호를 붙여줍니다. 이후 이 행을 주별로 그룹화하여 번호가 1인 행들만 검색하면 매주 1위 영상 중 가장 많은 조회 수를 기록한 데이터만 검색할 수 있습니다. ---p.378 |
|
데이터를 읽고 분석하는 가장 현대적인 방식 DuckDB
이 책은 실제 데이터를 다루는 분석 과정 속에서 DuckDB의 강점을 자연스럽게 경험할 수 있도록 구성했습니다. 프리미어리그(EPL) 경기 및 선수 데이터를 활용해 순위와 경기 결과를 분석하고, 유튜브 인기 영상과 〈케이팝 데몬 헌터스〉 채널 데이터를 통해 트렌드 흐름을 살펴봅니다. 데이터를 불러오고, SQL로 분석하고, 파이썬으로 시각화하고, 대시보드로 연결하는 흐름을 따라가며 DuckDB 기반 데이터 분석 환경을 단계적으로 익힐 수 있습니다. 이 책만의 특별한 점 DuckDB는 강력하지만 데이터베이스와 SQL이 낯선 독자에게는 어렵게 느껴질 수 있습니다. 이 책은 그런 부담을 줄이는 데서 출발합니다. 데이터를 불러오고, SQL로 분석하고, 시각화하는 흐름을 따라가다 보면 DuckDB의 사용 방식과 장점이 자연스럽게 익숙해지도록 구성했습니다. 설명을 먼저 외우기보다 직접 쿼리를 실행하고 결과를 확인하면서 '이렇게 분석하는구나'를 체감하는 데 초점을 맞췄습니다. EPL 경기 데이터와 유튜브 데이터를 활용한 실전 예제를 따라가며 SQL과 데이터 분석 흐름을 자연스럽게 익힐 수 있습니다. 1. 복잡한 환경 구축 없이 시작하는 데이터 분석 DuckDB는 별도의 무거운 서버 환경 없이도 가볍게 설치해 사용할 수 있는 분석 데이터베이스입니다. 이 책은 CSV와 Parquet 같은 다양한 데이터를 직접 다루며 DuckDB의 빠르고 직관적인 분석 흐름을 자연스럽게 익힐 수 있도록 구성했습니다. 2. 실전 데이터로 배우는 SQL과 데이터 분석 단순한 문법 예제가 아니라 프리미어리그(EPL) 경기 데이터와 유튜브 데이터를 활용해 실제 분석 흐름을 경험합니다. 데이터를 조회하고, 조인하고, 집계하고, 시각화하는 과정을 따라가며 데이터 분석의 흐름을 자연스럽게 이해할 수 있습니다. 3. 기초 SQL부터 고급 SQL까지 단계적으로 학습 조회와 조인 같은 기본 SQL부터 CTE, 윈도 함수, 피벗 등 분석에 자주 사용되는 고급 SQL까지 단계적으로 학습합니다. SQL과 데이터베이스를 처음 접하는 독자도 흐름을 따라가며 학습할 수 있도록 구성했습니다. 4. 파이썬과 연결되는 현대적인 데이터 분석 흐름 DuckDB를 파이썬과 연동해 데이터를 분석하고, Plotly와 great_tables를 활용해 시각화와 대시보드 제작까지 경험합니다. 단순히 쿼리만 작성하는 것이 아니라 실제 데이터 분석 결과를 어떻게 보여줄 것인지까지 함께 다룹니다. 이 책은 누가 읽으면 좋을까요? - 데이터베이스를 사용한 데이터 분석에 처음 입문하는 분 - 기초 SQL부터 분석용 고급 SQL까지 실전 예제로 익히고 싶은 분 - EPL 및 유튜브 데이터를 활용해 실제 분석 흐름을 경험하고 싶은 분 이 책에서 다루는 내용은 무엇인가요? - DuckDB 개념과 사용법 - DuckDB CLI와 SQL 기반 데이터 처리 - CSV, JSON, Parquet 데이터 활용 - 윈도 함수, 피봇 등 데이터 분석용 SQL - 파이썬과 DuckDB 연동 데이터 분석 - Plotly와 great_tables 기반 데이터 시각화 - 실전 프로젝트: 프리미어리그 데이터와 유튜브 트렌드 분석 |