|
원서보는 것보다야 번역서가 빠르니 그냥 구입했다 후회중이다. 대명사 번역이 엄청 부자연스럽다. :으로 연결된 번역도 부자연스러운 것이 많다. 3장에 와서는 이런부분이 상당히 짜증스럽게 느껴진다. 거의 2-3페이지 마다 응?!! 거리게 만든다. 예를 들면 75페이지에서 "이 연산의 배치 버전에서는 평생 동안 스키를 타러 갈 총 횟수를 받게 되는 나중에를 진행하게 된다." (대체 먼소리야...!!! 번역기인가??)
번역은 한 75%가량은 괜찮다만 위에서 언급한 포인트마다 이건 편집자가 과연 문장을 하나씩 읽어보며 검수를 했냐 싶다. 역자의 몽고DB 번역은 괜찮었던거 같은데... 초벌 번역이후에 윤문하는 과정에서 이전 책보다 신경을 덜쓰거나 편집자가 일을 안했거나... |
|
원문을 제대로 이해하지 못한채로 번역을 하는 것 같은데요. 본인 커리어를 위해 말도 안되는 이상한 문장으로 번역 하는 사람들은 번역 좀 안했으면 좋겠습니다. 번역서가 안나오니만 못합니다. 더 나은 번역가가 번역할 기회도 없애버렸고 매번 많은 사람들은 좋은 책들을 잘 쓰여진 우리말로 접할 기회를 잃어버립니다........................ .... |
|
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다." 스파크를 활용한 실시간 처리 - 한빛미디어
파트 1은 스파크를 사용한 스트림 처리의 기본 방법에 대해서 설명하고 있다 파트 2는 구조적으로 스트리임을 설명하고 있다 파트 3은 본격적인 스파크 스트리밍에 대해 설명한다. 파트 4는 스파크를 활용한 고급 애플리케이션과 근사알고리즘과 머신러닝 알고림에 대해 설명한다. 파트 5는 스파크 뿐만 아니라 다른 분산 실시간 스트림 처리 시스템에 대해서 간략하게 소개한다. 이러한 기술서적을 20일동안 모두 독파하기는 쉽지 않다. |
|
[도서리뷰]스파크를 활용한 실시간 처리(Stream Processing with Apache Spark)
오늘 리뷰할 도서는 스파크를 활용한 실시간 처리(Stream Processing with Apache Spark)입니다. 이 리뷰는 한빛 미디어로부터 도서를 제공받아 독서 후 작성되었음을 알려드립니다. 들어가며웹개발자들 중에 실시간 처리가 필요 없는 개발자는 없을것이다. 비록 스파크를 직접 사용해본 적은 없더라도 서비스를(혹은 플랫폼)을 함께 만드는 다른 팀에서는 실시간 처리를 위해서 스파크를 사용하고 있을 가능성이크다(필자의 경우가 그랬다.) 우리 서비스에서 스파크가 실시간 처리를 담당해준다는 사실도 알고있었고, 여러 컨퍼런스에서 스파크를 이용한 실시간 처리에 관한 세션도 들어본적이 있지만, 공부를 하지않았다. 매번 해야한다는 생각만하고 당장 처리해야할 일이 너무 많아서 하지않았던거같다. 하지만 좋은 기회에 한빛미디어가 도서를 제공해주었고 덕분에 미루어둔 공부를 할 수 있게되었다. 먼저 목차부터 살펴보도록하자. 목차에 나와있다시피 기초부터 시작하여 사례, 적용 법까지 다양한 내용을 다루고있다. "한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."
|
|
아파치 스파크는 SQL, 스트리밍, 머신러닝, 그래프 처리를 위한 대규모 데이터 처리용 통합 분석 엔진입니다.
스파크는 분산 시스템에 속하는데요. 주로 인 메모리 처리 아키텍처에 쓰입니다.
스파크에 관심 있는 분들에게 추천하고 싶은 책이 있습니다.
책 제목은 '스파크를 활용한 실시간 처리'입니다.
여기서는 스파크는 아파치 스파크를 줄여서 말하겠습니다.
이 책을 통해 스트리밍 데이터를 처리하는 방법을 배워가는 시간이 되길 바랍니다.
1. 스트림 분석 도구로 빠르게 인사이트를 얻으려면 어떻게 해야 할까요? 데이터를 실시간처리 하는 방법을 알아야 합니다.
실시간 처리라 하면 생방송을 예로 들 수 있습니다.
생방송이 중간에 끊기면 시청자들은 불만을 느끼게 됩니다.
끊김 없이 바로바로 처리되어야 문제가 없는 겁니다.
이처럼 데이터를 처리할 때 실시간 처리가 잘 이뤄져야 오류 없이 실행됩니다.
직렬과 병렬을 비교하면 직렬보다 병렬이 빠르게 동작합니다.
병렬처리는 속도는 빠르지만, 비용이 많이 듭니다.
2. 분산처리 분산처리는 쉽게 표현해보겠습니다.
100명의 사람이 한길로 가게 되면 오랜 시간이 걸리게 됩니다.
하지만 100명의 사람이 10개의 길로 간다면 시간은 십 분의 일이 줄어듭니다.
분산처리란 자원을 효과적으로 관리하는 것을 의미합니다.
간단한 경우 설명이 쉽지만 복잡한 구조의 경우 구조에 대한 이해가 필요합니다.
Ps 아파치 스파크 이론과 예제를 통해 학습하신다면 스파크를 이해하는 데 도움 될 것입니다.
기본개념부터 머신러닝을 사용하는 고급 스파크 스트리밍 기술까지 알려줍니다.
이 책을 통해 스파크 스트리밍 라이브러리와 최신 구조적 스트리밍 API를 배울 수 있습니다.
스트리밍은 사람들이 실시간 처리로 알고 있습니다.
데이터 처리 방식에는 예를 들어 일괄처리방식이 있는데요. 데이터를 모아뒀다가 일괄적으로 처리하는 것을 말합니다.
스파크가 궁금하신 분들은 이 책을 한 번 읽어보시길 추천합니다.
한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다. |
|
2021년 4월에 출간된 <스파크를 활용한 실시간 처리>에 대해 알아보겠습니다. 평소에 데이터 분석과 아파치 스파크에 대해 관심이 많았었기에 이 책이 출간된다는 소식을 듣고 기대감이 높았었습니다. 이 책의 저자는 라이트벤드(Lightbend)의 수석 엔지니어로 재직 중인 제러드 마스와 라이트벤드에서 페이스북으로 이직한 프랑수아 가릴로입니다. <스파크를 활용한 실시간 처리>는 스칼라 언어를 기반으로 작성되어 있습니다. 그러므로 스칼라 언어를 모르는 분이라면 이 책을 이해하기에 다소 어려울 수 있습니다. <스파크를 활용한 실시간 처리>는 약 500여 페이지로 구성되어 있어 휴대하면서 읽기에 부담스러울 수 있습니다. 이 책은 전차잭으로도 만나볼 수 있음으로 전자책 뷰어가 있으신 분은 전자책으로 보셔도 좋을 것 같습니다. 한빛미디어 리뷰 평가단에 참가하여 작성한 글이며, 한빛미디어에서 제공해준 책을 읽고 작성했음을 밝힙니다. 이 책의 매력은?<스파크를 활용한 실시간 처리>에서 다루는 내용을 제대로 이해하기 위해서는 기본적으로 아파치 스파크에 대한 기본적인 특성과 내용, 그리고 스칼라 언어를 이해하고 있어야 합니다. 그렇지 않으면 이 책을 읽고 이해하기 쉽지 않을 것입니다. 개인적으로 한빛미디어에서 출간한 <스파크 완벽가이드>를 먼저 보고 이 책을 접하는 것이 좋을 것 같습니다. 사실 이 책을 읽는 대부분의 독자는 앞에서 제가 우려했던 내용을 마주하지 않으리라 생각합니다. 이 책에서 다루는 내용에 관해 관심 있으신 분들은 이미 스파크에 대한 경험이 있을 것으로 생각하기 때문입니다. 이 책은 스트리밍의 개념부터 활용 예제까지 꽤 많은 내용을 담고 있습니다. 실제로 관련 주제에 관해 관심 있으신 분은 도움을 받을 수 있을 것입니다. <스파크를 활용한 실시간 처리>의 구성은 좋습니다. 5개의 파트 안에 총 30개의 장으로 구성되어 있는데 적절히 구성되어 있다고 생각합니다. 다소 아쉬운 부분이 있는 부분도 있지만, 전체적으로 만족도가 높았습니다. 지식을 전달하는 과정이 돋보였으며, 이 책에서 제공하는 실습 예제도 좋았습니다. 이뿐만 아니라, 실습 코드와 노트북 환경 등을 제공한 부분도 매력적인 부분입니다. 이 책에서 한 가지 아쉬운 점은 번역 문제입니다. 저만 이런 느낌이 들었는지 모르겠지만, 이 책은 부드럽게 읽히지 않았습니다. 최근 한빛미디어 번역서에서 느끼지 못했던 느낌이었고, 개인적으로 아쉬운 부분이었습니다. 마치면서<스파크를 활용한 실시간 처리>를 정독하기에는 리뷰 시간이 부족해서 아쉽지만 스키밍 한 부분도 있었습니다. 하지만 이 책에서 다루는 내용은 제가 높은 관심과 흥미를 보이는 분야이므로 몇 번 더 정독하며 학습할 예정입니다. 좋은 책을 출간해 주셔서 감사드립니다.
"한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다." |
|
이 책은 아파치 스파크를 기반으로 인메모리 프레임워크를 사용해 스트리밍데이터를 학습한다. 또한, 스파크로 어떻게 배치 작업하듯이 스트리밍 작업을 수행할 수 있는지를 다룬다. 스트림처리 엔진으로서 아파치 스파크의 개념, 도구, 기능과 예제를 학습하는 데 중점을 두었으며, 최신 분산처리를 이해하는데 필요한 핵심 스파크 개념을 소개한다. 그런다음 다른 스트림 처리 아키텍쳐와 그 사이의 근본적인 아키텍처적인 절충안을 탐구한다. 마지막으로 아파치 스파크의 구도적 스트리밍으로 분산 스트리밍 애플리케이션을 쉽게 구 스파크가 현재 지원하는 스파크 스트리밍 라이브러리와 최신 구조적 스트리밍 API를 배울 수 있다. 스트리밍 애플리케이션에 아파치 스파크를 적용하려는 독자라면 스트림 처리의 기본 개념부터 머신러닝을 포함한 고급 기술까지 다양한 인사이트를 얻을 수 있을 것이다. 스트림 처리를 지원하는 개념을 이해하려면 1부를 보면 책 전반에 걸쳐 공통적으로 등장하는 언어와 개념을 쉽게 사용 할 수 있도록 도움을 준다. 그 그외는 원하는 내용으로 보면 될거 같다. 데이터에 애착이 있고 스트림 처리 영역의 지식과 기술을 향상시키기 원하며 이미 아파치 스파크에 친숙하거나 자신의 스트리밍 애플리케이션에 아파치 스파크를 사용하려는 사람들이 볼 만한 책이다. 입문자, 초심자가 보기엔 어려운 책이다. 원서 번역이라 살짝 자연스럽지 않을 수 있어도 필요한 사람은 도움이 많이 될거 같다. "한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다."
|
|
이 책은 스파크 어플리케션 개발의 다양한 모델과 적용 사례를 보여준다. 구조적 스트리밍과 스파크 스트리밍을 다루면서, 이벤트 기반 스트림 처리,
|
|
스파크는 빅데이터 분석 분야에서 독보적인 위치에 있습니다. 스트리밍 프로세싱에 있어 Flink라는 강력한 경쟁자가 있지만, 배치와 스트리밍을 모두 같은 플랫폼을 사용할 수 있다는 점에서 스파크는 널리 사용되고 있습니다.
스파크 공식 문서를 통해 스파크 스트리밍을 사용하다가 해당 도서가 출판된 것을 보고 매우 기뻤습니다. 이 책에는 스트리밍의 개념부터 활용 예제까지 많은 내용이 담겨있습니다. 스파크를 처음 사용하시는 분은 먼저 공식 문서나 스파크 완벽 가이드를 통해 학습하시고 이 책을 보시길 추천드립니다. (이 책을 보시는 분들은 본인의 스파크 실행 환경을 가지고 계시겠지만, 책에서도 스파크를 사용할 수 있는 노트북 환경을 제공합니다.)
소스, 처리, 싱크를 순서에 맞게 설명하고 있으며, 시간 처리와 상태를 정기적으로 저장할 수 있는 체크포인팅까지 코드와 함께 잘 설명하고 있습니다. 스트리밍 애플리케이션을 만드실 때 참고하기 좋은 도서라고 생각합니다.
다만, 번역 부분이 매끄럽지 않아서 잘 읽히지 않는 것이 아쉬웠습니다.
한빛미디어 <나는 리뷰어다> 활동을 위해서 책을 제공받아 작성된 서평입니다. |
|
아파치 스파크는 빅 데이터 분산 처리에 활용하는 오픈 소스입니다. 책의 표지에는 "실시간 데이터 처리"라는 부분을 강조하고 있고, 이 책의 모든 소스 코드는 스칼라로 구현된 예제를 실었습니다. 카프카와 연동한 부분을 매우 흥미롭게 읽었습니다. 빅 데이터와 뗄 수 없는 기술이 머신러닝이라 할 수 있죠. 이 책의 또 다른 장점은 어려운 개념을 풀어쓰기 위해 많은 기술서들이 그러하지만 특히 어려운 개념을 아래와 같이 클라우드에서는 빅데이터 분산 처리를 어떻게 수행하는지 부록의 성격으로 알려주고 있습니다. 그렇지만 국내서로는 이렇다 할 스파크 관련 도서가 많지 않다는 점과, |