이미 소장하고 있다면 판매해 보세요.
|
CHAPTER 01 언어와 계산 1
데이터 과학 패러다임 2 언어 인식 데이터 제품 4 데이터 제품 파이프라인 6 데이터로서의 언어 9 언어의 계산 모델 10 언어 자질 11 맥락 자질 15 구조적 자질 17 결론 20 CHAPTER 02 사용자 정의 말뭉치 구축 21 말뭉치란 무엇인가? 22 영역 특정 말뭉치 22 Baleen 수집 엔진 23 말뭉치 데이터 관리 25 말뭉치 디스크 구조 27 말뭉치 리더 30 NLTK를 사용한 스트리밍 데이터 액세스 32 HTML 말뭉치 읽기 34 데이터베이스에서 말뭉치 읽기 38 결론 40 CHAPTER 03 말뭉치의 전처리와 가공 41 문서 쪼개 보기 42 핵심 내용 식별 및 추출 42 문서를 단락별로 나누기 44 분할: 문장별로 나누기 46 토큰화: 개별 토큰 식별 48 품사 태깅 49 중간 말뭉치 분석론 50 말뭉치 변환 52 중간 전처리 및 저장 52 처리된 말뭉치 읽기 56 결론 58 CHAPTER 04 텍스트 벡터화와 변환 파이프라인 59 공간 내 단어 61 빈도 벡터 62 원핫 인코딩 64 용어빈도-역문서빈도 67 분산 표현 71 사이킷런 API 74 BaseEstimator 인터페이스 74 TransformerMixin 확장 76 파이프라인 81 파이프라인의 기초 81 하이퍼파라미터 최적화를 위한 격자 검색 83 특징결합을 사용한 특징추출 강화 84 결론 86 CHAPTER 05 텍스트 분석을 위한 분류 89 텍스트 분류 90 분류 문제 식별 91 분류기 모델 92 텍스트 분류 애플리케이션 만들기 94 교차검증 94 모델 구성 98 모델 평가 100 결론 105 CHAPTER 06 텍스트 유사성을 위한 군집화 107 텍스트에 대한 비지도학습 108 문서 유사성에 의한 군집화 109 거리 계량 110 부분 군집화 112 위계적 군집화 118 문서 토픽 모델링 122 잠재 디리클레 할당 122 잠재 의미 분석 130 음이 아닌 행렬 인수분해 133 결론 134 CHAPTER 07 문맥 인식 텍스트 분석 137 문법 기반 특징추출 138 문맥 자유 문법 139 구문론적 구문분석기 139 키프레이즈 추출 141 엔터티 추출 144 엔그램 특징추출 145 엔그램 인식 CorpusReader 147 올바른 엔그램 창 선택하기 149 유의한 병치 150 엔그램 언어 모델 153 빈도 및 조건부 빈도 154 최대 가능도 추정 157 알 수 없는 단어: 백오프 및 평활화 160 언어 생성 163 결론 164 CHAPTER 08 텍스트 시각화 167 특징공간 시각화 168 시각적 특징분석 168 유도된 특징공학 179 모델 진단 187 군집 시각화 188 계급 시각화 190 분류 오차 진단 191 시각적 조향 195 실루엣 점수 및 엘보 곡선 195 결론 198 CHAPTER 09 텍스트의 그래프 분석 201 그래프 계산 및 분석 203 그래프 기반 시소러스 만들기 203 그래프 구조 분석 205 그래프의 시각적 분석 206 텍스트에서 그래프 추출하기 207 소셜 그래프 만들기 208 소셜 그래프에서 통찰력 얻기 211 엔터티 분해 219 그래프상의 엔터티 분해 220 구조로 차단하기 221 퍼지 차단 221 결론 224 CHAPTER 10 챗봇 227 대화의 기초 228 대화: 간략한 의견 교환 230 대화 유지 233 예의바른 대화 규칙 236 인사와 경례 236 의사불통 다루기 241 재미있는 질문 244 의존 구문분석 245 구 구조 분석 246 질문 검출 249 스푼에서 그램으로 251 도움을 위한 학습 256 이웃이 되기 257 추천 정보 제공 260 결론 263 CHAPTER 11 멀티프로세싱과 스파크를 사용한 텍스트 분석론 확장 265 파이썬 멀티프로세싱 266 병렬로 작업 실행 269 프로세스 풀 및 큐 274 병렬 말뭉치 전처리 276 스파크를 사용한 클러스터 컴퓨팅 278 스파크 작업의 해부학 278 말뭉치 배포 280 RDD 운영 282 스파크를 이용한 자연어 처리 284 결론 296 CHAPTER 12 딥러닝과 그 이후 299 응용 신경망 300 신경 언어 모델 300 인공 신경망 301 딥러닝 아키텍처 306 정서 분석 311 심층 구조 분석 313 미래가 바로 눈앞에 318 용어 해설 321 찾아보기 338 |
Benjamin Bengfort
Rebecca Bilbro
Tony Ojeda
박진수의 다른 상품
|
우리가 제안하는 텍스트 분석용 모델은 머신러닝 작업흐름과 직접 관련이 있다. 이런 작업흐름 중에서 검색 과정에서는 특징과 알고리즘 및 학습 데이터에서 가장 잘 작동하는 하이퍼파라미터로 구성된 모델을 찾아 알려지지 않은 데이터에 대한 추정치를 산출한다. 텍스트 분석 시에 이 작업흐름은 말뭉치라고 하는 훈련 데이터셋을 작성하고 관리하는 일로 시작된다. 그런 다음에 머신러닝이 이해할 수 있는 숫자 데이터로 텍스트를 구성하는 특징추출 방법 및 전처리 방법들을 찾아본다. 우리는 몇 가지 기본 특징을 사용해 책의 처음 몇 장에 대한 결론을 지으면서 텍스트 분류 및 텍스트 군집화 기술을 살펴볼 것이다.
--- p.xxiv 사실, 이 책을 쓰는 중요한 동기는 의미 있는 데이터 제품에 힘을 실어 줄 만큼 충분히 크고 풍부한 자료를 만들고 다룰 수 있기 위해 노력하는 과정에서 우리가 겪었던 엄청난 어려움 때문이었다. 우리의 일상적인 시간과 노력이 텍스트 전처리와 랭글링(wrangling, 정리)에 얼마나 많은 노력을 기울이고 있는지를 감안할 때 이러한 단계를 지원(또는 심지어 인정하는 것)하는 리소스가 거의 없다는 점이 놀라웠다. 이번 장에서는 수집된 원시 텍스트를 계산하고 모델링을 하기 좋은 형태에 맞게 체계적으로 변환하는 데 사용할 수 있는 다목적 전처리 프레임워크를 제안한다. 우리의 프레임워크는 다섯 가지 핵심 단계인 내용 추출, 단락 블록 지정, 문장 분할, 단어 토큰화 및 품사 태깅(tagging, 테그 달기)을 포함한다. 이 단계들 각각에 대해 우리는 이전 장에서 정의된 HTMLCorpusReader 클래스의 메서드로 여겨지는 함수들을 제공할 것이다. --- p.41 문서를 숫자로 표현하면 유의한 분석을 수행할 수 있으며, 머신러닝 알고리즘이 작동하는 사례도 생성된다. 텍스트 분석 시, 전체 문서 또는 발화가 사례에 해당하므로 텍스트의 길이는 따옴표 길이에서 시작해서 트윗 정도의 길이를 거쳐 도서 내용 전체를 아우르는 길이에 이르기까지 그 길이가 저마다 다를 수 있지만, 벡터의 길이는 항상 일정하게 된다. 벡터 표현을 이루는 각 속성에 해당하는 것이 특징(feature)이다. 텍스트라면 특징은 문서의 길이와 작성자, 출처 및 게시 날짜와 같은 메타 속성뿐만 아니라 내용을 포함해 문서의 특성(attributes)과 속성(properties)을 나타낸다. --- p.59 앞으로 수십 년이 지나면 스팸을 걸러 내는 일이 가장 일반적이며, 아마도 상업적으로 성공한 텍스트 분류 모델이 될 것으로 보인다. 이메일의 내용이 스팸인지 아닌지를 결정하는 것이 중요하다는 점이 혁신을 이루게 된 핵심 아이디어다. 단순히 ‘비아그라’나 ‘김미영 팀장’이라는 용어의 존재가 중요한 것이 아니라 스팸 메일에 담긴 맥락이나 빈도 및 철자 오류의 존재가 중요하다. 스팸 메일과 햄 메일을 둘 다(both) 담고 있는 말뭉치 모음집으로 나이브 베이즈 모델을 만들 수 있었는데, 이 나이브 베이즈 모델은 빈도를 기반으로 한 스팸 메일과 햄 이메일 모두에서 한 단어의 존재 확률을 예측하기 전에 먼저 획일적인 방법을 적용해 본다. --- p.90 특징분석 및 특징공학을 수행한 후에, 3중 모델 선택 작업흐름의 다음 단계는 모델 선택이다. 실제로는 새로운 모델로 어떤 모델이 가장 효과적일지 미리 예측하기가 일반적으로 어렵기 때문에 여러 모델을 선택하고 비교할 것이다. 따라서 우리의 다음 과제는 모델이 잘 작동하는지 또는 불량하게 작동하는지를 결정하는 것이다. 전통적인 머신러닝 문맥에서 볼 때 우리는 모델 성능 점수에 의존할 수 있는데, 회귀라면 평균제곱오차(mean square error) 또는 결정계수(coefficient of determination) 등에서, 그리고 분류라면 정밀도(precision)와 정확도(accuracy) 및 F1 점수(F1 score) 등에서 어떤 것이 가장 강력한 모델인지를 결정한다. 이러한 기술은 또한 시각적 분석의 맥락으로 확장될 수 있다. --- p.187 |
|
이 책의 주요 내용
* 텍스트를 전처리하고 벡터화해서 고차원 특징 표현으로 바꾸기 * 문서 분류 및 토픽 모델링 수행하기 * 시각적인 진단을 통해 모델 선택 과정 조정하기 * 핵심 어구 추출, 개체명 식별, 그래프 구조 추출을 통해 텍스트가 담고 있는 데이터 추론하기 * 챗봇이나 언어로 상호작용을 하는 대화형 프레임워크 만들기 * 스파크를 사용해 처리 능력을 늘리거나 신경망을 사용해 더 복잡한 모델로 키우기 |