확장메뉴
주요메뉴


소득공제
미리보기 공유하기

기초부터 시작하는 강화학습/신경망 알고리즘

: AI는 어떻게 게임을 할까

위키북스- 데이터 사이언스 시리즈-044이동
첫번째 리뷰어가 되어주세요 | 판매지수 1,338
베스트
IT 모바일 top100 3주
정가
27,000
판매가
24,300 (10% 할인)
YES포인트
배송비?
무료
신상품이 출시되면 알려드립니다. 시리즈 알림신청
eBook이 출간되면 알려드립니다. eBook 출간 알림 신청
서울특별시 영등포구 은행로 지역변경
  •  국내배송만 가능
  •  최저가 보상
  •  문화비소득공제 신청가능
1월 전사
1월 혜택모음
1 2 3 4 5

품목정보

품목정보
출간일 2019년 11월 21일
쪽수, 무게, 크기 312쪽 | 175*235*30mm
ISBN13 9791158391768
ISBN10 1158391765

책소개 책소개 보이기/감추기

강화학습을 어떻게 시작해야 할지 모르는 분들을 위해서 준비했다!

강화학습은 인간이 학습하는 과정과 비슷한 인공지능 분야 중 하나이다. 로봇의 행동학습, 자율주행 자동차의 행동학습에 대표적으로 사용되며, 알파고의 핵심 알고리즘으로 유명해졌다. 이 책은 강화학습에 관심이 있지만 어디서 어떻게 시작해야 할지 모르는 분들을 위해 가장 기초적인 상태가치함수/행동가치함수의 정의부터 시작해서 신경망을 이용한 DQN까지 강화학습의 기본 알고리즘을 충분히 이해할 수 있게 구성했다. 실습 예제로 고전게임 틱택토(Tic Tac Toe)를 플레이하는 알파고 제로(AlphaGo Zero)와 같은 인공지능 플레이어를 만들어 봄으로써 인공지능이 어떻게 게임을 플레이하는가를 알아본다.

이 책으로 차근차근 실습을 진행한다면 강화학습의 기본 알고리즘을 충분히 이해할 수 있을 것이며, 이를 바탕으로 여러 가지 인공지능 시스템을 만들 수 있으리라 생각한다.

목차 목차 보이기/감추기

01장: 인공지능이란?

머신러닝의 종류
__지도학습
__비지도학습
__강화학습
강화학습과 신경망
이 책의 구성

02장: 강화학습

강화학습의 기본 요소
__환경
__상태 (S)
__에이전트
__행동 (A)
__상태전이확률 (P)
__보상 (R)
__수익 (G)
__정책 (r)
__에피소드
__마르코프 의사결정과정 (MDP)
환경과 에이전트 준비
가치함수 : 상태/행동의 가치 계산
__상태가치함수 : Vr
__행동가치함수 : Qr
동적계획법 : 최적 정책 선택
__정책 평가
__반복 정책 평가
__정책 개선
__정책 반복
__가치 반복
몬테카를로 방법
__몬테카를로 방법의 Prediction
__몬테카를로 방법의 Control
시간차 학습
__시간차 학습의 Prediction
__시간차 학습의 Control : SARSA(On-policy)
__시간차 학습의 Control : Q-learning(Off-policy)
__Double Q-learning
__정책 그레이디언트 : 액터-크리틱
함수 근사
함수 근사 : TD(0) Prediction
함수 근사 : Q-learning

03장: 인공신경망

퍼셉트론
손실함수
__평균제곱오차
__교차엔트로피오차
경사하강법
퍼셉트론의 학습
__숫자 외우기
__선형 함수 근사
__비선형 함수 근사
다층 퍼셉트론
활성화 함수
__시그모이드 함수
__하이퍼볼릭탄젠트 함수
__ReLU 함수
__소프트맥스 함수
오차역전파법
__오차역전파법이란?
__중간층과 출력층 사이의 가중치와 편향 학습
__입력층과 중간층 사이의 가중치와 편향 학습
__비선형 함수 근사
학습 최적화
__일정 비율 감소
__모멘텀
__AdaGrad
__RMSProp
__Adam
__드롭아웃
__배치 정규화
__그 밖의 방법
배치 경사하강법, 확률적 경사하강법, 미니배치 경사하강법
__배치 경사하강법
__확률적 경사하강법
__미니 배치 경사하강법
__에폭
케라스를 이용한 신경망 구현
합성곱신경망
__합성곱신경망이란?
__합성곱층
__채널
__스트라이드
__패딩
__풀링층
__플래튼층
케라스를 이용한 합성곱신경망 구현
__손글씨 데이터
__손글씨 데이터 전처리
__합성곱신경망 구축
__학습과 결과 확인

04장: 인공지능 만들기: 틱택토 게임

틱택토 준비
인간 플레이어
랜덤 플레이어
게임 진행 함수
몬테카를로 플레이어
Q-learning 플레이어
DQN 플레이어

부록A: 참고 자료

A.1 미분
A.2 편미분
A.3 연쇄법칙

저자 소개 (1명)

한줄평 (1건) 한줄평 총점 4.0

혜택 및 유의사항 ?
평점2점
내용 괜찮은데 오타 넘 많아요. p59, p79, p109, p114~118, p137 등
이 한줄평이 도움이 되었나요? 공감 0
스*터 | 2020.02.15
  •  쿠폰은 결제 시 적용해 주세요.
1   24,300
뒤로 앞으로 맨위로 aniAlarm