이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
CHAPTER 1 밴디트 문제_1.1 머신러닝 분류와 강화 학습_1.2 밴디트 문제_1.3 밴디트 알고리즘_1.4 밴디트 알고리즘 구현_1.5 비정상 문제_1.6 정리CHAPTER 2 마르코프 결정 과정_2.1 마르코프 결정 과정(MDP)이란?_2.2 환경과 에이전트를 수식으로_2.3 MDP의 목표_2.4 MDP 예제_2.5 정리CHAPTER 3 벨만 방정식_3.1 벨만 방정식 도출_3.2 벨만 방정식의 예_3.3 행동 가치 함수(Q 함수)와 벨만 방정식_3.4 벨만 최적 방정식_3.5 벨만 최적 방정식의 예_3.6 정리CHAPTER 4 동적 프로그래밍_4.1 동적 프로그래밍과 정책 평가_4.2 더 큰 문제를 향해_4.3 정책 반복법_4.4 정책 반복법 구현_4.5 가치 반복법_4.6 정리CHAPTER 5 몬테카를로법_5.1 몬테카를로법 기초_5.2 몬테카를로법으로 정책 평가하기_5.3 몬테카를로법 구현_5.4 몬테카를로법으로 정책 제어하기_5.5 오프-정책과 중요도 샘플링_5.6 정리CHAPTER 6 TD법_6.1 TD법으로 정책 평가하기_6.2 SARSA_6.3 오프-정책 SARSA_6.4 Q 러닝_6.5 분포 모델과 샘플 모델_6.6 정리CHAPTER 7 신경망과 Q 러닝_7.1 DeZero 기초_7.2 선형 회귀_7.3 신경망_7.4 Q 러닝과 신경망_7.5 정리CHAPTER 8 DQN_8.1 OpenAI Gym_8.2 DQN의 핵심 기술_8.3 DQN과 아타리_8.4 DQN 확장_8.5 정리CHAPTER 9 정책 경사법_9.1 가장 간단한 정책 경사법_9.2 REINFORCE_9.3 베이스라인_9.4 행위자-비평자_9.5 정책 기반 기법의 장점_9.6 정리CHAPTER 10 한 걸음 더_10.1 심층 강화 학습 알고리즘 분류_10.2 정책 경사법 계열의 고급 알고리즘_10.3 DQN 계열의 고급 알고리즘_10.4 사례 연구_10.5 심층 강화 학습이 풀어야 할 숙제와 가능성_10.6 정리APPENDIX A 오프-정책 몬테카를로법A.1 오프-정책 몬테카를로법 이론A.2 오프-정책 몬테카를로법 구현APPENDIX B n단계 TD법APPENDIX C Double DQN 이해하기C.1 DQN에서의 과대적합이란?C.2 과대적합 해결 방법APPENDIX D 정책 경사법 증명D.1 정책 경사법 도출D.2 베이스라인 도출
|
齋藤康毅
사이토 고키의 다른 상품
이복연
개앞맵시의 다른 상품
|
강화 학습 마스터의 지름길은 기초를 다지는 것!딥러닝은 매우 핫한 분야여서 하루가 멀다 하고 새로운 알고리즘과 응용 사례가 발표되고 있습니다. 엄청난 발전 속도에 따라 관련 기술과 서비스도 빠르게 진화해서, 이전에는 유행이었던 것들이 지금은 사라지기도 합니다. 하지만 한편으로는 변하지 않고 전해져 내려오는 것도 있죠. 이 책에서는 배우는 지식이 바로 그 변하지 않는 것입니다. 강화 학습의 기초를 이루는 아이디어와 기술은 예나 지금이나 변함이 없습니다. 최신 알고리즘도 오래전부터 존재해온 아이디어를 토대로 합니다. 강화 학습의 기본 원리, 마르코프 결정 과정, 벨만 방정식, Q 러닝, 신경망 등과 같은 주제는 앞으로도 변함없이 중요하게 여겨질 것입니다. 따라서 현재의 강화 학습, 나아가 심층 강화 학습까지 이해하려면 강화 학습의 기초부터 차근차근 학습하는 것이 오히려 지름길입니다. 파이썬과 수학에 대한 기초만 있다면 읽을 수 있도록 수식 기호 하나하나, 코드 한 줄 한 줄 친절히 설명합니다. 이 책으로 강화 학습의 기초를 제대로 배우고 ‘변하지 않는 것’의 아름다움을 맛보기 바랍니다. 여러분 곁에 포스가 함께 하기를…대상 독자- 강화 학습의 원리를 제대로 배우고자 하는 독자- 딥러닝을 더 깊게 이해하고 싶은 개발자 - 파이썬 지식이 있으며 딥러닝과 강화 학습에 흥미가 있는 데이터 과학 입문자 주요 내용 - 여러 후보 가운데 가장 좋은 것을 순차적으로 찾는 '밴디트 문제' 풀어보기(1장)- 일반적인 강화 학습 문제를 ‘마르코프 결정 과정’으로 정의하기(2장)- 마르코프 결정 과정에서 최적의 답을 찾는 데 핵심이 되는 ‘벨만 방정식’ 도출하기(3장)- 벨만 방정식을 풀기 위한 방법: 동적 프로그래밍(4장), 몬테카를로법(5장), TD법(6장)- 딥러닝에 대해 알아보고 딥러닝을 강화 학습 알고리즘에 적용하기(7장)- DQN을 구현하고 DQN을 확장한 방법 알아보기(8장)- DQN과는 다른 접근법: ‘정책 경사법’ 알고리즘(9장)- A3C/DDPG/TRPO/레인보우 알고리즘과 심층 강화 학습(10장)
|