이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
CHAPTER 01 소개1 강화 학습이란2 기계 학습 = 지도 학습 + 비지도 학습 + 강화 학습3 성공 사례와 응용 분야4 간략 역사5 읽을거리연습문제CHAPTER 02 강화 학습 기초 다지기1 환경과 상호작용하는 에이전트2 파이썬으로 MDP 프로그래밍3 랜덤 정책과 최적 정책의 기대 이득 비교4 정책과 가치 함수5 강화 학습의 난이도와 접근방법 이해연습문제CHAPTER 03 동적 프로그래밍1 원리2 벨만 방정식과 정책 반복 알고리즘3 벨만 최적 방정식과 가치 반복 알고리즘4 스토캐스틱 과업의 동적 프로그래밍5 동적 프로그래밍의 특성과 한계연습문제CHAPTER 04 몬테카를로 방법1 에피소드 발생기2 탐험과 탐사의 균형3 몬테카를로 방법으로 정책 평가4 몬테카를로 방법으로 정책 학습5 성능 향상 기법연습문제CHAPTER 05 시간차 학습1 원리2 정책 평가3 Sarsa4 Q-러닝5 Q-러닝으로 블랙잭 게임 학습6 Q-러닝으로 CartPole 학습7 성능 향상 기법8 관점 확장연습문제CHAPTER 06 신경망을 이용한 근사 방법1 신경망 기초2 신경망 구현3 신경망을 이용한 Q-러닝4 신경망 기반 Q-러닝 구현: CartPole 과업5 신경망 기반 Q-러닝 구현: Blackjack 과업6 신경망에 대한 논쟁과 새로운 길연습문제CHAPTER 07 딥러닝 방법1 딥러닝으로 대전환2 DQN3 리플레이 메모리4 딥러닝 기초5 아타리 게임 환경6 DQN을 이용한 퐁 아타리 게임7 덧붙이는 말연습문제CHAPTER 08 정책 그레이디언트 방법1 정책이 중심인 학습2 REINFORCE 알고리즘3 REINFORCE 프로그래밍: 이산 과업4 연속 과업을 위한 정책 그레이디언트5 REINFORCE 프로그래밍: 연속 과업6 파이썬의 배열 연산을 이용한 속도 향상연습문제CHAPTER 09 행동가 - 비평가 방법1 행동가와 비평가의 협력2 편향-분산 트레이드오프3 이익 함수4 A2C와 A3C5 A2C 프로그래밍: 이산 과업6 A2C 프로그래밍: 연속 과업연습문제CHAPTER 10 신뢰 영역 방법1 단조 정책 개선2 TRPO 알고리즘3 PPO 알고리즘4 PPO의 효율 향상5 PPO 프로그래밍: 연속 과업연습문제CHAPTER 11 정책 최적화와 DQN의 결합1 동기와 전개2 DDPG 학습 알고리즘3 프로그래밍 실습: DDPG를 이용한 Hopper 과업 학습4 TD3 학습 알고리즘5 프로그래밍 실습: TD3을 이용한 Hopper 과업 학습6 SAC 학습 알고리즘7 프로그래밍 실습: SAC를 이용한 Hopper 과업 학습8 벤치마킹 분석연습문제CHAPTER 12 흉내 학습1 발상과 전개2 행위 복제3 역강화 학습4 적대 흉내 학습5 관찰 흉내연습문제CHAPTER 13 고급 응용1 강화 학습으로 만든 고급 제품: 기회와 도전2 비디오 게임3 보드 게임4 대규모 언어 모델5 자율주행6 로봇7 인공일반지능을 향하여연습문제참고문헌찾아보기
|
오일석의 다른 상품