이미지 검색을 사용해 보세요
검색창 이전화면 이전화면
최근 검색어
인기 검색어

소득공제 청년패스
강화학습 기본 완성과 PyTorch
추상목
자유아카데미 2025.12.15.
가격
23,000
23,000
YES포인트?
0원
5만원 이상 구매 시 2천원 추가 적립
결제혜택
카드/간편결제 혜택을 확인하세요

이미 소장하고 있다면 판매해 보세요.

  •  국내배송만 가능
  •  문화비소득공제 가능

강화학습 시리즈

이 상품의 태그

책소개

목차

제1장 REINFORCE-Monte Carlo Policy Gradient
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터 정의
5.손실 정의
6.파라미터 업데이트 함수
7.Main
8.코드 설명
9.전체 코드
10.부록

제2장 REINFORCE-Baseline
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터 정의
5.손실 정의
6.파라미터 업데이트 함수
7.Main
8.코드 설명
9.전체 코드
10.부록

제3장 Advantage Actor Critic(A2C)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터 정의
5.손실 정의
6.Main
7.전체 코드
8.부록

제4장 Asynchronous Advantage Actor Critic(A3C)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터 정의
5.손실 정의
6.train 함수
7.Main
8.코드 설명
9.전체 코드
10.부록

제5장 Deep Deterministic Policy Gradient(DDPG)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의와 노이즈 추가
4.학습데이터(replay memory) 정의
5.손실 정의
6.Main
7.코드 설명
8.전체 코드
9.부록

제6장 Twin Delayed Deep Deterministic Policy Gradient(TD3)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의와 노이즈 추가
4.학습데이터(replay memory) 정의
5.손실 정의
6.Main
7.전체 코드
8.부록

제7장 Trust Region Policy Optimization(TRPO)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터(replay memory) 정의
5.Critic 손실 정의와 actor 파라미터 업데이트 공식
6.Main
7.코드 설명
8.전체 코드
9.부록

제8장 Proximal Policy Optimization(PPO)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태를 입력하면 행동 출력) 정의
4.학습데이터(replay memory) 정의
5.손실 정의
6.Main
7.코드 설명
8.전체 코드
9.부록

제9장 Soft Actor Critic(SAC)
1.용어 설명과 구성 요소
2.신경망 구조
3.정책(상태가 입력되면 행동 출력) 정의
4.학습데이터(replay memory) 정의
5.손실 정의
6.Main(train 함수)
7.전체 코드
8.부록

저자 소개 1

서울대에서 이학사, 이학석사, 이학박사를 취득한 후, 울산대학교 수학과에 부임하여 현재까지 교수로 재임하면서 파이썬 프로그래밍, 수리 통계학, 수리인공지능(빅테이터 분석, 순방향신경망, 언어 처리에 사용하는 순환신경망, 이미지 처리에 사용하는 합성곱 신경망) 강의를 하고 있다.

추상목의 다른 상품

관련 분류

품목정보

발행일
2025년 12월 15일
쪽수, 무게, 크기
252쪽 | 188*257*12mm
ISBN13
9791158087890

리뷰/한줄평0

리뷰

첫번째 리뷰어가 되어주세요.

한줄평

첫번째 한줄평을 남겨주세요.

23,000
1 23,000