이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
시작하며01장 강화학습 기본 개념1.1 강화학습이란1.2 확률과 확률 과정1.3. 마르코프 연쇄1.4 마르코프 보상 과정02장 강화학습 기본 알고리즘2.1 마르코프 결정 과정2.2 MDP 행동 가치 함수2.3 MDP 최적 가치 함수2.4 강화학습에 사용되는 다양한 용어2.5 다이내믹 프로그래밍2.6 몬테카를로 방법2.7 TD와 SARSA2.8 Q 러닝03장 인공지능의 개념3.1 머신러닝3.2 선형 회귀 분석3.3 분류 분석3.4 딥러닝3.5 개발 환경 설치3.6 텐서플로우04장 함수 근사법4.1 미분4.2 편미분4.3 스칼라와 벡터4.4 그래디언트4.5 경사하강법4.6 확률적 경사하강법4.7 강화학습에서 편미분과 경사하강법의 표기법4.8 함수 근사법05장 가치 기반 강화학습과 DQN 알고리즘5.1 DQN 알고리즘5.2 카트폴5.3 탐험과 탐욕의 문제5.4 DQN 알고리즘 기본 구조5.5 DQN 알고리즘 전체 코드 리뷰5.6 DQN 알고리즘 세부 구조 살펴보기5.7 DQN 알고리즘 학습 결과 분석06장 정책 기반 강화학습 REINFORCE 알고리즘6.1 인공신경망 다시 보기6.2 정책 그래디언트6.3 REINFORCE 알고리즘 동작 방식6.4 REINFORCE 알고리즘 기본 구조6.5 REINFORCE 알고리즘 전체 코드 리뷰6.6 REINFORCE 알고리즘 세부 구조 살펴보기6.7 REINFORCE 알고리즘 학습 결과 분석07장 정책 기반 A2C 알고리즘7.1 액터 크리틱 알고리즘7.2 어드밴티지 액터 크리틱7.3 A2C 알고리즘 기본 구조7.4 A2C 알고리즘 전체 코드 리뷰7.5 A2C 알고리즘 세부 구조 살펴보기7.6 A2C 알고리즘 학습 결과 분석08장 정책 기반 PPO 알고리즘8.1 중요도 샘플링8.2 오프 폴리시 정책 그래디언트8.3 클리핑 기법8.4 GAE8.5 PPO 알고리즘 기본 구조8.6 PPO 알고리즘 전체 코드 리뷰8.7 PPO 알고리즘 세부 구조 살펴보기8.8 PPO 알고리즘 알고리즘 학습 결과 분석09장 인공신경망 튜닝9.1 인공신경망 튜닝 개요9.2 입력 데이터 전처리9.3 비용 함수의 선택9.4 활성화 알고리즘9.5 가중치 초기화9.6 최적화 알고리즘9.7 노드와 은닉층 개수에 대한 논의9.8 PPO 알고리즘 인공신경망 튜닝9.9 PPO 알고리즘 튜닝 코드 적용9.10 PPO 알고리즘 튜닝 결과 분석10장 그리드 서치 기반 최적화 기법10.1 그리드 서치 개념10.2 그리드 서치 코딩10.3 그리드 서치 전체 코드10.4 그리드 서치 결과 분석10.5 그리드 서치 파라미터 튜닝 적용11장 베이지안 최적화 기법11.1 빈도주의 확률과 베이지안 확률11.2 베이지안 확률 계산11.3 베이지안 최적화 패키지 소개11.4 베이지안 최적화 패키지 활용11.5 베이지안 최적화 전체 코드11.6 베이지안 최적화 결과 분석마무리하며찾아보기
|
김남준의 다른 상품
멀티코어의 다른 상품
윤철희의 다른 상품
|
인공지능의 최전선, 강화학습이제 인공지능은 IT 업계를 넘어 다양한 분야와 비즈니스로 활용 폭을 넓히고 있습니다. 인공지능을 공부하다 보면 머신러닝과 딥러닝부터 시작해서 결국에는 강화학습을 마주하게 됩니다. 강화학습은 시행착오를 거쳐 해결책을 찾아나가는 기법으로, 인공지능 기술 중에서 가장 난이도가 높습니다. 그래서 원리를 이해하려면 상당한 수준의 수학과 통계 이론을 알아야 합니다. 이 책에서는 강화학습의 기초가 되는 수식을 하나하나 자세히 유도하기보다는 수식이 이어지는 흐름을 따라가면서 다양한 알고리즘의 원리를 한눈에 살펴보고, 코드로 구현해가며 활용법을 익히도록 구성했습니다. 이 책을 출발점으로 삼아, 인공지능의 최전선에 있는 강화학습을 제대로 이해하고 활용할 수 있는 발판을 마련해 봅시다.이 책의 특징· 강화학습 이해에 필요한 통계와 수학 이론을 기초부터 다룬다.· 알고리즘의 기본 개념을 그림으로 표현하여 이해를 돕는다.· 하나의 예제를 통해 일관성 있게 개념과 이론을 설명해 나간다.· 파이썬 코드 구현과 튜닝, 최적화까지 실무에 적용할 수 있는 수준까지 다룬다.이 책의 구성이 책은 강화학습의 기초 개념과 인공지능 개념, 가치 기반 강화학습, 정책 기반 강화학습, 튜닝 문제, 이렇게 모두 다섯 부분으로 구성됩니다.· 강화학습의 기초 개념: 강화학습에 필요한 통계 및 수학 이론과 MDP에 대한 설명· 인공지능 개념: 머신러닝부터 강화학습 내부에서 사용하는 인공신경망으로 이르는 과정을 선형 회귀부터 차근차근 설명· 가치 기반 강화학습: 상대적으로 이해하기 쉬운 DQN 알고리즘을 코드 중심으로 설명· 정책 기반 강화학습: REINFORCE, A2C, PPO 알고리즘에 대한 설명과 실행 안내· 튜닝 문제: 알고리즘의 파라미터 튜닝을 효율적으로 돕는 그리드 서치와 베이지안 최적화 기법
|