이 상품은 구매 후 지원 기기에서 예스24 eBook앱 설치 후 바로 이용 가능한 상품입니다.
|
1부. 강화학습 개요1장. 강화학습 개요 1.1 강화학습이란?1.2 강화학습의 응용1.3 강화학습의 도전 과제2장. 강화학습 알고리즘 2.1 강화학습의 정의2.2 강화학습 알고리즘의 종류2.3 강화학습의 학습 단계 2.4 알고리즘 선택 기준2부. 강화학습 프레임워크 소개3장. 강화학습 프레임워크 3.1 강화학습 논리 구성3.2 강화학습 프레임워크 클래스 구성 3.2.1 공통 클래스와 커스터마이징 클래스4장. 강화학습 프레임워크 개발 환경 4.1 개발 환경 구성 4.2 OpenGym 소개4.3 강화학습 프레임워크의 실행 3부. 강화학습 맛보기 정책 기반 방법5장. 러너 5.1 러너의 구성5.2 러너의 작동 방식5.3 Runner 클래스 정의 5.4 Runner 클래스 구현코드 6장. 환경 루프 6.1 환경 루프의 구성6.2 환경 루프의 작동 방식6.3 EnvironmentLoop 클래스 정의 6.4 EnvironmentLoop 클래스 구현 코드7장. 폴리시 그레이디언트 7.1 정책 기반 방법의 유도 7.2 분산 최소화 방안8장. REINFORCE 알고리즘 구현 8.1 REINFORCE 알고리즘 구성 8.2 REINFORCE 클래스8.3 REINFORCENetwork 클래스8.4 REINFORCELearner 클래스 8.5 몬테카를로 리턴8.6 CartPole-v1 환경 8.7 LunarLanderContinuous-v2 학습 4부. 강화학습 발담그기 정책 기반 방법 성능 개선9장. 에이전트9.1 에이전트 구성 9.2 에이전트 9.3 액터 9.4 학습자9.5 네트워크 10장. 정책 10.1 정책의 종류10.2 정책의 구성 10.3 Policy 클래스 10.4 StochasticPolicy 클래스 10.5 CategoricalPolicy 클래스 10.6 GaussianPolicy 클래스10.7 MLP 클래스 10.8 CategoricalPolicyMLP 클래스 10.9 GaussianPolicyMLP 클래스11장. REINFORCE 베이스라인 적용 11.1 새로운 알고리즘 추가11.2 REINFORCE 베이스라인 버전 구성11.3 REINFORCEB 클래스 11.4 REINFORCEBNetwork 클래스 11.5 REINFORCEBLearner 클래스 11.6 CartPole-v1 학습 11.7 LunarLanderContinuous-v2 학습 11.8 새로운 환경 학습5부. 강화학습 즐기기 액터-크리틱 방법12장. 액터-크리틱 방법 12.1 가치 함수 12.2 액터-크리틱 방법 12.3 A2C 13장. A2C 알고리즘 구현 13.1 A2C 알고리즘 구성13.2 A2C 클래스 13.3 A2CNetwork 클래스 13.4 A2CLearner 클래스 13.5 n-스텝 리턴 13.6 GAE 13.7 CartPole-v1 학습 13.8 LunarLanderContinuous-v2 학습 14장. 가치 함수 14.1 가치 함수 14.2 가치 함수의 구성 14.3 ValueFunction 클래스 14.4 StateValueFunction 클래스14.5 ActionValueFunction 클래스 14.6 ValueFunctionMLP 클래스14.7 QFunctionMLP 클래스14.8 QFunctionMLPDQN 클래스15장. 데이터셋 15.1 데이터셋 구성 방식 15.2 데이터셋의 구성15.3 버퍼와 버퍼 스키마15.4 롤아웃 버퍼 15.5 리플레이 버퍼 16장. 환경 16.1 환경의 작동 방식16.2 환경 구성 16.3 Environment 클래스 16.4 EnvironmentSpec 클래스 16.5 OpenGym 클래스 6부. 강화학습 완성하기 가치 기반 방법17장. 가치 기반 방법 17.1 가치 기반 방법 17.2 DQN 17.3 더블 DQN(Double DQN) 18장. 가치 기반 방법 18.1 DQN 알고리즘 구성 18.2 DQN 클래스 18.3 DQNNetwork 클래스 18.4 유틸리티 함수 18.5 DQNLearner 클래스 18.6 CartPole-v1 학습 19장. 더블 DQN 알고리즘 구현 19.1 더블 DQN 알고리즘 구성 19.2 DDQN 클래스 19.3 DDQNNetwork 클래스19.4 DDQNLearner 클래스 19.5 CartPole-v1 학습 7부. 강화학습 성능 개선 분산 강화학습20장. PPO 알고리즘 20.1 PPO 알고리즘 21장. PPO 알고리즘 구현 21.1 PPO 알고리즘 구성 21.2 PPO 클래스 21.3 PPONetwork 클래스21.4 PPOLearner 클래스 21.5 CartPole-v1 학습 21.6 LunarLanderContinuous-v2 학습 21.7 AntBulletEnv-v0 학습 22장. 다중 환경 러너 22.1 A2C와 A3C22.2 다중 환경 러너의 구성 22.3 MultiEnvRunner 클래스 22.4 MultiEnvAsyncRunner 클래스 22.5 다중 환경 성능 확인22.6 Ray 소개
|
윤성진의 다른 상품
|
◈ 이 책에서 다루는 내용 ◈◆ 단계적이고 체계적으로 다루는 강화학습의 기초부터 고급 주제까지◆ 정책 기반(REINFORCE, PPO), 액터-크리틱(A2C, A3C), 가치 기반(DQN, DDQN) 알고리즘의 이론과 실습을 균형 있게 제공 ◆ 개념을 시각화하고 수식을 단계별로 풀어 설명하며 배경 지식을 이해하도록 팁을 제공 ◆ 알고리즘의 핵심 코드를 직접 구현해 보고 정답을 즉시 확인해 보는 방식의 실습 구성 ◆ 강화학습 프레임워크를 설계하고 이를 기반으로 강화학습 알고리즘을 구현 ◆ 강화학습의 주요 구성 요소와 전체 프로세스를 체계적으로 이해할 수 있으며 독자가 알고리즘을 스스로 개선하고 확장할 수 있도록 지원 ◆ 분산 학습과 같은 최신 기법을 포함해 실무 환경에 바로 적용할 수 있는 실전 지식 제공 ◈ 이 책의 대상 독자 ◈◆ 심층 강화학습을 이론부터 실습까지 체계적으로 학습하고자 하는 독자◆ 강화학습 프레임워크의 구조를 이해하고 직접 구현해 보려는 독자◆ 여러 알고리즘을 구현해 성능을 비교·분석해 보고 싶은 독자◆ 강화학습을 실제 업무에 적용하고자 하는 개발자 및 연구자 ◆ 이공계 학부·대학원생, AI 분야 취업 준비생, 머신러닝 개발자, AI R&D 연구원 등 ◈ 지은이의 말 ◈거대 언어 모델의 눈부신 성공은 AGI(Artificial General Intelligence)를 향한 인공지능 기술의 도약을 알리고 있다. 머지않아 우리는 지능형 에이전트와 함께 일상을 공유하게 될 것이다. 이 에이전트들은 우리가 번거롭게 느끼는 일상 업무를 대신 처리하고, 우리의 감정 상태에 맞춰 반응하며, 복잡한 상황 속에서 합리적인 판단을 도울 조언을 제공하고, 때로는 새로운 기회를 제안하기도 할 것이다. 지능형 에이전트에게 중요한 능력 중 하나는 장기적이고 인과 관계가 복잡한 의사결정 문제를 푸는 능력이다. 강화학습은 의사결정 과정에서 현재의 행동이 미래에 어떠한 영향을 미칠지를 고려하며 자율 학습을 통해 지능화를 가속한다. 로봇 팔은 수차례의 시행착오를 거쳐 물체를 잡고 조작하는 법을 터득하고, 알파제로(AlphaZero)는 인간의 기보 없이도 자기 대국(self-play)을 반복하며 바둑 실력을 획득한다. 최선의 행동을 반복하는 ‘활용’과, 새로운 행동을 시도해 더 나은 전략을 발견하는 ‘탐험’을 스스로 조절하며, 게임에서 승리하거나 로봇이 임무를 완수해야 하는 것과 같은 장기적인 목표를 달성하기 위해 계획을 세우고 수정하기도 한다. 이런 강화학습의 인과성을 고려한 자율 학습 능력은 지능형 에이전트가 가져야 할 주요 역량이다. 가끔 “강화학습 공부는 어떻게 시작하면 좋을까요?”라는 질문을 받곤 하는데, 그때마다 적절한 학습 자료를 추천하기가 쉽지 않았다. 지나치게 이론을 중심으로 써진 고전 서적은 입문자가 중도에 포기하기 쉽고, 실무 적용을 위해 꼭 필요한 심층 강화학습 내용은 깊이 다루지 않고 있다. 반면에 국내 입문서는 드물고 설명이 간소하다. 언젠가 강화학습 책을 쓰게 된다면 심층 강화학습을 중심으로 이론은 명쾌하게, 실습은 이론을 검증하는 방식으로 구성하면 좋겠다고 생각했다. 그렇게 몇 년의 시간이 흐른 뒤에야 이 책을 쓸 수 있게 됐다. 이 책은 강화학습의 이론과 실습을 균형 있게 엮은 ‘이론서’이자 ‘실습서’이다. 단순히 알고리즘을 나열하지 않고 각 기법이 발전하고 확장된 과정을 따라 차례대로 구성했다. 또한, 사전에 설계된 프레임워크를 기반으로 강화학습 알고리즘을 구현하는 방식을 취하고 있어서 이론적 개념을 명확히 이해하면서도 즉시 실무에 적용해 볼 수 있도록 설계했다. 본서를 통해 강화학습의 원리와 실제를 폭넓게 익혀 지능형 에이전트 시대에 한 발 더 앞서 나가길 바란다.
|