|
(글쓴이는 본서의 편집자입니다.) 강화학습(reinforcement learning)은 인공지능의 한 갈래로, 《PyTorch를 활용한 강화학습/심층강화학습 실전 입문》의 표현을 빌리면 “자전거 타는 방법을 배울 때처럼 대상의 거동을 결정하는 물리법칙을 모르는 상태에서 시행착오를 반복하며 바람직한 제어 방법을 익히는 학습기법”이다. 《강화학습/심층강화학습 특강》처럼 인공지능 입문자에게 바로 강화학습을 가르치는 경우도 있지만 이는 예외적이고, 보통은 지도학습 → 비지도학습 → 강화학습의 순서로 배우게 되며, 강화학습을 아예 다루지 않는 책도 많다. 강화학습도 세부적으로 들어가면 여러 가지가 있다.
《수학으로 풀어보는 강화학습 원리와 알고리즘》 개정판에서는 강화학습을 크게 세 가지로 분류한다. 1. DQN과 같은 가치 기반 학습 방법 2. 액터-크리틱(actor-critic) 구조를 사용해 직접 정책을 유도하는 정책 그래디언트(policy gradient) 방법 3. 환경 모델을 추정해 사용하는 모델 기반 강화학습
이 책에서 다루는 방법은 정책 그래디언트(3~8장)와 모델 기반 강화학습(9~10장)이다. REINFORCE(3장), A2C(4장), A3C(5장), PPO(6장), DDPG(7장), SAC(8장)은 정책 그래디언트에 해당한다.
개정판과 초판의 가장 큰 차이는, 초판에서 텐서플로 1.X로 구현했던 코드가 개정판에서 2.X로 바뀌었고, SAC를 다루는 8장이 추가됐다는 점이다.
뒤표지의 책 소개에 “수학의 선수 지식으로 대학 2학년 때 배우는 공업수학을 이수한 정도면 충분하고, 딥러닝의 선수 지식으로는 텐서플로 또는 파이토치를 사용하여 MNIST와 같은 간단한 딥러닝 예제를 따라해 본 정도면 충분하다.”고 되어 있는데, 책을 읽고 최대한의 소득을 얻으려면 그 정도의 지식이 필요하겠지만, 수학에 자신이 없더라도 한번쯤 읽어보면 시야를 넓히는 데 도움이 되지 않을까 한다. 수학을 공부한 지 오래되어 잊어버렸다면 1장에서 복습할 기회가 있다.
|