Foundations
The Bitter Lesson
Dynamic Programming
Markov Decision Process (MDP) Tutorial
Reinforcement Learning: An Introduction
Intro to Reinforcement Learning — Monte Carlo to Policy Gradient
Exhaustive Tabular Methods
Principles of Autonomy and Decision Making: MDPs and Value Iteration
Principles of Autonomy and Decision Making: Policy Iteration
Monte Carlo and Temporal Difference Methods
Monte Carlo Learning
4.6 BlackJack with First visit MC.ipynb
Function Approximation
RL Course by David Silver - Lecture 6: Value Function Approximation
Reinforcement Learning Part 7: Value Function Approximation
Deep RL
Temporal Difference Learning and TD-Gammon
TD-Gammon: Reinforcement Learning Algorithm for Backgammon
Playing Atari with Deep Reinforcement Learning
Policy Gradient
RL Course by David Silver - Lecture 7: Policy Gradient Methods
Policy Gradient Methods for Reinforcement Learning with Function Approximation
REINFORCE Algorithm: Reinforcement Learning from Scratch in PyTorch
CartPole Balance with REINFORCE Policy Gradient
Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning
Trust Region Policy Optimization
Proximal Policy Optimization Algorithms