Couvre les méthodes de prédiction sans modèle dans l'apprentissage par renforcement, en se concentrant sur Monte Carlo et les différences temporelles pour estimer les fonctions de valeur sans connaissance de la dynamique de transition.
Couvre l’apprentissage par renforcement d’horizons finis, les politiques non stationnaires et la variante optimiste de l’Optimisation Proximale des Politiques (OPPO).