Explore les sujets d'apprentissage avancés du renforcement, y compris les politiques, les fonctions de valeur, la récursion de Bellman et le contrôle de la TD sur les politiques.
Couvre les méthodes de gradient de politique dans l'apprentissage du renforcement, en se concentrant sur les techniques d'optimisation et les applications pratiques comme le problème du poteau.
Explore la sélection, l'évaluation et la généralisation des modèles dans l'apprentissage automatique, en mettant l'accent sur l'estimation impartiale des performances et les risques de surapprentissage.