Couvre l’apprentissage par renforcement d’horizons finis, les politiques non stationnaires et la variante optimiste de l’Optimisation Proximale des Politiques (OPPO).
Couvre les bases de l'optimisation convexe, y compris les problèmes mathématiques, les minimiseurs et les concepts de solution, en mettant l'accent sur des méthodes efficaces et des applications pratiques.