Explore la réversibilité dans les chaînes de Markov et son impact sur la distribution stationnaire, en soulignant la complexité des chaînes non réversibles.
Explore les sujets d'apprentissage avancés du renforcement, y compris les politiques, les fonctions de valeur, la récursion de Bellman et le contrôle de la TD sur les politiques.