Couvre les techniques de simulation stochastique et de réduction de la variance, en se concentrant sur la génération de distributions variables et auxiliaires de Courra.
Couvre Mod.7 sur les chaînes Markov en continu, en mettant l'accent sur les chaînes réversibles et leurs applications dans les systèmes de communication.
Explore la convergence de la chaîne de Markov, en mettant l'accent sur la distribution invariante, la loi des grands nombres et le calcul des récompenses moyennes.
Explore les sujets d'apprentissage avancés du renforcement, y compris les politiques, les fonctions de valeur, la récursion de Bellman et le contrôle de la TD sur les politiques.
Explore la stationnarité dans les processus stochastiques, en montrant comment les caractéristiques statistiques restent constantes au fil du temps et les implications sur les variables aléatoires et les transformées de Fourier.