Explore la convergence de la chaîne de Markov, en mettant l'accent sur la distribution invariante, la loi des grands nombres et le calcul des récompenses moyennes.
Explore la programmation dynamique pour un contrôle optimal, couvrant le remplacement de la machine, les chaînes de Markov, les politiques de contrôle et les problèmes quadratiques linéaires.
Explore la programmation dynamique pour optimiser les processus de prise de décision au fil du temps, en utilisant des exemples concrets tels que l'extraction de pétrole et la négociation d'actions.
Explore la dimension Hausdorff et son application au mouvement brownien, en soulignant l'importance de comprendre les dimensions définies dans les processus stochastiques.
Explore les sujets d'apprentissage avancés du renforcement, y compris les politiques, les fonctions de valeur, la récursion de Bellman et le contrôle de la TD sur les politiques.
Couvre les instruments fondés sur le marché pour la réduction des émissions et leur efficacité à minimiser les coûts entre les différentes sources d'émissions.