Couvre les méthodes de prédiction sans modèle dans l'apprentissage par renforcement, en se concentrant sur Monte Carlo et les différences temporelles pour estimer les fonctions de valeur sans connaissance de la dynamique de transition.
Introduit l'apprentissage par renforcement, couvrant ses définitions, ses applications et ses fondements théoriques, tout en décrivant la structure et les objectifs du cours.
Couvre les principes fondamentaux de la théorie du contrôle optimal, en se concentrant sur la définition des OCP, l'existence de solutions, les critères de performance, les contraintes physiques et le principe d'optimalité.
Explore la stabilité des équations différentielles ordinaires, en se concentrant sur la dépendance des solutions, les données critiques, la linéarisation et le contrôle des systèmes non linéaires.
Couvre les problèmes d'arrêt optimaux dans les probabilités appliquées et les processus stochastiques, en se concentrant sur la théorie et les applications pratiques.
Couvre les problèmes de contrôle optimal en se concentrant sur les conditions nécessaires, l'existence de contrôles optimaux et les solutions numériques.
Explore l'apprentissage et le contrôle des systèmes complexes, en abordant les défis et les possibilités en matière de technologie et de recherche interdisciplinaire.
Explore les représentations factorisées pour la planification, en se concentrant sur la réduction de la complexité et l'amélioration de l'efficacité grâce à une modélisation distincte des fonctionnalités.