Mediaspace scheduled maintenance: Aug 25, 2026 07:00 - 12:00 AM. During this time, videos will be temporarily unavailable. Check status updates.
Cette séance de cours présente les méthodes de Monte-Carlo pour l'apprentissage par renforcement, qui évaluent directement les valeurs en faisant la moyenne des rendements mesurés empiriquement, en les comparant aux méthodes TD qui exploitent l'équation de Bellman. La séance de cours couvre l'estimation de Monte-Carlo, la prédiction MC de première visite, l'estimation de Monte-Carlo des valeurs Q et le SARSA attendu par lots. Il examine également la comparaison entre SARSA, Monte-Carlo et l'apprentissage de Batch-attendu-SARSA, en soulignant l'importance de l'équation empirique de Bellman. La séance de cours se termine par une comparaison des méthodes Monte-Carlo par rapport aux méthodes batch-TD, soulignant l'efficacité des méthodes TD dans la propagation de l'information dans le graphique à travers l'étape 'bootstrap'.
Network: Computation in Neural Systems', Journal of Computational Neuroscience', and `Science'.