Séance de cours
Mediaspace scheduled maintenance: Aug 25, 2026 07:00 - 12:00 AM. During this time, videos will be temporarily unavailable. Check status updates.
Cette séance de cours présente l'apprentissage par différence temporelle (TD learning) et l'algorithme standard TD(0) pour estimer les valeurs dans l'apprentissage par renforcement. Il couvre le concept de valeurs V, les valeurs d'état et l'équation de Bellman pour la cohérence des valeurs des états voisins. La séance de cours explique également comment les méthodes TD explorent le graphique au fil du temps, comparent les valeurs aux pas de temps voisins et mettent à jour les valeurs en fonction de la «différence temporelle».
Network: Computation in Neural Systems', Journal of Computational Neuroscience', and `Science'.