Explore l'équilibre entre l'exploration de nouvelles possibilités et l'exploitation d'actions gratifiantes connues dans l'apprentissage par renforcement.
Explore l'algorithme SARSA pour l'apprentissage par renforcement, en mettant l'accent sur la mise à jour des valeurs Q et l'importance de l'exploration dans l'apprentissage par récompenses.
Discute des processus décisionnels de Markov et des techniques de programmation dynamique pour résoudre des politiques optimales dans divers scénarios.
Couvre l'histoire et l'inspiration derrière les réseaux neuronaux artificiels, la structure des neurones, l'apprentissage par les connexions synaptiques et la description mathématique des neurones artificiels.
Couvre la préparation pour dériver l'algorithme Backprop dans des réseaux en couches en utilisant des perceptrons multicouches et la descente de gradient.
Explore les traces d'éligibilité dans les architectures de gradient de politique et d'acteur-critique, conduisant à une règle d'apprentissage en ligne élégante.
Couvre l'algorithme BackProp, y compris l'initialisation, la propagation du signal, le calcul des erreurs, la mise à jour du poids et la comparaison de la complexité avec la différenciation numérique.
Explore les réseaux neuronaux apprenant par récompense, les structures acteur-critique, la plasticité synaptique et le rôle de la dopamine dans les changements synaptiques.