Apprentissage par renforcementEn intelligence artificielle, plus précisément en apprentissage automatique, l'apprentissage par renforcement consiste, pour un agent autonome ( robot, agent conversationnel, personnage dans un jeu vidéo), à apprendre les actions à prendre, à partir d'expériences, de façon à optimiser une récompense quantitative au cours du temps. L'agent est plongé au sein d'un environnement et prend ses décisions en fonction de son état courant. En retour, l'environnement procure à l'agent une récompense, qui peut être positive ou négative.
Continuous functionIn mathematics, a continuous function is a function such that a continuous variation (that is a change without jump) of the argument induces a continuous variation of the value of the function. This means that there are no abrupt changes in value, known as discontinuities. More precisely, a function is continuous if arbitrarily small changes in its value can be assured by restricting to sufficiently small changes of its argument. A discontinuous function is a function that is .
Q-learningvignette|400x400px|Dans le Q-learning, l'agent exécute une action a en fonction de l'état s et d'une fonction Q. Il perçoit alors le nouvel état s' et une récompense r de l'environnement. Il met alors à jour la fonction Q. Le nouvel état s' devient alors l'état s, et l'apprentissage continue. En intelligence artificielle, plus précisément en apprentissage automatique, le Q-learning est un algorithme d'apprentissage par renforcement. Il ne nécessite aucun modèle initial de l'environnement.
Continuous linear operatorIn functional analysis and related areas of mathematics, a continuous linear operator or continuous linear mapping is a continuous linear transformation between topological vector spaces. An operator between two normed spaces is a bounded linear operator if and only if it is a continuous linear operator. Continuous function (topology) and Discontinuous linear map Bounded operator Suppose that is a linear operator between two topological vector spaces (TVSs). The following are equivalent: is continuous.
Dual spaceIn mathematics, any vector space has a corresponding dual vector space (or just dual space for short) consisting of all linear forms on together with the vector space structure of pointwise addition and scalar multiplication by constants. The dual space as defined above is defined for all vector spaces, and to avoid ambiguity may also be called the . When defined for a topological vector space, there is a subspace of the dual space, corresponding to continuous linear functionals, called the continuous dual space.
Espace de BanachEn mathématiques, plus particulièrement en analyse fonctionnelle, on appelle espace de Banach un espace vectoriel normé sur un sous-corps K de C (en général, K = R ou C), complet pour la distance issue de sa norme. Comme la topologie induite par sa distance est compatible avec sa structure d’espace vectoriel, c’est un espace vectoriel topologique. Les espaces de Banach possèdent de nombreuses propriétés qui font d'eux un outil essentiel pour l'analyse fonctionnelle. Ils doivent leur nom au mathématicien polonais Stefan Banach.
Espace séquentielEn mathématiques, un espace séquentiel est un espace topologique dont la topologie est définie par l'ensemble de ses suites convergentes. C'est le cas en particulier pour tout espace à base dénombrable. Soit X un espace topologique. Un sous-ensemble U de X est dit « séquentiellement ouvert » si toute suite (xn) de X qui converge vers un point de U « appartient à U à partir d'un certain rang ». Un sous-ensemble F de X est dit « séquentiellement fermé » si la convergence d'une suite (xn) de F vers x implique que x appartient à F.
Espace complètement régulierEn mathématiques, un espace complètement régulier (ou de Tikhonov) est un espace topologique vérifiant une propriété de séparation plus forte que la séparation usuelle et même que la propriété d'être régulier. Un espace topologique X vérifie la propriété de séparation T si pour tout point x de X et pour tout fermé F de X ne contenant pas x, il existe une application continue de X dans le segment [0, 1] valant 0 en x et 1 sur F (on dit alors que cette application sépare le point du fermé).
Temporal difference learningLe Temporal Difference (TD) learning est une classe d'algorithmes d'apprentissage par renforcement sans modèle. Ces algorithmes échantillonnent l'environnement de manière aléatoire à la manière des méthodes de Monte Carlo. Ils mettent à jour la politique (i.e. les actions à prendre dans chaque état) en se basant sur les estimations actuelles, comme les méthodes de programmation dynamique. Les méthodes TD ont un lien avec les modèles TD dans l'apprentissage animal. vignette|151x151px|Diagramme backup.
Condition de HölderEn analyse, la continuité höldérienne ou condition de Hölder — nommée d'après le mathématicien allemand Otto Hölder — est une condition suffisante, généralisant celle de Lipschitz, pour qu’une application définie entre deux espaces métriques soit uniformément continue. La définition s’applique donc en particulier pour les fonctions d’une variable réelle. Si (X, d) et (Y, d) sont deux espaces métriques, une fonction f : X → Y est dite a-höldérienne s’il existe une constante C telle que pour tous x, y ∈ X : La continuité höldérienne d’une fonction dépend donc d’un paramètre a ∈ ]0, 1].
ZielA goal or objective is an idea of the future or desired result that a person or a group of people envision, plan and commit to achieve. People endeavour to reach goals within a finite time by setting deadlines. A goal is roughly similar to a purpose or aim, the anticipated result which guides reaction, or an end, which is an object, either a physical object or an abstract object, that has intrinsic value. Goal setting Goal-setting theory was formulated based on empirical research and has been called one of the most important theories in organizational psychology.
Vecteur vitesseLe vecteur vitesse, nommé parfois vélocité, est une notion de physique qui à la différence de la vitesse comprend un déplacement vers un point. Par exemple, une voiture a une vitesse de 60 km/h mais a une vélocité de 60 km/h vers le nord, le nord étant un point de référence ou de destination pour la voiture. Le terme vélocité est tiré des mots latins velocitas et velox signifiant respectivement rapidité, vitesse, et rapide, prompt, véloce, mots ayant eux-mêmes une origine obscure, mais supposé étant lié à la racine proto-indo-européenne wegh- signifiant "aller, bouger," et "transport dans un véhicule".
Système de récompenseLe système de récompense / renforcement aussi appelé système hédonique, est un système fonctionnel fondamental des mammifères, situé dans le cerveau, le long du faisceau médian du télencéphale. Ce système de « récompenses » est indispensable à la survie, car il fournit la motivation nécessaire à la réalisation d'actions ou de comportements adaptés, permettant de préserver l'individu et l'espèce (prise de risque nécessaire à la survie, recherche de nourriture, reproduction, évitement des dangers, etc.).
Goal settingGoal setting involves the development of an action plan designed in order to motivate and guide a person or group toward a goal. Goals are more deliberate than desires and momentary intentions. Therefore, setting goals means that a person has committed thought, emotion, and behavior towards attaining the goal. In doing so, the goal setter has established a desired future state which differs from their current state thus creating a mismatch which in turn spurs future actions.
Vecteur positionEn géométrie, le vecteur position, ou rayon vecteur, est le vecteur qui sert à indiquer la position d'un point par rapport à un repère. L'origine du vecteur se situe à l'origine fixe du repère et son autre extrémité à la position du point. Si l'on note M cette position et O l'origine, le vecteur position se note . On le note aussi ou . En physique, le vecteur déplacement d'un point matériel ou d'un objet est le vecteur reliant une ancienne position à une nouvelle, donc le vecteur position final moins le vecteur position initial.
Vitesse angulaireEn mécanique, la ou est une grandeur physique qui représente le taux de variation d'un angle par rapport au temps. C'est l'analogue de la vitesse de translation pour un mouvement de rotation. La vitesse angulaire est définie comme la dérivée par rapport au temps de la position angulaire de l'objet en rotation : Si on dérive une nouvelle fois la vitesse angulaire, on obtient l'accélération angulaire.
Brain stimulation rewardBrain stimulation reward (BSR) is a pleasurable phenomenon elicited via direct stimulation of specific brain regions, originally discovered by James Olds and Peter Milner. BSR can serve as a robust operant reinforcer. Targeted stimulation activates the reward system circuitry and establishes response habits similar to those established by natural rewards, such as food and sex. Experiments on BSR soon demonstrated that stimulation of the lateral hypothalamus, along with other regions of the brain associated with natural reward, was both rewarding as well as motivation-inducing.
Goal orientationGoal orientation, or achievement orientation, is an "individual disposition towards developing or validating one's ability in achievement settings". In general, an individual can be said to be mastery or performance oriented, based on whether one's goal is to develop one's ability or to demonstrate one's ability, respectively. A mastery orientation is also sometimes referred to as a learning orientation. Goal orientation refers to how an individual interprets and reacts to tasks, resulting in different patterns of cognition, affect and behavior.
Vitesse de libérationLa vitesse de libération, ou vitesse d'évasion ou d'échappement est, en physique, la vitesse minimale que doit atteindre un projectile pour échapper définitivement à l'attraction gravitationnelle d'un astre (planète, étoile, etc.) dépourvu d'atmosphère et s'en éloigner indéfiniment. Cette vitesse est d'autant plus importante que la masse de l'astre est importante et que l'objet est proche de son centre. Relative à l'astre, c'est une valeur scalaire (sa direction ne joue aucun rôle).
QuadrivitesseEn physique, en particulier en relativité restreinte et en relativité générale, la quadrivitesse d'un objet est un quadrivecteur généralisant le vecteur vitesse en mécanique classique. La quadrivitesse est une des notions que le mathématicien et physicien allemand Hermann Minkowski (-) a introduites dans le cadre de sa reformulation géométrique de la relativité restreinte d'Albert Einstein (-). La quadrivitesse est ainsi désignée car elle est le quadrivecteur qui généralise la notion de vitesse de la mécanique newtonienne.