Apprentissage par renforcementEn intelligence artificielle, plus précisément en apprentissage automatique, l'apprentissage par renforcement consiste, pour un agent autonome ( robot, agent conversationnel, personnage dans un jeu vidéo), à apprendre les actions à prendre, à partir d'expériences, de façon à optimiser une récompense quantitative au cours du temps. L'agent est plongé au sein d'un environnement et prend ses décisions en fonction de son état courant. En retour, l'environnement procure à l'agent une récompense, qui peut être positive ou négative.
Q-learningvignette|400x400px|Dans le Q-learning, l'agent exécute une action a en fonction de l'état s et d'une fonction Q. Il perçoit alors le nouvel état s' et une récompense r de l'environnement. Il met alors à jour la fonction Q. Le nouvel état s' devient alors l'état s, et l'apprentissage continue. En intelligence artificielle, plus précisément en apprentissage automatique, le Q-learning est un algorithme d'apprentissage par renforcement. Il ne nécessite aucun modèle initial de l'environnement.
ActualisationL'actualisation est l'application de taux, dits taux d'actualisation, à des flux financiers non directement comparables et portant sur des durées différentes, afin de les comparer ou combiner de diverses façons. Elle apporte de la méthode dans le choix des investissements et peut intégrer l'évolution de la valeur de l'argent. Les méthodes d'actualisation doivent prendre en considération deux facteurs humains déterminant la valeur temps de l'argent : la préférence pour la jouissance immédiate et l'aversion au risque.
Discounted cash flowThe discounted cash flow (DCF) analysis, in finance, is a method used to value a security, project, company, or asset, that incorporates the time value of money. Discounted cash flow analysis is widely used in investment finance, real estate development, corporate financial management, and patent valuation. Used in industry as early as the 1700s or 1800s, it was widely discussed in financial economics in the 1960s, and U.S. courts began employing the concept in the 1980s and 1990s.
Temporal difference learningLe Temporal Difference (TD) learning est une classe d'algorithmes d'apprentissage par renforcement sans modèle. Ces algorithmes échantillonnent l'environnement de manière aléatoire à la manière des méthodes de Monte Carlo. Ils mettent à jour la politique (i.e. les actions à prendre dans chaque état) en se basant sur les estimations actuelles, comme les méthodes de programmation dynamique. Les méthodes TD ont un lien avec les modèles TD dans l'apprentissage animal. vignette|151x151px|Diagramme backup.
Actualisation exponentielleEn économie, lactualisation exponentielle est une forme de fonction d'actualisation utilisée dans l'analyse des choix intertemporels (avec ou sans incertitude), supposant un taux constant de dépréciation. Mathématiquement, il y a actualisation exponentielle lorsque l'utilité totale est donnée par où ct est la consommation au temps t, est le coefficient d'actualisation, et u est la fonction d'utilité instantanée.
Hyperbolic discountingIn economics, hyperbolic discounting is a time-inconsistent model of delay discounting. It is one of the cornerstones of behavioral economics and its brain-basis is actively being studied by neuroeconomics researchers. According to the discounted utility approach, intertemporal choices are no different from other choices, except that some consequences are delayed and hence must be anticipated and discounted (i.e., reweighted to take into account the delay). Given two similar rewards, humans show a preference for one that arrives sooner rather than later.
Valuation using discounted cash flowsValuation using discounted cash flows (DCF valuation) is a method of estimating the current value of a company based on projected future cash flows adjusted for the time value of money. The cash flows are made up of those within the “explicit” forecast period, together with a continuing or terminal value that represents the cash flow stream after the forecast period. In several contexts, DCF valuation is referred to as the "income approach".
Time preferenceIn economics, time preference (or time discounting, delay discounting, temporal discounting, long-term orientation) is the current relative valuation placed on receiving a good or some cash at an earlier date compared with receiving it at a later date. Time preferences are captured mathematically in the discount function. The higher the time preference, the higher the discount placed on returns receivable or costs payable in the future. One of the factors that may determine an individual's time preference is how long that individual has lived.