Apprentissage par renforcementEn intelligence artificielle, plus précisément en apprentissage automatique, l'apprentissage par renforcement consiste, pour un agent autonome ( robot, agent conversationnel, personnage dans un jeu vidéo), à apprendre les actions à prendre, à partir d'expériences, de façon à optimiser une récompense quantitative au cours du temps. L'agent est plongé au sein d'un environnement et prend ses décisions en fonction de son état courant. En retour, l'environnement procure à l'agent une récompense, qui peut être positive ou négative.
Analyse séquentielleEn statistique, l'analyse séquentielle, ou test d'hypothèse séquentiel, est une analyse statistique où la taille de l'échantillon n'est pas fixée à l'avance. Plutôt, les données sont évaluées au fur et à mesure qu'elles sont recueillies, et l'échantillonnage est arrêté selon une règle d'arrêt prédéfinie, dès que des résultats significatifs sont observés. Une conclusion peut ainsi parfois être atteinte à un stade beaucoup plus précoce que ce qui serait possible avec des tests d'hypothèse ou des estimations plus classiques, à un coût financier ou humain par conséquent inférieur.
Q-learningvignette|400x400px|Dans le Q-learning, l'agent exécute une action a en fonction de l'état s et d'une fonction Q. Il perçoit alors le nouvel état s' et une récompense r de l'environnement. Il met alors à jour la fonction Q. Le nouvel état s' devient alors l'état s, et l'apprentissage continue. En intelligence artificielle, plus précisément en apprentissage automatique, le Q-learning est un algorithme d'apprentissage par renforcement. Il ne nécessite aucun modèle initial de l'environnement.
Temporal difference learningLe Temporal Difference (TD) learning est une classe d'algorithmes d'apprentissage par renforcement sans modèle. Ces algorithmes échantillonnent l'environnement de manière aléatoire à la manière des méthodes de Monte Carlo. Ils mettent à jour la politique (i.e. les actions à prendre dans chaque état) en se basant sur les estimations actuelles, comme les méthodes de programmation dynamique. Les méthodes TD ont un lien avec les modèles TD dans l'apprentissage animal. vignette|151x151px|Diagramme backup.
CUSUMIn statistical quality control, the CUsUM (or cumulative sum control chart) is a sequential analysis technique developed by E. S. Page of the University of Cambridge. It is typically used for monitoring change detection. CUSUM was announced in Biometrika, in 1954, a few years after the publication of Wald's sequential probability ratio test (SPRT). E. S. Page referred to a "quality number" , by which he meant a parameter of the probability distribution; for example, the mean.
Plan d'expériencesOn nomme plan d'expériences (en anglais, design of experiments ou DOE) la suite ordonnée d'essais d'une expérimentation, chacun permettant d'acquérir de nouvelles connaissances en maîtrisant un ou plusieurs paramètres d'entrée pour obtenir des résultats validant un modèle avec une bonne économie de moyens (nombre d'essais le plus faible possible, par exemple). Un exemple classique est le « plan en étoile » où en partant d'un jeu de valeurs choisi pour les paramètres d'un essai central, on complète celui-ci par des essais où chaque fois un seul des facteurs varie « toutes choses égales par ailleurs ».
Martingale (calcul stochastique)Une martingale est une séquence de variables aléatoires (autrement dit un processus stochastique), telles que l'espérance mathématique à l'instant , conditionnellement à l'information disponible à un moment préalable , notée , vaut (avec ). En particulier, dans un processus discret (t entier), . Une martingale peut modéliser les gains / pertes accumulés par un joueur au cours de répétitions indépendantes d'un jeu de hasard à espérance nulle (même si le joueur s'autorise à modifier sa mise en fonction des gains passés), d'où l'emprunt du terme martingale au monde du jeu.
Doob's martingale convergence theoremsIn mathematics specifically, in the theory of stochastic processes Doob's martingale convergence theorems are a collection of results on the limits of supermartingales, named after the American mathematician Joseph L. Doob. Informally, the martingale convergence theorem typically refers to the result that any supermartingale satisfying a certain boundedness condition must converge.
Alignement des intelligences artificiellesLalignement des intelligences artificielles (ou alignement de l'IA, ou encore problème de l'alignement) est un champ de recherche visant à concevoir des intelligences artificielles (IA) dont les résultats s'orientent vers les objectifs, éthiques ou autres, de leurs concepteurs. On dit ainsi qu'une IA est alignée avec un opérateur si elle essaie de faire ce que l'opérateur veut qu'elle fasse. Les systèmes d'IA peuvent être difficiles à aligner, et être dysfonctionnels ou dangereux si mal alignés.
Intelligence artificiellevignette|redresse=0.8|Les assistants personnels intelligents sont l'une des applications concrètes de l'intelligence artificielle dans les années 2010. L'intelligence artificielle (IA) est un ensemble de théories et de techniques visant à réaliser des machines capables de simuler l'intelligence humaine. Souvent classée dans le groupe des mathématiques et des sciences cognitives, elle fait appel à la neurobiologie computationnelle (particulièrement aux réseaux neuronaux) et à la logique mathématique (partie des mathématiques et de la philosophie).
Espace de HardyLes espaces de Hardy, dans le domaine mathématique de l'analyse fonctionnelle, sont des espaces de fonctions analytiques sur le disque unité D du plan complexe. Soit f une fonction holomorphe sur D, on sait que f admet un développement en série de Taylor en 0 sur le disque unité : On dit alors que f est dans l'espace de Hardy H(D) si la suite appartient à l. Autrement dit, on a : On définit alors la norme de f par : La fonction appartient à H(D), par convergence de la série (série de Riemann convergente).
PolicyPolicy is a deliberate system of guidelines to guide decisions and achieve rational outcomes. A policy is a statement of intent and is implemented as a procedure or protocol. Policies are generally adopted by a governance body within an organization. Policies can assist in both subjective and objective decision making. Policies used in subjective decision-making usually assist senior management with decisions that must be based on the relative merits of a number of factors, and as a result, are often hard to test objectively, e.
Évaluation des politiques publiquesL’évaluation des politiques publiques en tant que nouvel outil d’aide à la décision publique est apparue aux États-Unis dans les années 1960 avant de se développer au Royaume-Uni, dans les pays scandinaves puis dans les autres démocraties occidentales vingt ans plus tard, notamment à l’initiative de la Commission européenne, qui en a fait une exigence règlementaire systématique dans le cadre des financements alloués aux États membres à partir des années 1990.
Politique publiqueUne politique publique est une intervention de l'État ou d'une autre autorité publique (banque centrale, collectivité territoriale, ...) afin d'avoir un effet sur la société ou un territoire. Les politiques publiques sont la modalité d'action de la puissance publique. Jean-Claude Thoenig définit les politiques publiques comme les . Le terme prend un sens différent selon la discipline qui l'utilise.
Policy studiesPolicy studies is a subdiscipline of political science that includes the analysis of the process of policymaking (the policy process) and the contents of policy (policy analysis). Policy analysis includes substantive area research (such as health or education policy), program evaluation and impact studies, and policy design. It "involves systematically studying the nature, causes, and effects of alternative public policies, with particular emphasis on determining the policies that will achieve given goals.
Rat de laboratoireOn appelle « rat de laboratoire » un rat issu d’une souche ou d'une lignée sélectionnée, élevée et reproduite à la demande des établissements d'expérimentation animale, ou parfois pour les leçons d'anatomie et de dissection. Les rats étant bien plus faciles à élever que les singes (plus proches génétiquement de l'espèce humaine), ils sont devenus l'une des espèces les plus utilisées pour l'expérimentation animale.
Windows NTWindows NT (« New technology » ou « nouvelle technologie ») désigne la série de systèmes d'exploitation multitâche préemptif, multi-utilisateur, multiprocesseur, créés par Microsoft et ne reposant pas sur le système historique MS-DOS de Microsoft, contrairement à Windows 1.0, 2, 3.x, 95, 98 et Me. Il a permis à Microsoft et son partenaire Intel d'entrer sur le marché des serveurs, une nouvelle stratégie qui a contribué à la très forte hausse des sociétés de technologie de la seconde partie des années 1990.
Politique socialeLa politique sociale constitue, dans une société organisée autour du principe de solidarité, un ensemble d’actions mises en œuvre progressivement par les pouvoirs publics pour parvenir à transformer les conditions de vie des salariés et éviter les explosions sociales, la désagrégation des liens sociaux. En France, on associe l'idée de politique sociale à une politique publique liée à la protection sociale (sécurité sociale, assistance sociale). Elle fait référence au concept d'État providence.
Rattus norvegicusLe rat brun (Rattus norvegicus) est une espèce de rat. C'est un rongeur trapu de la famille des Muridae. Il a un corps long d'environ et une queue d'à peu près la même taille. Adulte, il pèse environ . Il est donc plus grand et plus lourd que son proche parent le rat noir (Rattus rattus). Il est appelé rat brun, rat d'égout, rat de Norvège ou encore rat gris pour le distinguer du rat noir. Comme tous les rats du genre Rattus, le rat brun est originaire d'Extrême-Orient, plus précisément de la Chine.
Windows NT 3.1Windows NT 3.1 is the first major release of the Windows NT operating system developed by Microsoft, released on July 27, 1993. At the time of Windows NT's release, Microsoft's Windows 3.1 desktop environment had established brand recognition and market share; but Windows 3.1 relied on the DOS operating system for essential functions, and it had a constrictive 16-bit architecture. Windows NT, however, was a complete, 32-bit operating system that retained a desktop environment familiar to Windows 3.1 users.