Q-learningvignette|400x400px|Dans le Q-learning, l'agent exécute une action a en fonction de l'état s et d'une fonction Q. Il perçoit alors le nouvel état s' et une récompense r de l'environnement. Il met alors à jour la fonction Q. Le nouvel état s' devient alors l'état s, et l'apprentissage continue. En intelligence artificielle, plus précisément en apprentissage automatique, le Q-learning est un algorithme d'apprentissage par renforcement. Il ne nécessite aucun modèle initial de l'environnement.
Apprentissage par renforcementEn intelligence artificielle, plus précisément en apprentissage automatique, l'apprentissage par renforcement consiste, pour un agent autonome ( robot, agent conversationnel, personnage dans un jeu vidéo), à apprendre les actions à prendre, à partir d'expériences, de façon à optimiser une récompense quantitative au cours du temps. L'agent est plongé au sein d'un environnement et prend ses décisions en fonction de son état courant. En retour, l'environnement procure à l'agent une récompense, qui peut être positive ou négative.
Apprentissage par renforcement profondL'apprentissage par renforcement profond (en anglais : deep reinforcement learning ou deep RL) est un sous-domaine de l'apprentissage automatique (en anglais : machine learning) qui combine l'apprentissage par renforcement et l'apprentissage profond (en anglais : deep learning). L'apprentissage par renforcement considère le problème d'un agent informatique (par exemple, un robot, un agent conversationnel, un personnage dans un jeu vidéo, etc.) qui apprend à prendre des décisions par essais et erreurs.
Learning rateIn machine learning and statistics, the learning rate is a tuning parameter in an optimization algorithm that determines the step size at each iteration while moving toward a minimum of a loss function. Since it influences to what extent newly acquired information overrides old information, it metaphorically represents the speed at which a machine learning model "learns". In the adaptive control literature, the learning rate is commonly referred to as gain. In setting a learning rate, there is a trade-off between the rate of convergence and overshooting.
Apprentissage automatiqueL'apprentissage automatique (en anglais : machine learning, « apprentissage machine »), apprentissage artificiel ou apprentissage statistique est un champ d'étude de l'intelligence artificielle qui se fonde sur des approches mathématiques et statistiques pour donner aux ordinateurs la capacité d'« apprendre » à partir de données, c'est-à-dire d'améliorer leurs performances à résoudre des tâches sans être explicitement programmés pour chacune. Plus largement, il concerne la conception, l'analyse, l'optimisation, le développement et l'implémentation de telles méthodes.
Apprentissage profondL'apprentissage profond ou apprentissage en profondeur (en anglais : deep learning, deep structured learning, hierarchical learning) est un sous-domaine de l’intelligence artificielle qui utilise des réseaux neuronaux pour résoudre des tâches complexes grâce à des architectures articulées de différentes transformations non linéaires. Ces techniques ont permis des progrès importants et rapides dans les domaines de l'analyse du signal sonore ou visuel et notamment de la reconnaissance faciale, de la reconnaissance vocale, de la vision par ordinateur, du traitement automatisé du langage.
Temporal difference learningLe Temporal Difference (TD) learning est une classe d'algorithmes d'apprentissage par renforcement sans modèle. Ces algorithmes échantillonnent l'environnement de manière aléatoire à la manière des méthodes de Monte Carlo. Ils mettent à jour la politique (i.e. les actions à prendre dans chaque état) en se basant sur les estimations actuelles, comme les méthodes de programmation dynamique. Les méthodes TD ont un lien avec les modèles TD dans l'apprentissage animal. vignette|151x151px|Diagramme backup.
Bandit manchot (mathématiques)vignette|Une rangée de machines à sous à Las Vegas. En mathématiques, plus précisément en théorie des probabilités, le problème du bandit manchot (généralisable en problème du bandit à K bras ou problème du bandit à N bras) se formule de manière imagée de la façon suivante : un utilisateur (un agent), face à des machines à sous, doit décider quelles machines jouer. Chaque machine donne une récompense moyenne que l'utilisateur ne connait pas a priori. L'objectif est de maximiser le gain cumulé de l'utilisateur.
Robotvignette|Atlas (2013), robot androïde de Boston Dynamics vignette|Bras manipulateurs dans un laboratoire (2009) vignette|NAO (2006), robot humanoïde éducatif d'Aldebaran Robotics vignette|DER1 (2005), un actroïde d'accueil vignette|Roomba (2002), un robot ménager Un robot est un dispositif mécatronique (alliant mécanique, électronique et informatique) conçu pour accomplir automatiquement des tâches imitant ou reproduisant, dans un domaine précis, des actions humaines.
Procès en droit françaisEn droit français, un procès est un litige soumis à une juridiction, laquelle peut être par exemple une cour ou un tribunal. À l'issue du procès, une décision est rendue. En France, la décision est généralement appelée jugement, lorsque la juridiction qui l'a rendue est appelée tribunal, ou arrêt, lorsque cette juridiction est appelée « cour ». Avant toute action, la compétence juridique doit être définie de manière à savoir auprès de quel type de tribunal l'action en justice doit être portée et à quel endroit elle le sera.
Tribu (mathématiques)En mathématiques, une tribu ou σ-algèbre (lire sigma-algèbre) ou plus rarement corps de Borel sur un ensemble X est un ensemble non vide de parties de X, stable par passage au complémentaire et par union dénombrable (donc aussi par intersection dénombrable). Les tribus permettent de définir rigoureusement la notion d'ensemble mesurable. Progressivement formalisées pendant le premier tiers du , les tribus constituent le cadre dans lequel s'est développée la théorie de la mesure.
Cognitive roboticsCognitive Robotics or Cognitive Technology is a subfield of robotics concerned with endowing a robot with intelligent behavior by providing it with a processing architecture that will allow it to learn and reason about how to behave in response to complex goals in a complex world. Cognitive robotics may be considered the engineering branch of embodied cognitive science and embodied embedded cognition, consisting of Robotic Process Automation, Artificial Intelligence, Machine Learning, Deep Learning, Optical Character Recognition, , Process Mining, Analytics, Software Development and System Integration.
Mesure sigma-finieSoit (X, Σ, μ) un espace mesuré. On dit que la mesure μ est σ-finie lorsqu'il existe un recouvrement dénombrable de X par des sous-ensembles de mesure finie, c'est-à-dire lorsqu'il existe une suite (E) d'éléments de la tribu Σ, tous de mesure finie, avec Mesure finie Mesure de comptage sur un ensemble dénombrable Mesure de Lebesgue. En effet, l'ensemble des intervalles pour tous les nombres entiers est un recouvrement dénombrable de , et chacun des intervalles est de mesure 1.
Androïdevignette|Becoming Human sculpture androïde de Christian Ristow. L'adjectif androïde, du grec ancien (« d’homme ») et (« aspect extérieur »), désigne ce qui est de forme humaine. Un androïde est un robot construit à l'image d'un homme et par extension sémantique d'un être humain. Stricto sensu, andr désigne l'homme au sens masculin, le terme gynoïde est utilisé pour un robot à l'image d'une femme ; les termes neutres humanoïde et anthropoïde sont synonymes.
Bench trialA bench trial is a trial by judge, as opposed to a trial by jury. The term applies most appropriately to any administrative hearing in relation to a summary offense to distinguish the type of trial. Many legal systems (Roman, Islamic) use bench trials for most or all cases or for certain types of cases. While a jury renders a verdict, a judge in a bench trial does the same by making a finding. The majority of civil trials proceed without a jury and are heard by a judge sitting alone.
Robot d'aide à la personneUn robot d'aide à la personne est un robot spécifique qui se distingue notamment des robots industriels. Ces derniers sont utilisés en entreprise alors que les robots d'aide à la personne sont utilisés par des particuliers. Robot aspirateur Les robots aspirateurs sont principalement efficaces sur les moquettes. Les robots lave sol sont plus dédiés aux parquets et carrelages. Le scooba en est un exemple en anglais ::en:Floor scrubber en français :Robot laveur Ce sont des robots à chenilles qui adhèrent à la vitre .
Jury trialA jury trial, or trial by jury, is a legal proceeding in which a jury makes a decision or findings of fact. It is distinguished from a bench trial in which a judge or panel of judges makes all decisions. Jury trials are used in a significant share of serious criminal cases in many but not all common law judicial systems. The majority of common law jurisdictions in Asia (such as Singapore, India, Pakistan and Malaysia) have abolished jury trials on the grounds that juries are susceptible to bias.
Sigma additivitévignette|Illustration de la sigma additivité La sigma additivité, appelé aussi additivité dénombrable, est un concept en théorie de la mesure. Soit un ensemble et un ensemble de parties de . On dit que l'application μ est σ-additive sur lorsqu'elle vérifie la propriété suivante : si E1, E2, ... est une suite d'éléments de , si ces parties de sont deux à deux disjointes et si leur réunion E est aussi un élément de , alors la valeur μ(E) de μ sur cette réunion E est égale à la somme des valeurs de μ sur les parties Ek : Il s'agit d'une version plus forte de l'additivité simple.