Nettoyage de donnéesLe nettoyage de données est l'opération de détection et de correction (ou suppression) d'erreurs présentes sur des données stockées dans des bases de données ou dans des fichiers. Le nettoyage de données est un des problèmes majeurs des entrepôts de données. Les données présentes dans les bases de données peuvent avoir plusieurs types d'erreurs comme des erreurs de frappe, des informations manquantes, des imprécisions etc. La partie impropre de la donnée traitée peut être remplacée, modifiée ou supprimée.
Management de la qualitévignette|La roue de Deming illustre le processus d'amélioration continue, l'un des principes fondamentaux du management de la qualité. Le management de la qualité, ou gestion de la qualité, est une discipline du management regroupant l'ensemble des concepts et méthodes visant à satisfaire les clients d'un organisme (en général les entreprises, associations, organismes publics) et à fournir des produits et services correspondant à leurs attentes.
Rule-based machine learningRule-based machine learning (RBML) is a term in computer science intended to encompass any machine learning method that identifies, learns, or evolves 'rules' to store, manipulate or apply. The defining characteristic of a rule-based machine learner is the identification and utilization of a set of relational rules that collectively represent the knowledge captured by the system. This is in contrast to other machine learners that commonly identify a singular model that can be universally applied to any instance in order to make a prediction.
Langue contrôléeEn linguistique, une langue contrôlée (LC) est généralement définie comme sous-ensemble d'une langue naturelle, dont la grammaire et le vocabulaire ont été restreints afin de réduire l'ambigüité et la complexité des textes. On distingue traditionnellement deux groupes de langues contrôlées : les LC pour les humains, qui visent à améliorer la lisibilité des documents et à en faciliter la compréhension. les LC pour les machines, qui visent à faciliter le traitement automatique de textes.
Validation croiséeLa validation croisée () est, en apprentissage automatique, une méthode d’estimation de fiabilité d’un modèle fondée sur une technique d’échantillonnage. Supposons posséder un modèle statistique avec un ou plusieurs paramètres inconnus, et un ensemble de données d'apprentissage sur lequel on peut apprendre (ou « entraîner ») le modèle. Le processus d'apprentissage optimise les paramètres du modèle afin que celui-ci corresponde le mieux possible aux données d'apprentissage.
Jeux d'entrainement, de validation et de testEn apprentissage automatique, une tâche courante est l'étude et la construction d'algorithmes qui peuvent apprendre et faire des prédictions sur les données. De tels algorithmes fonctionnent en faisant des prédictions ou des décisions basées sur les données, en construisant un modèle mathématique à partir des données d'entrée. Ces données d'entrée utilisées pour construire le modèle sont généralement divisées en plusieurs jeux de données .
Règle de d'Alembertvignette|Jean Le Rond d'Alembert, mathématicien français. La règle de d'Alembert (ou critère de d'Alembert), doit son nom au mathématicien français Jean le Rond d'Alembert. C'est un test de convergence pour une série à termes positifs. Dans certains cas, elle permet d'établir la convergence absolue d'une série à termes complexes ou vectoriels, ou au contraire sa divergence. Soit (u) une suite de réels strictement positifs. On note et les limites inférieure et supérieure des quotients successifs : Si , alors la série de terme général u converge.
Sélection naturellevignette|Selon les principes de la sélection naturelle de Darwin, les pinsons des Galápagos sont issus d'une espèce souche venue du continent. La sélection s'est traduite par une spécialisation de la taille de leur bec en liaison avec leur régime alimentaire (seconde édition de son la publiée en 1845). En biologie, la est l'un des mécanismes moteurs de l'évolution des espèces qui explique le succès reproductif différentiel entre des individus d'une même espèce et le succès différentiel des gènes présents dans une population.
Directional selectionIn population genetics, directional selection, is a mode of negative natural selection in which an extreme phenotype is favored over other phenotypes, causing the allele frequency to shift over time in the direction of that phenotype. Under directional selection, the advantageous allele increases as a consequence of differences in survival and reproduction among different phenotypes. The increases are independent of the dominance of the allele, and even if the allele is recessive, it will eventually become fixed.
Sélection stabilisatriceEn génétique des populations, la sélection stabilisatrice ou stabilisante (à ne pas confondre avec la sélection négative ou purificatrice) est un mode de sélection naturelle dans laquelle la moyenne de la population se stabilise sur une valeur de trait non extrême particulière. On pense que c'est le mécanisme d'action le plus courant pour la sélection naturelle car la plupart des traits ne semblent pas changer radicalement au cours du temps.
Sélection négative (sélection naturelle)Dans la sélection naturelle, la sélection négative ou la sélection purifiante est l'élimination sélective des allèles délétères. Cela peut stabiliser la sélection par la purge des polymorphismes génétiques délétères qui résultent de mutations aléatoires. La purge des allèles délétères peut être réalisée au niveau de la génétique des populations, ne nécessitant pas plus d'une seule mutation ponctuelle comme l'unité de sélection.
Statistical model validationIn statistics, model validation is the task of evaluating whether a chosen statistical model is appropriate or not. Oftentimes in statistical inference, inferences from models that appear to fit their data may be flukes, resulting in a misunderstanding by researchers of the actual relevance of their model. To combat this, model validation is used to test whether a statistical model can hold up to permutations in the data.