Nettoyage de donnéesLe nettoyage de données est l'opération de détection et de correction (ou suppression) d'erreurs présentes sur des données stockées dans des bases de données ou dans des fichiers. Le nettoyage de données est un des problèmes majeurs des entrepôts de données. Les données présentes dans les bases de données peuvent avoir plusieurs types d'erreurs comme des erreurs de frappe, des informations manquantes, des imprécisions etc. La partie impropre de la donnée traitée peut être remplacée, modifiée ou supprimée.
Qualité des donnéesLa qualité des données, en informatique se réfère à la conformité des données aux usages prévus, dans les modes opératoires, les processus, les prises de décision, et la planification (J.M. Juran). De même, les données sont jugées de grande qualité si elles représentent correctement la réalité à laquelle elles se réfèrent. Ces deux points de vue peuvent souvent entrer en contradiction, y compris lorsqu'un même ensemble de données est utilisé avec un objectif commun.
Data wranglingData wrangling, sometimes referred to as data munging, is the process of transforming and mapping data from one "raw" data form into another format with the intent of making it more appropriate and valuable for a variety of downstream purposes such as analytics. The goal of data wrangling is to assure quality and useful data. Data analysts typically spend the majority of their time in the process of data wrangling compared to the actual analysis of the data.
Data transformation (computing)In computing, data transformation is the process of converting data from one format or structure into another format or structure. It is a fundamental aspect of most data integration and data management tasks such as data wrangling, data warehousing, data integration and application integration. Data transformation can be simple or complex based on the required changes to the data between the source (initial) data and the target (final) data. Data transformation is typically performed via a mixture of manual and automated steps.
Data mappingLe data mapping est un procédé permettant de définir au niveau d'un langage de programmation la correspondance entre deux modèles de données. L'Office québécois de la langue française propose comme équivalent en français mise en correspondance de données. L'accès aux données se fait habituellement à travers des requêtes SQL fortement typées selon la structure des données. Le mapping permet aux utilisateurs d'accéder aux données à travers un ensemble de fonctions sans se soucier de la structure des bases de données.
Consolidation informatiqueLa consolidation est en informatique le regroupement cohérent de données. Elle concerne généralement des données organisées logiquement ou liées entre elles. Plus spécifiquement pour les tableurs, il s’agit du regroupement de plusieurs tableaux issus de feuilles différentes (les feuilles sont des composantes des tableurs) voire de classeurs différents. La consolidation de données consiste à rassembler plusieurs données semblables afin d’obtenir un rapport plus facile à consulter que l’information brute présente sur le serveur, avec le moins de perte d’information possible.
Gestion des données de référenceLa gestion des données de référence ou gestion des données maîtres (GDR, plus connue sous le vocable anglais de master data management ou MDM) est une branche des technologies de l'information qui définit un ensemble de concepts et de processus visant à définir, stocker, maintenir, distribuer et imposer une vue complète, fiable et à jour des données référentielles au sein d’un système d’information, indépendamment des canaux de communications, du secteur d'activité ou des subdivisions métiers ou géographiqu
Corrélation (statistiques)En probabilités et en statistique, la corrélation entre plusieurs variables aléatoires ou statistiques est une notion de liaison qui contredit leur indépendance. Cette corrélation est très souvent réduite à la corrélation linéaire entre variables quantitatives, c’est-à-dire l’ajustement d’une variable par rapport à l’autre par une relation affine obtenue par régression linéaire. Pour cela, on calcule un coefficient de corrélation linéaire, quotient de leur covariance par le produit de leurs écarts types.
Pearson correlation coefficientIn statistics, the Pearson correlation coefficient (PCC) is a correlation coefficient that measures linear correlation between two sets of data. It is the ratio between the covariance of two variables and the product of their standard deviations; thus, it is essentially a normalized measurement of the covariance, such that the result always has a value between −1 and 1. As with covariance itself, the measure can only reflect a linear correlation of variables, and ignores many other types of relationships or correlations.
QuadrilatèreEn géométrie plane, un quadrilatère est un polygone à quatre côtés. Les trapèzes, parallélogrammes, losanges, rectangles, carrés et cerfs-volants sont des quadrilatères particuliers. Le mot « quadrilatère » provient du latin : quatuor, quatre, et latus, lateris, côté. Le mot équivalent d'origine grecque est tétrapleure (de τεσσερα / tèssera, quatre, et πλευρά / pleura, côté) ou tétragone (de γωνία / gônia, angle). Le mot tétragone était employé par Gerbert d'Aurillac au et par Oresme au .
Quadrilatère bicentriquevignette|Porisme de Poncelet pour les quadrilatères bicentriques ABCD et EFGH. En géométrie euclidienne, un quadrilatère bicentrique est un quadrilatère convexe possédant à la fois un cercle inscrit (tangent à ses quatre côtés) et un cercle circonscrit (passant par ses quatre sommets). Il découle de cette définition que les quadrilatères bicentriques ont les propriétés des quadrilatères circonscriptibles et celles des quadrilatères inscriptibles.
ImpôtL'impôt constitue un des prélèvements obligatoires effectué par voie d’autorité par la puissance publique (l'État et les collectivités territoriales) sur les ressources des personnes vivant sur son territoire ou y possédant des intérêts. Ce prélèvement est destiné à être affecté par l'intermédiaire des budgets publics au financement de ressources (biens ou services) d'utilité générale.
New YorkNew York (prononcé en anglais : ), officiellement nommée en, connue également sous les noms et abréviations de en ou en (pour éviter la confusion avec l'État de New York), et dont le surnom le plus connu est , est la plus grande ville des États-Unis en nombre d'habitants et l'une des plus importantes du continent américain et du monde. Elle se situe dans le Nord-Est du pays, sur la côte atlantique, à l'extrémité sud-est de l'État de New York. La ville de New York se compose de cinq arrondissements appelés boroughs : Manhattan, Brooklyn, Queens, le Bronx et Staten Island.
TriiodothyronineLa triiodothyronine ou T3 est une hormone thyroïdienne issue de la désiodation de la thyroxine. Cette hormone affecte pratiquement tous les processus physiologiques de l'organisme, y compris la croissance biologique, le développement du corps, le métabolisme, la température corporelle et le rythme cardiaque. La production de la T3 et de sa prohormone T4 sous l'effet de la thyroperoxydase (TPO) est activée par la thyréostimuline (TSH) libérée par l'antéhypophyse.
Base de données relationnellethumb|upright=1.2|Structure générale d'une base de données relationnelle. En informatique, une base de données relationnelle (en anglais: relational database management system (RDBMS)) est une base de données où l'information est organisée dans des tableaux à deux dimensions appelés des relations ou tables, selon le modèle introduit par Edgar F. Codd en 1960. Selon ce modèle relationnel, une base de données consiste en une ou plusieurs relations. Les lignes de ces relations sont appelées des nuplets ou enregistrements.
Hormone thyroïdiennevignette|Structure de la L-thyroxine (T4). vignette|Structure de la L-triiodothyronine (T3). Les hormones thyroïdiennes, c'est-à-dire la thyroxine (T4) la triiodothyronine (T3) et la diiodothyronine (T2), sont des hormones produites par les cellules folliculaires de la thyroïde à partir de la thyroglobuline et d'iodure. Il existe également la thyrocalcitonine, hormone produite par les cellules parafolliculaires de la thyroide et qui joue un rôle dans le métabolisme phospho-calcique.
Ensemblevignette|Ensemble de polygones dans un diagramme d'Euler En mathématiques, un ensemble désigne intuitivement un rassemblement d’objets distincts (les éléments de l'ensemble), « une multitude qui peut être comprise comme une totalité » pour paraphraser Georg Cantor qui est à l'origine de la théorie des ensembles. Dans une approche axiomatique, la théorie des ensembles est une théorie de l'appartenance (un élément d'un ensemble est dit « appartenir » à cet ensemble).
Réparation de l'ADNright|vignette|Chromosomes montrant de nombreuses lésions. La réparation de l'ADN est un ensemble de processus par lesquels une cellule identifie et corrige les dommages aux molécules d'ADN qui codent son génome. Dans les cellules, l'acide désoxyribonucléique (ADN) est soumis continuellement à des activités métaboliques normales et à des facteurs environnementaux portant atteinte à son intégrité. Ces facteurs environnementaux sont le plus souvent de nature chimique comme les radicaux libres de l'oxygène et les agents alkylants, ou physique, comme les radiations ultraviolettes et les rayonnements ionisants.
Fraude fiscaleLa fraude fiscale est le détournement d'un système fiscal afin de ne pas contribuer aux contributions publiques. Par contraste, l'optimisation fiscale ou évitement fiscal est l'utilisation de moyens légaux afin de réduire le montant de l'imposition. L'évasion fiscale comprend à la fois la fraude et l'optimisation fiscale. L'OCDE tente actuellement de limiter celle-ci via son . Le blanchiment de fraude fiscale consiste à réinvestir les sommes détournées du fisc dans des opérations légales.
Big dataLe big data ( « grosses données » en anglais), les mégadonnées ou les données massives, désigne les ressources d’informations dont les caractéristiques en termes de volume, de vélocité et de variété imposent l’utilisation de technologies et de méthodes analytiques particulières pour créer de la valeur, et qui dépassent en général les capacités d'une seule et unique machine et nécessitent des traitements parallélisés. L’explosion quantitative (et souvent redondante) des données numériques permet une nouvelle approche pour analyser le monde.