Régularisation (mathématiques)vignette|Les courbes bleues et vertes correspondent à deux modèles differents, tous les deux étant des solutions possibles du problème consistant à décrire les coordonnées de tous les points rouges. L'application d'une régularisation favorise le modèle moins complexe correspondant à la courbe verte. Dans le domaine des mathématiques et des statistiques, et plus particulièrement dans le domaine de l'apprentissage automatique, la régularisation fait référence à un processus consistant à ajouter de l'information à un problème, s'il est mal posé ou pour éviter le surapprentissage.
Analyse des donnéesL’analyse des données (aussi appelée analyse exploratoire des données ou AED) est une famille de méthodes statistiques dont les principales caractéristiques sont d'être multidimensionnelles et descriptives. Dans l'acception française, la terminologie « analyse des données » désigne donc un sous-ensemble de ce qui est appelé plus généralement la statistique multivariée. Certaines méthodes, pour la plupart géométriques, aident à faire ressortir les relations pouvant exister entre les différentes données et à en tirer une information statistique qui permet de décrire de façon plus succincte les principales informations contenues dans ces données.
Ridge regressionRidge regression is a method of estimating the coefficients of multiple-regression models in scenarios where the independent variables are highly correlated. It has been used in many fields including econometrics, chemistry, and engineering. Also known as Tikhonov regularization, named for Andrey Tikhonov, it is a method of regularization of ill-posed problems. It is particularly useful to mitigate the problem of multicollinearity in linear regression, which commonly occurs in models with large numbers of parameters.
Visualisation de donnéesvignette|upright=2|Carte figurative des pertes successives en hommes de l'armée française dans la campagne de Russie 1812-1813, par Charles Minard, 1869. La visualisation des données (ou dataviz ou représentation graphique de données) est un ensemble de méthodes permettant de résumer de manière graphique des données statistiques qualitatives et surtout quantitatives afin de montrer les liens entre des ensembles de ces données. Cette fait partie de la science des données.
Visualisation scientifiqueLa visualisation scientifique, ou l’usage de graphiques scientifiques, est l'étude et/ou la réalisation de la représentation sous forme graphique de résultats scientifiques. Cette visualisation est donc intimement liée aux sciences et à l'informatique. Il existe une gamme complète de matériels destinés à la visualisation scientifique. Il existe sur le marché des postes personnels de type PC équipé avec une ou plusieurs cartes graphiques permettant de faire de la visualisation scientifique.
Visualization (graphics)Visualization or visualisation (see spelling differences) is any technique for creating s, diagrams, or animations to communicate a message. Visualization through visual imagery has been an effective way to communicate both abstract and concrete ideas since the dawn of humanity. from history include cave paintings, Egyptian hieroglyphs, Greek geometry, and Leonardo da Vinci's revolutionary methods of technical drawing for engineering and scientific purposes. Visualization today has ever-expanding applications in science, education, engineering (e.
Elastic net regularizationIn statistics and, in particular, in the fitting of linear or logistic regression models, the elastic net is a regularized regression method that linearly combines the L1 and L2 penalties of the lasso and ridge methods. The elastic net method overcomes the limitations of the LASSO (least absolute shrinkage and selection operator) method which uses a penalty function based on Use of this penalty function has several limitations. For example, in the "large p, small n" case (high-dimensional data with few examples), the LASSO selects at most n variables before it saturates.
Science des donnéesLa science des données est l'étude de l’extraction automatisée de connaissance à partir de grands ensembles de données. Plus précisément, la science des données est un domaine interdisciplinaire qui utilise des méthodes, des processus, des algorithmes et des systèmes scientifiques pour extraire des connaissances et des idées à partir de nombreuses données structurées ou non . Elle est souvent associée aux données massives et à l'analyse des données.
Lasso (statistiques)En statistiques, le lasso est une méthode de contraction des coefficients de la régression développée par Robert Tibshirani dans un article publié en 1996 intitulé Regression shrinkage and selection via the lasso. Le nom est un acronyme anglais : Least Absolute Shrinkage and Selection Operator. Bien que cette méthode fut utilisée à l'origine pour des modèles utilisant l'estimateur usuel des moindres carrés, la pénalisation lasso s'étend facilement à de nombreux modèles statistiques tels que les modèles linéaires généralisés, les modèles à risque proportionnel, et les M-estimateurs.
Apprentissage automatiqueL'apprentissage automatique (en anglais : machine learning, « apprentissage machine »), apprentissage artificiel ou apprentissage statistique est un champ d'étude de l'intelligence artificielle qui se fonde sur des approches mathématiques et statistiques pour donner aux ordinateurs la capacité d'« apprendre » à partir de données, c'est-à-dire d'améliorer leurs performances à résoudre des tâches sans être explicitement programmés pour chacune. Plus largement, il concerne la conception, l'analyse, l'optimisation, le développement et l'implémentation de telles méthodes.
Analyse en composantes principalesL'analyse en composantes principales (ACP ou PCA en anglais pour principal component analysis), ou, selon le domaine d'application, transformation de Karhunen–Loève (KLT) ou transformation de Hotelling, est une méthode de la famille de l'analyse des données et plus généralement de la statistique multivariée, qui consiste à transformer des variables liées entre elles (dites « corrélées » en statistique) en nouvelles variables décorrélées les unes des autres. Ces nouvelles variables sont nommées « composantes principales » ou axes principaux.
Lipoprotéine de haute densitéLes lipoprotéines de haute densité (HDL, pour l'anglais high density lipoprotein) sont des lipoprotéines responsables du transport du cholestérol vers le foie, où il pourra être éliminé. Cette fonction permet d'éviter l'accumulation de cholestérol dans les vaisseaux sanguins et donc d'éviter les risques d'athérosclérose. C'est pour cela que les HDL sont communément appelées « bon cholestérol », par opposition aux LDL (lipoprotéines de basse densité) qualifiées de « mauvais cholestérol » (en réalité, ni les unes ni les autres ne sont du cholestérol).
HypercholestérolémiePar hypercholestérolémie (littéralement : cholestérolémie élevée) on entend un taux élevé de cholestérol sanguin par rapport à une limite fixée par une instance de santé. Ce n'est pas une maladie en soi mais un trouble métabolique, c'est-à-dire une déviation par rapport à une norme. En termes de santé publique, on parlera de marqueur de risque, voire de facteur de risque. Les lipoprotéines sont des particules complexes contenues dans le sang et contenant un mélange de cholestérol, acide gras, triglycérides, phospholipides et apolipoprotéines (protéine spécialisées).
CholestérolLe cholestérol est un lipide de la famille des stérols. Sa molécule, plate et rigide, est un constituant essentiel de la membrane des cellules de presque tous les animaux, contrôlant ses propriétés physiques (rigidité, courbure, perméabilité). Le cholestérol joue un rôle central dans de nombreux processus biochimiques. Le mot cholestérol désigne une molécule unique.
Algorithme d'apprentissage incrémentalEn informatique, un algorithme d'apprentissage incrémental ou incrémentiel est un algorithme d'apprentissage qui a la particularité d'être online, c'est-à-dire qui apprend à partir de données reçues au fur et à mesure du temps. À chaque incrément il reçoit des données d'entrées et un résultat, l'algorithme calcule alors une amélioration du calcul fait pour prédire le résultat à partir des données d'entrées.
Statistique multivariéeEn statistique, les analyses multivariées ont pour caractéristique de s'intéresser à des lois de probabilité à plusieurs variables. Les analyses bivariées sont des cas particuliers à deux variables. Les analyses multivariées sont très diverses selon l'objectif recherché, la nature des variables et la mise en œuvre formelle. On peut identifier deux grandes familles : celle des méthodes descriptives (visant à structurer et résumer l'information) et celle des méthodes explicatives visant à expliquer une ou des variables dites « dépendantes » (variables à expliquer) par un ensemble de variables dites « indépendantes » (variables explicatives).
Blood pressureBlood pressure (BP) is the pressure of circulating blood against the walls of blood vessels. Most of this pressure results from the heart pumping blood through the circulatory system. When used without qualification, the term "blood pressure" refers to the pressure in a brachial artery, where it is most commonly measured. Blood pressure is usually expressed in terms of the systolic pressure (maximum pressure during one heartbeat) over diastolic pressure (minimum pressure between two heartbeats) in the cardiac cycle.
MontageLe montage est, en audiovisuel, l'action d'assembler bout à bout plusieurs plans pour former des séquences qui forment à leur tour un film. Alfred Hitchcock est l’auteur d’un aphorisme vigoureux : Montage de fiction : Le montage de fiction est la fabrication proprement dite de la bande image et de la bande son (ou de plusieurs bandes son) d’un film joué par des comédiens, à partir des éléments fournis par l’enregistrement au tournage des plans définis par le réalisateur dans son découpage technique, ou dessinés sur le storyboard (ou ) selon ses indications.
Exploration d'une anomalie lipidiqueL'exploration d'une anomalie lipidique (EAL) ou bilan lipidique est un examen biologique permettant de déterminer le profil lipidique d'un individu. Il porte sur les taux sanguins des lipides comme le cholestérol, le HDL, le LDL et les triglycérides. Dosage de la concentration sanguine des lipoprotéines pour le dépistage ou le suivi des dyslipidémies. Le bilan lipidique se fait à partir d’une prise de sang à jeun depuis au moins 12h. Le prélèvement se fait traditionnellement sur tube sec pour permettre un dosage du sérum sanguin.
Lipoprotéine de basse densitéLes lipoprotéines de basse densité (LDL, pour l'anglais low-density lipoprotein) sont un groupe de lipoprotéines de types et de tailles variables ( de diamètre). Leur fonction est de transporter le cholestérol, libre ou estérifié, dans le sang et à travers le corps pour l'apporter aux cellules. Les LDL sont produites par le foie à partir des lipoprotéines de très basse densité (ou VLDL, ). Elles portent des apolipoprotéines B-100, une monocouche de phospholipides, des triglycérides et des vitamines liposolubles antioxydantes (vitamine E et caroténoïdes).