Couvre les meilleures pratiques et les lignes directrices pour les mégadonnées, y compris les lacs de données, l'architecture, les défis et les technologies comme Hadoop et Hive.
Présentation d'Apache Spark, couvrant son architecture, ses RDD, ses transformations, ses actions, sa tolérance aux pannes, ses options de déploiement et ses exercices pratiques dans les blocs-notes Jupyter.
Fournit un aperçu de la théorie des probabilités de base, de l'ANOVA, des tests t, du théorème de limite centrale, des métriques, des intervalles de confiance et des tests non paramétriques.
Couvre une mission de travail sur les données de querelle et d'analyse à l'aide de la bibliothèque de pandas de Python pour les ensembles de données du monde réel.
Introduit des statistiques descriptives, une quantification de l'incertitude et des relations variables, soulignant l'importance de l'interprétation statistique et de l'analyse critique.
Introduit le cours d'analyse des données appliquées à l'EPFL, couvrant un large éventail de sujets d'analyse des données et mettant l'accent sur l'apprentissage continu en sciences des données.
Explore les paires unilatérales et bilatérales dans les tests d'hypothèses statistiques, couvrant les valeurs critiques, les statistiques de test et les valeurs de p.
Explore les possibilités de transformation numérique, les mégadonnées, l'analyse et les innovations technologiques dans le domaine des affaires et de la recherche.
Explore la méthodologie d'analyse des flux de matériaux à l'échelle économique et les applications dans les projets du monde réel à l'aide de carnets Jupyter.
Couvre l'essentiel de la science des données, y compris le traitement, la visualisation et l'analyse des données, en mettant l'accent sur les compétences pratiques et l'engagement actif.