Ingénierie des données massives

Master 2 Statistique pour l’évaluation et la prévision
Master 2 Calcul scientifique
Université de Reims Champagne-Ardenne

Description de l’enseignement

L’objectif de ce cours est d’apprendre à construire une chaîne de traitement complète, depuis les données brutes jusqu’à leur exploitation analytique ou leur utilisation par un modèle d’intelligence artificielle.

Les étudiants apprennent à choisir une base SQL ou NoSQL, à modéliser un entrepôt, à construire un pipeline ETL ou ELT et à utiliser GCP, BigQuery et Spark. Ils abordent également le traitement des documents, l’OCR, les embeddings, les bases vectorielles et le RAG.

Chaque partie associe les principes théoriques à une mise en œuvre pratique sur des données réelles.

Prérequis

  • Connaissances de base en Python, notamment avec Pandas et scikit-learn ;
  • connaissances de base en SQL ;
  • notions de machine learning, en particulier la régression linéaire et les modèles basés sur les arbres de décision.

Programme

Fondamentaux de l’ingénierie des données

  • Décrire le cycle de vie et les architectures data lake, data warehouse et lakehouse ;
  • distinguer les bases SQL et NoSQL ;
  • concevoir un modèle analytique et un pipeline ETL ou ELT.

Cloud, GCP, BigQuery et SQL

  • Comprendre le cloud et les principaux services GCP, dont BigQuery et Cloud Storage ;
  • écrire des requêtes analytiques avec jointures, CTE et fonctions de fenêtrage ;
  • comprendre et optimiser le stockage, l’exécution et le coût des requêtes BigQuery.

Traitement distribué avec Spark

  • Comprendre le calcul distribué, Spark, les RDD et les DataFrames ;
  • manipuler des données avec PySpark et Spark SQL ;
  • construire des pipelines de Feature Engineering et entraîner des modèles avec Spark MLlib.

Données non structurées, bases vectorielles et RAG

  • Préparer des documents et des images avec le parsing et l’OCR ;
  • produire des embeddings et construire une base vectorielle ;
  • développer un pipeline RAG : chunking, indexation et interrogation d’un LLM avec un contexte métier.

Organisation des séances

Séance Date Contenu Support
CM1 11/09/2026 Fondamentaux : histoire, cycle de vie de la donnée, bases de données et modélisation Support CM1
CM2 25/09/2026 Cloud, GCP, BigQuery et SQL analytique À venir
TD1 09/10/2026 Atelier : construction d’un data lake, d’un data warehouse et d’un pipeline ETL à partir de données SNCF À venir
CM3 16/10/2026 Traitement distribué avec PySpark et Spark SQL À venir
TD2 23/10/2026 Atelier : prédiction de séries temporelles avec PySpark À venir
CM4 06/11/2026 Ingénierie des données pour l’IA : données non structurées, bases vectorielles et RAG À venir
CM5 à définir Restitution finale des projets À venir

Contact

Ouael Ettouileb · ouael@mailbox.org