Ingénierie des données massives
Master 2 Statistique pour l’évaluation et la prévision
Master 2 Calcul scientifique
Université de Reims Champagne-Ardenne
Description de l’enseignement
L’objectif de ce cours est d’apprendre à construire une chaîne de traitement complète, depuis les données brutes jusqu’à leur exploitation analytique ou leur utilisation par un modèle d’intelligence artificielle.
Les étudiants apprennent à choisir une base SQL ou NoSQL, à modéliser un entrepôt, à construire un pipeline ETL ou ELT et à utiliser GCP, BigQuery et Spark. Ils abordent également le traitement des documents, l’OCR, les embeddings, les bases vectorielles et le RAG.
Chaque partie associe les principes théoriques à une mise en œuvre pratique sur des données réelles.
Prérequis
- Connaissances de base en Python, notamment avec Pandas et scikit-learn ;
- connaissances de base en SQL ;
- notions de machine learning, en particulier la régression linéaire et les modèles basés sur les arbres de décision.
Programme
Fondamentaux de l’ingénierie des données
- Décrire le cycle de vie et les architectures data lake, data warehouse et lakehouse ;
- distinguer les bases SQL et NoSQL ;
- concevoir un modèle analytique et un pipeline ETL ou ELT.
Cloud, GCP, BigQuery et SQL
- Comprendre le cloud et les principaux services GCP, dont BigQuery et Cloud Storage ;
- écrire des requêtes analytiques avec jointures, CTE et fonctions de fenêtrage ;
- comprendre et optimiser le stockage, l’exécution et le coût des requêtes BigQuery.
Traitement distribué avec Spark
- Comprendre le calcul distribué, Spark, les RDD et les DataFrames ;
- manipuler des données avec PySpark et Spark SQL ;
- construire des pipelines de Feature Engineering et entraîner des modèles avec Spark MLlib.
Données non structurées, bases vectorielles et RAG
- Préparer des documents et des images avec le parsing et l’OCR ;
- produire des embeddings et construire une base vectorielle ;
- développer un pipeline RAG : chunking, indexation et interrogation d’un LLM avec un contexte métier.
Organisation des séances
| Séance | Date | Contenu | Support |
|---|---|---|---|
| CM1 | 11/09/2026 | Fondamentaux : histoire, cycle de vie de la donnée, bases de données et modélisation | Support CM1 |
| CM2 | 25/09/2026 | Cloud, GCP, BigQuery et SQL analytique | À venir |
| TD1 | 09/10/2026 | Atelier : construction d’un data lake, d’un data warehouse et d’un pipeline ETL à partir de données SNCF | À venir |
| CM3 | 16/10/2026 | Traitement distribué avec PySpark et Spark SQL | À venir |
| TD2 | 23/10/2026 | Atelier : prédiction de séries temporelles avec PySpark | À venir |
| CM4 | 06/11/2026 | Ingénierie des données pour l’IA : données non structurées, bases vectorielles et RAG | À venir |
| CM5 | à définir | Restitution finale des projets | À venir |
Contact
Ouael Ettouileb · ouael@mailbox.org