Senior Data Engineer spécialisé dans la conception et l’industrialisation de pipelines de données robustes, scalables et performants sur Azure Databricks et Azure Synapse. Expert en traitement batch & streaming, en architectures Delta Lake (ACID, Time Travel) et en gouvernance des données via Unity Catalog. Maîtrise avancée de Python, SQL et Spark/PySpark, avec une forte orientation performance, automatisation et qualité des données
Traitement big data avec PySpark Utilisation des fonctions natives PySpark (pyspark.sql.functions) pour :
transformations de colonnes
nettoyage / normalisation de données
agrégations complexes
fonctions de fenêtres (window functions) Manipulation de données structurées, semi‑structurées et complexes (JSON, arrays, structs)
Traitement et analyse spatiale avec Spark Sedona (ex‑GeoSpark)
Chargement, indexation et manipulation de données géospatiales (ST_Point, ST_Polygon, ST_GeomFromWKT, etc.)
SedonaRegistrator pour enregistrer les fonctions spatiales
Réalisation de jointures spatiales distribuées à grande échelle(ST_Intersects, ST_Contains, ST_DWithin)
Élaboration de pipelines envoyant les résultats :
vers un API client, via requêtes HTTP (POST/PUT)
avec sérialisation JSON optimisée gestion des erreurs, retries, logs
Transformation finale en formats consommables (GeoJSON, parquet, CSV, etc.)
Industrialisation des pipelines Big Data en adoptant une approche orientée objet (OOP) afin de structurer, modulariser et réutiliser le code PySpark/Sedona, tout en facilitant la maintenance et l’extension des traitements spatiaux et des flux d’intégration vers les APIs clients.
Projets clés : Pipeline d'ingestion des couches départements (GeoSpatial) Arcgis : Azure Databricks - Delta lake, PySpark, Batch, OPTIMIZE, POO
Capegemini
Depuis 2026
Remplacement d’un processus manuel par un système entièrement automatisé de bout en bout.
Mise en place d’un traitement d’enrichissement automatique du fichier des départements (réseaux Idex / autres réseaux).
Développement d’un pipeline automatisé pour transférer les données d’ADLS vers PostgreSQL.
Orchestration complète du workflow via Databricks Workflows, garantissant l’exécution séquentielle et la supervision centralisée.
Simplification du processus opérationnel : dépôt du fichier → lancement du job → exécution automatique.
Impacts clés :
Forte simplification du processus,
Réduction des risques d’erreur et cohérence accrue,
Gains de temps significatifs pour l’équipe,
Libération de bande passante pour des sujets à plus forte valeur ajoutée.
Forte simplification du processus,
Réduction des risques d’erreur et cohérence accrue,
Gains de temps significatifs pour l’équipe,
Libération de bande passante pour des sujets à plus forte valeur ajoutée.
Projets clés : Projet Géospatial ICPE — Intégration via APIs ArcGIS & Georisque sur Synapse
Azure Synapse
2025
Contexte : Intégration de données environnementales sensibles (Installations Classées pour la Protection de l’Environnement) depuis des APIs géospatiales vers une plateforme métier (SMART) — réalisé sur Azure Synapse.
Ingestion : Extraction depuis APIs ArcGIS & Georisque → stockage Delta Lake (Bronze) via Synapse.
Transformation :
Nettoyage et enrichissement via Spark SQL + Apache Sedona (géospatial).
Création de géométries valides, calcul de clés composites, filtrage des points invalides
Passage en couche Silver → Gold avec optimisation (Z-ORDER sur coordonnées).
Chargement : Injection en batch vers la plateforme cible via API ArcGIS (GET/POST).
Projets clés : Générateur Automatisé de Requêtes SQL d’UPDATE (Historique)
Objectif : Automatiser la reconstruction et la correction rétroactive des données dans une table SQL de logs historiques, en générant dynamiquement des requêtes UPDATE basées sur les événements passés — pour garantir la cohérence des données sans intervention manuelle.
Ingestion : Récupération des données historiques depuis une table SQL source (logs d’événements, dates, IDs).
Extraction intelligente des clauses WHERE : → Identification des conditions uniques pour cibler chaque enregistrement à corriger (combinaison de clés métier, timestamps, statuts…).
Génération dynamique de requêtes UPDATE : → Construction automatisée de milliers de requêtes SQL UPDATE ... WHERE ... via PySpark / Python sur Databricks. → Export des scripts SQL générés dans un fichier ou un stockage contrôlé (DBFS / Azure Blob).
Exécution contrôlée : → Indexation des tables avant de lancer les updates → Les requêtes peuvent être relancées à la demande depuis le début du projet, avec traçabilité totale.
Sécurité & traçabilité : → Audit des requêtes générées, sauvegardes avant exécution, logs d’exécution.
Tech Lead Data & Chef de Projet SI – Data & Analytics (Technologies :Databricks,Azure (Spark SQL, Python, Spark sedona), Azure Synapse (Spark SQL, Python, Pyspark, Spark sedona), Delta Lake, Azure Blob Storage, Unity Catalog)
AXA
Octobre 2018
à avril 2025
Volet Technique (Tech Lead) :
Conception et développement de pipelines d’ingestion et de transformation (FO/BO) sur Azure Databricks.
Refonte des pipeline existants bascule en version automatisés.
Architecture des flux batch/streaming avec Delta Lake, DLT, Auto Loader.
Optimisation des performances, gestion des exceptions, et mise en place de bonnes pratiques de data engineering.
Supervision technique des livrables data (qualité, scalabilité, documentation).
Volet Management & Pilotage :
Pilotage de projets data de A à Z : planning, ressources, qualité, deadlines.
Conception UX/UI des dashboards (Figma) + développement Power BI pour les métiers.
Montée en compétence des Data Analystes : coaching, revues de code, partage de bonnes pratiques.
Animation d’ateliers transverses avec les équipes IT, Métier et Data Governance.
Projets Clés : Pipeline Back Office – Données Salesforce