Votre navigateur est obsolète !

Pour une expériencenet et une sécurité optimale, mettez à jour votre navigateur. Mettre à jour maintenant

×

Amine AITHOUSSE

Senior Data Engineer

Amine AITHOUSSE
Situation professionnelle
En poste
Ouvert aux opportunités
Présentation
Senior Data Engineer spécialisé dans la conception et l’industrialisation de pipelines de données robustes,
scalables et performants sur Azure Databricks et Azure Synapse. Expert en traitement batch & streaming,
en architectures Delta Lake (ACID, Time Travel) et en gouvernance des données via Unity Catalog. Maîtrise
avancée de Python, SQL et Spark/PySpark, avec une forte orientation performance, automatisation et
qualité des données
CV réalisé sur DoYouBuzz
Expériences

Senior Data Engineer - Stack : Azure Databricks, Azure Synapse (Spark), PySpark, Spark SQL, Python, Spark Sedona, Delta Lake, Azure Blob Storage, APIs HTTP, JSON/Parquet/CSV/GeoJSON

Capegemini
Depuis avril 2025
  • Traitement big data avec PySpark
    Utilisation des fonctions natives PySpark (pyspark.sql.functions) pour :
    • transformations de colonnes
    • nettoyage / normalisation de données
    • agrégations complexes
    • fonctions de fenêtres (window functions)
      Manipulation de données structurées, semi‑structurées et complexes (JSON, arrays, structs)
  • Traitement et analyse spatiale avec Spark Sedona (ex‑GeoSpark)
    • Chargement, indexation et manipulation de données géospatiales (ST_Point, ST_Polygon, ST_GeomFromWKT, etc.)
    • SedonaRegistrator pour enregistrer les fonctions spatiales
    • Réalisation de jointures spatiales distribuées à grande échelle(ST_Intersects, ST_Contains, ST_DWithin)
  • Élaboration de pipelines envoyant les résultats :
    • vers un API client, via requêtes HTTP (POST/PUT)
    • avec sérialisation JSON optimisée
      gestion des erreurs, retries, logs
    • Transformation finale en formats consommables (GeoJSON, parquet, CSV, etc.)
  • Industrialisation des pipelines Big Data en adoptant une approche orientée objet (OOP) afin de structurer, modulariser et réutiliser le code PySpark/Sedona, tout en facilitant la maintenance et l’extension des traitements spatiaux et des flux d’intégration vers les APIs clients.
Description de l'entreprise
Stack : Azure Databricks, Azure Synapse (Spark), PySpark, Spark SQL, Python, Spark Sedona, Delta Lake, Azure
Blob Storage, APIs HTTP, JSON/Parquet/CSV/GeoJSON

Projets clés : Pipeline d'ingestion des couches départements (GeoSpatial) Arcgis : Azure Databricks - Delta lake, PySpark, Batch, OPTIMIZE, POO

Capegemini
Depuis 2026
  • Remplacement d’un processus manuel par un système entièrement automatisé de bout en bout.
  • Mise en place d’un traitement d’enrichissement automatique du fichier des départements (réseaux Idex / autres réseaux).
  • Développement d’un pipeline automatisé pour transférer les données d’ADLS vers PostgreSQL.
  • Orchestration complète du workflow via Databricks Workflows, garantissant l’exécution séquentielle et la supervision centralisée.
  • Simplification du processus opérationnel : dépôt du fichier → lancement du job → exécution automatique.
  • Impacts clés :
    • Forte simplification du processus,
    • Réduction des risques d’erreur et cohérence accrue,
    • Gains de temps significatifs pour l’équipe,
    • Libération de bande passante pour des sujets à plus forte valeur ajoutée.
  • Forte simplification du processus,
  • Réduction des risques d’erreur et cohérence accrue,
  • Gains de temps significatifs pour l’équipe,
  • Libération de bande passante pour des sujets à plus forte valeur ajoutée.

Projets clés : Projet Géospatial ICPE — Intégration via APIs ArcGIS & Georisque sur Synapse

Azure Synapse
2025
  • Contexte : Intégration de données environnementales sensibles (Installations Classées pour la Protection de l’Environnement) depuis des APIs géospatiales vers une plateforme métier (SMART) — réalisé sur Azure Synapse.
  • Ingestion : Extraction depuis APIs ArcGIS & Georisque → stockage Delta Lake (Bronze) via Synapse.
  • Transformation :
    • Nettoyage et enrichissement via Spark SQL + Apache Sedona (géospatial).
    • Création de géométries valides, calcul de clés composites, filtrage des points invalides
    • Passage en couche Silver → Gold avec optimisation (Z-ORDER sur coordonnées).
  • Chargement : Injection en batch vers la plateforme cible via API ArcGIS (GET/POST).

Projets clés : Générateur Automatisé de Requêtes SQL d’UPDATE (Historique)

Azure Databricks | Delta Lake | DLT | Unity Catalog | Python | SQL
2025
  • Objectif :
    Automatiser la reconstruction et la correction rétroactive des données dans une table SQL de logs historiques, en générant dynamiquement des requêtes UPDATE basées sur les événements passés — pour garantir la cohérence des données sans intervention manuelle.
  • Ingestion : Récupération des données historiques depuis une table SQL source (logs d’événements, dates, IDs).
  • Extraction intelligente des clauses WHERE :
    → Identification des conditions uniques pour cibler chaque enregistrement à corriger (combinaison de clés métier, timestamps, statuts…).
  • Génération dynamique de requêtes UPDATE :
    → Construction automatisée de milliers de requêtes SQL UPDATE ... WHERE ... via PySpark / Python sur Databricks.
    → Export des scripts SQL générés dans un fichier ou un stockage contrôlé (DBFS / Azure Blob).
  • Exécution contrôlée :
    → Indexation des tables avant de lancer les updates
    → Les requêtes peuvent être relancées à la demande depuis le début du projet, avec traçabilité totale.
  • Sécurité & traçabilité :
    → Audit des requêtes générées, sauvegardes avant exécution, logs d’exécution.

Tech Lead Data & Chef de Projet SI – Data & Analytics (Technologies :Databricks,Azure (Spark SQL, Python, Spark sedona), Azure Synapse (Spark SQL, Python, Pyspark, Spark sedona), Delta Lake, Azure Blob Storage, Unity Catalog)

AXA
Octobre 2018 à avril 2025
  • Volet Technique (Tech Lead) :
    • Conception et développement de pipelines d’ingestion et de transformation (FO/BO) sur Azure Databricks.
    • Refonte des pipeline existants bascule en version automatisés.
    • Architecture des flux batch/streaming avec Delta Lake, DLT, Auto Loader.
    • Optimisation des performances, gestion des exceptions, et mise en place de bonnes pratiques de data engineering.
    • Supervision technique des livrables data (qualité, scalabilité, documentation).
  • Volet Management & Pilotage :
    • Pilotage de projets data de A à Z : planning, ressources, qualité, deadlines.
    • Conception UX/UI des dashboards (Figma) + développement Power BI pour les métiers.
    • Montée en compétence des Data Analystes : coaching, revues de code, partage de bonnes pratiques.
    • Animation d’ateliers transverses avec les équipes IT, Métier et Data Governance.

Projets Clés : Pipeline Back Office – Données Salesforce

Azure Databricks | Delta Lake | DLT |Python | SQL — 2024
2024
  • Ingestion : Auto Loader quotidien (120K lignes/jour) : Claims, Tasks, Users, Status, Opportunités.
  • Transformation :
    • Nettoyage, regroupement, enrichissement avec données FO (taux de réponse, temps de traitement).
    • Validation via Delta Live Tables (passage Bronze → Silver, gestion des expectations).
    • Calculs avancés avec fonctions window (OVER, PARTITION BY, LEAD, LAG, RANK).
  • Agrégation (niveau Gold) : Table "Réitération" : flux détectés, délais de traitement, échanges.
  • Restitution :
    • Chargement dans Unity Catalog (schémas dédiés).
    • Accès sécurisé via GRANT/REVOKE.

Projets clés : Pipeline Téléphonie & Temps Productifs

Azure Databricks - Delta lake, Stream, Batch,Auto loader, OPTIMIZE, POO
2023
  • Ingestion : Données Genesys (500K+/jour) + données collaborateurs (5K/mois).
  • Transformation :
    • Segmentation, enrichissement, jointures multi-sources.
    • Optimisation via Z-ORDER (DATE, CollaborateurID).
    • Validation DLT (Bronze → Silver).
  • Agrégation (Gold) :
    Téléphonie : Offerts, Servis, Durées, DMT, DMC, ACW.
    Temps productif : par activité, par tranche horaire, par collaborateur.
  • Orchestration & Sécurité :
    Workflow automatisé.
    Gestion des droits via Unity Catalog.
  • Visualisation :
    Rapports Power BI rafraîchis quotidiennement : Performance Opérationnelle, Téléphonie.
  • Restitution via Power BI (rafraîchissement quotidien) :
    • Rapport Performance Opérationnelle
    • Rapport Téléphonie

Projets clés : Pipeline Intégration FO/BO

Azure Databricks - Data lake, Notebook, POO, SQL
2022
  • Ingestion : API (50K/jour) + fichiers déposés (150K/jour).
  • Transformation : Classes de traitement (dé-doublonnage, exceptions, backup).
    Validation manuelle → enrichissement de la matrice de risques.
  • Modélisation :
    • Table de faits consolidée (Qualtrics, Salesforce, MediaBar, Hermes).
    • Dimensions : Calendrier personnalisé, Collaborateurs.