Ingénieur Informatique dont l'intérêt se tourne vers les nouvelles technologies, l'innovation, la l'ingénierie de données et la data science (plus particulièrement le Deep Learning et l'IA en général).
En dehors du domaine Informatique, mes passions sont essentiellement la musique, les jeux vidéos, les arts martiaux, les voyages et l'E-Sport (compétiteur sur SSBU et SF6).
Mon objectif professionnel est de me consacrer intégralement à la data, avec pour finalité de me spécialiser en tant que Data Scientist.
Ma mission s'est effectuée dans un contexte Big Data, dans une équipe de Data Engineers, en renfort afin de travailler en autonomie sur un besoin établi principalement orienté développement Python / Pandas.
Migration d'un pipeline de traitement analytique / statistique :
Migration d'une architecture R/Oracle vers Python/PostgreSQL, avec la modélisation d'un nouveau schéma BDD et la création d'un pipeline ETL de migration pour s'adapter aux nouvelles structures tout en assurant une continuité dans les processus d'analyse et de traitement
Optimisation des flux de données en batch processing et adaptation aux différences générationnelles entre les deux environnements, pour garantir une transition fluide.
Conversion des procédures SQL complexes (centaines de lignes) en pipelines ETL orientés data (Python, Pandas et NumPy) pour traiter des jeux de données volumineux bidimensionnels multi-sources en batch.
Développement d'agrégats personnalisés avec Pandas pour optimiser le traitement des données volumineuses permettant des transformations spécifiques tout en améliorant les performances des analyses avancées et en appliquant un monitoring de données (cleaning, filtering, etc...)
Préparation de différents jeux de données à destination d'une BDD cible et d'un reporting Excel
Centralisation des scripts + factorisation + ajouts de fonctionnalités connexes
En résumé simplifié : Migration d'architecture -> multi-sourcing -> conversion + traitements analytiques complexes -> injection des données + génération de reporting Excel
Automatisation d'opérations :
Conception / développement d'un robot d'automatisation pour effectuer des opérations en masse à distance sur des cartes E-SIM, en contournant l'absence d'API via l'interaction avec un site web externe dédié.
Code Python (objet + Selenium) pour simuler les actions de l'utilisateur et automatiser le processus de correction d'erreurs sur les cartes, garantissant ainsi une réduction des interventions manuelles.
Etude des alternatives à ChatGPT, actuellement utilisé dans un chatbot environnemental, en réalisant une documentation d'étude et analyse comparative selon différents critères comme budget, RGPD, utilisation, etc... Afin d'envisager (ou non) le remplacement de la partie ChatGP
Test de l'utilisation d'APIs de chatGPT alternatives (Python)
Pipeline ETL d'intégration / migration de fichiers de données géospatiales QGIS vers une BDD PostgreSQL métier, assurant la transformation et le sourcing des données
Pipeline de synchronisation et d'intégration en batch processing (cron) et en streaming (event driven) pour des données documentaires (SI interne) et terrain (SI externe online et offline) :
Mise à jour simultanée en temps réel des données selon les règles métier avec des systèmes disparates (internes / externes et connectés / non connectés), avec gestion des conflits
Monitoring avec alertes e-mail, incluant du logging et reporting, assurant traçabilité et la conformité
Création des flux API
Pipeline de correction massive d'études Enedis
Outil d'automatisation des processus métiers :
Automatisation (Selenium) des opérations métiers complexes nécessitant des interactions web par plusieurs étapes et des processus longs.
Logging via API / triggers BDD de suivi et reprise en cas d'échec
Tests de régression et performance (web scraping + algorithme récursif)
En vrac :
Redmine (setup+ init + process + intégration API)
Git master
Flux BDD + backup / restore + migration de données
Migration SSO
POC tests Behave
Environnement général : Python (logiciel, graphique et web), Django, PostgreSQL (dénormalisé), Pandas / Numpy, QGIS
Exploration professionnelle et projets indépendants : Au cours de cette période, j’ai consacré mon temps à des projets personnels, à des recherches, à des formations visant à développer mes compétences, à un accompagnement d’orientation professionnelle avec Activ’Projet et à l’exploration de diverses pistes professionnelles.
[POC sur 2 mois] Projet Data Lake (Big Data) / Data Warehouse dans un contexte de migration SI :
Analyse fonctionnelle et technique pour la migration des données issues de plusieurs sources hétérogènes vers un environnement Big Data
Rédaction du cahier des charges pour la mise en place d'un Data Lake sous l’écosystème Hortonworks (Hadoop open-source), permettant l’ingestion et le stockage de données brutes et semi-structurées dans HDFS
Pipelines de traitement des données via des workflows (coordination de jobs Sqoop, Hive, Pig, ...)
Optimisations avec Yarn et Tez
Tests de performance avec pyspark (Spark)
Export par des requêtes Hive ou pipeline de données brutes du Data Lake vers un Data Warehouse PostgreSQL
Création d'une base de contrôle d'intégrité des flux EDI :
Pipeline de contrôle de qualité de données pour valider l'intégrité des flux EDI, en croisant des données entre des reportings Excel et une base de données infocentre MSSQL dénormalisée
Fonctions PostgreSQL avec intégration de code Python pour plus de flexibilité sur le processus d'ETL entre plusieurs sources de données hétérogènes
Vues matérialisées dénormalisées (avec champs de type objet) pour de l'analyse
Réalisation d'un système d'EDI pour la mise à jour en masse de contrats :
Pipeline ETL de données en Python à partir de bases PostgreSQL, MSSQL, et de fichiers XML, permettant des mises à jour massives
Monitoring et logging des traitements avec suivi des statuts via une BDD (PostgreSQL avec champs JSON)
Gestion d'une file d'attente et traitement des flux en asynchrone via des Web services, assurant la scalabilité
Réalisation d'un système de dématérialisation :
Client RESTful en Python pour l'API d'Alfresco (GED), assurant l'intégration et la gestion des flux à travers des pipelines de traitement de documents pour la dématérialisation
Environnement général :
Python/Django, PostegreSQL (objets / types complexes) / MSSQL, VM Linux / Windows
Réalisation d’une application web collaboratif de gestion de création de tablatures (partitions musicales) multi-pistes format Guitar Pro (PHP / MySQL / Workbench)
Développement en PHP/MySQL de l’application, création d’une base de donnée et gestion de version par git