Ingénieur Informatique dont l'intérêt se tourne vers les nouvelles technologies, l'innovation, la l'ingénierie de données et la data science (plus particulièrement le Deep Learning et l'IA en général).
En dehors du domaine Informatique, mes passions sont essentiellement la musique, les jeux vidéos, les arts martiaux, les voyages et l'E-Sport (compétiteur sur SSBU et SF6).
Mon objectif professionnel est de me consacrer intégralement à la data, avec pour finalité de me spécialiser en tant que Data Scientist.
[POC sur 2 mois] Projet Data Lake (Big Data) / Data Warehouse dans un contexte de migration SI :
Analyse fonctionnelle et technique pour la migration des données issues de plusieurs sources hétérogènes vers un environnement Big Data
Rédaction du cahier des charges pour la mise en place d'un Data Lake sous l’écosystème Hortonworks (Hadoop open-source), permettant l’ingestion et le stockage de données brutes et semi-structurées dans HDFS
Pipelines de traitement des données via des workflows (coordination de jobs Sqoop, Hive, Pig, ...)
Optimisations avec Yarn et Tez
Tests de performance avec pyspark (Spark)
Export par des requêtes Hive ou pipeline de données brutes du Data Lake vers un Data Warehouse PostgreSQL
Création d'une base de contrôle d'intégrité des flux EDI :
Pipeline de contrôle de qualité de données pour valider l'intégrité des flux EDI, en croisant des données entre des reportings Excel et une base de données infocentre MSSQL dénormalisée
Fonctions PostgreSQL avec intégration de code Python pour plus de flexibilité sur le processus d'ETL entre plusieurs sources de données hétérogènes
Vues matérialisées dénormalisées (avec champs de type objet) pour de l'analyse
Réalisation d'un système d'EDI pour la mise à jour en masse de contrats :
Pipeline ETL de données en Python à partir de bases PostgreSQL, MSSQL, et de fichiers XML, permettant des mises à jour massives
Monitoring et logging des traitements avec suivi des statuts via une BDD (PostgreSQL avec champs JSON)
Gestion d'une file d'attente et traitement des flux en asynchrone via des Web services, assurant la scalabilité
Réalisation d'un système de dématérialisation :
Client RESTful en Python pour l'API d'Alfresco (GED), assurant l'intégration et la gestion des flux à travers des pipelines de traitement de documents pour la dématérialisation
Environnement général :
Python/Django, PostegreSQL (objets / types complexes) / MSSQL, VM Linux / Windows