Votre navigateur est obsolète !

Pour une expériencenet et une sécurité optimale, mettez à jour votre navigateur. Mettre à jour maintenant

×

Soufiane Benamar

Developpeur Python (IA / Data)

Data Engineering
Data Science
Databases
Python
Innovation
Soufiane Benamar
36 ans
Lyon (69007) France
Situation professionnelle
En fin de contrat
En recherche active
Présentation
Ingénieur Informatique dont l'intérêt se tourne vers les nouvelles technologies, l'innovation, la l'ingénierie de données et la data science (plus particulièrement le Deep Learning et l'IA en général).

En dehors du domaine Informatique, mes passions sont essentiellement la musique, les jeux vidéos, les arts martiaux, les voyages et l'E-Sport (compétiteur sur SSBU et SF6).

Mon objectif professionnel est de me consacrer intégralement à la data, avec pour finalité de me spécialiser en tant que Data Scientist.
CV réalisé sur DoYouBuzz
  • [POC sur 2 mois] Projet Data Lake (Big Data) / Data Warehouse dans un contexte de migration SI :
    • Analyse fonctionnelle et technique pour la migration des données issues de plusieurs sources hétérogènes vers un environnement Big Data
    • Rédaction du cahier des charges pour la mise en place d'un Data Lake sous l’écosystème Hortonworks (Hadoop open-source), permettant l’ingestion et le stockage de données brutes et semi-structurées dans HDFS
    • Pipelines de traitement des données via des workflows (coordination de jobs Sqoop, Hive, Pig, ...)
    • Optimisations avec Yarn et Tez
    • Tests de performance avec pyspark (Spark)
    • Export par des requêtes Hive ou pipeline de données brutes du Data Lake vers un Data Warehouse PostgreSQL
  • Création d'une base de contrôle d'intégrité des flux EDI :
    • Pipeline de contrôle de qualité de données pour valider l'intégrité des flux EDI, en croisant des données entre des reportings Excel et une base de données infocentre MSSQL dénormalisée
    • Fonctions PostgreSQL avec intégration de code Python pour plus de flexibilité sur le processus d'ETL entre plusieurs sources de données hétérogènes
    • Vues matérialisées dénormalisées (avec champs de type objet) pour de l'analyse
  • Réalisation d'un système d'EDI pour la mise à jour en masse de contrats :
    • Pipeline ETL de données en Python à partir de bases PostgreSQL, MSSQL, et de fichiers XML, permettant des mises à jour massives
    • Monitoring et logging des traitements avec suivi des statuts via une BDD (PostgreSQL avec champs JSON)
    • Gestion d'une file d'attente et traitement des flux en asynchrone via des Web services, assurant la scalabilité
  • Réalisation d'un système de dématérialisation :
    • Client RESTful en Python pour l'API d'Alfresco (GED), assurant l'intégration et la gestion des flux à travers des pipelines de traitement de documents pour la dématérialisation
  • Environnement général :
    • Python/Django, PostegreSQL (objets / types complexes) / MSSQL, VM Linux / Windows
    • Relation clients