Votre navigateur est obsolète !

Pour une expériencenet et une sécurité optimale, mettez à jour votre navigateur. Mettre à jour maintenant

×

Soufiane Benamar

Developpeur Python (IA / Data)

Data Engineering
Data Science
Databases
Python
Innovation
Soufiane Benamar
36 ans
Lyon (69007) France
Situation professionnelle
En fin de contrat
En recherche active
Présentation
Ingénieur Informatique dont l'intérêt se tourne vers les nouvelles technologies, l'innovation, la l'ingénierie de données et la data science (plus particulièrement le Deep Learning et l'IA en général).

En dehors du domaine Informatique, mes passions sont essentiellement la musique, les jeux vidéos, les arts martiaux, les voyages et l'E-Sport (compétiteur sur SSBU et SF6).

Mon objectif professionnel est de me consacrer intégralement à la data, avec pour finalité de me spécialiser en tant que Data Scientist.
CV réalisé sur DoYouBuzz
  • Ma mission s'est effectuée dans un contexte Big Data, dans une équipe de Data Engineers, en renfort afin de travailler en autonomie sur un besoin établi principalement orienté développement Python / Pandas.
  • Migration d'un pipeline de traitement analytique / statistique :
    • Migration d'une architecture R/Oracle vers Python/PostgreSQL, avec la modélisation d'un nouveau schéma BDD et la création d'un pipeline ETL de migration pour s'adapter aux nouvelles structures tout en assurant une continuité dans les processus d'analyse et de traitement
    • Optimisation des flux de données en batch processing et adaptation aux différences générationnelles entre les deux environnements, pour garantir une transition fluide.
    • Conversion des procédures SQL complexes (centaines de lignes) en pipelines ETL orientés data (Python, Pandas et NumPy) pour traiter des jeux de données volumineux bidimensionnels multi-sources en batch.
    • Développement d'agrégats personnalisés avec Pandas pour optimiser le traitement des données volumineuses permettant des transformations spécifiques tout en améliorant les performances des analyses avancées et en appliquant un monitoring de données (cleaning, filtering, etc...)
    • Préparation de différents jeux de données à destination d'une BDD cible et d'un reporting Excel
    • Centralisation des scripts + factorisation + ajouts de fonctionnalités connexes
    • En résumé simplifié : Migration d'architecture -> multi-sourcing -> conversion + traitements analytiques complexes -> injection des données + génération de reporting Excel
  • Automatisation d'opérations :
    • Conception / développement d'un robot d'automatisation pour effectuer des opérations en masse à distance sur des cartes E-SIM, en contournant l'absence d'API via l'interaction avec un site web externe dédié.
    • Code Python (objet + Selenium) pour simuler les actions de l'utilisateur et automatiser le processus de correction d'erreurs sur les cartes, garantissant ainsi une réduction des interventions manuelles.
  • Etude des alternatives à ChatGPT, actuellement utilisé dans un chatbot environnemental, en réalisant une documentation d'étude et analyse comparative selon différents critères comme budget, RGPD, utilisation, etc... Afin d'envisager (ou non) le remplacement de la partie ChatGP
  • Test de l'utilisation d'APIs de chatGPT alternatives (Python)
  • Logiciel contrôleur d'études :
    • Logiciel (exe) avec UI (QT)
    • Pipeline de contrôle de données des phases opérationnelles
    • Monitoring des données (cohérence, conformité, règles métier, ...) multi-sources de formats variés (OFFICE, PDF, SHP, DBF, ...)
    • Traitement ETL permettant la génération d'un rapport analytique
    • Manipulation de données cartographiques géospatiales (SIG : QGIS) avec jointures spatiales, calculs vectoriels, ... (shapes, géométries 3D, plans, ...)
    • Migration logiciel -> web (QT -> Django, Excel -> dataviz leaflet, ...)
  • Pipeline ETL d'intégration / migration de fichiers de données géospatiales QGIS vers une BDD PostgreSQL métier, assurant la transformation et le sourcing des données
  • Pipeline de synchronisation et d'intégration en batch processing (cron) et en streaming (event driven) pour des données documentaires (SI interne) et terrain (SI externe online et offline) :
    • Mise à jour simultanée en temps réel des données selon les règles métier avec des systèmes disparates (internes / externes et connectés / non connectés), avec gestion des conflits
    • Monitoring avec alertes e-mail, incluant du logging et reporting, assurant traçabilité et la conformité
    • Création des flux API
  • Pipeline de correction massive d'études Enedis
  • Outil d'automatisation des processus métiers :
    • Automatisation (Selenium) des opérations métiers complexes nécessitant des interactions web par plusieurs étapes et des processus longs.
    • Logging via API / triggers BDD de suivi et reprise en cas d'échec
  • Tests de régression et performance (web scraping + algorithme récursif)
  • En vrac :
    • Redmine (setup+ init + process + intégration API)
    • Git master
    • Flux BDD + backup / restore + migration de données
    • Migration SSO
    • POC tests Behave
  • Environnement général : Python (logiciel, graphique et web), Django, PostgreSQL (dénormalisé), Pandas / Numpy, QGIS

Réalisation de projet personnel

Pause professionnelle
Novembre 2016 à décembre 2018
Besançon
France
  • Exploration professionnelle et projets indépendants :
    Au cours de cette période, j’ai consacré mon temps à des projets
    personnels, à des recherches, à des formations visant à développer mes
    compétences, à un accompagnement d’orientation professionnelle avec
    Activ’Projet et à l’exploration de diverses pistes professionnelles.
  • [POC sur 2 mois] Projet Data Lake (Big Data) / Data Warehouse dans un contexte de migration SI :
    • Analyse fonctionnelle et technique pour la migration des données issues de plusieurs sources hétérogènes vers un environnement Big Data
    • Rédaction du cahier des charges pour la mise en place d'un Data Lake sous l’écosystème Hortonworks (Hadoop open-source), permettant l’ingestion et le stockage de données brutes et semi-structurées dans HDFS
    • Pipelines de traitement des données via des workflows (coordination de jobs Sqoop, Hive, Pig, ...)
    • Optimisations avec Yarn et Tez
    • Tests de performance avec pyspark (Spark)
    • Export par des requêtes Hive ou pipeline de données brutes du Data Lake vers un Data Warehouse PostgreSQL
  • Création d'une base de contrôle d'intégrité des flux EDI :
    • Pipeline de contrôle de qualité de données pour valider l'intégrité des flux EDI, en croisant des données entre des reportings Excel et une base de données infocentre MSSQL dénormalisée
    • Fonctions PostgreSQL avec intégration de code Python pour plus de flexibilité sur le processus d'ETL entre plusieurs sources de données hétérogènes
    • Vues matérialisées dénormalisées (avec champs de type objet) pour de l'analyse
  • Réalisation d'un système d'EDI pour la mise à jour en masse de contrats :
    • Pipeline ETL de données en Python à partir de bases PostgreSQL, MSSQL, et de fichiers XML, permettant des mises à jour massives
    • Monitoring et logging des traitements avec suivi des statuts via une BDD (PostgreSQL avec champs JSON)
    • Gestion d'une file d'attente et traitement des flux en asynchrone via des Web services, assurant la scalabilité
  • Réalisation d'un système de dématérialisation :
    • Client RESTful en Python pour l'API d'Alfresco (GED), assurant l'intégration et la gestion des flux à travers des pipelines de traitement de documents pour la dématérialisation
  • Environnement général :
    • Python/Django, PostegreSQL (objets / types complexes) / MSSQL, VM Linux / Windows
    • Relation clients
  • Réalisation d’une application (C#/.NET) de formation avec système de sécurité par cryptographie (Python) :
    • C#, .NET, Python, cryptage RSA, Flash, AS 2
  • Réalisation d’une application web de gestion de projet basé sur MS PROJECT / GANTT PROJECT:
  • Développement d’une plateforme interne de gestion des postes informatiques pour maintenances
  • Synchronisation d’agendas en PHP avec Gmail et Outlook (Web Services REST API)
  • Développement/Maintenance/Déploiement de plateformes web modulaires
  • Intégration de l'agenda de l'office de tourisme de Vesoul sur la nouvelle version du site de Vesoul par flux CSV (Joomla/PHP5)
  • Environnement général :
    • PHP / Zend / Mootools
    • HTML / CSS / Javascript
  • Réalisation d’une application web collaboratif de gestion de création de tablatures (partitions musicales) multi-pistes format Guitar Pro (PHP / MySQL / Workbench)
  • Développement en PHP/MySQL de l’application, création d’une base de donnée et gestion de version par git
  • Utilisation de BaseCamp pour la gestion du projet