Votre navigateur est obsolète !

Pour une expériencenet et une sécurité optimale, mettez à jour votre navigateur. Mettre à jour maintenant

×

Vincent MARIN

Vincent MARIN

Data Engineer

Data Science
Big data
Finance
data mining
Machine Learning
35 ans
Permis de conduire
Paris (75019) France
En poste Indisponible
Ayant poursuivi une formation en économie et en finance, j'ai gardé de ces disciplines un attrait pour l'étude statistique et la découverte de phénomènes contre-intuitifs. De l’extraction des données à la mise en place des algorithmes de traitement en passant par l’analyse et les différentes méthodes de représentation graphique, je maîtrise l’ensemble des étapes de la data science. Pour ce faire j’utilise les langages R, Python et Scala, le framework Apache Spark sur des bases de données relationnelles.
CV réalisé sur DoYouBuzz
  • Formation DevOps / Container / Cloud
En savoir +
  • SYNCHRONE : Présentation en temps réel de la consommation et de la production d'électricité d'un territoire à destination des collectivités territoriales.

    • Mise en service de nouveaux territoires
    • Optimisation des traitements Spark
    • Debug et refactorisation du code
    • Ajout de nouvelles fonctionnalités liées à des problématiques métier (ex: cogénération)
    • Scraping automatisé de bases de données météo
    • Refonte de l'ordonnancement des traitements
    • Création d'un script de rejeu "From Scratch"
    • Établissement de tables de recette pour valider ou non les données en sortie
    • Mise en place des bonnes pratiques (branching, code review, convention de nommage ...)
    • Amélioration des processus Scrum

    Environnement technique : Hadoop, Spark, Hive, Scoop, Control-M, RedHat, Python
  • 1/ NEST (novembre 2018 - décembre 2018) : mise en place d'un dashboard à destination des commerciaux du réseau Renault
    • Constitution d'un modèle de données
    • Modélisation en étoile
    • Ingestion des données sur une platforme Hadoop puis Google Cloud

    2/ FT&T (juin 2018 – novembre 2018) : ingestion en temps réel des données produites par des outils-machine
    •Développement d’ingestions avec Spark Streaming sur Google Cloud

    3/ UBM (juin 2018 – aout 2018) : étude du comportement des automobilistes pour leur proposer un contrat d'entretien adapté
    • Nettoyage des données en provenance d'un capteur embarqué
    • Ingestion des données sur une platforme Hadoop et Google Cloud.
    • Portage d'un programme pour déterminer si la conduite d'un automobiliste est sollicitante ou non.

    4/ DataLake (mai 2018 – décembre 2018) : platforme Hadoop/Hortonworks de stockage des données de Renault
    • Ingestion des sources de données internes
    • Amélioration des procédés SCRUM
  • Projet OpenData

    Extraction, traitement et exposition des données de l’OpenData.
    Production de KPI à destination des commerciaux.

    • Installation et paramétrage d’un cluster Hadoop, distribution Cloudera
    • Scraping des bases de données SIRENE, OpenStreetMap, Banque de France et Insee.
    • Géocoding des entreprises françaises (Addok)
    • Création d’indicateurs à destination du métier via Spark
    • Présentation des résultats dans des tables Hive
    • Automatisation des traitements à l’aide d’Oozie

    Environnement technique : Hadoop, Cloudera (Hue), Python (geopandas), Scala, Spark, Hive, Oozie
  • Projet interne : étudier les sources de données issus de l'OpenData et croisement de ces sources

    • Identification de nouvelles sources de données de contextualisation
    • Web Scrapping
    • Géocodage
    • Normalisation et agrégation des donnée
    • Construction de KPIs à valeur ajoutée
  • Engie Pro – Porte à porte : application tablette pour cibler les prospects en fonction de leur appétence pour un contrat particulier.

    • Optimisation du modèle de Machine Learning
    • Amélioration des performances des jobs Spark
    • Correction d’anomalies suite à la recette

[MOOC] Neural Networks and Deep Learning

DeepLearning.ai | Coursera

Depuis 2018
• Introduction à Numpy
• Classification binaire d’images
• Mise en place d’une forward et d’une backpropagation
• Réglage des Hyperparamètres (régularisation, gradient checking, mini-batch gradient descent)

[MOOC] Data Science

Université Johns-Hopkins | Coursera

Juillet 2016 à novembre 2016
-R Programming
-Getting and Cleaning Data
-Exploratory Data Analysis
-Regression Models
-Practical Machine Learning

• Importation et traitement de documents XML, JSON et HDF5
• Maîtrise des techniques de data vizualisation, via les bibliothèques lattice et ggplot2
• Méthodes de partitionnement des données (k-means, hierarchical clustering)
• Méthodes de modélisation et d'apprentissages automatiques à l'aide de caret tels que les arbres décisionnels ou les régressions multiples : https://www.docdroid.net/7qCIeVB/regression-models-course-project.pdf.html
https://vincentm000.github.io/

Certificats vérifiés ci-dessous :
En savoir +

[MOOC] Functional Programming Principles in Scala

Ecole Polytechnique de Lausanne | Coursera

Novembre 2016 à décembre 2016
• Functions & Evaluation
• Higher Order Functions
• Types and Pattern Matching
• Lists and Collections

[MOOC] Python for Everybody

Université du Michigan | Coursera

Mars 2016 à septembre 2016
-Programming for Everybody (Getting Started with Python)
-Using Python to Access Web Data
-Python Data Structure

• Initiation au langage Python
• BeautifulSoup xml.etree.ElementTree WebScrapping
• Berkeley Sockets Interface
• RegEx et Text Mining

Certificats vérifiés ci-dessous :
En savoir +

[MOOC] Distributed Machine Learning with Apache Spark

BerkeleyX

Juillet 2016 à septembre 2016
  • Introduction to Apache Spark
  • Big Data Analysis with Apache Spark
  • Distributed Machine Learning with Apache Spark

Initiation à Apache Spark via la plaforme Databricks :
https://github.com/VincentM000/Data-Science-and-Engineering-with-Spark

Certificats vérifiés ci-dessous :
En savoir +

Master I Finance de Marché

Université Paris Ouest Nanterre La Défense

Septembre 2014 à mai 2016
-Calcul actuariel
-Étude et pricing des produits dérivés (options, swap, future/forward)
-Méthodes de gestion de portefeuille (Markowitz, Black&Scholes)

Service civique

Nanterre 92 RL

Septembre 2013 à mai 2014
  • Initiation au rugby à treize auprès d'élèves d'écoles primaires
  • Organisation d'un tournoi inter-écoles de fin d'année
  • Recherche de sponsors
  • Développement de l'école de rugby du club
  • Recrutement auprès de toutes les catégories d'âge

Licence Monnaie Banque Finance

Université Paris Ouest Nanterre La Défense

Septembre 2008 à mai 2013
-Initiation à R et SAS
-Économétrie (séries temporelles et données de panel)
-Macroéconomie
-Microéconomie
-Histoire économique
  • Scala
  • Python
  • R
  • SQL (PostgreSQL, MySQL)
  • Hadoop
  • Apache Spark
  • Apache Hive
  • Impala
  • Zeppelin
  • Oozie
  • Control-M
  • Ansible
  • Terraform
  • NLP
  • Méthodes supervisées
  • Méthodes non supervisées
  • Modèles de régression
  • Séries temporelles
  • Deep Learning
  • Méthodologie Scrum (certifié)
  • Trello
  • Redmine
  • Confluence
  • Jira
  • Unix
  • Cloudera
  • Hortonworks
  • Google Cloud Platform
  • Gitlab
  • Anglais (C1)
  • Espagnol (scolaire)
  • Mandarin (A2)
  • Rugby à XIII
  • Fitness
  • Running