Expertise en Data Science avec une thèse de doctorat axée sur les algorithmes de Machine Learning. -Compétences approfondies dans le choix et l'adaptation d'algorithmes de Machine Learning en fonction des besoins spécifiques du secteur d'activité. -Expérience significative dans l'industrialisation de projets de Data Science, avec une expertise dans le développement et le déploiement de packages en production. -Engagement soutenu envers l'excellence, illustré par une approche méthodique dans la conception, l'implémentation et l'optimisation réussies de solutions innovantes en Data Science.
Conception et optimisation d'un modèle de détection de fraudes pour renforcer la sécurité des paiements sur Leboncoin:
Utilisation de PySpark pour l'analyse de données et développement de modèles ML robustes avec LightGBM et XGBoost.
Création de pipelines ML automatisés avec MLFlow et Airflow.
Collaboration avec l'équipe de paiement pour l'intégration des solutions de détection de fraude.
Amélioration du modèle de détection de fraudes des comptes utilisateurs en générant des scores qui seront soumis à une modération manuelle pour les scores les plus élevés.
Développement d'un algorithme NLP pour détecter les annonces semi-dupliquées basées sur le titre, visant à améliorer la qualité des KPIs de dépôts d'annonces et à éviter les doublons.
Outils : Text embedding, universal-sentence-encoder-multilingual, cosine_similarity, NLTK, TensorflowHub, Pyspark
Optimisation des campagnes publicitaires par segmentation d'audience par marché pour affiner et personnaliser le ciblage.
Outils : Pyspark, Pandas, Scikit-Learn, Airflow
Identification des messages de sollicitation commerciale envoyés par les utilisateurs sur le site grâce bi-grammes et tri-grammes de mots clés, obtenus par le traitement en masse des messages commerciaux.
Identification des messages de sollicitation commerciale par analyse de bi-grammes et tri-grammes de mots clés à partir du traitement en masse des messages commerciaux.
Optimisation du projet de "trending topics" CRM pour identifier et promouvoir les mots clés tendances sur Leboncoin, en utilisant le machine learning pour l'agrégation de mots-clés, l'analyse de séries temporelles et l'estimation des prix des articles.
Optimisation des campagnes publicitaires en RTB (Real Time Bidding) grâce au traitement de vastes ensembles de données.
Collaborer étroitement avec les experts métier pour identifier et automatiser les défis opérationnels via des modèles.
Développer une solution de "Retargeting Algorithmique" alimentée par le Machine Learning : anticiper les intentions d'achat des visiteurs précédents pour maximiser l'efficacité des campagnes de ciblage.
Concevoir une stratégie de "Prospection de nouveaux internautes" basée sur le Machine Learning : établir un score de conversion pour chaque emplacement publicitaire selon le type de campagne, le secteur d'activité et le budget.
Mettre en œuvre une stratégie d'Optimisation du funnel: élaborer de nouveaux segments de funnel de conversion par une analyse descriptive sémantique
Outils :
Mllib, ML de Spark (Régression Logistique, Arbre de Décision, Random Forest, PCA, ...) PySpark, scikit-learn (DBScan, Kmeans, ...) Google Cloud Platform, plateforme Appnexus.
Identifier les problématiques liées à la qualité de données dans le processus d’intégration de données hétérogènes
Développement en collaboration avec un doctorant chez Talend, des algorithmes pour améliorer la qualité des données et nettoyer automatiquement les bases de données, en se concentrant sur la suppression des semi-doublons.
Outils : NetBeans (Java), Oracle 10G, sérialisation XML, performance des algorithmes de similarités (levenshtein, jaccard)