CV/Mission d'Ingénieur data lake freelance

Je dépose une mission gratuitement
Je dépose mon CV
Vous êtes freelance ?
Sécurisez votre activité grâce au portage salarial !

Exemple de missions de Slim,
Ingénieur data lake habitant le Val-de-Marne (94)

  • Cloud/ Big Data Ingénieur - Pyspark développeur– AWS -

    Projet 7 Dalma :
    Jan 2022 - aujourd'hui

    PROJET : Proposition d'une nouvelle architecture AWS qui permet la collecte, le traitement et l'automatisation de la génération
    de rapports financiers mensuels pour l'assureur de manière évolutive et générique en France et à l'international.
    Réalisations
    &#9642 Amélioration et proposition de nouvelles architectures AWS adaptées aux besoins de chaque projet.
    &#9642 Optimisation continue des coûts par la création d'un système de notifications en temps réel.
    &#9642 Gestion des accès aux ressources AWS pour l'équipe data - IAM
    &#9642 Optimisation et création de scripts à l'aide de pyspark (pour la préparation du big data)
    &#9642 Centraliser les requêtes SQL provenant de différentes sources de données et les transformer en DataPipelines pyspark
    automatisés.
    &#9642 Configuration et installation de composants AWS multi-cloud pour centraliser les données provenant de sources
    externes et les données provenant d'autres clouds (BigQuery)
    &#9642 Extraction automatique (OCR) et collecte de données non structurées à partir de fiches de soins avec AWS Textract
    &#9642 Développement et optimisation de DataPipeline avec GlueETL et GlueVisual
    &#9642 Création et automatisation de différents workflows avec un système de notifications sur Slack avec EventBridge
    &#9642 Optimisation du stockage de différentes tables et centralisation des données ainsi que l'exploitation des ressources
    AWS (combinaison d'ETL, format de stockage, sélection de variables)
    &#9642 Créer une documentation détaillée de tous les projets (sources de données, architectures et outils utilisés) via des
    diagrammes simplifiés et centralisés (draw.io)
    &#9642 Amélioration continue de la DataQuality des données sources ainsi que des rapports financiers générés.
    &#9642 Orchestration des données et création de sauvegardes continues sur les données sources et les rapports générés.
    &#9642 Suivi et configuration des événements sur CloudWatch
    &#9642 Détection d'anomalies dans les données sources et correction des tables via les fonctions lambda

    ENVIRONNEMENTS : AWS, lambda, Glue ETL , S3, Athena, dynamoDB, EventBridge, SageMaker, spark, python,Textract,SQL
  • Data Ingénieur/ Développeur PySpark-

    Projet 6 : Bouygues telecom -
    Jan 2021 - aujourd'hui

    PROJET : Création de socles et élaboration de dashboard (KPI) pour le suivi des projets (messages d’erreurs, équipements, box…)
    Réalisations
    Achievements
    &#9642 Préparation et connexions aux sources de données
    &#9642 Automatisation du nettoyage des sources de données
    &#9642 Optimisation des scripts spark existants
    &#9642 Proposition et partage de bonnes pratiques - Documentation
    &#9642 Création de bases de données (jupyter + pyspark (spark sql notamment))
    Création de DAGs et de fichiers de configuration (git)
    &#9642 Automatisation des jobs avec Airflow
    Visualization:
    &#9642 Création de tableaux de bord avec superset
    &#9642 Migration de tableaux de bord vers Tableau (serveur et bureau)

    ENVIRONNEMENTS : Jupyter, Python, PySpark , Tableau Software, Airflow , Superset
  • Data Ingénieur/Développeur PySpark

    Projet 5 : Schneider Electric -
    Jan 2019 - aujourd'hui

    PROJET : DataQuality, DataGouvernance, Machine Learning
    - Amélioration des procédures de collecte de données pour inclure des informations pertinentes pour la construction des
    systèmes analytiques
    - Détection d’anomalies dans les jeux de données Schneider
    - Amélioration de la qualité des données en utilisant des algorithmes de machine learning.
    - Optimisation et/ou création de pipelines spark pour gagner en performance
    - Utilisation de Glue AWS pour les jobs spark coûteux (en termes de volumétrie et consommation mémoire) -
    Vérification de l’intégration des données avec Athena.
    Réalisations :
    &#9642 Préparation des données
    - Création des connexions aux données stockées sous S3 amazon bucket (Redshift)
    - Transformation des données sous format parquet (optimisation des stockages via des partitions)
    - Préparation et exploration des données avec SageMaker (noyau Pyspark) sur AWS
    - Traitement, nettoyage et vérification de l'intégrité des données utilisées pour l'analyse
    - Effectuer des analyses ponctuelles et présenter les résultats en utilisant Tableau Software
    - Création de pipeline spark/python pour l’optimisation de certains processus (StringIndexer, OneHotEncoder,
    VectorAssember, Standardscaler…)
    - Intégration et installation de librairies externes (pyarrow, boto3…)
    &#9642 Machine Learning
    - Création de systèmes automatisés de détection des anomalies et suivi de ses performances
    - Sélection des variables en se basant sur des méthodes statistiques et le business
    - Elaboration de modèles pour la prédiction et la détection des anomalies (comparaison de performances des algorithmes
    pour la sélection du meilleur modèle)
    - Analyses des données non structurées et détection des similarités (fuzzywuzzy)

    Utilisation de certains concepts et techniques de NLP (TF-IDF, Bag of words , Cosine similarity, stopwords, Levenshtein
    Distance, stemming and lemmatization)
    - Création et test de plusieurs pipelines en utilisant (SoundIndex, Hash, NGam…)
    - Clustering (algorithme Isolation Forest) pour identifier et confirmer certaines anomalies dans la BD.

    ENVIRONNEMENTS : Python, PySpark, AWS, SparkMagic, Glue, S3, Athena, Lambda, Databricks,Tableau Software.
  • Data Ingénieur /Développeur PySpark-

    Projet 4 : Groupe Caisse de dépôts (ICDC) -
    Jan 2018 - aujourd'hui

    PROJET : Mettre à disposition un nouvel outil de requêtage et de décisionnel internalisé à la CDC couvrant les besoins existants
    des métiers sur l’ancienne solution INGRE qui est gérée et hébergée par les équipes de la Banque de France au sein du GIE
    Victoire Paiement. Cette solution aura pour but de répondre à de nouveaux besoins exprimés notamment en termes de DataViz
    avec une 360 de l’ensemble des opérations financières en réception et à destination de la Place en utilisant des technologies de
    Big Data.
    Réalisations :
    &#9642 Gestion de projet
    - Test de solutions techniques et comparaison de performance à travers des ateliers
    - Proposition de pistes d’améliorations en travaillant avec le socle Big Data
    - Elaboration de workshops et formation en interne pour les transferts et montés en compétences
    - Suivi et découpage des tâches techniques en suivant la méthode agile (Confluence, Godzilla, trello)
    - Proposition d’activités de team building
    &#9642 Optimisation d’un script existant
    - Redéfinition des structures utilisées (les schémas)
    - Utilisation des transformations RDD/DF et inversement
    - Vectorisation de tout le script (enlever les while, boucles…)
    - Utilisation des actions et transformations spark (map, reduce…)
    - Parallélisation de tous les objets utilisés
    - Utilisation du mode cluster pour distribuer les calculs
    - Optimisation de la consommation de la mémoire
    - Utilisation de databricks pour le traitement des XML
    &#9642 Configuration de la connexion aux fichiers HDFS sur le DataLake
    - Gestion des droits d’accès
    - Récupération des flux de données
    - Importation et stockage des fichiers qui contiennent les opérations bancaires sur le DataLake
    &#9642 Développement Spark (Intégration de 18 types d’opérations)
    - Traitement et préparation des données massives
    - Récupération des champs en utilisant les udfs (RIB, IBAN, adresse…)
    - Configuration des paramètres de lancement (nombre de clusters, d’exécuteurs, mémoire…
    - Elaboration d’un script d’anonymisation des données sensibles
    - Ingestion des données dans des tables HIVE ORC
    - Lancement des job Spark avec spark-submit en mode client et cluster
    - Test de performances
    &#9642 Elaboration de dashboards
    - Recherche Unitaire sur les opérations
    - Visualisation des flux des opérations émises et reçus et statistique descriptive
    &#9642 Mise en production
    - Contribution dans les recettes MOA et MOE
    - Support et travail avec le socle BIG DATA pour la mise en production
    - Elaboration des tests techniques et métiers et optimisation

    ENVIRONNEMENTS: Python, PySpark, databricks, HIVE, ORC, Hortonworks, Talend Open Studio BD, Tableau
  • Chef de Projet/ Team Leader Data Scientist

    Projet 3 : Bouygues Construction-
    Jan 2018 - aujourd'hui

    Réalisations :
    &#9642 Chef de projet et team leader Data
    - Rencontre des différents clients et compréhension des besoins
    - Proposition de solutions innovantes en se basant sur la compréhension du métier
    - Choix des techniques et algorithmes nécessaires pour résoudre les problèmes
    - Intervention et coaching en interne…
    - Suivi, estimation et découpage des tâches en...

  • ESN Data ingénieur et référent technique-

    Adservio Lyon -
    aujourd'hui

    &#9679 Responsabilités managériales en tant que référent technique:
    &#9642 Pass technical interviews and selection of data profiles
    &#9642 Supervise and follow the development of the employees of my internal team
    &#9642 Look for new collaborators to grow the team Work in close collaboration with the training division to develop
    the activity Analyze the data division, its profitability and its development
    &#9642 Support sales representatives in pre-sales Technical responsibilities
    &#9642 Set up a training program on several cutting-edge technologies to improve the skills of consultants with
    sharing of best practices
    &#9642 Contribute to the integration of consultants under the best conditions
    &#9642 Organize and offer events, workshops ...
    &#9642 Be a source of proposals to sales and training centers and develop its activities
    &#9642 R&D projects
    &#9642 Project management
    &#9642 Definitions of needs and distribution of tasks (Agility)
    &#9642 Evaluation of technical solutions

Voir le profil complet de ce freelance

Profils similaires parfois recherchés

CV Ingénieur data lake, Missions Ingénieur data lake, Ingénieur data lake freelance

Les nouvelles missions d'Ingénieur data lake

DATA ENGINEER CONFIRMÉ / SENIOR

Data Asset Management Azure
ASAP
Télétravail
6 mois
Voir la mission

Data Ingénieur/ DevOps AWS

CI/CD Airflow Data Lake ETL Git
ASAP
78 - Plaisir
A définir
Voir la mission

Développeur React Native Databricks

React Native Apache Spark SQL DevOps
ASAP
92 - Chatillon
6 mois
Voir la mission

Data Platform Enablement Engineer

SQL Data Python BigQuery
ASAP
75 - PARIS
365 jours ouvrés
Voir la mission

Data ingénieur/Architecte Data

Databricks Power BI
ASAP
93 - SAINT-DENIS
12 mois
Voir la mission

Développeur Java Spark Scala

Java Scala Apache Spark Adobe Spark
ASAP
75 - PARIS
12 mois
Voir la mission

Ingénieur DBA confirmé

Oracle POSTGRES PostgreSQL HashiCorp Terraform Ansible
ASAP
92 - PUTEAUX
35 mois
Voir la mission

Ingénieur DBA / DevOps (Cloud AWS)

Oracle POSTGRES HashiCorp Terraform DevOps CI/CD
ASAP
92 - PUTEAUX
36 mois
Voir la mission

Developpeur Salesforce Marketing Cloud 3-7 ans d'experience

Jira Confluence Salesforce Marketing Cloud
ASAP
44 - NANTES
6 mois
Voir la mission

Consultant FinOps Cloud

OpenStack Red Hat OpenShift Python Cloud AWS Data Lake
ASAP
75 - Paris
3 mois
Voir la mission
Je trouve ma mission

Les derniers CV d'Ingénieur data lake disponibles

CV Business Analyst SQL
Myriam

Business Analyst SQL

  • SAINT-PATHUS
SQL Xray Agile Maîtrise d'ouvrage Jira MOA (Maîtrise d'ouvrage) SWIFT XML KTP Agile XP
CV Développeur Python | Backend (Django, FastAPI)
Zeliang

Développeur Python | Backend (Django, FastAPI)

  • BONDOUFLE
Python SQL CI/CD Cloud AWS Kubernetes MongoDB
CV Chef de projet Senior
Patrice

Chef de projet Senior

  • VINCENNES
MS Project Automate PMI PMP Agile SCADA Visual Studio Jira IoT Cybersécurité
CV Data Engineer Snowflake
E.

Data Engineer Snowflake

  • PARIS
SQL Cognos TM1 Data Snowflake
CV Solution Architect
Ali

Solution Architect

  • NANTERRE
Oracle Java API RESTful
CV Ingénieur Logiciel .NET & AZURE
Guy

Ingénieur Logiciel .NET & AZURE

  • Deuil-LA-BARRE
.NET ASP.NET MVC Azure SQL Server JavaScript Agile Entity Framework DevOps Angular HashiCorp Terraform
CV Expert Talend/Architecte Middleware
Quynh Mai, Amandine

Expert Talend/Architecte Middleware

  • CHEVILLY-LARUE
Talend Data SQL Webservices API RESTful Java Salesforce
CV Data Engineer SQL
Dimitri

Data Engineer SQL

  • LILLE
SQL Google Cloud Platform HashiCorp Terraform BigQuery Data Microsoft Power BI
CV Ingénieur de développement JAVA/Python
Massinissa

Ingénieur de développement JAVA/Python

  • PALAISEAU
Java SQL Spring Boot Python TypeScript Angular DevOps Microservices Vue.js HashiCorp Terraform
CV Business Analyst - Product Owner - Chef de Projet
Adel

Business Analyst - Product Owner - Chef de Projet

  • Bonneuil sur Marne
Pega Jira UML Scrum SAFe SQL Confluence Swagger Postman Java
Je trouve mon freelance