Disponible immédiatement · Paris

Senior Data Engineer & Architecte Cloud

Je bâtis des plateformes data scalables.

Architecte Lakehouse Databricks et AWS Certified Solutions Architect, basée à Paris. Je transforme des événements bruts en données gouvernées, fiables et prêtes pour l'analyse, sur Databricks et AWS.

  • PlateformeDatabricks · Delta Lake · Unity Catalog
  • CloudAWS Certified Solutions Architect – Associate
  • MoteurApache Spark · PySpark · Python · SQL
Architecture médaillon du Lakehouse Trois couches Delta Lake empilées, Bronze, Silver et Gold, avec la donnée qui remonte des sources brutes vers la BI et l'analytics. BRONZE brute · immuable · rejouable SILVER nettoyée · conformée GOLD métier · servie à la BI BI & ANALYTICS tableaux de bord · SQL · décisions SOURCES BRUTES événements · fichiers · zone S3
  • Databricks
  • Apache Spark
  • PySpark
  • Delta Lake
  • Unity Catalog
  • AWS
  • Amazon S3
  • Amazon Kinesis
  • AWS Lambda
  • DynamoDB
  • AWS Glue
  • Amazon EC2
  • RDS PostgreSQL
  • CloudFormation
  • CloudWatch
  • Python
  • SQL
  • Power BI
  • Tableau

01 — Profil

Ingénieure de formation, architecte par la pratique.

Ingénieure Data, IA & Cloud, avec une solide expérience dans la conception de pipelines de données, les architectures Cloud AWS et le développement de solutions analytiques. Ma boîte à outils : Python, SQL, PySpark, Databricks et l'architecture Lakehouse.

Curieuse, rigoureuse et orientée résultats, je conçois des solutions performantes, sécurisées et évolutives, qui répondent aux enjeux métiers. Des données terrain d'un exploitant autoroutier à une plateforme d'événements temps réel et un Lakehouse gouverné, la constante est la même : des données auxquelles on peut faire confiance.

Portrait de Soukaina Errouani
Soukaina Errouani · Paris
Basée à
Paris, France
Disponibilité
Immédiate
Certifiée
AWS Solutions Architect – Associate
Formation
Master Data Analytics, ENSAE Paris
Master Systèmes de communication & électronique embarquée, ENSA Tanger
Langues
Arabe (natif) · Français (natif) · Anglais (professionnel)
Nationalité
Marocaine / Française
Hors travail
Recherche GenAI & LLM · Blockchain · Escalade & fitness · Voyages

02 — Expérience

Des pipelines aux plateformes.

Quatre postes, une trajectoire : chaque plateforme plus distribuée, plus gouvernée et plus temps réel que la précédente.

  1. 04 Fév. 2025 — Aujourd'hui HabitPilot.io En poste

    Data Architect / Data Engineer Databricks

    • Participation à la conception d'une architecture Lakehouse sur AWS avec Databricks et Amazon S3.
    • Développement de pipelines d'ingestion et de transformation avec Python et PySpark.
    • Mise en œuvre de Delta Lake et de l'architecture médaillon Bronze / Silver / Gold.
    • Gouvernance des données avec Unity Catalog : catalogs, schémas, tables et contrôle d'accès.
    • Optimisation et industrialisation des traitements Data Engineering.
    • Exposition des données curées vers les outils de BI et d'analytics.
    • Databricks
    • Delta Lake
    • Unity Catalog
    • PySpark
    • Amazon S3
    • Python
  2. 03 Sept. 2024 — Fév. 2025 HabitPilot.io

    Data Architect AWS / Senior Data Engineer

    • Conception d'un pipeline de données temps réel basé sur Amazon Kinesis et AWS Lambda.
    • Développement des traitements d'ingestion et de transformation des événements avec Python.
    • Stockage temps réel dans DynamoDB et archivage des données dans Amazon S3.
    • Mise en place du monitoring et des alertes avec Amazon CloudWatch.
    • Participation aux choix d'architecture liés à la scalabilité et au traitement des flux.
    • Amélioration du suivi opérationnel et de la détection d'anomalies.
    • Amazon Kinesis
    • AWS Lambda
    • DynamoDB
    • Amazon S3
    • CloudWatch
    • Python
  3. 02 Mai 2024 — Sept. 2024 SmartMan Labs

    AWS Cloud Architect / Data Engineer

    • Participation à la conception d'une architecture de traitement Big Data distribuée sur Amazon EC2.
    • Développement de traitements ETL avec PySpark sur des données volumineuses.
    • Ingestion des données depuis Amazon S3 et traitement des fichiers CSV et JSON.
    • Optimisation des traitements Spark via le partitionnement et les transformations distribuées.
    • Chargement des données transformées dans Amazon RDS PostgreSQL.
    • Automatisation du déploiement et supervision avec CloudFormation et CloudWatch.
    • PySpark
    • Amazon EC2
    • Amazon S3
    • RDS PostgreSQL
    • CloudFormation
    • CloudWatch
  4. 01 Janv. 2023 — Avr. 2024 SANEF

    Data Engineer

    • Clôtures autoroutes — audit, nettoyage, analyse et exploration avec Python, monitoring sur carte.
    • Dossier technique amiante — nettoyage, analyse, optimisation et exploration avec Python et Power Query.
    • Indicateurs de suivi — collecte, nettoyage et analyse prédictive avec Python.
    • Indicateurs des aires de repos — construction d'un pipeline de données complet (collecte → nettoyage → reporting) pour le suivi des concessionnaires et des installations, KPIs exposés via Power BI.
    • Python
    • Power BI
    • Power Query
    • Analyse prédictive
    • Monitoring géospatial

03 — Blueprints

Les plateformes que j'ai construites, dessinées telles que je les ai construites.

Trois architectures issues de trois missions réelles. Survolez ou touchez un composant pour voir ce qu'il fait et pourquoi il est là.

Interactif — survol, toucher ou clavierFaites défiler · touchez un composant

Composant Sélectionnez un composant

Chaque nœud de ce schéma correspond à un travail décrit dans mon expérience. Survolez ou sélectionnez-en un pour lire son rôle.

Décisions clés

    04 — Expertise

    Une stack data moderne, de bout en bout.

    Les outils avec lesquels j'emmène la donnée de la source à la décision, et la profondeur que j'apporte à chacun.

    Databricks & Lakehouse

    Architecture Lakehouse sur AWS avec Databricks et S3. Tables Delta Lake organisées en couches Bronze, Silver et Gold. Notebooks, ingestion et transformations industrialisés pour la production.

    • Databricks
    • Delta Lake
    • Architecture médaillon
    • Notebooks

    Apache Spark & PySpark

    Traitement et transformation distribués à grande échelle. Stratégies de partitionnement et transformations distribuées adaptées à la forme des données.

    • Spark
    • PySpark
    • Partitionnement
    • ETL

    Gouvernance des données

    Unity Catalog comme plan de contrôle : catalogs, schémas, tables et accès modélisés explicitement pour que les bonnes personnes voient les bonnes données.

    • Unity Catalog
    • Contrôle d'accès
    • Schémas

    Architecture Cloud AWS

    Certifiée Solutions Architect – Associate. Je conçois des plateformes data avec les briques AWS adaptées à la charge : stockage objet, streaming, calcul serverless, bases managées et infrastructure as code.

    • S3
    • Kinesis
    • Lambda
    • DynamoDB
    • Glue
    • EC2
    • RDS PostgreSQL
    • CloudFormation
    • CloudWatch

    Python & SQL avancé

    Développement ETL, requêtes complexes, optimisation et modélisation. Les deux langages derrière chaque pipeline que j'ai livré.

    • Python
    • SQL
    • Modélisation
    • Optimisation

    Bases de données

    Stockages relationnels et NoSQL choisis selon le mode d'accès : PostgreSQL et SQL Server pour l'analytique, DynamoDB pour les lectures temps réel.

    • PostgreSQL
    • SQL Server
    • DynamoDB

    BI & Delivery

    Une donnée n'est utile que lorsqu'elle est vue. Tableaux de bord Power BI et Tableau, livrés en équipe Agile / Scrum avec Git et Jira.

    • Power BI · DAX
    • Power Query
    • Tableau
    • Git
    • Jira
    • Agile / Scrum

    05 — Ma méthode

    Des principes qui survivent à la production.

    1. 01

      Étager par confiance.

      Bronze conserve la vérité brute, Silver nettoie et conforme, Gold sert le métier. Chaque table porte un niveau de confiance connu, et tout problème peut être rejoué depuis la source.

    2. 02

      Gouverner dès le premier jour.

      Catalogs, schémas, tables et accès sont modélisés dans Unity Catalog avant le premier tableau de bord, pas après le premier incident.

    3. 03

      Automatiser la plateforme.

      Une infrastructure décrite dans CloudFormation, des déploiements identiques à chaque fois, des environnements qu'on reconstruit plutôt qu'on ne répare.

    4. 04

      Tout observer.

      Métriques CloudWatch, alertes et détection d'anomalies font partie de la conception du pipeline : un incident est vu par la plateforme avant d'être ressenti par le métier.

    06 — Certifications & diplômes

    Certifiée sur le cloud, formée sur la plateforme.

    2025

    Formation Databricks Platform Architecture

    Databricks

    2022

    Master en Data Analytics

    ENSAE Paris — spécialisation Data Science et Data Analytics

    2020

    Master en Systèmes de communication & électronique embarquée

    ENSA Tanger — enseignements avancés en systèmes de communication et électronique embarquée

    07 — Contact

    Construisons quelque chose qui dure.

    Ouverte aux postes et missions Data Engineering, Databricks et plateformes AWS. Basée à Paris, disponible immédiatement.