Hamza Ben Marzouk

Hamza Ben Marzouk

Data & AI Engineer · Paris

English

À propos

Data & AI Engineer avec plus de 7 ans d'expérience, dont 5 en cabinet de conseil (OCTO Technology), dans des environnements exigeants : banque, assurance, énergie, médias, cloud. Je conçois et fiabilise des plateformes data (Snowflake, dbt, Databricks, Spark) et je mets l'IA en production : agents, évaluation de LLM, adoption par les équipes métier. Je fais le lien entre métier et technique, je fais monter les équipes en compétence et je laisse derrière moi des systèmes documentés, testés et maintenables.

Ce que je propose

Expérience

Wakam

févr. 2024 – Aujourd'hui

Data Platform Engineer

Retour sur la Data Platform pour industrialiser la sécurité, la gouvernance et la fiabilité de la plateforme.

  • Conception d'un système GitOps d'accès temporaires à Snowflake : demande par pull request, validation, révocation automatique et journal d'audit, y compris pour les données sensibles (RGPD)
  • Passage de la configuration Snowflake en infrastructure as code (Terraform) : politiques réseau, warehouses, comptes de service, tâches de sécurité ; traitement des recommandations du benchmark CIS
  • Mise en place d'un miroir de données réglementaire (résidence des données UK) vers Azure Blob Storage, avec contrôle d'intégrité quotidien indépendant
  • Fiabilisation de l'orchestration Prefect : isolation dev/prod, supervision des runs en retard, alerting Slack
  • Migration de la CI/CD d'Azure DevOps vers GitHub Actions, environnements de recette éphémères par pull request, quality gate SonarCloud, migration Python 3.13 / uv
  • Outillage agentique pour l'équipe : skills Claude Code automatisant PR, tickets, diagnostics et opérations courantes

Stack : Snowflake · Terraform · Prefect · dbt · Azure · GitHub Actions · Python · Claude Code

AI Engineer — équipe KamAI

Développement et déploiement de solutions d'IA, avec un double objectif : industrialiser l'évaluation des agents IA et maximiser l'adoption des outils IA par les collaborateurs.

  • Conception et déploiement d'un système d'évaluation de bout en bout pour les agents IA à fort impact métier
  • Pipeline de génération automatique de jeux d'évaluation synthétiques, validés par les experts métier dans une application Retool
  • Pipelines d'évaluation automatique avec suivi centralisé des résultats sur Langfuse
  • Mise en production d'un chatbot conversationnel sur wakam.com pour les assurés (workflows agentiques Dify)
  • Pilotage de l'adoption de la plateforme Dust ; hackathons bimensuels (satisfaction moyenne ≥ 4/5) et accompagnement des métiers sur des cas d'usage à forte valeur

Stack : Dust · Dify · Langfuse · Retool · LLMs · Python

Data Engineer — Data Platform

Deux périmètres stratégiques, PDX (Partner Data eXchange) et DPF (Data Platform Foundation), pour garantir la fiabilité, la scalabilité et l'exploitabilité de la plateforme data.

  • Référent technique data contracts : montée en autonomie de 3 équipes partenaires dans la définition et l'application des standards
  • Mise en production d'une chaîne de bout en bout fiabilisée (échange partenaires → Snowflake), avec documentation, transfert de compétences et processus formalisés
  • Optimisation du run mensuel : 50 % des demandes de support data traitées en self-service
  • Observabilité complète via Datadog (alerting, dashboards) ; refonte du framework data quality et intégration d'Elementary
  • Conception de pipelines ETL / reverse ETL et restructuration par domaine du code dbt ; réduction significative des incidents data

Stack : Snowflake · dbt · dlt · Databricks · Elementary · Datadog · Python

OCTO Technology

févr. 2019 – janv. 2024

Consultant — missions client

Scaleway — Consultant Data Ops

Lancement du premier produit data de Scaleway : une offre de Spark managé (Spark as a Service).

  • Validation des prérequis techniques : scalabilité, connectivité, résilience
  • Implémentation et validation des premiers cas d'usage (POC)

Stack : Apache Spark · Spark as a Service · POC

Mobilize Financial Services (groupe Renault) — Développeur Backend

Création de la néobanque Mobilize Pay, avec Accenture : développement et mise en production de l'application bancaire mobile.

  • Implémentation des fonctionnalités bancaires (architecture en couches inspirée de la clean architecture)
  • Garant des bonnes pratiques de développement et de l'amélioration continue de l'équipe

Stack : GCP · Java · Spring Boot · Flutter · PostgreSQL · GitLab CI

RelevanC — Data Engineer

Refonte du data lake (optimisation et remise à niveau).

  • Pipelines PySpark de nettoyage et de traitement des données ; chaîne CI/CD et infrastructure as code
  • Montée en compétence de l'équipe : pair et mob programming, revues de code

Stack : GCP · BigQuery · Apache Spark · Airflow · Dataproc · Terraform

SACEM — Tech Lead

Brique de réconciliation automatique des mises à jour de contrats de droits envoyées par les éditeurs musicaux.

  • Conception des flux d'ingestion, d'enrichissement et d'application des règles métier, et des métriques de suivi
  • Leadership technique : animation de l'équipe, pair programming, revues de code, design d'architecture avec les architectes

Stack : AWS · Java · Python · PostgreSQL · Lambda · ECS · Terraform

Engie Digital — Développeur Backend

Plateforme smart city Livin' : qualité de l'air en temps réel, éclairage public, trafic.

  • Conception et développement de fonctionnalités produit, expertise data sur l'ingestion et le traitement
  • Acculturation DevOps et mise en œuvre des pratiques Accelerate ; ateliers d'event storming

Stack : AWS · Java · Spring Boot · PostgreSQL · MongoDB · Apache Spark · CQRS

BNP Paribas BDDF — Data Engineer

Refonte des pipelines de traitement des dossiers clients : migration d'un mainframe DB2 vers une stack Big Data.

  • Jobs Spark d'agrégation et de transformation, orchestrés avec Oozie
  • Mise en place et maintenance de la chaîne CI/CD

Stack : Scala · Apache Spark · HDFS · Hive · Oozie · Jenkins

Missions de conseil

Compétences

Data engineering
Snowflake dbt dlt Databricks Apache Spark Delta Lake Kafka BigQuery Airflow Prefect
Data quality & observabilité
Elementary Datadog Data contracts Alerting
IA & LLMs
Agents IA Évaluation de LLM Datasets synthétiques Dust Dify Langfuse Retool Claude Code
Cloud & infrastructure
AWS Azure GCP Terraform GitHub Actions GitLab CI Docker
Langages
Python SQL Java Scala
Architecture & pratiques
Data Mesh Modélisation Clean Architecture Software Craftsmanship Accelerate Agile

Formation

  • Master 2, Intelligence Artificielle, Systèmes, Données
    Université Paris Dauphine · sept. 2017 – sept. 2018
  • Diplôme d'ingénieur, Réseaux informatiques & télécommunications
    INSAT, Tunis · sept. 2012 – sept. 2017

Certifications

  • Databricks Certified Data Engineer Associate (vérifier)
  • Databricks Certified Associate Developer for Apache Spark 3.0 (vérifier)
  • Databricks Partner Training — Solutions Architect Essentials (vérifier)
  • AWS Certified Solutions Architect — Associate

Langues

  • Français — Bilingue
  • Anglais — Professionnel

R&D & conférences

  • Architectures frugales · Grille d'analyse des architectures logicielles sous l'angle de l'empreinte carbone, avec des recommandations activables.
  • Cache CPU · Tech talk : cache lines, localité spatiale et temporelle, cohérence de cache.
  • Plateforme Databricks · Exploration approfondie de l'écosystème Databricks et diffusion des connaissances en interne.

Centres d'intérêt

Contact

Le plus simple pour me joindre est par email. [email protected]