
- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Apache Iceberg
Qu'est-ce qu'Apache Iceberg ?
Apache Iceberg est un format de table open source conçu pour les grands data lakes. Il permet une gestion fiable, performante et évolutive des données, en assurant la compatibilité avec de nombreux moteurs de traitement comme Apache Spark, Trino, Flink ou Dremio. Grâce à sa structure innovante et sa gestion des métadonnées, Iceberg répond aux problématiques de versioning, de partitionnement évolutif et de time travel.
Pourquoi suivre une formation Apache Iceberg ?
Avec l’explosion des volumes de données, les architectures data lake classiques atteignent leurs limites. Apache Iceberg permet de structurer et d’optimiser les accès aux données en assurant la conformité ACID, une gestion fine des partitions et une gouvernance robuste. Suivre cette formation Apache Iceberg vous permettra de concevoir et d’implémenter des solutions performantes de data lakehouse, interopérables avec vos outils de traitement distribués. C’est un véritable levier pour moderniser vos infrastructures et maîtriser le cycle de vie des données à grande échelle.

Objectifs pédagogiques
Objectifs pédagogiques :
À l'issue de cette formation Apache Iceberg, vous aurez acquis les connaissances et compétences nécessaires pour :
- Comprendre les principes fondamentaux d’Apache Iceberg et son architecture
- Créer, manipuler et versionner des tables Iceberg avec différents moteurs
- Optimiser les performances des requêtes et des traitements de données
- Intégrer Iceberg avec Spark, Dremio, Trino ou AWS Glue
- Appliquer les meilleures pratiques de gouvernance et de sécurité sur les données
Objectifs opérationnels
Objectif opérationnel :
Savoir utiliser Apache Iceberg pour créer, gérer et optimiser des tables de données dans un environnement de data lakehouse.
Programme
Contenu du cours, module par module
6 modules
- Présentation d’Apache Iceberg en tant que format de table open source pour data lakes modernes
- Identification des limitations des formats historiques comme Hive, Delta Lake ou Hudi
- En quoi Iceberg révolutionne-t-il la gestion des données dans un data lake ?
- Découverte des concepts clés : tables immuables, time travel, conformité ACID
- Présentation de l’interopérabilité d’Iceberg avec les principaux moteurs de traitement de données
- Présentation de la structure interne : couches de données et de métadonnées
- Exploration des fichiers de manifestes et listes de manifestes
- Comment Iceberg gère-t-il les métadonnées sans alourdir les traitements
- Introduction au fonctionnement des catalogues : Hive, Glue, REST
- Compréhension du rôle du snapshot dans le contrôle de version
Travaux pratiques
Description : Utilisation de Spark pour initialiser une table Iceberg
Définition d’un schéma, insertion de données et lecture via le catalogue
Exécution de la commande DESCRIBE HISTORY pour visualiser les snapshots
Vérification de la structure générée (manifestes, métadonnées)
- Utilisation des opérations de base : INSERT, DELETE, UPDATE, MERGE
- Gestion des versions avec snapshot et rollback
- Comment restaurer une table à un état antérieur avec Iceberg ?
- Utilisation de la commande TIME TRAVEL pour accéder à un état précédent
- Présentation des mécanismes de schéma évolutif
- Mise en place du compactage automatique des petits fichiers
- Optimisation du partitionnement grâce au partitionnement caché
- Quelles sont les bonnes pratiques pour maintenir les performances des tables Iceberg ?
- Utilisation de expireSnapshots pour limiter les métadonnées inutiles
- Présentation des opérations de réécriture des manifestes pour optimiser les lectures
Travaux pratiques
Description : Réalisation d’opérations MERGE INTO et DELETE
Création de snapshots intermédiaires et restauration d’un état antérieur
Compactage des fichiers via Spark et suppression des anciens snapshots
Visualisation des améliorations via des plans d’exécution
- Connexion d’Apache Iceberg à Apache Spark, Trino, Dremio et AWS Glue
- Comparaison des syntaxes DDL entre les moteurs supportés
- Quels moteurs peuvent interagir avec la même table Iceberg sans conversion ?
- Démonstration d’interopérabilité Spark ↔ Trino
- Configuration des catalogues Hive et REST pour la lecture et l’écriture
- Présentation des pratiques de gouvernance sur les données Iceberg
- Mise en œuvre de stratégies d’accès avec Apache Ranger ou AWS Lake Formation
- Comment gérer les droits d’accès sur les tables Iceberg dans un environnement multi-utilisateurs ?
- Gestion des accès au niveau du catalogue et des moteurs
- Sensibilisation aux bonnes pratiques de documentation, traçabilité et conformité
Travaux pratiques
Description : Création d’une table accessible depuis Spark et Trino
Configuration d’un catalogue partagé (Hive Metastore)
Attribution de droits simulés via des groupes utilisateurs fictifs
Exécution de requêtes différenciées selon les profils
Programme mis à jour le 20/04/2026
Public concerné
Ce cours s'adresse aux data engineers, architectes data, développeurs Big Data et plus globalement à toute personne en charge de la gestion des données dans un environnement data lake.

Prérequis
Une bonne maîtrise du langage SQL et des notions sur les architectures data lake sont attendues pour suivre cette formation.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
5/5
2 avis
« Mon avis sur le contenu du stage : "La formation est très accessible. Il pourrait être intéressant de plus s'adapter au niveau des participants (par exemple, très bonnes connaissances UNIX/SQL) afin d'aller plus vite sur certaines notions déjà maitrisées. " Ce que j'ai le plus apprécié : "- Le site internet regroupant tous les documents . - La pédagogie du formateur." »
DJINFOTEL CONSEIL « Mon avis sur le contenu du stage : "ça aurait été bien de mettre plus de détails sur les slides. Ils sont un peu trop synthétiques, pas sûr qu'en les relisant dans un mois on garde toutes les informations pertinentes que tu as dis" »
DMGROUPEMENT INTERMINISTERIEL DE CONTROLE
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Apache Spark : Optimiser Apache Spark sur DatabricksRéf. APSO2 joursAvancé
- Apache Spark : Programmer avec Apache Spark de DatabricksRéf. APSK2 joursIntermédiaireProchaine session : 16 nov.1 800 €
- Big Data : Développement d'applications et Data Visualisation Réf. ODAB4 joursFondamentalProchaine session : 2 nov.2 490 €
- Fivetran : Automatisation de l’intégration de données cloudRéf. FAID2 joursFondamentalProchaine session : 26 oct.1 590 €