- Cours pratique
- FSE
- Informatique
Formation Apache Spark : Programmer avec Apache Spark de Databricks

- Durée
- 2 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Apache Spark Databricks
Apache Spark est un moteur d'analyses unifiées ultra-rapide pour le big data et le machine learning. Depuis sa sortie, il a connu une adoption rapide par les entreprises de secteurs très divers. Des acteurs majeurs du monde de l'internet tels que Netflix, Yahoo et eBay l’ont déployé à très grande échelle, traitant ensemble plusieurs peta-octets de données sur des clusters de plus de 8 000 nœuds.
En deux jours, cette formation propose un panorama pratique de la solution Apache Spark en alternant des présentations théoriques et des exercices pratiques. Ce module couvre les APIs de base de Spark, les fondamentaux et les mécanismes du framework, mais aussi les outils de plus haut-niveau, dont SQL, ainsi que ses capacités de traitement en streaming et l’API de machine learning.
À l’issue de la session, les notebooks peuvent être conservés et être réutilisés dans le service cloud gratuit Databricks Community Edition, pour lequel la compatibilité est garantie. Il est également possible d’exporter le notebook sous forme de code source pour exécution sur n’importe quel environnement Spark.

Objectifs pédagogiques
Objectifs pédagogiques :
À l'issue de cette formation Apache Spark, vous aurez acquis les connaissances et compétences nécessaires pour :
- Décrire les concepts fondamentaux d'Apache Spark (Architecture, RDD, DataFrames, Spark SQL, PySpark).
- Exploiter les APIs Spark (principalement DataFrame et Spark SQL) pour ingérer, transformer et manipuler des données.
- Identifier les composants clés de la plateforme Databricks et son architecture.
- Utiliser l'espace de travail Databricks pour organiser le code (Notebooks, Repos/Git) et gérer les ressources de calcul (Clusters).
- Expliquer les caractéristiques et les avantages du format de stockage Delta Lake.
- Mettre en œuvre les opérations clés de Delta Lake (création de tables, transactions ACID : MERGE, UPDATE) et utiliser le "Time Travel"
Objectifs opérationnels
Objectif opérationnel :
Savoir utiliser Apache Spark dans le cadre d'un projet Big Data.
Programme
Contenu du cours, module par module
7 modules
- Introduction à Spark :
- Historique
- Place dans le Big Data
- La plateforme Databricks :
- Vue d'ensemble de l'architecture
- Le Workspace
- Gestion des clusters
- Le Notebook Databricks :
- Prise en main et bonne pratique
- Les concepts fondamentaux :
- RDD
- SparkContext
- Driver/Executor
- Le modèle d'exécution :
- Stages
- Tasks
- Shuffles
- Transformations vs Actions
- PySpark vs Spark SQL :
- Dans quel cas utiliser quelle solution
- Le DataFrame :
- Création
- Lecture et écriture de données (formats CSV, JSON, Parquet)
- Filtrage et projection :
- Clauses where(), select() et withColumn()
- Jointures (joins) :
- Types de jointures
- Les meilleures pratiques
- Présentation de Delta Lake :
- Le format open source
- La gestion des métadonnées
- Les avantages clés :
- ACID
- Gestion des schémas
- Time Travel
- Opérations Delta :
- Création de tables
- Manipulation de données avec MERGE, UPDATE et DELETE
- Modélisation par couches (Bronze, Silver, Gold) :
- L'architecture LakeHouse et ses principes
- Gestion des versions et collaboration :
- Utilisation des repos Databricks (intégration Git)
- Tests unitaires basiques :
- Écriture de code "Spark testable"
- Analyse de la performance :
- Lecture et interprétation du Spark UI (Stages, Tasks, Exécuteurs)
- Optimisation des requêtes :
- Les techniques de base (coalesce/repartition, taille du fichier)
Programme mis à jour le 19/02/2026
Public concerné
Ce cours Apache Spark s'adresse principalement aux data engineers et data analysts ayant l'expérience des traitements Big Data, souhaitant apprendre à utiliser Apache Spark, à construire des jobs Spark et à déboguer des applications Spark.

Prérequis
Pour suivre cette formation Apache Spark dans de bonnes conditions, une expérience de programmation en langage objet ou fonctionnel est impérative. Une première expérience avec Apache Spark et Spark DataFrames sont également souhaitables, en particulier si vous visez la certification associée.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
5/5
1 avis
« Mon avis sur le contenu du stage : "très bien" Mon avis sur le formateur : "très sympa" Mon avis sur la salle de formation : "RAS" Ce que j'ai le plus apprécié : "top" Ce que j'ai le moins apprécié : "Rien" »
TORTEAU PhilippeLA POSTE / i-TEAM
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Big Data : Développement d'applications et Data Visualisation Réf. ODAB4 joursFondamentalProchaine session : 2 nov.2 490 €
- Fivetran : Automatisation de l’intégration de données cloudRéf. FAID2 joursFondamentalProchaine session : 26 oct.1 590 €
- IBM InfoSphere DataStage Essentials (v11.7) Réf. KM204G4 joursFondamental3 400 €
- Introduction à l'ingénierie des donnéesRéf. IIDD2 joursFondamentalProchaine session : 7 déc.1 590 €