Aller au contenu principal
  • Cours pratique
  • FSE
  • Informatique

Formation Apache Spark : Programmer avec Apache Spark de Databricks

Demander un devis
Une formatrice accompagne deux participants penchés sur leurs notes, en salle de formation
Durée
2 jours
Niveau
Intermédiaire
Modalités
Présentiel / Distanciel

Description de la formation Apache Spark Databricks

Apache Spark est un moteur d'analyses unifiées ultra-rapide pour le big data et le machine learning. Depuis sa sortie, il a connu une adoption rapide par les entreprises de secteurs très divers. Des acteurs majeurs du monde de l'internet tels que Netflix, Yahoo et eBay l’ont déployé à très grande échelle, traitant ensemble plusieurs peta-octets de données sur des clusters de plus de 8 000 nœuds.

En deux jours, cette formation propose un panorama pratique de la solution Apache Spark en alternant des présentations théoriques et des exercices pratiques. Ce module couvre les APIs de base de Spark, les fondamentaux et les mécanismes du framework, mais aussi les outils de plus haut-niveau, dont SQL, ainsi que ses capacités de traitement en streaming et l’API de machine learning.

À l’issue de la session, les notebooks peuvent être conservés et être réutilisés dans le service cloud gratuit Databricks Community Edition, pour lequel la compatibilité est garantie. Il est également possible d’exporter le notebook sous forme de code source pour exécution sur n’importe quel environnement Spark.

Atelier en salle : une participante présente des notes au tableau

Objectifs pédagogiques

Objectifs pédagogiques :

À l'issue de cette formation Apache Spark, vous aurez acquis les connaissances et compétences nécessaires pour :

  • Décrire les concepts fondamentaux d'Apache Spark (Architecture, RDD, DataFrames, Spark SQL, PySpark).
  • Exploiter les APIs Spark (principalement DataFrame et Spark SQL) pour ingérer, transformer et manipuler des données.
  • Identifier les composants clés de la plateforme Databricks et son architecture.
  • Utiliser l'espace de travail Databricks pour organiser le code (Notebooks, Repos/Git) et gérer les ressources de calcul (Clusters).
  • Expliquer les caractéristiques et les avantages du format de stockage Delta Lake.
  • Mettre en œuvre les opérations clés de Delta Lake (création de tables, transactions ACID : MERGE, UPDATE) et utiliser le "Time Travel"

Objectifs opérationnels

Objectif opérationnel :

Savoir utiliser Apache Spark dans le cadre d'un projet Big Data.

Programme

Contenu du cours, module par module

7 modules

Programme mis à jour le 19/02/2026

Formations liées