- ACN_ATLAS
- Cours pratique
- FSE
- Informatique
Formation Spark, développer des applications pour le Big Data

- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Objectifs pédagogiques
Plus concrètement, à l'issue de cette formation Spark, vous aurez acquis les connaissances et compétences nécessaires pour :
- Comprendre la philosophie de Spark et ses limites
- Utiliser Spark avec Hadoop
- Développer avec Spark streaming pour de l’analyse de flux en temps réel
- Développer des applications réparties avec Spark (parallélisme sur Cluster)
- Accéder à des données structurées dans vos applications (Spark SQL)
- Découvrir le machine learning avec Spark ML
Objectifs opérationnels
Savoir utiliser Spark pour intégrer des données, les manipuler et utiliser les outils appropriés à chaque situation.
Programme
Contenu du cours, module par module
7 modules
- Introduction générale à hadoop
- La place de mapreduce
- Le traitement de données avec Hadoop
- Les composants d’un cluster Hadoop
- Un système de fichiers distribué (HDFS)
- Traitement distribué sur un cluster Hadoop (mapreduce)
- Travailler avec Yarn
- En quoi Spark complète-t-il Hadoop ?
Travaux pratiques
Exemples de traitement avec mapreduce pour introduire concrètement Spark Streaming
- Un framework offrant de nombreux services…
- … mais pas de stockage (Hadoop, AWS S3, Cassandra, MongoDB, etc.)
- Rôle du cœur de Spark (moteur)
- RDD, la couche d’abstraction des données (Resilient Distributed Datasets)
- Accéder aux données avec Spark SQL
- Traiter les données en pseudo temps réel avec Spark Streaming
- Développer des applications distribuées de machine learning (Spark MLib)
- Quels liens entre Spark et les langages de programmation (Java, Python, R, …) ?
- Manipuler les graphes avec GraphX
- Limites de Spark
Travaux pratiques
Premiers pas avec la console Spark (scripts simples permettant de manipuler par l’exemple les concepts présentés dans ce chapitre)
- Introduction aux RDD
- Les sources de données de RDD
- Créer et sauvegarder des RDD
- Les opérations sur les RDD
- Écrire et passer des fonctions de transformation
- Fonctionnement des transformations de Spark
- Les RDD clé-valeur
- Map-Reduce : principe et usage dans Spark
- Autres opérations sur les RDD de paires
- Exécuter des requêtes SQL (Spark SQL)
- Interopérabilité avec les RDD
Travaux pratiques
Agrégation de données avec les RDD de paires
Soumissions de travaux
Exécution de requêtes SQL
- Créer des DataFrames depuis diverses sources de données
- Les schémas des DataFrames
- Afficher le Dataframe en mode texte (take)
- Visualiser graphiquement le DataFrame (display)
- Sauvegarder des DataFrames
- Requêter des DataFrames avec des expressions sur les colonnes nommées
- Les requêtes de groupement et d’aggrégation
- Les jointures
- Les différences entre Datasets et DataFrames
- Créer des Datasets
- Charger et sauvegarder des Datasets
- Les opérations sur les Datasets
- Conversion entre RDD et DataFrames
Travaux pratiques
Analyse du fonctionnement de Spark dans l’exécution de nos requêtes d’extraction de données
Création de dataframe à partir de fichiers CSV et Json, affichage et visualisation
Créer explicitement un DataFrame à partir de RDD
Manipuler des dataframe avec SQL catalyst
Écriture de requêtes SQL
Manipulations de Datasets
- Introduction au machine learning.
- Les différentes classes d'algorithmes.
- Présentation de SparkML et MLlib.
- Implémentations des différents algorithmes dans MLlib.
Travaux pratiques
- Comprendre l’architecture du streaming.
- Présentation des Discretized Streams (DStreams).
- Les différents types de sources.
- Manipulation de l'API (agrégations, watermarking...).
- Machine Learning en temps réel.
Travaux pratiques
- Écrire, configurer et lancer des applications spark
- Écrire une application Spark
- Compiler et lancer une application
- Le mode de déploiement d’une application
- L’interface utilisateur web des applications Spark
- Configurer les propriétés d’une application
Travaux pratiques
Programme mis à jour le 20/11/2025
Public concerné
Ce cours Spark s’adresse à des chefs de projet, développeurs, data scientists ou architectes.

Prérequis
Pour suivre cette formation Spark, il est essentiel d’avoir des connaissances de base en développement dans les univers Java ou Python. Si vous connaissez un autre langage vous serez moins autonome pour réaliser les TP mais la formation gardera un sens au niveau des concepts et des librairies présentées.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
4,3/5
4 avis
« Mon avis sur le contenu du stage : "La formation est excellente et l'intervenant également. Il était difficile en 3 jours de revoir toute la partie architecturale et la configuration from scratch d'un cluster Hadoop ou Spark. Cette partie m'aurait aussi beaucoup intéressé." Mon avis sur le formateur : "Très pédagogique et patient. L'intervenant maitrise l'art de transmettre avec des temps pauses bien respectés, ni trop long, ni trop couts" Ce que j'ai le plus apprécié : "Agréable et propice à l'apprentissage" Ce que j'ai le moins apprécié : "RAS" »
TCHALA LaoUMAKE AQUITAINE « Ce que j'ai le plus apprécié : "Le rythme de la formation" Ce que j'ai le moins apprécié : "Quelques difficultés avec l'utilisation de la VM (ralentissements)" »
CHTANKO ConstantinAPSIDE SA
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- SQL pour BigQuery : Pipeline et optimisationRéf. SQLQ2 joursFondamentalProchaine session : 22 déc.1 590 €
- Tableau Software - Administration ServerRéf. TSAS2 joursAvancé
- Talaxie Open Studio for Data Integration : InitiationRéf. TODI3 joursFondamental
- Talend - Data Integration (DI) - AvancéRéf. OETA2 joursAvancéProchaine session : 12 oct.1 590 €