- Cours pratique
- FSE
- Informatique
- Officiel
Formation Développer des applications pour Apache Spark avec Python ou Scala
Formation Hadoop officielle Hortonworks "HDP Developer: Enterprise Apache Spark"

- Durée
- 4 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Apache Spark Python ou Scala
Le framework de programmation Spark se démarque de MapReduce d’Hadoop par sa simplicité et ses temps d’exécution jusqu’à 100 fois plus courts. Les développeurs disposent ainsi d'un moyen pour écrire simplement des applications distribuées complexes débouchant sur des décisions plus judicieuses et plus rapides, à des actions en temps réel, dans une grande variété de cas d’utilisations, d’architecture et de secteurs d’activités.
Cette formation Développer des applications pour Apache Spark avec Python ou Scala vous permet d'identifier et définir les composants de l'écosystème Hadoop. Vous saurez appréhender le fonctionnement de Spark ainsi que développer des applications avec Apache Spark. Pour finir vous explorerez, manipulerez et virtualiserez vos données avec Zeppelin.

Objectifs pédagogiques
À l'issue de cette formation Développer des applications pour Apache Spark avec Python ou Scala vous aurez acquis les connaissances et les compétences nécessaires pour :
- Identifier et définir les différents composants de l’écosystème Hadoop
- Appréhender le fonctionnement de Spark
- Développer des applications avec Apache Spark
- Optimiser une application Spark
- Utiliser Spark SQL et les dataframes
- Faire de l’analyse en temps réel avec Spark streaming
- Découvrir MLLib pour du machine learning sur Spark
- Explorer, manipuler et visualiser vos données avec Zeppelin.
Objectifs opérationnels
Savoir développer des applications pour Apache Spark avec Python ou Scala.
Programme
Contenu du cours, module par module
13 modules
- Cas d’usage pour Hadoop
- Qu’est-ce que le Big Data ?
- HDP, Hortonworks et l’écosystème Hadoop
- Pourquoi utiliser Hortonworks ?
- Qu’est-ce que Spark et d’où vient-il ?
- Pourquoi utiliser Spark ?
- Spark vs MapReduce
- L’évolution rapide de Spark et l’engagement d’Hortonworks
- Les composants de Spark
- Premiers pas avec Spark
- Les RDD
- Transformations et actions
- Spark Hello World (wordcount)
- Lazy evaluation
Travaux pratiques
- Vue d’ensemble de HDFS
- Le Namenode et le Datanode
- Vue d’ensemble de YARN
- Composants cœur de YARN
Travaux pratiques
- D’autres fonctions de RDD "cœur"
- Fonctions de RDD paires
- Utiliser la documentation de Spark
Travaux pratiques
- Partitionnement, jobs, stage et tasks
- L’UI de Spark
- Changer le niveau de parrallélisation
Travaux pratiques
- Cache et persistance
- Exemple d’application itérative : PageRank
- Checkpointing
Travaux pratiques
Travaux pratiques
- Créer une application à soumettre au cluster
- Soumettre une application au cluster
- Yarn client vs Yarn cluster
- Points importants de configuration
- Gérer/packager les dépendances
Travaux pratiques
- Accumulateurs
- Variables « broadcast »
- Partitionnement avancé et opérations
- Point de départ pour l’optimisation
Travaux pratiques
Travaux pratiques
- L'exploration de données en Spark avec Zeppelin
- Visualisation de données avec Zeppelin
- Faire du reporting avec Zeppelin
- Les concepts de Spark SQL
- Créer une Dataframe
- Sauvegarder une Dataframe
- Spark SQL et UDF
Travaux pratiques
Spark SQL avec Hive
- L’architecture de Spark Streaming
- Vue d’ensemble de Spark Streaming
- Fiabilité des récepteurs et des sources
- Transformations et opérations de sorties
- Configurer le checkpointing
Travaux pratiques
- Vue d’ensemble de MLLib
- Apprentissage supervisé
- Apprentissage non supervisé
Travaux pratiques
Les apports théoriques sont complétés par des travaux pratiques, des mises en situation, des échanges sur les contextes des participants et des retours d’expérience du formateur.
Programme mis à jour le 03/11/2023
Public concerné
Ce stage s'adresse aux développeurs d'applications avec des contraintes temps réel, ingénieurs d’études, architectes techniques et aux chefs de projets techniques.

Prérequis
Afin de suivre ce stage il est nécessaire que les participants aient :
- Des connaissances de base en programmation ou en scripting (Python/Scala)
- Une expérience basique en ligne de commande
De plus, il est recommandé d'avoir des connaissances en SQL et en conception d'application temps réel. Aucune connaissance sur Hadoop n’est requise.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
4,6/5
7 avis
« Mon avis sur le contenu du stage : "Le formateur nous a permis de ne pas bloquer sur des problèmes de codage dans les exercices pour des non codeurs endurcis, mais d'appuyer sur l'apprentissage et la compréhension des principes des modules de Spark." Ce que j'ai le plus apprécié : "Dialogue ouvert avec le formateur." »
BG « Mon avis sur le contenu du stage : "une formation riche et variée " Mon avis sur le formateur : "un prof très généreux en info , compétent et sympa. " Mon avis sur la salle de formation : "La personne à l’accueil est souriante. J'aime bien ..." Ce que j'ai le plus apprécié : "un nombre réduit de participant " »
SBOUI SirineGFI Informatique « Mon avis sur le formateur : "le formateur maitrise bien le sujet, et ila proposé beaucoup de TP et il a abordé des sujet non inclu dans la formation de base comme le cluster et machine learning etc" »
FCOPEN
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Elastic Security : bâtir un SIEM avec la suite Elastic Réf. ESBS3 joursFondamentalProchaine session : 9 déc.2 090 €
- Elasticsearch : administrationRéf. ELAD3 joursIntermédiaireProchaine session : 7 déc.2 090 €
- Elasticsearch : indexation de contenuRéf. ELSE2 joursFondamentalProchaine session : 5 nov.1 590 €
- Elasticsearch, Logstash et Kibana (ELK - Elastic Stack)Réf. IELK3 joursIntermédiaireProchaine session : 2 nov.2 090 €