- ACN_ATLAS
- Cours pratique
- FSE
- Informatique
Formation Hadoop - Développement
Développement Hortonworks ou Cloudera

- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Developpement Hadoop
La gestion des ensembles de données volumineux offre aux entreprises de toutes tailles de nouvelles opportunités et de nouveaux défis à relever. Au cours de cette formation Développement Hadoop, vous allez acquérir les compétences pratiques de programmation nécessaires pour développer des solutions compatibles avec la plateforme Hadoop d'Apache grâce auxquelles vous pourrez traiter efficacement différents types de Big Data.
Lors de cette formation, vous utiliserez plusieurs produits dédiés au Big Data, Apache Hadoop, MapReduce, le système de fichiers distribué Hadoop (HDFS), HBase, Hive et Pig. Vous étudierez aussi d'autres composants de l'écosystème dont l’apport du standard Spark dans le traitement des données.
Selon la session choisie, la distribution peut changer entre Cloudera et Hortonworks. Contactez notre service commercial pour connaître la solution choisie sur les sessions à venir.

Objectifs pédagogiques
À l'issue de cette formation Hadoop vous aurez acquis les connaissances et compétences nécessaires pour :
- Identifier les fonctionnalités d’Hadoop et son écosystème
- Développer des algorithmes parallèles efficaces avec MapReduce
- Mettre en œuvre des tâches Hadoop pour extraire des éléments pertinents d'ensembles de données volumineux et variés et apporter ainsi de la valeur à votre entreprise
- Développer des tâches parallèles MapReduce performantes
- Charger des données en environnement HDFS et HBase (données non structurées)
- Découvrir la puissance des traitements de données avec Spark
Objectifs opérationnels
Savoir développer avec Hadoop des applications pour le traitement de gros volumes de données.
Programme
Contenu du cours, module par module
8 modules
- Définir les fonctionnalités du framework Hadoop et son écosystème
- Identifier le projet et les modules : Hadoop Common, HDFS, YARN, MapReduce
- Utilisation de Yarn pour piloter les jobs mapreduce
- Déterminer le principe et objectifs du modèle de programmation MapReduce
- Données structurées et non-structurées
- Utiliser les fonctions map() et reduce().
- Couples (clés, valeurs).
- Implémentation par le framework Hadoop.
- Étude d'exemples
Travaux pratiques
- Configuration des jobs, notion de configuration.
- Identifier les interfaces principales : mapper, reducer,
- Importance de la configuration HDFS sur le découpage en blocs et les mappers
- La chaîne de production : entrées, input splits, mapper, combiner, shuffle/sort, reducer, sortie.
- Gérer le partitionnement des données afin d’équilibrer la charge sur un cluster..
- Format des entrées et sorties d'un job MapReduce : InputFormat et OutputFormat.
Travaux pratiques
- Paramétrage d'un job : ToolRunner, transmission de propriétés.
- Accès à des systèmes externes : S3, hdfs, har, ...
- Configuration des sorties vers une unité de persistance
Travaux pratiques
- Définir le streaming map/reduce.
- Échantillonnage de données.
- Définition de fenêtre temporelle en regard des données consommées.
- Liaisons avec des systèmes externes.
Travaux pratiques
- Présentation des différentes interfaces disponibles
- Commandes de base, syntaxe, variables, manipulation des données : create, list, put, scan, get
- Désactiver une table ou l'effacer : disable (enable), drop, ...
- Programmation de scripts (shell proposé par Hbase)
- Gestion des tables : principe des filtres
- Mise en œuvre de filtres de recherche, paramètres des tables
- Présentation des espaces de nommage
Travaux pratiques
Traitement de données depuis un datalake vers un datalab
- Simplification du requêtage.
- Syntaxe de base.
- Définition d’un mapping de données issus de HBase afin de requêter en SQL
- Charger et stocker les données efficacement avec SerDes
- Concevoir la disposition des données pour la performance
- Automatisation de requêtes sur un flux de données
Travaux pratiques
Extraire des données en SQL avec utilisation de fonctions définies par l’utilisateur.
- Programmation de haut niveau pour le Big Data : RDD
- Standard de fait : pour son approche SQL : DataFrame
- Echantillonnage de données ou streaming structuré
- Big Data sur les graphes : Page ranking
- Machine Learning à partir de données structurées (Spark ML)
Travaux pratiques
Programme mis à jour le 20/11/2025
Public concerné
Ce cours Hadoop Développement s'adresse essentiellement aux chefs de projets, développeurs, data scientists et architectes amenés à développer des applications avec Hadoop dans un environnement Big Data. Il conviendra également aux ingénieurs ou à toute personne souhaitant comprendre les techniques de développement dans l'environnement Hadoop.

Prérequis
Pour suivre cette formation Hadoop Développement dans les meilleures conditions possibles, il est recommandé d’avoir une bonne connaissance d'un langage de programmation objet (Java, C#, Python, etc.) et du scripting.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
Formations liées
- Informatica PowerCenter Développeur Niveau 2Réf. ETLI3 joursAvancé
- Introduction à l'ingénierie des donnéesRéf. IIDD2 joursFondamentalProchaine session : 7 déc.1 590 €
- Kafka - DéveloppementRéf. AKAF3 joursIntermédiaireProchaine session : 28 oct.2 090 €
- Matillion - AvancéRéf. MAAV1 jourAvancéProchaine session : 16 déc.950 €