- ACN_ATLAS
- Cours pratique
- FSE
- Informatique
Formation Talend : intégration de données pour le Big Data
Maîtriser Talend dans un environnement Big Data

- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Talend Big Data
Considéré comme un pionnier de l'open source dans l'univers de la business intelligence, Talend (Talend Open Studio for Big Data) s'est également progressivement imposé comme une référence dans le Big Data. Tirant partie des bases de données cloud (Hadoop, NoSQL), Talend pour le Big Data s'appuie par ailleurs sur les modules Hadoop (HDFS, Hive, Pig) et sur de nombreux connecteurs cloud (AWS, GCP, Azure) afin de proposer de la gestion de fichiers, de l'orchestration des flux de données, de l'importation et chargement vers un data lake et naturellement les fonctionnalités ETL et ELT.

Objectifs pédagogiques
À l'issue de cette formation Talend pour le Big Data, vous aurez acquis les connaissances et compétences nécessaires pour :
- Lister les composants et fonctionnalités de Talend dans un environnement Big Data
- Créer des jobs Talend faisant interagir des fichiers, et base de données Big Data
- Connaître les bonnes pratiques de développements avec Talend
- Lire et écrire des données sur HDFS et dans des bases de données NoSQL avec des Jobs Talend
- Réaliser des Jobs de transformation à l’aide de Pig et Hive
- Utiliser les composants de gestion de qualité de donnée
- Réaliser des Jobs de migration de base de données relationnelles dans Hadoop avec Sqoop
- Créer des traitements ETL (Extraction, Transform and Load) de bout en bout en environnement Big Data
Objectifs opérationnels
Savoir utiliser Talend dans un environnement Big Data afin de manipuler des données en masse.
Programme
Contenu du cours, module par module
13 modules
- Tour d’horizon des composants et philosophie de l’outils
- Ouvrir un projet
- Quelles différences pour Talend dans le contexte Big Data
- Les spécificités liées au Big Data
- Monitorer un cluster Hadoop
- Créer un cluster de métadonnées
- Principes d’un système de fichiers distribué
- Enregistrer un fichier sur du HDFS
- Manipulations d’un grand nombre de fichiers et de gros fichiers
- Lire les données de HDFS
- Hbase une base NoSQL orientée colonnes au-dessus de HDFS
Travaux pratiques
Lecture écriture de données dans la base
- Comment apporter la dimension relationnelle ?
- Vue générale de Hive
- Utiliser Sqoop pour faciliter la migration de bases de données relationnelles dans Hadoop
Travaux pratiques
Création de tables dans HDFS avec Hive
- Traitement des tables Hive avec des jobs
- Traitement des données avec Pig
- Traitement des données par lots
Travaux pratiques
- Dépannage de votre cluster
- Les composants de qualité de données
Travaux pratiques
- Surveillance du cluster Hadoop
- Créer un environnement de développement
- Chargement des données dans HDFS
- Enrichissement des logs
- Calculer les statistiques
- Conversion d'un job standard en un lot Big Data
- Comprendre les jobs MapReduce
Travaux pratiques
- Chargement du dictionnaire et des données du fuseau horaire dans HDFS
- Chargement des tweets dans HDFS
- Traitement des tweets avec MapReduce
- Planification de l'exécution du job
- Exemples d’applications et de flux de messages
- Problématiques posées pour la gestion et le dispatch de ces flux
- Ce que propose Kafka
- Publication de messages sur un sujet Kafka
- Consommer des messages Kafka dans Talend
Travaux pratiques
- Comprendre les bases de Spark
- Analyser les données des clients
- Produire et consommer des flux en temps réel
- Différents modes pour les job Talend Spark (local, standalone, yarn client)
- Création d’un job Spark
- Tests de Jobs Spark à l’aide de scénarios de test
Travaux pratiques
- Introduction au cas d'utilisation du traitement des lois
- Génération de logs bruts
- Génération de logs enrichis
- Surveillance des logs enrichis
- Génération de rapports basés sur les fenêtres de données
- Ingestion de flux de données
- Analyser les logs avec un batch job
Programme mis à jour le 12/06/2025
Public concerné
Ce cours Talend pour le Big Data s’adresse essentiellement à des consultants BI, des architectes, chefs de projets qui souhaitent gérer des flux de données avec Talend Big Data

Prérequis
Pour faciliter le déroulement de cette formation Talend pour le Big Data, il est souhaitable que les participants disposent de connaissances préalables sur Hadoop, Spark et Kafka.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
Formations liées
- Talend Open Studio : ETL UtilisateurRéf. OETM3 joursFondamentalProchaine session : 12 oct.2 150 €
- Talend Open Studio ESBRéf. OESB2 joursIntermédiaire
- Talend Open Studio Expertise : ETL développeurRéf. OETE2 joursAvancéProchaine session : 29 oct.1 650 €
- Informatica PowerCenter Développeur Niveau 2Réf. ETLI3 joursAvancé