- Cours pratique
- FSE
- Informatique
Formation Big Data : Les techniques d'Analyse et de Visualisation
Hive, Pig, Impala, Spark, Drill, Elasticsearch, Logstash, Kibana, Dataviz

- Durée
- 4 jours
- Niveau
- Fondamental
- Modalités
- Présentiel / Distanciel
Description de la formation Big Data Analyse Visualisation
L’objectif de cette formation est de vous rendre autonome dans l’analyse et la visualisation des données dans un contexte Big Data. Un premier rappel permet de replacer les technologies dans le contexte du Big Data afin de clairement comprendre pourquoi de nouveaux outils apparaissent par rapport aux standards SQL ou de visualisation.
Ensuite, la progression logique de la formation vous permettra de savoir structurer vos données, les alimenter, les analyser et enfin de les visualiser avec le bon outil. On se situe ainsi dans un scénario cohérent et réaliste autour du cycle de vie des données.
Les nombreuses manipulations réalisées durant la formation vous permettront non seulement de disposer d’une vue générale très précise des différents concepts et outils, y compris sur le plan méthodologique, mais aussi d’être véritablement opérationnel sur les standards du marché tant en termes de langage que de framework de traitement de la donnée. Vous saurez également choisir le bon outil de visualisation pour restituer des présentations dynamiques sur des analyses plus ou moins complexes en communiquant de manière efficace et accessible (Dataviz, Data Storytelling).

Objectifs pédagogiques
Objectifs pédagogiques :
À l'issue de cette formation Big Data Analyse Visualisation, vous aurez acquis les connaissances et compétences nécessaires pour :
- Comprendre les spécificités du Big Data
- Connaître les concepts fondamentaux et technologies associées au Big Data
- Gérer, collecter et explorer des données
- Analyser et visualiser ces données
Objectifs opérationnels
Objectif opérationnel :
Être autonome dans l'analyse et la visualisation des données dans un contexte Big Data.
Programme
Contenu du cours, module par module
6 modules
- Les origines du Big Data
- Les données au cœur des enjeux (volume, diversité, IoT etc.)
- Les limites des architectures actuelles et de la BI
- Sécurité, éthique, environnement juridique (données personnelles, CNIL, accords internationaux, etc.)
- Le concept de Datalake
- L’écosystème Hadoop, quel outil pour quel usage ?
- Comprendre Hadoop et ses composants
- Le système de fichiers répartis HDFS
- Philosophie MapReduce
- Quelles différences entre les distributions pour l’analyste ?
- Différentes catégories de bases NoSQL (clé/valeur, documents, colonnes, graphes)
- La philosophie open source et les alternatives propriétaires
- Python, langage phare du Big Data
- Solution Cloud ou on Premise, quels impacts ?
- Moteur de recherche et Big Data, quand utiliser la stack Elasticsearch, Logstash, Kibana (ELK) ?
- Impacts techniques et organisationnel
- Exemples de données non structurées
- Manipuler les données avec différents formats de fichiers :
- HDFS
- Fichiers plats : CSV, JSON
- Structures optimisées : Parquet, Avro
- Organisation relationnelle : Hive metastore
- Le Master Data Management (MDM) pour réconcilier les référentiels
- Structurer vos données avec Hive (bases, tables, etc.)
- Intégrer les données avec un ETL
- La phase de collecte des données
- Les outils dédiés à la collecte :
- Utiliser Scoop pour intégrer les données depuis une base de données relationnelle
- Travailler en streaming avec Kafka et Spark Streaming
- Utiliser le langage Pig latin pour intégrer les données
- Utiliser Spark pour la collecte et l’exploration
- Analyse en contexte Big Data
- Vue générale des différentes méthodes d’analyse (exploration, segmentation, classification, estimation, prédiction)
- Data Science et Machine Learning :
- quels rôles pour quels usages ?
- phase d’un projet de Data Science
- domaines d’application
- Interagir avec Hadoop en temps réel (traitement parallèle avec Impala, interroger les données Hive avec Spark)
- Les frameworks orientés « analyse de données »
- Ce que les statistiques ne disent pas
- Les objectifs de la visualisation
- Quels graphes pour quels usages ?
- Représentation de données complexes (encodage visuel, visualisation interactive)
- Exemple de visualisations avec les standards du marché (Tableau, Power BI)
- Savoir communiquer sur les analyses de données (Data Storytelling)
Travaux pratiques
Ce stage est illustré par diverses études de cas permettant une pratique concrète des différentes phases de la chaine globale de traitement des données et pas seulement sur la partie analyse. TP introductif les base de Python, gestion et exploration de données avec Hive, l’ETL et le traitement des données avec Pig ou Spark, analyse et visualisation de données avec Python, Analyse et visualisation de logs avec l’Elastic stack (ELK).
Programme mis à jour le 23/07/2025
Public concerné
Cette formation est destinée aux statisticiens, analystes de données (Data Analyst), consultants en informatique décisionnelle (BI), dataminers, développeurs, chefs de projets.

Prérequis
Des connaissances de base sur le langage SQL, le développement et les statistiques (de niveau scolaire) sont nécessaires pour suivre ce cours.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
4,3/5
14 avis
« Mon avis sur le contenu du stage : "Baignant dans le technique, j'aurai aimé des exercices plus compliqués techniquement ! Je comprends tout à fait que ça ne soit pas le cas avec des participants pouvant ne pas être technique du tout :) Un peu de Spark aurait pu être cool" Mon avis sur le formateur : "Peut-être essayer de faire participer un peu plus les participants, mais j'avoue que pas grand monde semblait répondant pendant le formation. Je suis déjà tombé sur des groupes plus animés ! Manques de quelques explications dans les TPs, sur PIG par exemple, il fallait avoir la doc à côté (ce qui ne me gêne pas vraiment)." Mon avis sur la salle de formation : "La formation à distance s'est très bien déroulée malgré mon appréhension (de la distance). Différents sujets abordés techniques comme un peu moins (visu). " »
CLERC-GHERARDI ArthurKLANIK « Mon avis sur le contenu du stage : "La formation alterne théorie et mise en pratique, ce qui aide à mieux appréhender les concepts. J'aurais aimé que la suite ELK fasse partie de la formation (analyse de logs d'applications). L'animateur nous a présenté ce sujet hors programme. Le support est clair dans l'ensemble avec le détail des Tracaux Pratiquess. Cependant, certaines diapos sont parfois très denses et contiennent des coquilles, ce qui est dommage." Mon avis sur le formateur : "Le formateur a été très pédagogue et très disponible pour des questions d'approfondissement (notamment ELK). Il est passionné par son sujet et parvient à transmettre son savoir. " Ce que j'ai le plus apprécié : "Environnement de mise en pratique" »
TTLE GROUPE LA POSTE « Mon avis sur le contenu du stage : "Nous avons vu le programme annoncé, ça correspondait à mes attentes" Mon avis sur le formateur : "J'ai beaucoup apprécié l'intervenant, Maxime, qui a su s'adapter à nos niveaux et rendre accessible un domaine très vaste et parfois encore un peu abstrait. J'ai également apprécié que l'on accorde un peu de temps à réfléchir ensemble à des problématiques bigdata que nous rencontrons dans nos entreprises respectives, c'était très intéressant." Ce que j'ai le plus apprécié : "Le stylo clef usb avec le cours dessus : super idée :)" »
GM
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Business Intelligence - Les fondamentauxRéf. ABID2 joursFondamental
- Concept et architecture des systèmes d'information décisionnelsRéf. ACAD2 joursIntermédiaireProchaine session : 9 nov.1 590 €
- Conception de DataWarehouseRéf. ACDW3 joursIntermédiaire
- Data Storytelling : Racontez l’histoire de vos donnéesRéf. ADST1 jourFondamentalProchaine session : 6 nov.950 €