- Cours pratique
- FSE
- Informatique
Formation Big Data : Développement d'applications et Data Visualisation
Hadoop, MapReduce, Spark, Machine Learning, R, Python, Dataviz

- Durée
- 4 jours
- Niveau
- Fondamental
- Modalités
- Présentiel / Distanciel
Description de la formation Big Data Developpement
Cette formation Big Data Développement vous présente les principales technologies concernant le développement d’applications Big Data. Elle forme un ensemble cohérent dans la mesure où, dans un premier temps, elle replace le cadre global du Big Data et se conclut par la visualisation des données que les programmes développés avec les technologies présentées dans cette formation sont capables d’extraire.
Nous n’avons volontairement pas fait le choix d’un langage particulier. En effet, qu’il s’agisse de MapReduce, Spark ou du Machine Learning, la philosophie est précisément d’être indépendant du langage. Cependant, afin d’être concret et de valider le discours théorique, les exemples seront exposés en Java, Python, Scala ou R.

Objectifs pédagogiques
Objectifs pédagogiques :
À l'issue de cette formation Big Data Développement, vous aurez acquis les connaissances et compétences nécessaires pour :
- Connaître les spécificités du Big Data
- Savoir mettre en œuvre les technologies relatives au Big Data
- Comprendre et exploiter le Machine Learning
- Pouvoir tirer partie de la visualisation des données
Objectifs opérationnels
Objectif opérationnel :
Être capable de développer des applications pour le Big Data et savoir exploiter les données qui en découlent.
Programme
Contenu du cours, module par module
6 modules
- Les origines du Big Data
- Les données au cœur des enjeux (volume, diversité, IoT, etc.)
- Les limites des architectures actuelles et de la BI
- Sécurité, éthique, environnement juridique
- Comprendre Hadoop et ses composants
- Le système de fichiers répartis HDFS (Hadopp Filesystem)
- Philosophie de MapReduce
- L’apport de YARN (Yet Another Resource Negotiator)
- Différentes catégories de bases NoSQL (clé/valeur, documents, colonnes, graphes)
- Indexer et rechercher des données avec Elasticsearch
- Les visualiser à l’aide de KIBANA
- Quand utiliser le couplage Elasticsearch, Logstash, Kibana (ELK) ?
- Le moteur de recherche SolR
- SAS VA et autres solutions mixtes Cloud/On Premice pour explorer vos données
- IBM Watson (fédération des informations)
- Solution BI Classique
- Impacts techniques et financiers des différentes solutions (savoir-faire, coûts, etc.)
- Philosophie et contraintes du pattern MapReduce (Hadoop)
- Concrètement quelles briques logicielles pour le développeur ?
- Exemple de pseudo-code pour les opérations map et reduce
- Limites de MapReduce et émergence de Spark
- Les différentes versions de Spark (Scala, Python et Java)
- Des traitements en mémoire et tolérants aux pannes RDD (Resilient Distributed Datasets)
- Les modes de travail en cluster de Spark
- Exemples :
- Développement d’un wordcount avec MapReduce Spark dans différents langages (Java, Python, Scala, R)
- Calcul d’une jointure sur deux grandes tables
- Qu’est-ce que le Machine Learning ?
- Les points de vigilance par rapport au Big Data
- Les différents types de machine learning
- Les principaux algorithmes
- Utiliser SparkML pour faire du Machine Learning de manière distribuée
- Créer un système de catégorisation
- Comprendre la différence entre Deep Learning et Machine Learning
- Réseaux de neurones et Deep Learning
- Utiliser le deep learning pour faire de la reconnaissance de caractère avec Tensorflow en Python
- Ce que les statistiques ne disent pas
- Les objectifs de la visualisation
- Quels graphes pour quels usages ?
- Représentation de données complexes (encodage visuel, visualisation interactive)
- Savoir communiquer sur les analyses de données (Data Storytelling)
- Analyse de profils clients avec l’utilisation de Spark (domaine Banque et Assurance)
- Classification de conducteur dans une agence de transport
- Proposition de produits par rapport à une liste d’achats (Machine Learning)
Travaux pratiques
Des études de cas illustrent cette formation sur les sujets suivants :
- Analyse de profils clients avec l’utilisation de Spark (domaine Banque et Assurance)
- Classification de conducteur dans une agence de transport
- Proposition de produits par rapport à une liste d’achats (Machine Learning)
De nombreux travaux pratiques courts viennent en complément de ceux réalisés sur l’étude de cas.
Programme mis à jour le 26/08/2025
Public concerné
Ce cours s'adresse aux développeurs ainsi qu'aux chefs de projets.

Prérequis
La connaissance d’un langage de programmation est impérative.
Les exemples seront présentés avec les langages suivants : Java, Python, Scala et R.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
4,6/5
7 avis
« Mon avis sur le contenu du stage : "Cours qui balaye l'ensemble du BigData avec des exemples concrets et des cas pratiques (présentation et utilisation d'outil concret) " Mon avis sur le formateur : "Formateur très compétent, qui a su répondre aux questions. Formateur très pédagogue, qui a également su vulgariser les termes techniques. " Mon avis sur la salle de formation : "Etant à l'extérieur, il m'est difficile de juger concrètement les salles. L'accueil par François et Maxime a été super !" Ce que j'ai le plus apprécié : "Bonne qualité de son, et dans le cas de soucis technique, Maxime a été très réactif." Ce que j'ai le moins apprécié : "Quelques exercices sur papier. Il faudrait prévoir des exercices sur d'autre support tel que des drives par exemple. " »
NGUYEN FrançoisPROGILONE « Mon avis sur le contenu du stage : "Les gros plus de la formation sont la compétence et la richesse des expériences d'Olivier. Les concepts sont imagés d'exemples souvent issus d'expériences vécues ce qui est très important pour apprécier correctement à quoi répond ou ne répond pas la problématique bigdata et les pièges à éviter. Les concepts et algorithmes de la partie Machine Learning sont ceux que j'ai le plus apprécié. Le point négatif pour moi est la partie pratique, il aurait ete préférable de disposer d'un accès à une sandbox pour tout les participants afin de pratiquer davantage... Mais ce n'était peut-être pas le but premier de cette introduction au bigdata." Mon avis sur la salle de formation : "Salles petites" »
GACHET RudyCAP GEMINI Technology Services « Mon avis sur le contenu du stage : "Malgré un manque de ma part sur les pré-requis techniques, formation très intéressante et complexe qui m'a permis de me plonger dans ce domaine (culture générale, vision technique nécessaire, bonnes pratiques)" Mon avis sur le formateur : "parfaite connaissance du sujet, animateur professionnel du domaine, et très bonne maîtrise des techniques pédagogiques" Mon avis sur la salle de formation : "A distance, quelques lags avec Adobe Connect" »
PJC
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Python avancé sur Databricks : notebooks, PySpark, SQL, visualisation et MLflowRéf. PYAD4 joursAvancé
- Concept et architecture des systèmes d'information décisionnelsRéf. ACAD2 joursIntermédiaireProchaine session : 9 nov.1 590 €
- Conception de DataWarehouseRéf. ACDW3 joursIntermédiaire
- Développer des applications de Data Visualisation (cours dédié aux actions collectives Atlas)Réf. ODAN4 joursFondamentalProchaine session : 2 nov.2 490 €