- ACN_ATLAS
- Cours pratique
- FSE
- Informatique
Formation Big Data - Python pour l'analyse de données (cours dédié aux actions collectives Atlas)

- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Big Data Python
Cette formation sur l’analyse de données en Python permet aux participants dans un premier temps de découvrir et apprendre le langage Python puis de comprendre pourquoi Python est particulièrement bien adapté à toutes sortes de problèmes d’analyse de données.
Lors de ce cours les participants aborderont donc le traitement de différents formats de données structurées ou non (tableau, matrice, série, CSV, flux XML ou JSON, etc.) tout en les rendant opérationnel dans l’utilisation des principales bibliothèques Python comme NumPy, Pandas, Matplotlib, IPython, SciPy, etc…

Objectifs pédagogiques
Objectifs pédagogiques :
À l'issue de cette formation Big Data Python, vous aurez acquis les connaissances et compétences nécessaires pour :
- Utiliser le langage Python dans la modélisation statistique
- Utiliser les outils d’analyse des données en Python
- Préparer différents types de données à l’analyse (nettoyage)
- Extraire les données de différentes sources (fichier, base de données, etc.)
- Déterminer les fonctions à utiliser selon le type de données
- Évaluer les performances prédictives d’un algorithme
- Utiliser Python dans un environnement Big Data
- Apprendre à mettre en place un modèle d'apprentissage simple
- Choisir entre la régression et la classification en fonction du type de données
- Créer des sélections et des classements dans de grands volumes de données pour dégager des tendances
- Connaître les possibilités de représentations graphiques en Python
Objectifs opérationnels
Objectif opérationnel :
Savoir utiliser Python pour la manipulation de différents types de données statistiques.
Programme
Contenu du cours, module par module
8 modules
- Les caractéristiques du langage Python
- Pourquoi choisir Python pour l’analyse de données ?
- Philosophie de Python (indentation, objet, etc.)
- Les types de données
- Appels de fonctions et méthodes
- Structures de contrôles (boucle, test, exceptions)
- Structures de données et séquences (tuple, liste, primitives, dict)
- Les principales bibliothèques de Python (NumPy, Pandas, Matplotlib, Ipython, SciPy)
Atelier
- Espace de noms, périmètre et fonctions locales
- Manipuler les fonctions comme des objets
- Les fonctions anonymes (lambda)
- Fonction à nombre variable d’arguments (*args, **kwargs)
Atelier
Passage de la fonction heuristique du tri (celle qui précise si un objet est « plus petit » qu’un autre) à la fonction précédente
- Lecture de fichiers de manière générique et spécifiquement de différents formats courants : CSV, XML, JSON
- Utilisation de la bibliothèque requests pour l’acquisition de données externes stockées sur un serveur de l’entreprise ou sur internet
Atelier
- Présentation des principales bibliothèques d’analyse de données Python : Pandas, SciPy, IPython (Jupyter)
- Fonctions de manipulation et de calcul matriciel (Numpy)
- Fonctions de Statistiques Descriptives (SciPy) : quantiles et des fonctions de répartition pour
- différentes lois statistiques
- Fonctions de comparaison de populations, mesures d’association
- Fonctions de classification automatique (SciPy) : k-means
Atelier
- Collecte automatique de séries financières
- Calcul d’indicateurs : d’indicateurs simples (moyennes mobiles) à des indicateurs avancés (tel que le RSI et les Bandes de Bollinger)
- Visualisation des résultats
- Introduction aux bases de la visualisation de données
- Focalisation sur la génération de graphes grâce à la librairie Matplotlib : démonstration de l’application de graphes Matplotlib à la visualisation de problèmes concrets
Atelier
- Établissement d’un modèle de classification et d’un modèle de régression avec Python pour résoudre deux problèmes distincts
- Évaluation du modèle dans son contexte, faux positifs, faux négatifs, matrice de confusion, différents scores de précision
Atelier
- Différence entre le machine learning et le deep learning
- Introduction aux réseaux de neurones et à la descente de gradient
- Introduction aux frameworks de deep learning Tensorflow et Keras de Google
Atelier
- Introduction à l’algorithme de MapReduce
- Introduction à la parallélisation du code dans le but d’améliorer les performances de calcul
- Introduction à Spark
- La composante Spark ML
Atelier
Programme mis à jour le 17/04/2026
Public concerné
Ce cours Big Data Python convient parfaitement aux développeurs, programmeurs et data analysts ou scientists qui doivent utiliser Python pour l’analyse statistique.
Elle peut également être suivie par toute personne souhaitant utiliser Python pour développer des applications de calcul scientifique ou d’analyse de données.

Prérequis
Il est nécessaire de connaître la programmation Python et d'avoir de bonnes bases en mathématiques et statistiques.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
4,7/5
26 avis
« Mon avis sur le contenu du stage : "Le dossier des supports ipynb et csv est un peu trop désordonné avec des fichiers manquants ou avec une version différente du formateur ce qui a rendu la formation un peu plus dur a suivre. Mais c'est un détail facilement réglable. Aussi le fichier /python_data_advanced sur le site PLB laisse a penser une formation sur la Machine Learning sur les 3j mais on est entré dans le sujet qu'au bout du troisième jour. Un quatrième jour de formation n'aurait pas été de trop." Ce que j'ai le plus apprécié : "La VM fonctionne parfaitement sans aucun lag." Ce que j'ai le moins apprécié : "La formation manque d'une description du contenu sur le site PLB avant le début de celle-ci" »
BEAUCHET QuentinXPERT « Mon avis sur le contenu du stage : "répond à mes attentes. Très bon support de cours et TP avec des exemples. Il nous manquait juste un peu de temps pour laisser un peu plus en autonomie pour les premiers TP sur pandas mais c'est lié à la contrainte de tout voir en 3 jours." Mon avis sur le formateur : "Explique très bien, a de solides compétences techniques." Mon avis sur la salle de formation : "La disposition de la salle un peu particulière (on doit se tourner pour voir l'écran)." Ce que j'ai le plus apprécié : "la grande salle" Ce que j'ai le moins apprécié : "le fait de devoir se tourner pour voir l'écran" »
DESMET ClaireMEDIAMETRIE « Mon avis sur le contenu du stage : "Le formateur a prit en compte nos demande et a ignoré le support de cours pour privilégier des besoins personnalisés" Ce que j'ai le plus apprécié : "Les autres participants avaient un niveau et besoins proches du mien, ce qui a permit au formateur d'insister sur les points qui nous intéressaient le plus." Ce que j'ai le moins apprécié : "Les VMs étaient assez lentes et le téléchargement de certaines librairies a pris pas mal de temps" »
HTSEI GROUPE LKS
Les avis figurant ci-dessus sont issus des fiches d’évaluation que remplissent les participants à la fin de la formation. Ils sont ensuite publiés automatiquement si les personnes ont explicitement accepté que nous les diffusions.
Formations liées
- Big Data : Développement d'applications et Data Visualisation Réf. ODAB4 joursFondamentalProchaine session : 2 nov.2 490 €
- Big Data : Les techniques d'Analyse et de VisualisationRéf. OTAV4 joursFondamentalProchaine session : 3 nov.2 490 €
- Business Intelligence - Les fondamentauxRéf. ABID2 joursFondamental
- Concept et architecture des systèmes d'information décisionnelsRéf. ACAD2 joursIntermédiaireProchaine session : 9 nov.1 590 €