- Certifiant
- Cours pratique
- FSE
- Informatique
- Officiel
Formation Google Cloud Plateform : Ingénierie de Données
Apprenez à concevoir et à construire des systèmes de traitement de données.

- Durée
- 4 jours
- Niveau
- Avancé
- Modalités
- Distanciel
- Certification
- Professional Data Engineer
Description de la formation Google Cloud Platform Data Engineering
L'ingénierie de données sur Google Cloud Platform se concentre sur les services Big Data et Machine Learning de la plate-forme cloud de Google.
L'objectif de cette formation Google Cloud Platform : Ingénerie des données est d'apprendre aux participants à concevoir des systèmes de traitement de données, à créer des pipelines de données de bout en bout, à analyser des données et à effectuer un apprentissage automatique. Les démonstrations s'appuient sur les différents services proposés par Google Cloud Platform : BigQuery, Dataflow, Tensorflow, CloudML, Dataproc...

Objectifs pédagogiques
À l'issue de cette formation Google Cloud Platform : Ingénerie de données vous aurez acquis les connaissances et les compétences nécessaires pour :
- Concevoir et déployer des pipelines et des architectures pour le traitement des données
- Créer et déployer des workflows de machine learning
- Interroger des ensembles de données
- Visualiser des résultats de requêtes et création de rapports
Objectifs opérationnels
Savoir concevoir des systèmes de traitement de données, créer des pipelines de données de bout en bout, analyser des données et effectuer un apprentissage automatique.
Durée : 2 heures
Format de l'examen : 40 à 50 questions à choix et sélections multiples
Programme
Contenu du cours, module par module
18 modules
- Explorez le rôle d’un data engineer
- Analyser les défis d’ingénierie des données
- Introduction à BigQuery
- Data lakes et data warehouses
- Démo : requêtes fédérées avec BigQuery
- Bases de données transactionnelles vs data warehouses
- Démo : recherche de données personnelles dans votre jeu de données avec l’API DLP
- Travailler efficacement avec d’autres équipes de données
- Gérer l’accès aux données et gouvernance
- Construire des pipelines prêts pour la production
- Étude de cas d’un client GCP
Travaux pratiques
- Introduction aux data lakes
- Stockage de données et options ETL sur GCP
- Construction d’un data lake à l’aide de Cloud Storage
- Démo : optimisation des coûts avec les classes et les fonctions cloud de Google Cloud Storage
- Sécurisation de Cloud Storage
- Stocker tous les types de données
- Démo : exécution de requêtes fédérées sur des fichiers Parquet et ORC dans BigQuery
- Cloud SQL en tant que data lake relationnel
- Le data warehouse moderne
- Introduction à BigQuery
- Démo : Requêter des TB + de données en quelques secondes
- Commencer à charger des données
- Démo : Interroger Cloud SQL à partir de BigQuery
- Explorer les schémas
- Exploration des jeux de données publics BigQuery avec SQL à l’aide de INFORMATION_SCHEMA
- Conception de schéma
- Démo : Exploration des jeux de données publics BigQuery avec SQL à l’aide de INFORMATION_SCHEMA
- Champs imbriqués et répétés dans BigQuery
- Optimiser avec le partitionnement et le clustering
- Démo : Tables partitionnées et groupées dans BigQuery
- Aperçu: Transformation de données par lots et en continu
Travaux pratiques
Travaux pratiques
- Considérations de qualité
- Comment effectuer des opérations dans BigQuery
- Démo : ELT pour améliorer la qualité des données dans BigQuery
- Des lacunes
- ETL pour résoudre les problèmes de qualité des données
- L’écosystème Hadoop
- Exécution de Hadoop sur Cloud Dataproc GCS au lieu de HDFS
- Optimiser Dataproc
Travaux pratiques
- Cloud Dataflow
- Pourquoi les clients apprécient-ils Dataflow ?
- Pipelines de flux de données
- Templates Dataflow
- Dataflow SQL
Travaux pratiques
MapReduce dans un flux de données (Python / Java)
Entrées latérales (Python / Java)
- Création visuelle de pipelines de données par lots avec Cloud Data Fusion : composants, présentation de l’interface utilisateur, construire un pipeline, exploration de données en utilisant Wrangler
- Orchestrer le travail entre les services GCP avec Cloud Composer - Apache Airflow Environment: DAG et opérateurs, planification du flux de travail
- Démo : Chargement de données déclenché par un événement avec Cloud Composer, Cloud Functions, Cloud Storage et BigQuery
Travaux pratiques
Travaux pratiques
- Traitement des données en streaming
- Cloud Pub/Sub
Travaux pratiques
- Fonctionnalités streaming de Cloud Dataflow
Travaux pratiques
- Fonctionnalités de streaming BigQuery
- Cloud Bigtable
Travaux pratiques
Travaux pratiques
- Analytic Window Functions
- Utiliser des clauses With
- Fonctions SIG
- Démo : Cartographie des codes postaux à la croissance la plus rapide avec BigQuery GeoViz
- Considérations de performance
Travaux pratiques
Création de tables partitionnées par date dans BigQuery
- Qu’est-ce que l’IA ?
- De l’analyse de données ad hoc aux décisions basées sur les données
- Options pour modèles ML sur GCP
- Les données non structurées sont difficiles à utiliser
- API ML pour enrichir les données
Travaux pratiques
- Qu’est-ce qu’un notebook
- BigQuery Magic et liens avec Pandas
Travaux pratiques
- Façons de faire du ML sur GCP
- Kubeflow AI Hub
Travaux pratiques
- BigQuery ML pour la construction de modèles rapides
- Démo : Entraîner un modèle avec BigQuery ML pour prédire les tarifs de taxi à New York
- Modèles pris en charge
Travaux pratiques
Recommandations de film dans BigQuery ML
- Pourquoi Auto ML?
- Auto ML Vision
- Auto ML NLP
- Auto ML Tables
Programme mis à jour le 05/03/2026
Public concerné
Ce stage s'adresse prioritairement aux développeurs expérimentés en charge de la gestion des grandes transformations de données, notamment en ce qui a trait à : l'extraction, le chargement, la transformation, le nettoyage et la validation des données ; la conception de pipelines et d'architectures pour le traitement de données ; la création et le maintien d'un apprentissage automatique et des modèles statistiques ou encore l'interrogation de jeux de données, visualisation des résultats de requête et création de rapports.

Prérequis
Pour suivre ce cours, il est nécessaire d'avoir préalablement assisté à la formation Google Cloud Platform : l'essentiel du Big Data et du Machine Learning (GCP100B) ou d'avoir de solides connaissances équivalentes. Il est par ailleurs demandé de connaître un langage de requête commun tel que SQL, d'avoir une expérience de la modélisation, de l'extraction, de la transformation et du chargement de données, de savoir développer des applications en utilisant un langage de programmation commun tel que Python et d'être familiarisé avec le machine learning ou les statistiques.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
Formations liées
- Data Warehousing with BigQuery : Storage Design, Query Optimization, and AdministrationRéf. BIGQ3 joursIntermédiaireProchaine session : 16 nov.2 370 €
- Google Cloud Platform : Cursus Professional Cloud ArchitectRéf. GCPIC6 joursIntermédiaireProchaine session : 16 nov.3 990 €
- Google Cloud Platform : Développement d'ApplicationsRéf. GCPDEV3 joursIntermédiaireProchaine session : 16 nov.2 450 €
- Google Cloud Platform : La Sécurité sur GCPRéf. GPCSEC3 joursAvancéProchaine session : 23 nov.2 370 €