- Cours pratique
- Informatique
Formation Starburst : Optimisation et analyse de données distribuées avec Starburst
Interrogez, analysez et optimisez vos données distribuées à grande échelle

- Durée
- 3 jours
- Niveau
- Intermédiaire
- Modalités
- Présentiel / Distanciel
Description de la formation Starburst
Qu'est-ce que Starburst ?
Starburst est une plateforme analytique distribuée, basée sur Trino (anciennement PrestoSQL), conçue pour interroger efficacement de vastes ensembles de données réparties sur plusieurs sources sans les déplacer. Elle permet une fédération de données moderne et puissante, adaptée aux environnements Big Data et cloud hybrides.
Pourquoi suivre une formation Optimisation et analyse de données distribuées avec Starburst ?
Dans un contexte où les données proviennent de sources toujours plus nombreuses et hétérogènes, maîtriser Starburst permet de centraliser les analyses sans déplacer les données. Cette formation vous aide à concevoir des requêtes performantes, comprendre les plans d'exécution et utiliser au mieux les capacités distribuées de Starburst. Elle s'adresse à toute personne souhaitant optimiser l’accès aux données et améliorer la rapidité d’analyse dans un environnement analytique moderne.

Objectifs pédagogiques
À l'issue de la formation, vous aurez les connaissances nécessaires pour :
- Comprendre l’architecture et les principes de fonctionnement de Starburst
- Savoir interroger différentes sources de données à l’aide de SQL via Starburst
- Analyser et optimiser les performances des requêtes
- Intégrer Starburst dans un écosystème analytique d’entreprise
- Sécuriser et administrer les accès aux sources de données
Objectifs opérationnels
Savoir interroger, analyser et optimiser des données distribuées avec Starburst.
Programme
Contenu du cours, module par module
6 modules
- Présentation de Trino et Starburst
- Fonctionnement de l’architecture fédérée
- Connecteurs disponibles et intégration multi-sources
- Interface Web, CLI et outils SQL
Travaux pratiques
Description : Création d’un workspace, connexion à des sources de données (PostgreSQL, S3), et exécution de requêtes simples. Que permet réellement une fédération de données efficace ?
- Jointures inter-sources
- Fonctions analytiques et agrégations
- Fonctions spécifiques à Starburst
- Gestion des formats de données (Parquet, ORC, etc.)
Travaux pratiques
Description : Création de requêtes complexes, calculs analytiques et filtres sur des jeux de données multi-sources. Comment optimiser une jointure sur des données volumineuses ?
- Analyse des plans d’exécution
- Principes de partitionnement et parallélisme
- Utilisation de cache et mémoire
- Bonnes pratiques d’écriture SQL avec Starburst
Travaux pratiques
Description : Étude de cas de lenteurs, comparaison de différents plans d'exécution. Quelles requêtes sont les plus coûteuses et pourquoi ?
- Contrôle des accès et rôles
- Configuration de la sécurité (LDAP, SSO)
- Audits et monitoring
- Intégration avec Ranger ou autres outils
Travaux pratiques
Description : Mise en place de rôles, tests d’accès restreints, consultation des logs de requêtes. Comment garantir la confidentialité dans un environnement partagé ?
- Architecture d’intégration typique
- Utilisation avec BI : Tableau, Power BI, Superset
- Exposition via API REST
- Automatisation des workflows d’analyse
Travaux pratiques
Description : Connexion avec Tableau, création de dashboards, exportation automatisée des résultats. Comment valoriser les données distribuées dans des outils métiers ?
- Choix d’un cas réel : client, log, ou IoT
- Conception d’une requête fédérée complexe
- Analyse, visualisation et recommandations
- Présentation des résultats
Travaux pratiques
Description : Projet en autonomie, encadré par le formateur, avec revue finale. Quel est l’impact de la fédération sur la performance globale d’un projet analytique ?
Programme mis à jour le 27/08/2025
Public concerné
Ce cours s'adresse aux ingénieurs data, analystes, architectes Big Data et administrateurs de plateformes analytiques.

Prérequis
Une bonne maîtrise du SQL, des notions d’architecture Big Data (par exemple Hadoop, Data Lake) et une compréhension des concepts de bases de données relationnelles et distribuées sont nécessaires pour suivre cette formation.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
Formations liées
- Tableau Software - Administration ServerRéf. TSAS2 joursAvancé
- Big Data : Développement d'applications et Data Visualisation Réf. ODAB4 joursFondamentalProchaine session : 2 nov.2 490 €
- Kafka Streams & ksqlDB : Traitement de flux de messages avec Kafka Streams et ksqlDBRéf. KSQL2 joursIntermédiaireProchaine session : 2 nov.1 590 €
- MariaDB : Galera ClusterRéf. MDGC3 joursIntermédiaireProchaine session : 16 déc.2 090 €