- ACN_ATLAS
- Cours pratique
- Informatique
Formation AutoML avec H2O.ai
Automatiser la création, la comparaison et le déploiement de modèles de Machine Learning avec H2O.ai

- Durée
- 2 jours
- Niveau
- Fondamental
- Modalités
- Présentiel / Distanciel
Description de la formation AutoML H2O.ai
La conception d'un modèle de machine learning performant suppose de tester de nombreux algorithmes, de régler leurs hyperparamètres et de comparer rigoureusement les résultats — un travail long et répétitif. L'AutoML (Automated Machine Learning) automatise ces étapes pour produire rapidement des modèles de qualité et permettre au praticien de se concentrer sur la compréhension du problème et l'interprétation des résultats.
H2O.ai est l'une des plateformes de référence de l'AutoML. Open source, distribuée et accessible depuis Python comme R, elle entraîne et compare automatiquement de multiples modèles (modèles linéaires, forêts aléatoires, gradient boosting, deep learning, ensembles empilés) et les classe dans un leaderboard pour faciliter la sélection du meilleur.
Cette formation rend les participants capables de créer des modèles automatisés, de comparer leurs performances et de déployer les modèles H2O.ai en production. L'approche par la pratique, structurée autour d'ateliers progressifs sur des jeux de données réels, permet de lancer un premier run d'AutoML dès le premier jour, puis d'aborder en confiance l'interprétabilité des modèles et leur industrialisation via les formats MOJO et POJO.

Objectifs pédagogiques
À l'issue de cette formation AutoML avec H2O.ai, vous aurez acquis les connaissances nécessaires pour :
- Créer des modèles ML automatisés.
- Comparer les performances des modèles.
- Déployer des modèles H2O.ai.
Objectifs opérationnels
Savoir automatiser la création de modèles Machine Learning.
Programme
Contenu du cours, module par module
8 modules
- Les enjeux de l'AutoML : automatiser le cycle de modélisation
- Ce que l'AutoML automatise : sélection d'algorithmes, hyperparamètres, ensembles
- Positionnement de H2O.ai dans l'écosystème AutoML
- Panorama des produits H2O (H2O-3 open source, Driverless AI)
- Cas d'usage et limites de l'approche automatisée
- Architecture distribuée de H2O (cluster, nœuds, mémoire)
- Installation et démarrage d'un cluster H2O local
- Les API Python (h2o) et R
- H2O Flow : l'interface web interactive
- Import des données et notion de H2OFrame
Travaux pratiques
Descriptif : Démarrage d'un cluster H2O local, connexion depuis Python, import d'un jeu de données dans un H2OFrame, exploration via H2O Flow et premières manipulations de données pour se familiariser avec la plateforme.
- Exploration et statistiques descriptives d'un H2OFrame
- Gestion des valeurs manquantes et des types de colonnes
- Encodage des variables catégorielles
- Séparation entraînement / validation / test
- Définition de la cible et des variables explicatives
Travaux pratiques
Descriptif : Préparation d'un jeu de données réel dans H2O : analyse exploratoire, traitement des valeurs manquantes, typage des colonnes, définition de la variable cible et découpage en jeux d'entraînement, de validation et de test.
- Lancement d'un run avec la fonction H2OAutoML
- Les principaux paramètres : max_models, max_runtime_secs, validation
- Les familles de modèles entraînées (GLM, Random Forest, GBM, XGBoost, Deep Learning)
- Les modèles d'ensemble empilés (Stacked Ensembles)
- Contrôle de la reproductibilité (seed)
Travaux pratiques
Descriptif : Configuration et lancement d'un run H2O AutoML sur le jeu de données préparé, paramétrage du nombre de modèles et du temps d'exécution, et observation des différents modèles générés automatiquement.
- Lecture du leaderboard H2O AutoML
- Métriques de classification (AUC, logloss, F1) et de régression (RMSE, MAE)
- Validation croisée et robustesse des scores
- Comparaison des modèles et choix selon le contexte métier
- Détection du surapprentissage
Travaux pratiques
Descriptif : Analyse du leaderboard produit par AutoML, comparaison des modèles selon les métriques adaptées, examen de la validation croisée, et sélection argumentée du modèle le plus performant et le plus robuste.
- Importance des variables (variable importance)
- Graphiques de dépendance partielle (PDP) et ICE
- Valeurs SHAP pour l'explication des prédictions
- Explicabilité automatique (H2O Explainability)
Travaux pratiques
Descriptif : Génération du rapport d'explicabilité H2O sur le modèle sélectionné, analyse de l'importance des variables, lecture des graphiques de dépendance partielle et des valeurs SHAP pour expliquer les prédictions.
- Sauvegarde et rechargement d'un modèle H2O (binary model)
- Export au format MOJO et POJO
- Intérêt des MOJO pour un déploiement portable et performant
- Inférence par lots et en temps réel
- Intégration dans une application Java ou un service de scoring
- Introduction au suivi des modèles en production (monitoring, drift)
Travaux pratiques
Descriptif : Export du modèle sélectionné au format MOJO, rechargement dans un nouvel environnement, mise en œuvre d'une inférence par lots sur un jeu de données inédit, et présentation d'un scénario d'intégration dans un service de scoring.
- Quand faire confiance à l'AutoML et quand reprendre la main
- Reproductibilité et versionnement des modèles
- Bonnes pratiques de mise en production
- Pièges courants de l'AutoML
Programme mis à jour le 22/05/2026
Public concerné
Ce cours s'adresse aux data scientists et aux analystes avancés amenés à concevoir des modèles de machine learning et souhaitant accélérer leur production grâce à l'AutoML.
Il intéressera également les développeurs et les ingénieurs data souhaitant industrialiser la création et le déploiement de modèles prédictifs au sein de leurs projets.

Prérequis
Des connaissances en machine learning et en Python ou R sont nécessaires pour suivre cette formation.
Une familiarité avec les concepts fondamentaux de la modélisation (apprentissage supervisé, jeu d'entraînement et de test, métriques d'évaluation, surapprentissage) facilitera le suivi des ateliers.
J’évalue mes connaissances pour vérifier que je dispose des prérequis nécessaires pour profiter pleinement de cette formation en faisant le test de prérequis.
Faire le testFinancement
Cette formation peut être prise en charge par votre entreprise, seule ou avec l’appui de son opérateur de compétences. Nous fournissons le devis et les pièces attendues par l’OPCO.
Formations liées
- Deep Learning avec PyTorchRéf. DLPT3 joursFondamentalProchaine session : 19 oct.2 090 €
- Machine Learning distribué avec Spark MLRéf. MLSP3 joursFondamentalProchaine session : 12 oct.2 090 €
- Machine Learning et Data Science : déployer, monitorer et gérer des modèles en productionRéf. MLDS3 joursIntermédiaire
- Deep Learning : les fondamentauxRéf. ADLP3 joursIntermédiaireProchaine session : 7 déc.2 090 €