Comprendre l'intelligence artificielle et le machine learning
Les définitions de base de l'IA, du machine learning et du deep learning, les trois grands types d'apprentissage et le cycle de vie complet d'un projet ML sur AWS.
À retenir
- •L'IA, le machine learning, le deep learning et l'IA générative s'emboîtent : chacun est un sous-ensemble du précédent.
- •Les trois grands types d'apprentissage sont supervisé, non supervisé et par renforcement, chacun adapté à des problèmes différents.
- •Un projet ML suit un cycle répétable : collecte et préparation des données, entraînement, évaluation, déploiement, surveillance.
- •Amazon SageMaker couvre l'ensemble de ce cycle de vie avec un outil dédié à chaque étape.
- •Le choix des bonnes métriques (précision, rappel, F1, RMSE) dépend du type de problème et de son contexte métier.
Intelligence artificielle, machine learning et deep learning
L'intelligence artificielle regroupe l'ensemble des techniques qui permettent à un système informatique d'imiter des capacités cognitives humaines comme le raisonnement, la perception ou la prise de décision. Le machine learning est une sous-catégorie de l'IA dans laquelle le système apprend des motifs à partir de données plutôt que de suivre des règles codées à la main par un développeur. Le deep learning est lui-même une sous-catégorie du machine learning qui s'appuie sur des réseaux de neurones à plusieurs couches, capables de traiter des données complexes comme des images, du son ou du texte brut.
L'IA générative est une branche récente du deep learning. Contrairement à un modèle de classification qui prédit une étiquette parmi un ensemble connu, un modèle génératif produit du contenu nouveau : texte, image, code ou audio. Cette hiérarchie de concepts revient souvent à l'examen AIF-C01, qui teste la capacité à situer un cas d'usage dans la bonne catégorie plutôt que la maîtrise de formules mathématiques.
Les trois grands types d'apprentissage
L'apprentissage supervisé entraîne un modèle sur des données étiquetées : chaque exemple contient à la fois les variables d'entrée et le résultat attendu. C'est le cas d'une détection de fraude bancaire entraînée sur des transactions déjà classées comme frauduleuses ou légitimes, ou d'une prédiction de prix immobilier à partir de ventes passées.
L'apprentissage non supervisé travaille sur des données sans étiquette. L'objectif est de découvrir une structure cachée : regrouper des clients par comportement d'achat (clustering) ou détecter des transactions anormales sans exemple préalable de fraude (détection d'anomalies).
L'apprentissage par renforcement fait apprendre un agent par essais et erreurs dans un environnement, en maximisant une récompense cumulée. AWS DeepRacer, la voiture autonome miniature utilisée dans les compétitions AWS, illustre ce principe : le véhicule apprend à suivre une piste en étant récompensé quand il reste sur la trajectoire.
Le cycle de vie d'un projet de machine learning
Un projet ML suit une séquence d'étapes qui se répète à chaque itération. La collecte et la préparation des données couvrent le nettoyage, la gestion des valeurs manquantes et la création de nouvelles variables utiles (feature engineering). Vient ensuite l'entraînement, où le jeu de données est divisé en un ensemble d'entraînement, un ensemble de validation pour ajuster les hyperparamètres, et un ensemble de test réservé à l'évaluation finale.
L'évaluation compare les prédictions du modèle à la réalité à l'aide de métriques adaptées au problème. Le déploiement expose ensuite le modèle, soit via un point de terminaison temps réel pour des prédictions unitaires, soit via une transformation par lots (batch) pour traiter de gros volumes en différé. Enfin la surveillance détecte la dérive des données (data drift) ou la dégradation de la performance dans le temps, ce qui déclenche un nouveau cycle d'entraînement.
Amazon SageMaker et l'écosystème AWS pour le ML
Amazon SageMaker est le service managé central d'AWS pour construire, entraîner et déployer des modèles de machine learning. SageMaker Studio offre un environnement de développement intégré unique pour l'ensemble du cycle de vie. SageMaker Autopilot automatise la sélection d'algorithme et le réglage d'hyperparamètres pour produire un modèle sans écrire de code de bas niveau (AutoML).
SageMaker Data Wrangler simplifie la préparation et la transformation des données directement depuis une interface visuelle. SageMaker Feature Store centralise et partage les variables (features) entre plusieurs équipes et modèles pour éviter de recalculer les mêmes transformations. SageMaker Clarify détecte les biais dans les données et les prédictions, et explique les décisions du modèle. SageMaker Model Monitor surveille en continu un modèle déployé pour détecter une dérive de qualité. SageMaker Ground Truth aide à constituer des jeux de données étiquetés avec l'appui d'annotateurs humains.
Mesurer la performance d'un modèle
Pour un problème de classification, la matrice de confusion sert de base à plusieurs métriques : l'exactitude (accuracy) mesure la proportion de prédictions correctes, la précision mesure la fiabilité des prédictions positives, le rappel (recall) mesure la capacité à retrouver tous les cas positifs réels, et le score F1 combine précision et rappel en une seule valeur. L'aire sous la courbe ROC (AUC-ROC) évalue la capacité globale du modèle à distinguer les classes.
Pour un problème de régression, on utilise plutôt l'erreur quadratique moyenne (RMSE), l'erreur absolue moyenne (MAE) ou le coefficient de détermination (R²). Le choix de la métrique dépend toujours du contexte métier : pour une détection de fraude, un rappel élevé est souvent prioritaire même au prix d'un peu de précision, car laisser passer une fraude coûte plus cher qu'une fausse alerte à vérifier.