Les fondamentaux du machine learning
Ce module couvre les concepts de base de l'apprentissage automatique : types d'apprentissage, régression, classification, clustering, et l'outillage Azure Machine Learning pour entraîner et évaluer des modèles.
À retenir
- •L'apprentissage supervisé utilise des données étiquetées, l'apprentissage non supervisé travaille sur des données sans étiquette.
- •La régression prédit une valeur numérique continue, la classification prédit une catégorie.
- •Le clustering regroupe des observations similaires sans connaître les catégories à l'avance.
- •Azure Machine Learning propose un studio avec designer visuel, notebooks et AutoML pour entraîner des modèles.
- •Le surapprentissage (overfitting) survient quand un modèle mémorise les données d'entraînement au lieu de généraliser.
- •Les métriques d'évaluation, précision, rappel ou RMSE selon la tâche, permettent de mesurer objectivement la qualité d'un modèle.
Apprentissage supervisé, non supervisé et par renforcement
Le machine learning, ou apprentissage automatique, désigne la capacité d'un système à apprendre des motifs à partir de données plutôt qu'à suivre des règles codées explicitement. Il existe trois grandes approches.
L'apprentissage supervisé entraîne un modèle sur des données étiquetées : chaque exemple est composé de caractéristiques (features) et d'une étiquette connue (label), la valeur que l'on cherche à prédire. Un modèle qui apprend à reconnaître un email de spam à partir d'exemples déjà classés spam ou non spam relève de l'apprentissage supervisé.
L'apprentissage non supervisé travaille sur des données sans étiquette. Le modèle cherche lui-même des structures ou des regroupements naturels, par exemple pour segmenter une base de clients en groupes homogènes sans savoir à l'avance combien de groupes existent ni ce qui les caractérise.
L'apprentissage par renforcement entraîne un agent à prendre des décisions séquentielles dans un environnement, en le récompensant ou en le pénalisant selon les résultats de ses actions. Ce mode d'apprentissage est moins présent dans l'examen AI-900 mais reste utile pour situer le paysage du machine learning.
Régression, classification et clustering
Au sein de l'apprentissage supervisé, on distingue deux tâches principales selon la nature de la valeur à prédire.
La régression prédit une valeur numérique continue. Estimer le prix de vente d'un bien immobilier à partir de sa surface, de sa localisation et du nombre de pièces est un problème de régression : la sortie peut prendre n'importe quelle valeur dans une plage continue.
La classification prédit une catégorie parmi un ensemble fini de classes. Déterminer si un email est un spam ou non, ou si une image de radiographie montre une anomalie ou non, sont des problèmes de classification binaire. Quand il y a plus de deux catégories possibles, comme reconnaître le type d'un fruit sur une photo, on parle de classification multiclasse.
Le clustering, propre à l'apprentissage non supervisé, regroupe des observations similaires entre elles sur la base de leurs caractéristiques, sans connaître de catégories prédéfinies. C'est la technique utilisée pour la segmentation client, la détection de groupes à risque ou le regroupement de documents similaires.
Dans Azure Machine Learning designer, ces trois familles de tâches correspondent à des modules prêts à l'emploi que l'on peut assembler visuellement dans un pipeline, sans écrire de code.
Le cycle d'entraînement d'un modèle : données, entraînement, validation, test
Entraîner un modèle suit un cycle en plusieurs étapes. On part d'un jeu de données que l'on divise généralement en trois sous-ensembles : les données d'entraînement, sur lesquelles le modèle apprend ses paramètres ; les données de validation, utilisées pour ajuster les hyperparamètres et comparer plusieurs modèles ; et les données de test, réservées à l'évaluation finale sur des exemples que le modèle n'a jamais vus.
Cette séparation est essentielle pour détecter deux problèmes courants. Le sous-apprentissage (underfitting) se produit quand un modèle est trop simple pour capturer les motifs présents dans les données, avec de mauvaises performances aussi bien à l'entraînement qu'au test. Le surapprentissage (overfitting) se produit à l'inverse quand un modèle mémorise les particularités des données d'entraînement, y compris leur bruit, au point de très bien performer sur ces données mais de mal généraliser sur des données nouvelles. Un écart important entre la précision sur les données d'entraînement et celle sur les données de test est le signal caractéristique d'un surapprentissage.
Un jeu de test représentatif, distinct des données d'entraînement, reste la seule façon fiable de savoir si un modèle sera utile en conditions réelles.
Azure Machine Learning : studio, designer, AutoML et notebooks
Azure Machine Learning est le service Azure dédié à l'entraînement, au déploiement et à la gestion du cycle de vie des modèles de machine learning. Il s'organise autour d'un espace de travail (workspace) qui centralise les données, les expériences, les modèles enregistrés et les ressources de calcul.
Plusieurs façons de travailler coexistent dans le studio Azure Machine Learning. Le designer visuel permet de construire un pipeline d'entraînement par glisser-déposer, en enchaînant des modules de préparation de données, d'entraînement et d'évaluation, sans écrire de code. Les notebooks intégrés, basés sur Python et le SDK Azure Machine Learning, conviennent aux data scientists qui préfèrent une approche code-first. AutoML, ou apprentissage automatique automatisé, teste automatiquement plusieurs algorithmes et combinaisons d'hyperparamètres sur un jeu de données donné, puis classe les modèles obtenus par performance, ce qui permet d'obtenir rapidement un modèle solide sans expertise poussée en science des données.
Une fois entraîné, un modèle peut être enregistré dans le registre de modèles puis déployé comme point de terminaison en temps réel ou en traitement par lot, exposé via une API REST que les applications peuvent appeler.
Évaluer la performance d'un modèle
Évaluer un modèle nécessite des métriques adaptées à la tâche. Pour un modèle de classification, la matrice de confusion croise les prédictions et les valeurs réelles ; elle permet de calculer la précision globale (accuracy, proportion de prédictions correctes), la précision positive (precision, proportion de prédictions positives réellement correctes) et le rappel (recall, proportion de cas positifs réels correctement détectés). Le score F1 combine precision et recall en une seule valeur, utile quand les classes sont déséquilibrées.
Pour un modèle de régression, on utilise plutôt l'erreur quadratique moyenne (RMSE), l'erreur absolue moyenne (MAE) ou le coefficient de détermination R², qui mesure la part de variance expliquée par le modèle.
Pour le clustering, faute d'étiquette de référence, on s'appuie sur des métriques internes comme le silhouette score, qui évalue à quel point les observations d'un même groupe sont proches entre elles par rapport aux autres groupes.
Choisir la bonne métrique selon le type de problème est une compétence directement testée dans l'examen AI-900.