SkillCert AI
Microsoft Certified: Azure AI Fundamentals

Les fonctionnalités d'IA générative sur Azure

Décrire les fonctionnalités d'IA générative sur Azure10 min de lecture

Ce module explique le fonctionnement des modèles de fondation et des grands modèles de langage, et présente Azure OpenAI Service ainsi que les bonnes pratiques de prompt engineering et de génération augmentée par récupération (RAG).

À retenir

  • •Les modèles de fondation sont pré-entraînés sur d'immenses volumes de données et réutilisables pour de nombreuses tâches.
  • •Azure OpenAI Service donne accès à des modèles comme GPT et DALL-E via une infrastructure Azure sécurisée.
  • •Le prompt engineering consiste à formuler des instructions précises pour orienter la réponse d'un modèle génératif.
  • •La génération augmentée de récupération (RAG) ancre les réponses d'un modèle dans des documents d'entreprise à jour.
  • •Les modèles génératifs peuvent halluciner, c'est-à-dire produire des réponses fausses avec assurance.
  • •Azure AI Foundry propose des filtres de contenu pour limiter les réponses inappropriées ou dangereuses.

Des modèles de fondation aux grands modèles de langage

Un modèle de fondation est un modèle de grande taille, entraîné une seule fois sur d'immenses volumes de données textuelles, de code ou d'images, puis réutilisé tel quel ou légèrement adapté pour de nombreuses tâches différentes, plutôt qu'entraîné à nouveau depuis zéro pour chaque usage. Cette approche s'oppose aux modèles de machine learning classiques, généralement entraînés sur un jeu de données restreint pour une tâche unique et précise.

La plupart des modèles de fondation utilisés en IA générative reposent sur une architecture de réseau de neurones appelée transformer, qui permet au modèle de traiter le texte en tenant compte du contexte de chaque mot par rapport à l'ensemble de la phrase ou du document, plutôt que mot par mot de façon isolée. C'est cette architecture qui a rendu possible les grands modèles de langage (LLM) comme la famille GPT, capables de générer du texte cohérent, de résumer des documents, de traduire ou d'écrire du code à partir d'une simple instruction en langage naturel.

Azure OpenAI Service

Azure OpenAI Service donne accès, au sein d'un abonnement Azure, à des modèles développés par OpenAI comme la famille GPT pour la génération de texte et de code, ou DALL-E pour la génération d'images à partir d'une description textuelle. Le service inclut aussi des modèles d'embeddings, qui convertissent un texte en un vecteur numérique représentant son sens, utile pour la recherche sémantique ou le regroupement de documents proches en signification.

L'intérêt principal d'Azure OpenAI Service par rapport à un accès direct à l'API d'OpenAI tient aux garanties d'entreprise apportées par Azure : isolement réseau, conformité réglementaire, résidence des données dans une région choisie, authentification via Microsoft Entra ID et intégration avec les autres services Azure. Les déploiements de modèles se gèrent et se surveillent désormais depuis Azure AI Foundry, qui centralise le choix du modèle, son paramétrage et le suivi de son utilisation.

Le prompt engineering, l'art de bien formuler une requête

Le prompt engineering désigne la pratique consistant à formuler et affiner l'instruction, le prompt, envoyée à un modèle génératif afin d'obtenir une réponse, la complétion, la plus pertinente possible, sans modifier les paramètres internes du modèle.

Quelques notions techniques reviennent régulièrement à l'examen. Le token est l'unité de texte, mot ou fragment de mot, que le modèle traite pour lire un prompt et générer sa réponse ; la facturation d'Azure OpenAI Service se fait généralement au nombre de tokens consommés. La fenêtre de contexte correspond au nombre maximal de tokens, prompt et réponse compris, que le modèle peut traiter en une seule requête. Le paramètre de température contrôle le degré de créativité ou de déterminisme de la réponse : une température basse produit des réponses plus prévisibles et répétables, une température élevée produit des réponses plus variées et parfois plus originales.

Fournir des exemples dans le prompt, une approche dite few-shot, ou décrire précisément le rôle attendu du modèle, par exemple tu es un assistant qui répond uniquement par des phrases courtes, améliore généralement la qualité et la cohérence des réponses obtenues.

La génération augmentée de récupération (RAG)

Un modèle de fondation a une connaissance figée à la date de son entraînement et ignore par définition les documents internes d'une entreprise ou les événements récents. La génération augmentée de récupération, ou RAG, répond à cette limite en ancrant les réponses du modèle dans une base de connaissances externe et à jour, sans nécessiter de réentraîner le modèle.

Le principe consiste à indexer au préalable les documents d'entreprise sous forme de vecteurs d'embeddings dans une base de recherche, par exemple Azure AI Search. Lorsqu'un utilisateur pose une question, le système recherche d'abord les extraits de documents les plus pertinents par similarité sémantique, puis les insère dans le prompt envoyé au modèle génératif comme contexte supplémentaire. Le modèle génère alors sa réponse en s'appuyant sur ces extraits réels plutôt que sur sa seule mémoire d'entraînement, ce qui réduit le risque de réponse inventée et permet de citer les sources d'origine.

Risques et bonnes pratiques : hallucinations et filtres de contenu

Un modèle génératif peut produire une hallucination, c'est-à-dire une réponse fausse ou inventée mais formulée avec la même assurance qu'une réponse correcte. Ce phénomène découle du fonctionnement même du modèle, qui génère la suite de mots la plus statistiquement probable sans vérifier la véracité factuelle de ce qu'il produit. C'est pourquoi les scénarios à fort enjeu, comme un conseil médical ou juridique, exigent une supervision humaine avant toute action basée sur une réponse générée.

Azure AI Foundry intègre des filtres de contenu appliqués par défaut aux déploiements de modèles génératifs, qui analysent les entrées et les sorties pour détecter et bloquer des catégories de contenu jugées à risque : haine, violence, contenu sexuel ou auto-mutilation. Ces filtres, ajustables selon le contexte d'usage, illustrent l'application concrète des principes d'IA responsable présentés dans le premier module de ce parcours, en particulier la fiabilité et la sécurité, aux spécificités de l'IA générative.