SkillCert AI
AWS Certified AI Practitioner

Les bases de l'IA générative

Fondamentaux de l'IA générative10 min de lecture

Les modèles de fondation, l'architecture transformer, les paramètres d'inférence, les cas d'usage courants et les limites de l'IA générative, avec un premier aperçu d'Amazon Bedrock.

À retenir

  • •Un modèle de fondation est entraîné sur d'immenses volumes de données puis adapté à de nombreuses tâches en aval.
  • •L'architecture transformer et son mécanisme d'attention permettent aux grands modèles de langage de traiter le contexte d'un texte entier.
  • •Les paramètres d'inférence (température, top-p, top-k, longueur de sortie) contrôlent la créativité et la longueur des réponses générées.
  • •L'IA générative excite pour la rédaction, le résumé, la génération de code, la conversation et la création d'images, mais reste sujette aux hallucinations.
  • •Amazon Bedrock donne accès via une API unique à plusieurs modèles de fondation, dont la famille Amazon Titan.

Qu'est-ce qu'un modèle de fondation

Un modèle de fondation est un modèle de très grande taille, entraîné sur des volumes massifs de données non étiquetées ou faiblement étiquetées, et conçu pour être réutilisé sur de nombreuses tâches différentes sans devoir repartir de zéro. Cette polyvalence le distingue des modèles de machine learning traditionnels, entraînés spécifiquement pour une seule tâche comme la classification d'e-mails ou la prévision de ventes.

Les grands modèles de langage (LLM, large language models) sont la famille de modèles de fondation la plus connue du grand public, capables de comprendre et de générer du texte. D'autres familles existent pour l'image, comme les modèles de diffusion utilisés par des outils de génération d'images, ou pour l'audio et la vidéo. AWS propose l'accès à plusieurs de ces familles via Amazon Bedrock, sans avoir à gérer d'infrastructure de calcul dédiée.

L'architecture transformer et le vocabulaire de base

L'architecture transformer, introduite en 2017, est à la base de la quasi-totalité des grands modèles de langage actuels. Son mécanisme central, l'attention, permet au modèle de pondérer l'importance relative de chaque mot d'un texte par rapport à tous les autres, ce qui lui donne une bonne compréhension du contexte, y compris sur de longs passages.

Quelques termes reviennent constamment à l'examen. Un token est une unité de texte, souvent un mot ou un fragment de mot, que le modèle manipule en interne. Un embedding est une représentation numérique d'un mot, d'une phrase ou d'un document sous forme de vecteur, qui capture le sens de façon à ce que des concepts proches aient des vecteurs proches. La fenêtre de contexte désigne la quantité maximale de texte (mesurée en tokens) que le modèle peut prendre en compte en une seule fois, à la fois en entrée et en sortie.

Contrôler la génération : les paramètres d'inférence

Plusieurs paramètres permettent d'ajuster le comportement d'un modèle génératif sans le réentraîner. La température contrôle le niveau d'aléatoire de la génération : une température basse produit des réponses plus déterministes et prévisibles, une température haute produit des réponses plus variées et parfois plus créatives.

Le top-p (nucleus sampling) et le top-k limitent l'ensemble des mots candidats à chaque étape de génération, respectivement en fixant un seuil de probabilité cumulée ou un nombre fixe de candidats. La longueur maximale de sortie borne le nombre de tokens générés dans la réponse. Ces paramètres se règlent au cas par cas selon l'usage : une température basse convient à un résumé factuel, une température plus haute convient à un brainstorming créatif.

Cas d'usage et limites de l'IA générative

Les cas d'usage les plus courants de l'IA générative en entreprise sont la rédaction et la reformulation de texte, le résumé de documents longs, la génération et l'explication de code, les agents conversationnels de support client, la recherche augmentée par le langage naturel, et la génération d'images ou de variantes visuelles pour le marketing.

Ces modèles restent toutefois limités. Une hallucination désigne une réponse générée avec assurance mais factuellement fausse ou inventée, un risque particulièrement sensible dans des domaines réglementés comme la santé ou la finance. Les modèles peuvent aussi reproduire des biais présents dans leurs données d'entraînement, et leur usage à grande échelle a un coût de calcul et une latence à prendre en compte dès la conception d'une solution.

Amazon Bedrock et la famille Amazon Titan

Amazon Bedrock est le service managé d'AWS qui donne accès, via une API unique, à des modèles de fondation de plusieurs fournisseurs (par exemple Anthropic, Meta, Mistral AI, Amazon lui-même) sans avoir à provisionner ni gérer de serveurs de calcul. Bedrock permet de comparer facilement plusieurs modèles sur un même cas d'usage et de personnaliser certains modèles avec ses propres données.

Amazon Titan est la famille de modèles de fondation développée directement par AWS, disponible dans Bedrock. Elle comprend notamment des modèles de génération de texte, des modèles d'embeddings pour la recherche sémantique, et des modèles de génération et d'édition d'images. Retenir qu'Amazon Bedrock est la porte d'entrée unique vers ces modèles, et qu'Amazon Titan est une des familles de modèles disponibles à l'intérieur de Bedrock, est un point fréquemment testé à l'examen.