SkillCert AI
Google Cloud Generative AI Leader

Comprendre l'IA générative et les modèles de fondation

Fondamentaux de l'IA générative9 min de lecture

Ce module pose le vocabulaire de base de l'IA générative : modèles de fondation, grands modèles de langage, entraînement, inférence et prompting, pour donner à un décideur les repères nécessaires avant d'aborder l'offre Google Cloud.

À retenir

  • •L'IA générative produit du contenu nouveau (texte, image, audio, code) plutôt que de simplement classer ou prédire une valeur.
  • •Un modèle de fondation est entraîné sur de très grands volumes de données puis adapté à de nombreuses tâches différentes.
  • •L'entraînement et l'inférence sont deux phases distinctes : la première façonne le modèle, la seconde l'utilise pour produire une réponse.
  • •Un prompt est l'instruction envoyée au modèle ; sa qualité influence directement la qualité de la réponse.
  • •Les grands modèles de langage (LLM) sont un cas particulier de modèle de fondation spécialisé dans le texte et le langage.

De l'IA prédictive à l'IA générative

L'IA prédictive classique apprend à reconnaître des motifs dans des données existantes pour classer, scorer ou prévoir : détecter une fraude, prédire une résiliation, recommander un produit déjà catalogué. L'IA générative va plus loin : elle apprend la structure profonde du langage, de l'image ou du son pour produire du contenu inédit. Un modèle de génération de texte ne choisit pas une réponse parmi une liste fermée, il construit une séquence de mots nouvelle, cohérente avec le contexte donné. Cette distinction est centrale pour un décideur, car elle change la nature des cas d'usage possibles : rédaction, synthèse, génération de code, création visuelle, dialogue conversationnel, là où l'IA prédictive reste cantonnée à des tâches de classification ou de scoring.

Les modèles de fondation

Un modèle de fondation est un modèle entraîné sur un très grand volume de données diverses (texte, code, images selon les cas), avec suffisamment de paramètres pour capturer des régularités générales du langage et du raisonnement. Sa force est la polyvalence : le même modèle de base peut ensuite être adapté, par prompting ou par fine-tuning, à des tâches très variées comme la synthèse de documents, la génération de code ou la classification de sentiment, sans devoir entraîner un modèle spécifique pour chaque tâche. Les grands modèles de langage (LLM) constituent la famille de modèles de fondation la plus connue, spécialisée dans la compréhension et la génération de texte. Google propose sa propre famille de modèles de fondation sous le nom Gemini, multimodale dès sa conception.

Entraînement et inférence

Deux phases distinctes structurent le cycle de vie d'un modèle. L'entraînement consiste à exposer le modèle à d'immenses volumes de données pour ajuster ses paramètres internes, un processus coûteux en calcul qui se déroule une fois, ou périodiquement pour les mises à jour du modèle. L'inférence est l'utilisation du modèle déjà entraîné pour produire une réponse à partir d'une nouvelle entrée : c'est ce qui se passe chaque fois qu'un utilisateur envoie un prompt et reçoit une réponse. Pour un décideur, cette distinction éclaire la structure des coûts : l'entraînement d'un modèle de fondation depuis zéro est réservé à quelques acteurs disposant d'infrastructures massives, alors que l'inférence, elle, est accessible à toute organisation via une API comme celle de Vertex AI.

Le prompting comme premier levier

Le prompt est l'instruction textuelle, ou multimodale, envoyée au modèle pour obtenir une réponse. Sans changer un seul paramètre du modèle, la formulation du prompt influence fortement la qualité, la précision et le format de la réponse obtenue. C'est le levier le plus rapide et le moins coûteux pour améliorer un résultat, avant d'envisager des techniques plus avancées comme le RAG ou le fine-tuning, abordées dans un autre module. Un bon prompt précise le contexte, le rôle attendu du modèle, le format de sortie souhaité et, si besoin, des exemples de réponses correctes.

Multimodalité et limites actuelles

Les modèles récents comme Gemini sont multimodaux : ils traitent et génèrent plusieurs types de contenus (texte, image, audio, vidéo, code) au sein d'un même modèle. Cela ouvre des cas d'usage combinant plusieurs formats, par exemple analyser une image et répondre à une question textuelle à son sujet. Ces modèles restent toutefois sujets à des limites connues : ils peuvent produire des réponses incorrectes avec assurance, un phénomène appelé hallucination, et leurs connaissances sont bornées par leurs données d'entraînement à une date donnée. Ces limites justifient les techniques d'ancrage et de vérification présentées plus loin dans la formation.