SkillCert AI
Google Cloud Generative AI Leader

Prompt engineering, grounding, RAG et fine-tuning

Techniques pour améliorer les résultats des modèles10 min de lecture

Ce module détaille les quatre grandes techniques pour améliorer les réponses d'un modèle d'IA générative, de la plus simple et la moins coûteuse à la plus exigeante en données et en calcul.

À retenir

  • •Le prompt engineering optimise la formulation de l'instruction sans modifier le modèle ni ajouter de données externes.
  • •Le grounding ancre les réponses du modèle dans des sources vérifiables, comme la recherche Google ou des documents d'entreprise.
  • •Le RAG (retrieval-augmented generation) va chercher des informations pertinentes dans une base documentaire avant de générer la réponse.
  • •Le fine-tuning ajuste les paramètres internes du modèle à partir d'exemples spécifiques à un domaine ou une tâche.
  • •Le choix de la technique dépend du volume de données disponible, du budget et du besoin de traçabilité des réponses.

Le prompt engineering, premier réflexe

Le prompt engineering consiste à structurer et affiner l'instruction envoyée au modèle pour obtenir une réponse plus précise, sans toucher au modèle lui-même. Les techniques courantes incluent la définition claire d'un rôle ou d'un persona pour le modèle, la fourniture d'exemples de réponses attendues, dite few-shot prompting, la décomposition d'un problème complexe en étapes explicites, et la précision du format de sortie souhaité. C'est la technique la plus rapide à mettre en œuvre et la moins coûteuse, ce qui en fait le point de départ recommandé avant d'envisager des approches plus lourdes comme le RAG ou le fine-tuning.

Le grounding, ancrer les réponses dans des faits

Le grounding, ou ancrage, consiste à connecter les réponses du modèle à des sources d'information vérifiables plutôt que de le laisser générer une réponse uniquement à partir de ses connaissances internes, potentiellement obsolètes ou incorrectes. Sur Google Cloud, le grounding peut s'appuyer sur la recherche Google pour des informations publiques et récentes, ou sur des documents internes à l'entreprise via Vertex AI Search. L'intérêt principal du grounding est de réduire les hallucinations et de permettre de citer les sources utilisées, un point souvent décisif dans des contextes réglementés ou à forte exigence de fiabilité.

Le RAG, retrieval-augmented generation

Le RAG est une architecture qui combine un système de recherche documentaire et un modèle génératif. Avant de répondre, le système recherche dans une base de documents (contrats, manuels, bases de connaissance internes) les passages les plus pertinents par rapport à la question posée, puis les transmet au modèle comme contexte pour construire sa réponse. Cette approche permet d'exploiter des données propriétaires ou très récentes sans avoir à réentraîner le modèle, et elle limite les hallucinations puisque le modèle s'appuie sur des extraits réels plutôt que sur sa seule mémoire. Le RAG demande en revanche de mettre en place une infrastructure de recherche et d'indexation, ce qui représente un effort d'ingénierie supérieur au simple prompt engineering.

Le fine-tuning, adapter le modèle lui-même

Le fine-tuning consiste à poursuivre l'entraînement d'un modèle de fondation sur un jeu de données spécifique à une tâche ou à un domaine, ce qui modifie ses paramètres internes. Cette technique convient quand un cas d'usage exige un style de réponse très particulier, un vocabulaire métier spécialisé, ou une tâche répétée à très grande échelle où un léger gain de précision par requête se traduit en économies substantielles. Le fine-tuning demande davantage de données étiquetées, de budget de calcul et d'expertise que le prompt engineering ou le RAG, et il doit être réévalué à chaque nouvelle version du modèle de base. C'est généralement la dernière option envisagée, après avoir épuisé les gains possibles du prompting et du RAG.

Choisir la bonne combinaison de techniques

Dans la pratique, ces techniques ne s'excluent pas : une application d'entreprise combine souvent un prompt bien conçu, un ancrage sur une base documentaire via RAG, et parfois un fine-tuning léger pour calibrer le ton des réponses. Le choix dépend de critères concrets : le volume et la fraîcheur des données disponibles, le budget alloué au projet, l'exigence de traçabilité des réponses, et la criticité des erreurs possibles. Un décideur doit être capable d'arbitrer entre ces options avec son équipe technique plutôt que d'imposer une solution a priori, car la complexité et le coût augmentent fortement du simple prompting jusqu'au fine-tuning.