Concevoir des applications avec des modèles de fondation
Les techniques concrètes pour construire une application autour d'un modèle de fondation : prompt engineering, RAG, fine-tuning, agents, et le panorama des services AWS d'IA appliquée.
À retenir
- •Le prompt engineering (zero-shot, few-shot, chain-of-thought) améliore la qualité des réponses sans modifier le modèle lui-même.
- •Le RAG connecte un modèle à des données à jour et propres à l'entreprise, en réduisant le risque d'hallucination.
- •Le fine-tuning ajuste les poids d'un modèle sur des données propriétaires quand un prompt seul ne suffit plus.
- •Les agents Bedrock orchestrent plusieurs étapes de raisonnement et peuvent appeler des outils ou des API externes.
- •AWS propose des services d'IA prêts à l'emploi (Comprehend, Textract, Rekognition, Transcribe, Polly, Amazon Q) pour des tâches spécifiques sans construire de modèle.
Le prompt engineering
Le prompt engineering consiste à formuler l'instruction envoyée à un modèle de façon à obtenir la meilleure réponse possible, sans changer les poids du modèle. La technique zero-shot demande directement une tâche sans exemple. La technique few-shot fournit quelques exemples de paires question-réponse dans le prompt pour guider le format et le style attendus. Le chain-of-thought (raisonnement en chaîne) invite explicitement le modèle à détailler ses étapes de raisonnement avant de donner sa réponse finale, ce qui améliore la fiabilité sur des tâches de logique ou de calcul.
Un prompt template structure ces instructions de façon réutilisable, avec des variables à remplacer selon le contexte. Bien conçu, le prompt engineering est souvent la première étape à essayer avant d'envisager un fine-tuning, car il ne nécessite ni données d'entraînement supplémentaires ni coût de calcul additionnel.
La génération augmentée par récupération (RAG)
Le RAG (retrieval augmented generation) connecte un modèle de fondation à une base de connaissances externe au moment de l'inférence. Plutôt que de compter uniquement sur ce que le modèle a mémorisé pendant son entraînement, le système récupère d'abord les documents les plus pertinents pour la question posée, puis les injecte dans le prompt envoyé au modèle. Cette approche réduit fortement le risque d'hallucination et permet de répondre avec des informations à jour ou propres à l'entreprise, sans réentraîner le modèle.
Sur AWS, Amazon Bedrock Knowledge Bases automatise ce pipeline : il découpe les documents, calcule leurs embeddings, les stocke dans un magasin vectoriel (par exemple Amazon OpenSearch Service ou Amazon Aurora avec pgvector) et orchestre la recherche puis l'appel au modèle. Le RAG est généralement la solution à privilégier quand le besoin est de répondre à partir d'une documentation d'entreprise plutôt que de changer le comportement ou le style du modèle.
Le fine-tuning et la personnalisation de modèles
Le fine-tuning ajuste les poids d'un modèle de fondation pré-entraîné à partir d'un jeu de données propriétaire, pour spécialiser son comportement sur un domaine, un ton ou un format précis. Il est pertinent quand le prompt engineering et le RAG ne suffisent plus, par exemple pour faire adopter à un modèle le vocabulaire très spécifique d'un secteur ou un format de sortie strict.
Amazon Bedrock permet de personnaliser certains modèles de deux façons : le fine-tuning classique avec des exemples étiquetés, et le continued pre-training qui poursuit l'entraînement du modèle sur un large corpus de texte non étiqueté propre à l'entreprise. Le fine-tuning demande plus de données, de temps et de budget qu'un simple ajustement de prompt, et doit être réservé aux cas où le gain de qualité le justifie.
Les agents et l'orchestration d'outils
Un agent d'IA générative va au-delà d'une simple question-réponse : il décompose une tâche complexe en plusieurs étapes, décide quand appeler un outil externe (une API, une base de données, une fonction de calcul), puis assemble les résultats pour produire une réponse finale cohérente. Cette capacité à appeler des outils est souvent désignée par function calling ou tool use.
Amazon Bedrock Agents automatise cette orchestration : l'agent interprète la demande de l'utilisateur, planifie les actions nécessaires, invoque des fonctions AWS Lambda pour exécuter des tâches concrètes, et peut interroger une base de connaissances via RAG au passage. Un exemple typique est un agent de support client capable de consulter le statut d'une commande dans une base de données, puis de rédiger une réponse personnalisée au client.
Le panorama des services AWS d'IA appliquée
AWS propose une gamme de services d'IA managés qui n'exigent pas de construire ni d'entraîner de modèle. Amazon Comprehend extrait des informations d'un texte : sentiment, entités nommées, expressions clés, langue détectée. Amazon Textract extrait du texte structuré et des données de formulaires ou de tableaux depuis des documents scannés. Amazon Rekognition analyse des images et des vidéos pour détecter des objets, des visages ou du texte incrusté. Amazon Transcribe convertit de la parole en texte, et Amazon Polly fait l'inverse en convertissant du texte en parole naturelle.
Amazon Q décline cette logique en assistants génératifs prêts à l'emploi : Amazon Q Business répond aux questions des employés en s'appuyant sur les données internes de l'entreprise, et Amazon Q Developer aide les développeurs à écrire, comprendre et migrer du code directement dans leur environnement de développement. Pour choisir entre un service prêt à l'emploi et une solution bâtie sur Bedrock, le critère principal est le niveau de personnalisation requis : un besoin standard se couvre avec un service managé, un besoin sur mesure justifie de construire sur des modèles de fondation.