SkillCert AI
AI Foundations

Comprendre l'IA générative et les grands modèles de langage

Fondamentaux de l'IA générative et des grands modèles de langage9 min de lecture

Les mécanismes qui permettent à un modèle comme GPT de générer du texte, et les grandes familles de modèles proposées par OpenAI.

À retenir

  • •Un LLM prédit le prochain token à partir du contexte, il ne récupère pas une réponse toute faite dans une base de données.
  • •L'entraînement combine pré-entraînement sur de vastes corpus de texte et alignement par retours humains (RLHF).
  • •La fenêtre de contexte fixe la quantité de texte (prompt et historique compris) que le modèle peut traiter en une fois.
  • •Les modèles de raisonnement de la série o allouent davantage de calcul avant de répondre, utile pour les tâches logiques ou mathématiques complexes.
  • •La température et les paramètres d'échantillonnage influencent la créativité et la variabilité des réponses.

Qu'est-ce qu'un grand modèle de langage

Un grand modèle de langage (LLM, large language model) est un modèle statistique entraîné sur d'énormes quantités de texte pour apprendre les régularités du langage : grammaire, style, faits fréquemment cités, structures de raisonnement récurrentes. Concrètement, un modèle comme GPT contient des centaines de milliards de paramètres, des valeurs numériques ajustées pendant l'entraînement pour que le modèle devienne de plus en plus précis à une tâche unique : prédire le mot ou fragment de mot suivant dans une séquence de texte. Cette simplicité apparente de l'objectif d'entraînement produit, à grande échelle, un système capable de rédiger, résumer, traduire, coder ou raisonner sur des problèmes qu'il n'a jamais vus tels quels. Il est utile de garder à l'esprit qu'un LLM ne consulte pas une base de connaissances au moment où il répond : il génère une suite de texte plausible compte tenu de tout ce qu'il a appris pendant l'entraînement et du contexte fourni dans la conversation.

Comment un modèle génère du texte : tokens et prédiction

Le texte n'est pas traité mot par mot mais découpé en tokens, des unités qui correspondent souvent à des fragments de mots, des mots entiers ou de la ponctuation. Un mot rare ou un mot composé peut ainsi être scindé en plusieurs tokens. Le modèle fonctionne de façon autorégressive : il prédit un token à la fois, l'ajoute à la séquence, puis recommence en tenant compte de ce nouveau contexte, jusqu'à produire une réponse complète. Deux paramètres influencent directement le résultat : - la température, qui contrôle le degré d'aléa dans le choix du prochain token : une température basse favorise les réponses les plus probables et donc plus prévisibles, une température élevée introduit plus de variété et de créativité, au risque d'imprécisions. - la fenêtre de contexte, qui définit combien de tokens (prompt, historique de conversation, documents joints) le modèle peut prendre en compte simultanément. Au-delà de cette limite, les informations les plus anciennes sont progressivement perdues ou tronquées.

De l'entraînement brut à l'assistant : pré-entraînement et RLHF

Un modèle fraîchement pré-entraîné sur du texte brut sait continuer une phrase de façon plausible, mais ne sait pas naturellement suivre une instruction ni refuser une demande problématique. Trois étapes transforment ce modèle brut en assistant utilisable : le pré-entraînement sur des corpus massifs de texte pour acquérir des connaissances générales et des compétences linguistiques, le fine-tuning supervisé sur des exemples de conversations où des instructions sont suivies correctement, puis l'apprentissage par renforcement à partir de retours humains (RLHF), où des évaluateurs classent plusieurs réponses possibles du modèle pour l'entraîner à privilégier les réponses les plus utiles, honnêtes et sûres. C'est cette dernière phase qui explique pourquoi ChatGPT répond à une question plutôt que de simplement la compléter comme le ferait un modèle de complétion brut.

Les grandes familles de modèles OpenAI

OpenAI propose deux grandes catégories de modèles, pensées pour des besoins différents. Les modèles généralistes multimodaux (comme la famille GPT-4o et GPT-5) sont optimisés pour la rapidité, la polyvalence et le traitement conjoint de texte, d'image et parfois d'audio : ils conviennent à la majorité des usages quotidiens, de la rédaction à l'analyse d'images. Les modèles de raisonnement (la série o, et les modes de réflexion approfondie de GPT-5) prennent davantage de temps de calcul interne avant de répondre, ce qui améliore nettement leurs performances sur des problèmes de mathématiques, de logique ou de code complexe, au prix d'une latence plus élevée et d'un coût supérieur. Choisir entre ces familles revient à arbitrer entre rapidité et profondeur de raisonnement selon la nature de la tâche.

Ce qu'un LLM sait faire et ne sait pas faire

Un LLM reste un système probabiliste : il produit la suite de texte qui lui semble la plus plausible, pas nécessairement la plus vraie. Sa connaissance du monde s'arrête à une date de coupure d'entraînement (knowledge cutoff) et il n'a pas d'accès direct à des informations en temps réel, sauf lorsqu'un outil externe (recherche web, plugin, appel d'API) lui est explicitement connecté. Il peut aussi produire des réponses affirmées avec assurance mais factuellement fausses, un phénomène appelé hallucination, détaillé plus loin dans ce parcours. Comprendre ces mécanismes de génération est la meilleure protection contre une confiance excessive dans les réponses obtenues. Cette compréhension du fonctionnement statistique du modèle explique aussi pourquoi deux exécutions du même prompt peuvent produire des réponses légèrement différentes, et pourquoi la qualité d'une réponse dépend directement de la qualité et de la précision du prompt fourni en entrée, un sujet approfondi dans le module suivant sur le prompting.