En bref

Ce glossaire réunit les termes essentiels de l’intelligence artificielle et des grands modèles de langage (LLM). Chaque entrée fournit le terme anglais, sa traduction française et une définition concise. Organisé par thématique pour faciliter la navigation.


Fondamentaux LLM

Attention (mechanism) (Mécanisme d’attention) — Composant central du Transformer qui permet au modèle de pondérer dynamiquement l’importance de chaque token par rapport aux autres lors du traitement d’une séquence. C’est ce mécanisme qui confère aux LLM leur capacité à saisir les dépendances à longue distance dans un texte. → Architecture Transformer

Autoregressive model (Modèle autorégressif) — Modèle qui génère du texte un token à la fois, chaque nouveau token étant conditionné par tous les tokens précédemment générés. La quasi-totalité des LLM actuels (GPT, Claude, Llama) fonctionnent selon ce principe.

Benchmark (Référence d’évaluation) — Ensemble de tâches standardisées et de métriques associées permettant de comparer les performances de différents modèles. Des exemples courants incluent MMLU (connaissances générales), HumanEval (code) et HellaSwag (raisonnement). → Benchmarks LLM

Context window (Fenêtre de contexte) — Quantité maximale de texte, mesurée en tokens, qu’un modèle peut traiter en une seule interaction. Elle englobe le prompt d’entrée et la réponse générée ; ce qui dépasse cette limite n’est pas accessible au modèle. → La fenêtre de contexte

Decoder (Décodeur) — Partie de l’architecture Transformer chargée de générer du texte en sortie. Les LLM comme GPT ou Claude sont des modèles “decoder-only” : ils prédisent le prochain token à partir du contexte déjà produit.

Embedding (Plongement vectoriel) — Représentation numérique d’un token ou d’un texte sous forme de vecteur dans un espace de grande dimension. Des tokens sémantiquement proches ont des vecteurs proches dans cet espace, ce qui permet au modèle de manipuler les significations. → Embeddings et recherche sémantique

Encoder (Encodeur) — Partie de l’architecture Transformer qui transforme une séquence d’entrée en représentations internes. Les modèles “encoder-only” comme BERT sont spécialisés dans la compréhension ; les modèles actuels de génération utilisent principalement le décodeur.

Fine-tuning (Ajustement fin) — Phase d’entraînement supplémentaire appliquée à un modèle pré-entraîné sur un jeu de données spécifique, pour adapter ses comportements à une tâche particulière ou un domaine cible. Plus économique que l’entraînement depuis zéro. → Fine-tuning vs RAG

Foundation model (Modèle de fondation) — Grand modèle pré-entraîné sur des volumes massifs de données générales, conçu pour être adapté à une large variété de tâches en aval. Le terme a été popularisé par Stanford en 2021.

Inference (Inférence) — Phase d’utilisation d’un modèle pour générer des prédictions ou des réponses à partir d’un prompt, par opposition à l’entraînement. Chaque requête adressée à un LLM est une opération d’inférence.

Large Language Model (LLM) (Grand modèle de langage) — Modèle de réseau de neurones profond entraîné sur de grandes quantités de texte, capable de comprendre et de générer du langage naturel. Les LLM modernes contiennent de quelques milliards à plusieurs centaines de milliards de paramètres.

Natural Language Processing (NLP) (Traitement automatique du langage naturel — TALN) — Domaine de l’IA qui s’intéresse à la compréhension, l’analyse et la génération du langage humain par les machines. Les LLM représentent l’état de l’art actuel en NLP.

Neural network (Réseau de neurones) — Architecture computationnelle inspirée du cerveau biologique, composée de couches de nœuds interconnectés ajustant leurs connexions lors de l’entraînement. Les LLM sont des réseaux de neurones profonds de type Transformer.

Parameter (Paramètre) — Valeur numérique apprise pendant l’entraînement et stockée dans le modèle. Les paramètres encodent la “connaissance” du modèle ; un LLM de 70 milliards de paramètres contient 70 × 10⁹ tels valeurs.

Pre-training (Pré-entraînement) — Phase initiale d’entraînement sur un corpus massif et général (pages web, livres, code), pendant laquelle le modèle apprend des représentations linguistiques générales. Elle précède toujours le fine-tuning. → Pipeline d’entraînement

Prompt (Invite / Requête) — Texte fourni en entrée à un LLM pour guider sa génération. Un prompt peut contenir des instructions, des exemples, du contexte documentaire ou une question ; sa formulation influence fortement la qualité de la réponse.

Token (Token) — Unité de base du texte traitée par un LLM. Un token correspond approximativement à un mot courant ou une sous-partie de mot ; en anglais, 1 000 tokens représentent environ 750 mots. C’est l’unité de mesure de la fenêtre de contexte et de la facturation des API. → Tokens et tokenisation

Tokenizer (Tokeniseur) — Outil qui segmente un texte brut en tokens avant de les transmettre au modèle. Chaque modèle possède son propre tokeniseur, entraîné sur son corpus ; des textes identiques peuvent produire des séquences de tokens différentes selon le modèle. → Tokenisation avancée

Transformer (Transformeur) — Architecture de réseau de neurones introduite par Vaswani et al. en 2017, reposant sur le mécanisme d’attention multi-têtes. Elle est devenue la base de presque tous les LLM modernes, supplantant les architectures récurrentes (RNN, LSTM). → Architecture Transformer

Weight (Poids) — Synonyme de paramètre dans le contexte des réseaux de neurones. Les poids sont les valeurs numériques ajustées lors de l’entraînement par rétropropagation du gradient. Les modèles open-source rendent leurs poids publiquement disponibles.


Techniques d’entraînement et d’optimisation

Backpropagation (Rétropropagation) — Algorithme fondamental d’entraînement des réseaux de neurones : il calcule le gradient de la fonction de perte par rapport à chaque paramètre, en propageant l’erreur de la sortie vers l’entrée. Il permet ensuite de mettre à jour les poids via la descente de gradient.

Batch size (Taille de lot) — Nombre d’exemples d’entraînement traités simultanément avant une mise à jour des poids. Un batch size plus grand stabilise les gradients mais nécessite plus de mémoire ; un batch size plus petit introduit plus de bruit mais peut aider à généraliser.

Distillation (Distillation de connaissances) — Technique qui entraîne un modèle compact (“élève”) à imiter les sorties d’un modèle plus grand (“professeur”). Elle permet d’obtenir un modèle plus rapide et moins coûteux tout en conservant une partie des capacités du modèle original. → Distillation de modèles

Epoch (Époque) — Un passage complet sur l’ensemble du jeu de données d’entraînement. L’entraînement d’un LLM implique typiquement plusieurs epochs sur les données de fine-tuning, mais souvent un seul passage sur le corpus de pré-entraînement en raison de sa taille.

Gradient descent (Descente de gradient) — Algorithme d’optimisation qui met à jour les paramètres du modèle dans la direction opposée au gradient de la fonction de perte. L’objectif est de minimiser cette perte de façon itérative jusqu’à convergence.

Learning rate (Taux d’apprentissage) — Hyperparamètre contrôlant l’amplitude des mises à jour des poids à chaque étape d’entraînement. Un taux trop élevé entraîne une instabilité ; un taux trop faible ralentit excessivement la convergence.

LoRA (Low-Rank Adaptation) (Adaptation de faible rang) — Technique de fine-tuning efficace qui gèle les poids du modèle original et n’entraîne que de petites matrices de faible rang ajoutées aux couches existantes. Elle réduit drastiquement le nombre de paramètres entraînables et la mémoire requise.

Mixed precision (Précision mixte) — Technique d’entraînement utilisant simultanément des nombres flottants en demi-précision (float16/bfloat16) et en pleine précision (float32). Elle accélère le calcul et réduit la consommation mémoire tout en préservant la stabilité numérique.

Quantization (Quantification) — Réduction de la précision numérique des poids d’un modèle (ex. : de float32 à int8 ou int4), afin de diminuer la taille du modèle et d’accélérer l’inférence, au prix d’une légère perte de qualité. Technique clé pour déployer des LLM sur du matériel limité. → Quantization

RLHF (Reinforcement Learning from Human Feedback) (Apprentissage par renforcement à partir du retour humain) — Technique d’alignement qui utilise des évaluations humaines de paires de réponses pour entraîner un modèle de récompense, puis optimise le LLM avec ce signal. Elle est à la base du comportement “assistant” des modèles comme ChatGPT ou Claude. → Alignement et RLHF

Supervised Fine-Tuning (SFT) (Ajustement fin supervisé) — Fine-tuning d’un modèle sur des paires (prompt, réponse idéale) annotées par des humains. Constitue souvent la première étape du pipeline d’alignement, avant RLHF.

Transfer learning (Apprentissage par transfert) — Paradigme consistant à réutiliser un modèle pré-entraîné sur une tâche source pour l’adapter à une tâche cible. Il est au cœur de l’efficacité des LLM modernes : le pré-entraînement massif capture des connaissances générales réutilisables.


Techniques de prompting et d’utilisation

Batching (Traitement par lots) — Regroupement de plusieurs requêtes pour les traiter simultanément lors de l’inférence. Améliore l’utilisation du matériel et le débit global du serveur, au prix d’une légère augmentation de la latence individuelle.

Chain-of-thought (CoT) (Chaîne de pensée) — Technique de prompting qui invite le modèle à expliciter ses étapes de raisonnement intermédiaires avant de formuler une réponse finale. Elle améliore significativement les performances sur les tâches de raisonnement logique et mathématique. → Chain-of-Thought

Few-shot learning (Apprentissage avec peu d’exemples) — Mode d’utilisation d’un LLM où quelques exemples (typiquement 2 à 10) illustrant la tâche sont inclus dans le prompt. Le modèle généralise à partir de ces exemples sans modifier ses poids.

In-context learning (Apprentissage en contexte) — Capacité d’un LLM à adapter son comportement à une nouvelle tâche en se basant uniquement sur les exemples ou instructions présents dans le prompt, sans entraînement supplémentaire.

Inference-time compute scaling (Mise à l’échelle du calcul à l’inférence) — Tendance récente consistant à allouer davantage de calcul lors de l’inférence (ex. : générer plusieurs réponses et sélectionner la meilleure, ou effectuer une réflexion prolongée) plutôt que d’augmenter uniquement la taille du modèle. → Optimisation de l’inférence

Latency (Latence) — Temps écoulé entre l’envoi d’une requête et la réception du premier token de réponse (time-to-first-token). Métrique critique pour les applications interactives, à distinguer du débit (throughput).

Prompt engineering (Ingénierie des prompts) — Discipline consistant à formuler, structurer et itérer des prompts pour obtenir les meilleures sorties possibles d’un LLM. Comprend des techniques comme le CoT, le few-shot, le rôle-playing et la structuration XML. → Le prompting

Prompt injection (Injection de prompt) — Attaque consistant à insérer des instructions malveillantes dans un prompt (via un document, un site web ou une entrée utilisateur) pour détourner le comportement d’un LLM de ses instructions légitimes. → Sécurité adversariale

RAG (Retrieval-Augmented Generation) (Génération augmentée par récupération) — Architecture combinant un système de recherche documentaire et un LLM : des documents pertinents sont récupérés dans une base de données, puis injectés dans le contexte du modèle pour ancrer ses réponses sur des sources vérifiables. → RAG

Rate limiting (Limitation de débit) — Mécanisme contrôlant le nombre de requêtes autorisées par unité de temps pour un utilisateur ou une application. Protège l’infrastructure et assure une distribution équitable des ressources.

Streaming (Diffusion en continu) — Mode de génération où les tokens sont transmis au client au fur et à mesure de leur production, plutôt qu’après la génération complète de la réponse. Améliore la réactivité perçue des interfaces conversationnelles.

Structured output (Sortie structurée) — Capacité d’un LLM à générer des réponses dans un format prédéfini (JSON, XML, Markdown structuré). Essentielle pour intégrer un LLM dans un pipeline logiciel qui consomme des données formatées.

System prompt (Prompt système) — Instructions transmises au modèle avant le tour de conversation de l’utilisateur, définissant son rôle, ses contraintes et son comportement général. Invisible à l’utilisateur final dans la plupart des interfaces.

Temperature (Température) — Paramètre contrôlant l’aléatoire de la génération : une température proche de 0 rend le modèle déterministe (il choisit systématiquement le token le plus probable) ; une température élevée favorise la diversité et la créativité au prix d’une moins grande cohérence. → Temperature et sampling

Throughput (Débit) — Nombre de tokens générés par unité de temps (tokens/seconde) ou nombre de requêtes traitées par seconde. Métrique clé pour évaluer l’efficacité d’un déploiement en production, à distinguer de la latence.

Top-k / Top-p sampling (Échantillonnage top-k / top-p) — Stratégies de sélection du token suivant lors de la génération : top-k restreint le choix aux k tokens les plus probables ; top-p (nucleus sampling) sélectionne les tokens dont la probabilité cumulée dépasse p. Ces méthodes contrôlent la diversité des sorties. → Temperature et sampling

Zero-shot learning (Apprentissage zéro exemple) — Mode d’utilisation d’un LLM où aucun exemple n’est fourni dans le prompt : le modèle doit résoudre la tâche uniquement à partir de sa description. Mesure la capacité de généralisation intrinsèque du modèle.


Architecture agentic

Agent (Agent) — Système basé sur un LLM qui perçoit son environnement, planifie des actions et les exécute de manière autonome ou semi-autonome pour atteindre un objectif donné. Un agent peut appeler des outils, lire des fichiers, naviguer sur le web et orchestrer d’autres agents. → Agents LLM

Agentic loop (Boucle agentique) — Cycle d’exécution répété d’un agent : observation de l’état, raisonnement, sélection d’une action, exécution, mise à jour de l’état. Le modèle s’arrête quand la tâche est complète ou qu’une condition d’arrêt est atteinte.

Function calling (Appel de fonction) — Mécanisme permettant à un LLM de signaler qu’il souhaite invoquer une fonction externe prédéfinie en transmettant son nom et ses arguments dans un format structuré. Le résultat est ensuite renvoyé au modèle pour qu’il poursuive sa génération. → MCP vs Tool Calling

Grounding (Ancrage) — Connexion des sorties d’un LLM à des sources d’information vérifiables (documents, bases de données, résultats de recherche) pour réduire les hallucinations et permettre la citation de sources. → RAG

Human-in-the-loop (HITL) (Humain dans la boucle) — Modèle d’interaction où un humain supervise, valide ou corrige les actions d’un système automatisé à des points de contrôle définis. Réduit les risques d’erreurs en cascade dans les systèmes agentiques. → Human-in-the-Loop

MCP (Model Context Protocol) (Protocole de contexte de modèle) — Protocole ouvert développé par Anthropic permettant à un LLM de se connecter à des outils, sources de données et services externes via une interface standardisée. Facilite l’interopérabilité entre modèles et environnements. → Model Context Protocol

Multi-agent system (Système multi-agents) — Architecture dans laquelle plusieurs agents LLM collaborent, se spécialisent et se coordonnent pour accomplir des tâches complexes. Les agents peuvent jouer des rôles distincts (planificateur, exécuteur, vérificateur) et s’échanger des informations. → Systèmes multi-agents

Orchestration (Orchestration) — Coordination des actions de plusieurs agents ou composants d’un pipeline pour accomplir une tâche complexe. L’orchestrateur décompose l’objectif, dispatche les sous-tâches et consolide les résultats. → Orchestration multi-agents, état de l’art

Retrieval (Récupération) — Opération consistant à rechercher et extraire des documents ou passages pertinents depuis une base de données, en réponse à une requête. Composant clé des architectures RAG et des agents disposant de mémoire externe. → Panorama RAG 2026

Scaffolding (Échafaudage) — Infrastructure logicielle (code, prompts, boucles de contrôle) qui entoure un LLM pour lui permettre d’exécuter des tâches complexes : gestion des tours de conversation, appels d’outils, gestion des erreurs, persistance de l’état.

Semantic search (Recherche sémantique) — Méthode de recherche basée sur la similarité de sens entre une requête et des documents, plutôt que sur la correspondance exacte de mots-clés. Elle repose sur la comparaison de vecteurs d’embeddings. → Embeddings et recherche sémantique

Tool use (Utilisation d’outils) — Capacité d’un LLM à invoquer des outils externes (moteur de recherche, calculatrice, interpréteur Python, API) pendant la génération, pour accéder à des informations récentes ou effectuer des opérations que le modèle seul ne pourrait pas réaliser. → MCP vs Tool Calling

Vector database (Base de données vectorielle) — Base de données spécialisée dans le stockage et la recherche efficace de vecteurs d’embeddings par similarité. Composant essentiel des architectures RAG ; exemples : Pinecone, Chroma, Weaviate. → Leçon RAG-04 — Vector stores


Sécurité et alignement

Alignment (Alignement) — Ensemble des techniques et pratiques visant à faire en sorte que le comportement d’un LLM corresponde aux intentions, valeurs et besoins humains. Comprend des dimensions de sûreté (éviter les nuisances), d’honnêteté et d’utilité. → Alignement et RLHF

Constitutional AI (IA constitutionnelle) — Approche d’alignement développée par Anthropic dans laquelle un ensemble explicite de principes (la “constitution”) guide le modèle lors de l’auto-critique et de la révision de ses réponses, réduisant la dépendance aux annotations humaines massives. → Constitutional AI

Guardrail (Garde-fou) — Mécanisme de contrôle ajouté autour d’un LLM pour prévenir les sorties indésirables (contenus nuisibles, informations sensibles, comportements hors périmètre). Peut être implémenté par prompt, par filtrage de sortie ou par un modèle de classification dédié. → Guardrails LLM

Hallucination (Hallucination) — Production par un LLM d’informations factuellement incorrectes, présentées avec le même niveau de confiance que des informations exactes. Ce phénomène est inhérent aux modèles autorégressifs, qui optimisent la vraisemblance textuelle et non la véracité. → Pourquoi ça invente des trucs

Jailbreak (Débridage) — Technique visant à contourner les garde-fous d’un LLM pour lui faire produire des contenus qu’il est configuré pour refuser. Peut s’appuyer sur des formulations détournées, des scénarios fictifs ou des injections de prompt. → Alignement des LLM

Red teaming (Équipe rouge) — Pratique consistant à tester adversarialement un système d’IA en cherchant activement à provoquer des comportements indésirables. Méthode standard d’évaluation de la robustesse et de la sécurité avant déploiement. → Red teaming agentique

Safety filter (Filtre de sécurité) — Composant chargé de détecter et bloquer les entrées ou sorties problématiques (contenu haineux, instructions dangereuses, données personnelles). Peut fonctionner par règles, par modèle de classification ou par LLM dédié à la modération.

Watermarking (Tatouage numérique) — Technique consistant à introduire un motif statistique détectable dans les sorties d’un LLM, permettant d’identifier que le texte a été généré par une machine. Domaine de recherche actif pour la détection de contenu synthétique.


Évaluation et données

Annotation (Annotation) — Processus consistant à étiqueter manuellement des données d’entraînement ou d’évaluation (ex. : noter la qualité d’une réponse, identifier l’entité nommée dans un texte). La qualité des annotations conditionne directement la qualité des modèles supervisés.

Dataset (Jeu de données) — Ensemble structuré d’exemples utilisé pour entraîner, valider ou évaluer un modèle. Sa taille, sa diversité et sa qualité sont des facteurs déterminants de la performance finale du modèle.

Evaluation (Eval) (Évaluation) — Processus de mesure des performances d’un modèle sur un ensemble de tâches standardisées. Les évals peuvent être automatisées (comparaison avec une vérité terrain) ou humaines (jugement de préférence entre réponses). → Évaluer un agent LLM

F1 score (Score F1) — Métrique d’évaluation combinant la précision (proportion de prédictions correctes parmi les positives) et le rappel (proportion d’exemples positifs correctement identifiés) via leur moyenne harmonique. Couramment utilisée pour les tâches de classification.

Ground truth (Vérité terrain) — Données de référence considérées comme correctes, servant à mesurer la performance d’un modèle. En NLP, la vérité terrain est souvent produite par des annotateurs humains ou extraite de sources autoritatives.

Mixture of Experts (MoE) (Mélange d’experts) — Architecture de modèle dans laquelle chaque token n’active qu’un sous-ensemble de paramètres (les “experts”) plutôt que l’ensemble du réseau. Permet d’augmenter la capacité totale du modèle sans augmenter proportionnellement le calcul par inférence. → Mixture of Experts

Multimodal (Multimodal) — Qualifie un modèle capable de traiter et de générer plusieurs types de données (texte, image, audio, vidéo). Les modèles multimodaux étendent les capacités des LLM textuels aux entrées et sorties non textuelles. → Multimodalité

Perplexity (Perplexité) — Métrique standard d’évaluation des modèles de langage mesurant leur incertitude moyenne lors de la prédiction du token suivant sur un corpus de référence. Une perplexité faible indique un modèle qui prédit bien le texte ; elle est moins corrélée aux performances sur des tâches applicatives.

Synthetic data (Données synthétiques) — Données générées artificiellement (souvent par un LLM) plutôt que collectées dans le monde réel. Utilisées pour augmenter des jeux de données rares, tester des cas limites ou pré-entraîner des modèles sans données sensibles. → Données synthétiques


Ce qu’il faut retenir

  • Ce glossaire couvre les termes fondamentaux du domaine LLM et IA, de l’architecture des modèles aux pratiques de déploiement
  • Les définitions sont volontairement courtes — chaque concept mériterait un article dédié
  • Les termes anglais sont conservés car ils constituent le vocabulaire standard de la communauté internationale
  • Le glossaire sera enrichi au fil des publications du site

Sources