En bref

Quand le contexte d’un LLM s’allonge, ses performances baissent — et cette baisse est mesurable, reproductible, et mathématiquement modélisable. Liu et al. (2024) ont documenté un biais positionnel en forme de U : le modèle traite mieux ce qui est au début ou à la fin du contexte, et mal ce qui est au milieu. Du et al. (2025) ont isolé la longueur brute comme variable causale indépendante : même avec une récupération parfaite, plus de tokens dégradent la performance. Roy et al. (2026) formalisent la dynamique : décroissance exponentielle pour les Transformers standards, décroissance polynomiale pour les architectures décomposées.

En clair : imaginez un assistant à qui vous lisez un dossier à voix haute. Au début, il écoute attentivement. À la fin, il retient mieux ce qu’il vient d’entendre. Mais entre les deux, son attention s’éparpille — et plus le dossier est long, plus le « milieu oublié » s’étend. Ce phénomène n’est pas une impression : il se mesure, se modélise, et conditionne la conception de tout système RAG sérieux.


Le problème : plus le contexte s’allonge, plus la qualité baisse

Les LLMs (grands modèles de langage) opèrent dans une fenêtre de contexte — la quantité maximale de texte qu’ils peuvent traiter en une seule passe. Cette fenêtre s’est considérablement étendue ces dernières années : de 4 096 tokens en 2023 à 200 000 tokens ou plus pour certains modèles actuels.

Cette extension a alimenté une hypothèse implicite dans les systèmes RAG (Retrieval-Augmented Generation, génération augmentée par récupération) : si le modèle dispose de toute l’information pertinente dans son contexte, la performance devrait rester stable. Les travaux récents invalident cette hypothèse.

Hong, Troynikov et Huber (Chroma Research, 2025) ont testé 18 modèles frontières — GPT-4.1, Claude Opus 4, Claude Sonnet 4, Gemini 2.5, Qwen3, et d’autres — sur plusieurs benchmarks de récupération longue. Résultat uniforme : chaque modèle testé exhibe du context rot à chaque incrément de longueur d’input. Le terme context rot (littéralement “pourriture contextuelle”) désigne cette dégradation progressive de la qualité des réponses à mesure que le contexte s’allonge.

Les ordres de grandeur documentés par Chroma : chute de précision de 20 à 50% entre 10 000 et 100 000 tokens sur les tâches NIAH (Needle in a Haystack, récupération d’une phrase cible dans un long document). Un modèle doté d’une fenêtre déclarée de 200 000 tokens peut montrer une dégradation significative dès 50 000 tokens — soit le quart de sa capacité théorique.

En clair : la fenêtre annoncée par un modèle (200K tokens) est un plafond technique, pas une zone de qualité constante. C’est l’équivalent d’une voiture vendue pour rouler à 250 km/h : elle peut techniquement, mais la stabilité, le freinage et la consommation se dégradent bien avant. Concevoir un RAG en supposant que le modèle gère uniformément 100K tokens, c’est ignorer la dégradation mesurée.


Lost in the Middle — la courbe en U

Liu et al. (2024) ont été parmi les premiers à documenter rigoureusement le biais positionnel des LLMs. Leur étude, publiée dans les Transactions of the Association for Computational Linguistics, porte sur deux tâches : la question-réponse sur documents multiples, et la récupération clé-valeur.

Le résultat central est une courbe de performance en U selon la position de l’information pertinente dans le contexte :

  • Début du contexte (primacy bias) : performance maximale.
  • Fin du contexte (recency bias) : performance maximale.
  • Milieu du contexte : performance minimale, y compris pour des modèles explicitement entraînés sur des contextes longs.

Les chiffres sont précis. Sur la tâche QA multi-documents, la performance chute de plus de 30% quand le document-réponse passe de la position 1 à la position 10 dans un contexte de 20 documents. GPT-3.5-Turbo, avec l’information placée au milieu, tombe en dessous de son score en mode closed-book — c’est-à-dire en dessous de ce qu’il obtiendrait sans aucun document fourni. Sur la récupération clé-valeur, certains modèles atteignent une précision quasi-parfaite aux positions extrêmes et chutent sous 40% au milieu.

Ce phénomène n’est pas anodin : il signifie que le contexte peut activement nuire à la performance en introduisant du bruit positionnel supérieur à la valeur de l’information fournie.

Mécanisme probable

Liu et al. formulent une hypothèse mécaniste : les données d’instruction-tuning (entraînement par instructions) placent typiquement l’instruction en début de contexte. Le modèle apprend structurellement à prioriser le début — et, par symétrie d’attention, la fin. Le milieu devient une zone d’attention faible.

Cette hypothèse n’est pas confirmée expérimentalement dans l’article. Les auteurs reconnaissent que des techniques de positional encoding plus récentes (RoPE, ALiBi) peuvent modifier ce profil, et que leurs résultats portent sur des modèles de 2023.

En clair : placer une instruction critique au milieu d’un long prompt revient à dire l’essentiel à un public qui s’ennuie au troisième acte d’une pièce. Pour qu’une consigne soit appliquée, il faut qu’elle soit en début ou en fin de contexte — pas enfouie dans la masse.


La dégradation contextuelle suit une loi mathématique — le modèle λ-RLM

Roy et al. (2026) apportent la première formalisation mathématique rigoureuse du context rot. Leur papier “The Y-Combinator for LLMs” (arXiv:2603.20105) établit deux modèles de décroissance, selon l’architecture du système.

Décroissance exponentielle : le cas des Transformers standards

Pour un Transformer standard opérant en mode direct (Direct M), la précision suit une décroissance exponentielle :

A_direct(n) = Θ(ρ^(n/K)) → 0

Où n est la longueur du contexte, K la fenêtre native du modèle, et ρ ∈ (0,1) le taux de décroissance. En langage concret : quand n dépasse largement K, la précision converge vers zéro. La dégradation s’accélère — chaque doublement du contexte au-delà de la fenêtre native multiplie la perte par un facteur constant.

Décroissance polynomiale : le cas λ-RLM

L’architecture λ-RLM (Lambda Recursive Language Model) remplace la boucle d’inférence ouverte par un runtime fonctionnel typé, fondé sur le λ-calcul. Le principe : décomposer le problème long en sous-problèmes bornés dans la fenêtre native, traiter chaque sous-problème indépendamment, puis agréger. La bibliothèque de combinateurs prédéfinis — SPLIT, MAP, FILTER, REDUCE — garantit la terminaison et les bornes de coût.

Dans ce cas, la décroissance suit une loi de puissance :

A_λ-RLM(n) = Ω(n^(−c))

Où c = −log_{k*}(A(τ*) · A_⊕), avec k* le facteur de branchement optimal, A(τ*) la précision sur les sous-problèmes, et A_⊕ la précision de l’agrégation. Une loi de puissance décroît beaucoup plus lentement qu’une exponentielle : à 10× la fenêtre native, une exponentielle peut approcher zéro là où la loi de puissance conserve une fraction significative de la précision initiale.

Dans le cas idéal — problème parfaitement décomposable, erreurs d’agrégation nulles — la précision reste constante quelle que soit la longueur n.

Résultats empiriques

Sur 4 tâches de raisonnement long-contexte et 9 modèles de base, λ-RLM surpasse les RLM standards dans 29 comparaisons sur 36. Les gains les plus importants concernent les modèles “faibles” : amélioration moyenne jusqu’à +21,9 points de précision. Un modèle 8B scaffoldé avec λ-RLM dépasse en précision un modèle 405B standard sur les tâches long-contexte. À précision équivalente (8B vs 70B standard), λ-RLM est 3,1× plus rapide.

Limites du modèle

Les garanties formelles s’appliquent à la bibliothèque de combinateurs définie — l’extension à des combinateurs arbitraires n’est pas couverte. Le modèle suppose que les erreurs de décomposition et d’agrégation sont indépendantes : une hypothèse qui peut être violée quand les sous-problèmes partagent des dépendances sémantiques. Les évaluations portent sur 4 tâches spécifiques ; la généralisation au code génératif ouvert ou au multimodal reste à valider.


Longueur ≠ qualité : quand plus de tokens dégradent la performance

Du et al. (2025) posent une question plus radicale : la longueur brute est-elle elle-même une cause de dégradation, indépendamment du contenu ?

Leur protocole isole la variable longueur. La structure expérimentale est : [Evidence] [Tokens de distraction] [Question], avec l’evidence placée de façon consécutive. Cinq modèles sont testés : Llama-3.1-8B-Instruct, Mistral-v0.3-7B-Instruct, GPT-4o, Claude-3.7-Sonnet, Gemini-2.0. Les tâches couvrent mathématiques, question-answering et coding.

La longueur brute est causale

Le résultat central : la longueur de l’input seule dégrade la performance, indépendamment de la qualité de la récupération. Llama-3.1-8B-Instruct chute de 24,2% sur le benchmark MMLU étendu à 30 000 tokens, malgré un taux de récupération parfaite de 97% — le bon passage est présent, le modèle le localise, mais sa performance se dégrade quand même.

L’expérience critique : remplacer les tokens de distraction en langage naturel par des espaces blancs (whitespace tokens), sémantiquement neutres. La dégradation persiste :

  • Llama : −48% sur VarSum à 30 000 tokens.
  • Mistral : −30% sur GSM8K à 30 000 tokens.

Ce résultat exclut la distraction sémantique comme cause unique. Ce n’est pas que le modèle est perturbé par du contenu confusant — c’est la quantité brute de tokens qui dégrade l’attention.

La dégradation observée varie de 13,9% à 85% selon les modèles et les tâches, à des longueurs restant bien en dessous des fenêtres annoncées.

Implications pour les systèmes RAG

Ces résultats expliquent pourquoi les performances RAG saturent — voire régressent — quand davantage de documents sont ajoutés au contexte. La stratégie “plus de contexte = plus d’information = meilleure réponse” est incorrecte au-delà d’un certain seuil. Ils corroborent aussi les observations sur les chaînes de raisonnement longues (long chain-of-thought) qui peuvent nuire à la performance sur des tâches simples.

Du et al. proposent une mitigation partielle : le recitation prompting, qui consiste à demander au modèle de reformuler l’evidence récupérée avant de répondre. Gain observé sur GPT-4o : +4% sur le benchmark RULER — réel, mais insuffisant pour adresser la cause structurelle.

En clair : la longueur seule fatigue le modèle, comme un orateur qui doit garder sa concentration sur trois heures de discours. Même si la phrase clé est là, juste sous ses yeux, sa qualité de traitement chute. Solution opérationnelle : ne pas charger 30 000 tokens « au cas où » — donner les 5 000 tokens vraiment utiles.


Solutions architecturales : décomposer pour préserver

Les quatre sources convergent vers une conclusion opérationnelle : la solution n’est pas d’augmenter la fenêtre de contexte, mais de décomposer le problème pour que chaque appel reste dans la zone de performance optimale du modèle.

Prompts focalisés vs prompts complets

Chroma Research (2025) documente l’effet le plus immédiatement actionnable : les prompts focalisés surpassent les prompts complets de 30 à 60% sur les tâches de récupération. Fournir au modèle uniquement le passage pertinent plutôt que l’ensemble du document améliore drastiquement la précision — même si la fenêtre de contexte serait capable d’absorber le document entier.

Autre résultat contre-intuitif de Chroma : les modèles performent mieux sur des haystacks mélangés aléatoirement que sur des documents logiquement cohérents. L’hypothèse des auteurs : la cohérence thématique augmente l’interférence sémantique entre passages proches.

Décomposition fonctionnelle (λ-RLM)

L’approche λ-RLM de Roy et al. formalise ce principe à l’échelle architecturale. La décomposition n’est pas ad hoc — elle est structurée par des combinateurs typés avec garanties formelles de terminaison. Chaque feuille du graphe d’exécution reçoit un sous-problème calibré pour la fenêtre native du modèle de base.

Le compromis : cette architecture nécessite un runtime externe et impose une décomposabilité du problème. Les tâches qui ne se fragmentent pas proprement — raisonnement narratif continu, cohérence stylistique longue — ne bénéficient pas des mêmes garanties.

Ce que les architectures actuelles ne résolvent pas

Les modèles avec fenêtres élargies (128K, 200K tokens) réduisent le problème sans l’éliminer. Chroma (2025) montre qu’un modèle à fenêtre 200K peut se dégrader significativement dès 50K tokens. L’attention reste un mécanisme quadratique en complexité : dans une séquence de 100 000 tokens, chaque token partage son budget d’attention sur 99 999 voisins. L’extension de la fenêtre repousse le seuil de dégradation — elle ne supprime pas la courbe.

Matrice décision — quelle stratégie pour quel contexte

Contexte applicatifRecommandationPourquoi
Q&A factuelle, corpus < 50K tokensRAG + prompts focalisés (top-5 chunks)Reste dans la zone optimale du modèle, +30 à 60% de précision vs prompt complet (Chroma 2025).
Document unique long, lecture séquentielleLong contexte natif jusqu’à 50% de la fenêtre déclaréeAu-delà, dégradation Chroma ≥ 20%. Mieux vaut sectionner.
Raisonnement multi-étapes sur corpus volumineuxDécomposition λ-RLM ou agent + sous-tâchesDécroissance polynomiale au lieu d’exponentielle, gains documentés jusqu’à +21,9 points.
Information critique à placer dans le promptDébut ou fin du contexte (jamais milieu)Biais positionnel en U, perte > 30% au milieu (Liu 2024).
Latence stricte, qualité non négociableModèle plus petit + contexte court > modèle large + long contexteUn 8B λ-RLM bat un 405B standard sur tâches longues à 3,1× la vitesse.

Ce qu’il faut retenir

  • La dégradation contextuelle est mesurable et reproductible : Liu et al. (2024), Du et al. (2025) et Chroma (2025) la documentent indépendamment sur des modèles et des tâches différents.
  • L’effet positionnel est réel et asymétrique : le début et la fin du contexte sont traités mieux que le milieu, avec des chutes de performance supérieures à 30% documentées.
  • La longueur brute est causale, pas seulement le contenu : des tokens d’espace blanc suffisent à dégrader la performance (−48% pour Llama à 30K tokens).
  • Deux modèles mathématiques s’opposent : décroissance exponentielle pour les Transformers en mode direct, décroissance polynomiale pour les architectures décomposées (λ-RLM) — la différence est pratiquement significative sur des contextes très longs.
  • La solution opérationnelle la plus robuste est la décomposition : réduire la taille des sous-problèmes soumis au modèle, pas étendre la fenêtre.