En bref
Des chercheurs de Stanford ont documenté un phénomène qu’ils nomment l’effet mirage : des modèles multimodaux de pointe génèrent des descriptions visuelles confiantes en l’absence totale d’image, sans signaler l’incohérence. Un modèle texte-only de 3 milliards de paramètres surpasse tous les grands modèles frontier — de plus de 100 milliards de paramètres — sur un benchmark de radiologie thoracique, sans jamais avoir analysé une seule image lors de l’entraînement. Le framework B-Clean, développé par la même équipe, révèle que 74 à 77 % des questions dans trois benchmarks multimodaux majeurs sont solubles sans recourir à la vision. Les classements publiés ne mesurent pas la compréhension visuelle. Ils mesurent autre chose.
En clair : le voyageur du désert qui voit de l’eau au loin n’invente pas — son œil capte une image cohérente, structurée, plausible. Mais cette image résulte de la réfraction de la lumière par des couches d’air chaud, pas d’une surface d’eau. Les modèles multimodaux font la même chose : ils produisent des descriptions cohérentes d’images qu’ils n’ont jamais vues. Le résultat est si plausible que les benchmarks le confondent avec une vraie compréhension visuelle.
Le mirage visuel — quand le modèle fabrique ce qu’il ne voit pas
Imaginez demander à un radiologue de commenter une radiographie thoracique. Il répond avec assurance : « On observe un foyer d’opacité para-hilaire droit, compatible avec un début de STEMI. » Vous lui signalez qu’il n’y avait pas de radiographie. Il n’en démord pas.
Ce scénario, qui paraît absurde pour un clinicien humain, décrit précisément le comportement documenté par Asadi et al. dans leur papier MIRAGE publié sur arXiv en mars 2026. L’étude teste des modèles multimodaux — des VLMs, pour vision-language models, c’est-à-dire des modèles capables de traiter conjointement du texte et des images — en leur soumettant des questions visuelles sans fournir d’image. Les résultats sont univoques : les modèles les plus puissants du moment génèrent des réponses descriptives confiantes dans plus de 60 % des cas en moyenne, tous types de questions confondus. Sous les protocoles d’évaluation multimodaux standard, ce taux monte à 90–100 % [Asadi et al., arXiv:2603.21687v2].
Une distinction fondamentale : mirage vs hallucination
La littérature sur les LLM a déjà bien documenté l’hallucination : un modèle invente des détails dans un contexte valide — il cite un article qui n’existe pas, attribue une citation erronée à un auteur réel. Le mirage est un phénomène distinct et plus profond. Là où l’hallucination opère à l’intérieur d’un cadre épistémique cohérent (il y a bien une question, un contexte, une modalité d’entrée), le mirage construit un cadre entièrement fictif. Le modèle ne se contente pas d’ajouter un faux détail à une image réelle : il construit une image mentale à partir de rien et la traite comme si elle était présente.
Les exemples documentés par Asadi et al. illustrent l’amplitude du phénomène. Des modèles ont fabriqué des numéros de plaque d’immatriculation pour des véhicules non photographiés. D’autres ont généré des dates d’expiration sur des médicaments absents de tout cadre. Sur des prompts de type médical, les modèles ont produit des constats radiologiques détaillés — énumérant des structures anatomiques, des densités, des profils d’anomalie — sans avoir eu accès à la moindre image [Asadi et al., arXiv:2603.21687v2].
Le biais vers le grave : STEMI, mélanome, carcinome
Sur les benchmarks médicaux, la susceptibilité à l’inférence non visuelle atteint 60 à 99 % selon les benchmarks testés [Asadi et al., arXiv:2603.21687v2]. Ce chiffre serait déjà inquiétant s’il était distribué aléatoirement entre pathologies bénignes et sévères. Il ne l’est pas. Les diagnostics générés spontanément par les modèles — en l’absence d’image — se concentrent sur les pathologies graves à caractère urgent : STEMI (syndrome coronarien aigu avec sus-décalage ST), mélanome, carcinome. Ce biais n’est pas documenté comme intentionnel. Il reflète probablement la distribution des données d’entraînement médicales : les cas graves sont surreprésentés dans la littérature clinique, les bases de questions-réponses médicales, les forums spécialisés. Le modèle apprend que les questions visuelles médicales appellent des réponses sévères.
Pourquoi parler de mirage et pas d’erreur ?
Le terme « mirage » n’est pas anodin. Un mirage au sens optique est une image cohérente, plausible, qui semble réelle mais résulte d’un mécanisme physique différent de celui qu’on croit. Un voyageur voit de l’eau dans le désert : l’image est là, nette, structurée — mais elle résulte de la réfraction de la lumière par des couches d’air chaud, pas d’une surface d’eau. Le modèle qui génère un constat radiologique détaillé produit quelque chose de structurellement correct, lexicalement approprié, cliniquement cohérent — mais il ne regarde rien. Il génère à partir de distributions statistiques apprises, sans ancrage dans un signal visuel réel.
Cette métaphore a des implications pour l’évaluation. Si le modèle produit des réponses correctes sur un benchmark tout en opérant en mode mirage, le score de benchmark est techniquement juste — mais il mesure quelque chose de fondamentalement différent de la compréhension visuelle.
Le test décisif : retirer l’image
La méthode employée par Asadi et al. est d’une élégance radicale : ils retirent l’image. Plutôt que de chercher à détecter la contamination par analyse des corpus d’entraînement — démarche complexe, souvent impossible sur des modèles fermés — ils testent directement si les modèles peuvent répondre correctement sans la modalité visuelle censée être centrale.
Des benchmarks majeurs à l’épreuve du vide
Les benchmarks testés couvrent les références standards du domaine : VQA-Rad, MicroVQA, MedXpertQA-MM, MMMU-Pro, Video-MMMU, Video-MME. Ces benchmarks sont utilisés par les laboratoires pour comparer leurs modèles multimodaux, par les publications académiques pour positionner leurs contributions, par les praticiens pour choisir des modèles adaptés à leurs cas d’usage.
Sur ces benchmarks, les modèles testés en mode « sans image » — en ne recevant que le texte de la question — obtiennent des scores qui retiennent 70 à 80 % de la performance mesurée avec image, parfois davantage [Asadi et al., arXiv:2603.21687v2]. Ce résultat a une lecture directe : une fraction substantielle du score obtenu sur ces benchmarks ne dépend pas de la vision. Il peut être atteint par simple inférence textuelle.
Le cas extrême : rang 1 sans voir
Le résultat le plus frappant de l’étude est peut-être le suivant : sur un benchmark standard de QA sur radiographie thoracique, un modèle a atteint le rang 1 — la première place du classement — sans accéder à aucune image [Asadi et al., arXiv:2603.21687v2]. Le modèle en tête du classement « analyse de radiographies » est un modèle qui n’a jamais regardé une seule radiographie lors de l’évaluation.
Le modèle de 3 milliards contre les géants
Le résultat le plus contre-intuitif de l’étude est probablement celui du modèle Qwen-2.5. Ce modèle de langage texte-only — c’est-à-dire sans aucune capacité de traitement visuel — avec 3 milliards de paramètres, a été fine-tuné sur ReXVQA, le plus grand benchmark de questions-réponses visuelles en radiologie thoracique. Le fine-tuning a été réalisé uniquement sur les paires question-réponse textuelles, sans jamais inclure les images correspondantes.
Résultat : ce modèle texte-only de 3 milliards de paramètres surpasse tous les modèles frontier multimodaux testés, y compris des modèles dépassant les 100 milliards de paramètres [Asadi et al., arXiv:2603.21687v2]. Il surpasse également des radiologues humains de plus de 10 % en moyenne [Asadi et al., arXiv:2603.21687v2].
Ce résultat n’est pas une anomalie statistique. Il révèle un problème de construction : les questions du benchmark ReXVQA peuvent être résolues correctement à partir du texte seul. Le modèle n’a pas besoin de voir les images parce que les réponses sont accessibles via les distributions statistiques des questions et réponses textuelles. En d’autres termes : le benchmark ne teste pas ce qu’il prétend tester.
L’angle mort de la comparaison homme-machine
Ce dernier point mérite un arrêt. Quand un article annonce que « le modèle X surpasse les radiologues sur le benchmark Y », le présupposé est que le modèle et les radiologues effectuent la même tâche — analyser une image médicale. Si le benchmark est text-soluble, les radiologues, eux, regardent les images. Ils mobilisent une compétence visuelle réelle sur un signal visuel réel. Le modèle court-circuite le signal visuel et exploite des raccourcis textuels. La comparaison ne mesure pas ce qu’elle semble mesurer.
74 % de vos benchmarks sont contaminés
La découverte de l’effet mirage conduisait à une question naturelle : si des modèles text-only peuvent performer sans image, c’est que les benchmarks contiennent des questions text-solubles. Dans quelle proportion ?
Pour répondre à cette question, Asadi et al. ont développé B-Clean — un framework post-hoc de nettoyage des benchmarks multimodaux. L’idée est directe : pour chaque question d’un benchmark, tester si un modèle text-only peut y répondre correctement. Si oui, la question est « compromise » — elle ne requiert pas la vision — et elle est retirée du benchmark. Le score sur le benchmark nettoyé (B-Clean) donne une mesure plus fiable de la compréhension visuelle réelle.
Les chiffres du nettoyage
Les résultats sont systématiques sur les trois benchmarks principaux analysés :
- MicroVQA : 802 questions supprimées sur 1 042, soit 77,0 % du benchmark retiré. Il reste 240 questions après nettoyage [Asadi et al., arXiv:2603.21687v2].
- MedXpertQA-MM : 1 486 questions supprimées sur 2 000, soit 74,3 % retirées, 514 conservées [Asadi et al., arXiv:2603.21687v2].
- MMMU-Pro : 1 302 questions supprimées sur 1 730, soit 75,3 % retirées, 428 conservées [Asadi et al., arXiv:2603.21687v2].
Trois quarts des questions dans trois benchmarks parmi les plus cités du domaine ne nécessitent pas de vision pour être résolues. Ce n’est pas un taux marginal, un artéfact statistique, ou un problème propre à un benchmark mal construit. C’est un pattern structurel et reproductible.
Les classements se reconfigurent
L’impact sur les classements de modèles est concret. Sur MMMU-Pro après nettoyage B-Clean, GPT-5.1 passe de 76,0 % à 67,1 % de précision, soit une chute de 8,9 points. Gemini-3-Pro passe de 81,0 % à 72,8 %, soit une chute de 8,2 points [Asadi et al., arXiv:2603.21687v2]. Sur MicroVQA après nettoyage, les chutes sont décrites comme dramatiques pour l’ensemble des modèles testés, sans que les résumés accessibles précisent les valeurs numériques exactes [Asadi et al., arXiv:2603.21687v2].
Ces chutes ne disqualifient pas les modèles. Ils restent performants. Mais elles révèlent que leurs scores « bruts » intègrent une composante substantielle d’inférence textuelle hors-sujet. La question posée aux praticiens n’est pas « ce modèle est-il bon » mais « bon à quoi ». Sur les benchmarks bruts, la réponse est biaisée.
Pourquoi ça arrive
L’effet mirage résulte de trois mécanismes cumulatifs. D’abord, les raccourcis textuels dans les données d’entraînement : les VLMs apprennent la corrélation entre question textuelle et réponse textuelle indépendamment du signal visuel. Si les paires question-réponse sont statistiquement cohérentes sans l’image, le modèle contourne la vision — il n’est pas entraîné à mentir, il est entraîné à prédire des tokens.
Ensuite, la contamination des benchmarks : les données de test se retrouvent dans les corpus d’entraînement crawlés automatiquement [Jacovi et al., EMNLP 2023]. Pour les modèles fermés, le corpus est un secret commercial. Pour les modèles ouverts, détecter la contamination dans des trillions de tokens reste une opération complexe [Oren et al., ICLR 2024].
Enfin, les défauts de conception structurels des benchmarks eux-mêmes. Construire des questions qui nécessitent réellement le signal visuel — non déductibles du texte, non mémorisables, visuellement significatives — est rarement atteint. Les annotateurs humains créent naturellement des corrélations texte-réponse exploitables. C’est un artéfact structurel, pas une négligence.
Le Mirage Score introduit par Asadi et al. — (accuracy sans image / accuracy avec image) × 100 % — mesure cette dépendance visuelle. Un score de 90 % signifie que le modèle atteint 90 % de ses performances sans image. Cette métrique n’existait pas avant MIRAGE : on présupposait que les modèles multimodaux utilisaient leurs entrées visuelles.
Implications pour les praticiens
Les découvertes de MIRAGE ne sont pas des curiosités académiques. Elles ont des implications directes pour quiconque utilise ou évalue des modèles multimodaux en contexte réel — déploiement médical, sélection de modèle, construction de pipeline.
L’ablation de modalité comme test obligatoire
Avant de déployer ou de sélectionner un modèle multimodal, il faut exécuter une ablation de modalité — tester le modèle sans l’image — et calculer le Mirage Score. Cette opération est simple (quelques heures sur un benchmark existant) mais absente des protocoles d’évaluation standards.
Les classements publiés (MMMU-Pro, MedXpertQA, MicroVQA) intègrent ~75 % d’inférence textuelle non visuelle. Le modèle en tête n’est pas nécessairement le meilleur modèle visuel — c’est le meilleur sur un benchmark partiellement text-soluble.
Le cas de l’IA médicale
La dimension médicale aggrave le tableau. Les diagnostics mirage se concentrent sur les pathologies graves urgentes : STEMI, mélanome, carcinome. Un modèle en aide au diagnostic qui opère en mode mirage génère des faux positifs systématiques sur les pathologies les plus alarmantes. En clinique, un faux positif STEMI déclenche une activation urgente du cathlab cardiaque. Un faux négatif mélanome laisse une lésion non traitée. La certification de dispositifs médicaux intégrant des VLMs devrait exiger la démonstration que le modèle utilise effectivement le signal visuel.
En clair : la solution est d’une simplicité radicale — retirer l’image et tester si le modèle répond quand même. Si oui, le benchmark mesure du raisonnement textuel, pas de la vision. Cette ablation prend quelques heures, ne nécessite aucune modification du modèle, et révèle des biais structurels que les classements publics ne peuvent pas voir. Toute équipe qui sélectionne un VLM pour la production devrait l’exécuter avant tout déploiement.
Ce qu’il faut retenir
-
L’effet mirage est documenté empiriquement sur les modèles frontier actuels : plus de 60 % des réponses à des questions visuelles sont générées avec confiance en l’absence totale d’image, sur toutes les catégories de benchmarks testées [Asadi et al., arXiv:2603.21687v2].
-
74 à 77 % des questions dans trois benchmarks multimodaux majeurs (MicroVQA, MedXpertQA-MM, MMMU-Pro) sont solubles sans recourir à la vision — elles sont retirées par le framework B-Clean [Asadi et al., arXiv:2603.21687v2].
-
Un modèle texte-only de 3 milliards de paramètres surpasse tous les VLMs frontier (>100 milliards de paramètres) sur un benchmark de radiologie thoracique, en opérant uniquement sur les paires textuelles question-réponse, sans jamais analyser d’image [Asadi et al., arXiv:2603.21687v2].
-
Les classements publiés mesurent en partie de l’inférence textuelle, non de la compréhension visuelle. Les scores de GPT-5.1 et Gemini-3-Pro chutent de 8 à 9 points sur MMMU-Pro après nettoyage B-Clean [Asadi et al., arXiv:2603.21687v2].
-
L’ablation de modalité — tester un VLM sans ses entrées visuelles — est un test de diagnostic simple qui devrait devenir systématique avant tout déploiement ou sélection de modèle multimodal.