En bref

Lu et al. (Nature, mars 2026) présentent The AI Scientist, un système agentique qui exécute l’intégralité du cycle de recherche en machine learning sans intervention humaine : génération d’hypothèses, implémentation du code, lancement des expériences, analyse des résultats, rédaction du manuscrit et évaluation par un revieweur automatisé. Sur trois soumissions à un workshop ICLR 2025, un papier a obtenu un score moyen de 6,33 sur 10 (seuil d’acceptation dépassé), avant d’être retiré selon le protocole préétabli. Les deux autres n’ont pas atteint le seuil.

En clair : imaginez un laboratoire de recherche miniature qui tourne sans personne. Il pose une question, écrit le code de l’expérience, lance les calculs, lit les résultats, rédige l’article, et même se note lui-même comme le ferait un comité scientifique. Tout ça en une journée, pour quelques dollars de calcul. Sur trois articles soumis, un a passé la barre — un sur trois, ce n’est pas zéro mais ce n’est pas Nature non plus.


Ce que le système fait concrètement

The AI Scientist opère en quatre phases séquentielles.

Phase 1 — Idéation

Le système maintient une archive croissante d’idées de recherche, dans un sous-domaine du machine learning fourni par l’opérateur. Pour chaque idée, il génère un titre, une hypothèse centrale et un plan expérimental, avec des scores auto-évalués de faisabilité, d’intérêt et de nouveauté (échelle 1–10). La nouveauté est vérifiée automatiquement via l’API Semantic Scholar : les idées trop proches de travaux existants sont écartées avant d’avancer dans le pipeline.

Phase 2 — Expérimentation

Deux modes coexistent. En mode template-based, le système reçoit un template de code existant (par exemple, un entraînement de transformer sur Shakespeare) et le modifie pour tester l’hypothèse. En mode template-free, il génère le code de zéro et pilote une recherche arborescente parallélisée à quatre étages : investigation préliminaire, réglage des hyperparamètres, exécution de l’agenda de recherche, études d’ablation. Chaque nœud de l’arbre correspond à un script Python exécuté en temps réel. Les erreurs d’exécution génèrent des nœuds de débogage ; les visualisations produites sont critiquées par un modèle multimodal (GPT-4o) pour détecter des axes mal labelisés ou des figures trompeuses.

La génération complète d’un papier par le mode template-free prend entre plusieurs heures et plus de 15 heures selon la complexité.

Phase 3 — Rédaction

Le manuscrit est produit section par section à partir d’un template LaTeX de conférence. Le système interroge Semantic Scholar sur 20 rounds pour construire la section “travaux connexes” et justifie textuellement chaque citation avant de l’insérer. Plusieurs passes de relecture automatique améliorent la cohérence. La compilation LaTeX est corrigée automatiquement (jusqu’à cinq cycles).

Phase 4 — Évaluation automatisée

The Automated Reviewer simule le processus d’évaluation NeurIPS : il produit cinq reviews indépendantes puis une méta-revue (rôle d’area chair) donnant une décision binaire accept/reject et des scores numériques (rigueur, présentation, contribution). Validé sur 1 000 papiers ICLR (2017–2024) : précision équilibrée de 69 %, contre 66 % pour les reviewers humains selon l’expérience de cohérence NeurIPS 2021. Sur des papiers post-cutoff (2025, absents de l’entraînement), la précision tombe à 66 %, ce qui reste comparable aux humains.

En clair : les quatre phases reproduisent le rythme habituel d’un projet de recherche, mais en un cycle de 5 à 15 heures au lieu de plusieurs mois. La phase 2 (expérimentation) est la plus coûteuse — l’arbre de recherche peut faire jusqu’à 30 nœuds, chaque nœud est un script Python qui tourne, échoue, se débogue, retente. Le code n’est pas écrit “à l’aveugle” : un modèle multimodal critique les graphiques produits pour repérer les axes mal labelisés.


Le test de peer review réel

L’expérience centrale du papier consiste à soumettre trois manuscrits entièrement générés au workshop ICBINB (résultats négatifs en deep learning) d’ICLR 2025 — avec accord préalable des organisateurs et d’un comité d’éthique (IRB, UBC). Les reviewers savaient que certaines soumissions étaient générées par IA, sans savoir lesquelles. Le workshop affichait un taux d’acceptation de 70 %, contre 32 % pour la conférence principale ICLR 2025.

Un papier a obtenu des scores de 6, 7 et 6 (moyenne : 6,33), au-dessus du seuil d’acceptation moyen du workshop. Il portait sur un résultat négatif — thème central du workshop. Selon les organisateurs, il aurait été accepté sans le protocole de retrait préétabli. Les deux autres papiers n’ont pas atteint le seuil.

L’équipe de chercheurs humains ayant examiné les trois papiers en interne a conclu qu’aucun ne satisfaisait au niveau d’une publication en conférence principale ICLR.

En clair : “1 sur 3 accepté” sonne impressionnant, mais le contexte modère. Le workshop ICBINB acceptait 70 % des soumissions humaines (très permissif), pas 32 % comme la conférence principale. Et l’équipe Nature elle-même a jugé qu’aucun des trois papiers ne tenait debout au standard d’ICLR principal. La barre franchie, c’est celle d’un workshop bienveillant — pas celle d’une publication scientifique sérieuse.


Corrélation qualité / modèle et / calcul

Le papier documente deux tendances mesurées par The Automated Reviewer :

  • Qualité en fonction du modèle de base : corrélation significative (R² = 0,517, p < 0,00001) entre la date de sortie du modèle sous-jacent et la qualité des papiers générés. GPT-4 (2023) produit des scores autour de 2 ; Gemini 2.5 et les modèles récents approchent 5–6. Les modèles testés incluent GPT-4, GPT-4o, o1, o3, Claude Sonnet 3/3.5/3.7/4, Gemini 1.5/2.0/2.5.
  • Qualité en fonction du budget de calcul : plus on alloue de nœuds à la recherche arborescente (de 5 à 30 nœuds), plus les scores progressent, avec une tendance claire jusqu’à n = 30 (limite testée).

Ce qui résiste à l’automatisation

Le papier liste explicitement les modes d’échec observés :

  • Idées naïves ou insuffisamment développées : le système génère des hypothèses plausibles mais parfois superficielles.
  • Implémentation incorrecte : le code peut ne pas réaliser exactement l’idée proposée.
  • Manque de rigueur méthodologique : certains papiers présentent des expériences sans ablations suffisantes ou sans comparatifs adéquats.
  • Erreurs d’implémentation : bugs non détectés affectant la validité des résultats.
  • Hallucinations bibliographiques : citations inexactes ou inexistantes.
  • Problèmes de mise en page : figures dupliquées entre corps et annexe.

Les auteurs soulignent que la question des “sauts conceptuels” — les idées vraiment nouvelles qui changent un champ — reste ouverte. Le système produit des variations et extensions de travaux existants, pas des ruptures paradigmatiques.

Par ailleurs, le système est limité aux expériences computationnelles. L’extension à d’autres disciplines (chimie, biologie) nécessite des laboratoires automatisés qui progressent mais restent coûteux.


Enjeux éthiques identifiés

Les auteurs identifient cinq risques principaux : saturation du système de peer review, inflation artificielle des crédits académiques, usage non attribué des idées d’autrui, suppression d’emplois de chercheurs, conduite d’expériences non éthiques. Le papier insiste sur l’absence de normes de divulgation établies dans la communauté scientifique, et traite le retrait systématique des soumissions comme une précaution nécessaire dans cet état transitoire.


Ce qu’il faut retenir

  • The AI Scientist automatise l’ensemble du cycle de recherche en machine learning : un papier généré a passé le premier tour d’un peer review ICLR 2025 (workshop, taux d’acceptation 70 %).
  • La qualité des papiers produits augmente de façon mesurable avec la qualité du modèle sous-jacent et le budget de calcul alloué.
  • Un revieweur automatisé atteint une précision équilibrée comparable aux reviewers humains (66–69 %) sur des données ICLR.
  • Les limites actuelles sont structurelles : idées peu profondes, hallucinations, manque de rigueur sur les cas difficiles — et aucun des trois papiers soumis ne satisfaisait au niveau d’une conférence principale.
  • L’extension à des domaines expérimentaux hors informatique (chimie, biologie) reste en cours, conditionnée à la disponibilité de laboratoires automatisés.