En bref

Les IA capables de discuter avec toi n’ont pas surgi de nulle part. Elles sont le résultat d’une dizaine d’années de recherche, avec quelques moments charnières où tout a basculé. Le plus visible : novembre 2022, quand ChatGPT a mis cette technologie entre les mains de tout le monde.

Imagine l’histoire des moteurs : on n’est pas passé de la diligence à la voiture électrique en un saut. Il y a eu la machine à vapeur, puis le moteur à explosion, puis l’injection électronique, et beaucoup d’erreurs entre les deux. Les IA conversationnelles suivent la même logique — chaque étape dépendait de la précédente, et 2022 ressemble à 1908 quand Henry Ford a sorti sa Model T : pas l’invention, mais le moment où l’objet est devenu accessible au grand public.


Avant 2017 — les chercheurs apprennent aux machines à lire

Pendant longtemps, les ordinateurs traitaient les mots comme des étiquettes sans lien entre elles. “Chat” et “chien” étaient aussi éloignés que “chat” et “galaxie”. Pas très utile pour comprendre une phrase.

En 2013, une équipe de Google trouve un moyen de placer les mots sur une sorte de carte. Sur cette carte, les mots proches par le sens se retrouvent proches géographiquement. “Roi” et “reine” sont voisins, “voiture” et “camion” aussi. Pour la première fois, une machine capte quelque chose qui ressemble à du sens.

Mais il restait un gros problème : le mot “avocat” avait la même position sur la carte, qu’on parle du fruit ou du métier. La machine ne tenait pas compte du contexte. En 2018, des chercheurs règlent ce problème : désormais, le même mot change de représentation selon la phrase où il apparaît. La machine commence à “lire” pour de vrai.

En clair : avant 2018, chaque mot avait une fiche fixe dans le dictionnaire de la machine. Après 2018, chaque mot est lu dans son contexte — le programme comprend que « avocat de la défense » et « avocat à la vinaigrette » désignent deux choses différentes.


2017 — L’invention qui change tout

En juin 2017, une équipe de Google publie un article au titre devenu célèbre : “Attention Is All You Need”. Ils y décrivent une nouvelle architecture — une manière d’organiser les calculs — appelée Transformer.

L’idée, en version simple : quand tu lis une phrase, tu ne lis pas mot par mot dans l’ordre. Tu fais des allers-retours, tu relies “il” au personnage mentionné plus tôt, tu comprends qu’un mot en fin de phrase éclaire le début. Le Transformer fait pareil. Au lieu de traiter les mots un par un (comme faisaient les systèmes précédents), il les regarde tous en même temps et calcule lesquels sont importants les uns pour les autres.

Deux conséquences majeures. D’abord, c’est beaucoup plus rapide — on peut exploiter la puissance des processeurs graphiques (GPU) à fond. Ensuite, la machine capte enfin les liens entre des mots très éloignés dans un texte. Le Transformer est la fondation sur laquelle toutes les IA conversationnelles actuelles sont construites.

En clair : le Transformer, c’est le moteur à explosion des IA conversationnelles. Toutes celles que tu connais — ChatGPT, Claude, Gemini, Mistral — tournent sur cette même base inventée en 2017. Sans cette pièce, rien de tout ça n’existerait.


2018–2020 — Plus c’est gros, plus ça marche (ou presque)

À partir de 2018, les labos de recherche adoptent tous le Transformer et commencent à l’entraîner sur des quantités astronomiques de texte. Le principe : faire lire à la machine des milliards de pages web, de livres, d’articles, pour qu’elle apprenne les structures du langage. Ensuite, on l’affine sur des tâches précises.

OpenAI lance GPT-1 en 2018, puis GPT-2 en 2019. GPT-2 surprend tout le monde : sans qu’on lui apprenne explicitement, il est capable de résumer des textes, de traduire, de répondre à des questions. Il a simplement absorbé tellement de texte qu’il a “compris” comment le langage fonctionne.

En 2020, GPT-3 pousse le curseur encore plus loin : 175 milliards de paramètres (les réglages internes du modèle). Tu lui donnes un exemple ou deux dans ta question, et il généralise immédiatement. Les chercheurs découvrent une règle empirique : plus le modèle est gros et plus il a lu de texte, meilleur il est. La course à la taille est lancée.

AnnéeModèle phareParamètresBond observé
2018GPT-1117 millionsApprentissage transférable d’un grand corpus à des tâches précises.
2019GPT-21,5 milliardCapacités émergentes (résumé, traduction) sans entraînement dédié.
2020GPT-3175 milliardsFew-shot learning : un ou deux exemples suffisent à généraliser.
2022GPT-3.5 (ChatGPT)~ 175 milliardsAlignement par retour humain : le modèle devient utilisable au quotidien.
2023GPT-4non publié (ordre du trillion)Multimodalité (image), raisonnements plus longs et stables.

Novembre 2022 — Le moment ChatGPT

Jusqu’ici, ces modèles étaient impressionnants mais frustrants. GPT-3 pouvait écrire un poème convaincant, puis enchaîner avec une réponse toxique ou complètement inventée. Il suivait des statistiques, pas des intentions.

La clé, c’est l’alignement. Des chercheurs d’OpenAI trouvent un moyen de rendre le modèle plus utile : ils font évaluer des réponses par des humains, puis utilisent ces retours pour ajuster le comportement de la machine. Le résultat est spectaculaire : un modèle cent fois plus petit, mais corrigé avec cette méthode, est préféré par les testeurs humains dans 85 % des cas par rapport à GPT-3 brut.

Le 30 novembre 2022, OpenAI met cette technologie dans une interface de chat simple, accessible à tous. ChatGPT est né.

Un million d’utilisateurs en cinq jours. Cent millions en deux mois. Aucun produit technologique n’avait atteint cette diffusion aussi vite. La technologie existait depuis des mois — ce qui a changé, c’est que n’importe qui pouvait taper une question et obtenir une réponse cohérente, sans rien connaître à l’informatique.

C’est ce moment précis qui fait basculer les IA conversationnelles du monde de la recherche vers le quotidien de millions de personnes.


2023–2025 — L’explosion et les nouveaux défis

Après ChatGPT, tout s’accélère. En 2023, OpenAI sort GPT-4, capable de comprendre aussi les images. Google lance Gemini, son propre modèle. Anthropic développe Claude. Des dizaines d’entreprises se lancent dans la course.

Un mouvement parallèle se développe du côté des modèles ouverts, que n’importe qui peut télécharger et utiliser librement. Meta publie LLaMA, Mistral AI (une startup française) sort des modèles compacts qui rivalisent avec des géants bien plus gros. La technologie se démocratise.

En 2024-2025, une nouvelle étape apparaît : les modèles qui “réfléchissent” avant de répondre. Au lieu de donner une réponse immédiate, ils déroulent un raisonnement étape par étape — un peu comme toi quand tu résous un problème complexe sur papier avant de donner ta réponse finale. OpenAI, DeepSeek (Chine) et d’autres publient des modèles de ce type. DeepSeek montre qu’on peut obtenir des résultats comparables avec beaucoup moins de ressources, remettant en question l’idée que seuls les géants américains pouvaient jouer.

Aujourd’hui, les IA conversationnelles sont partout : rédaction, code, recherche, service client. Mais des questions fondamentales restent ouvertes. Ces machines comprennent-elles vraiment ce qu’elles disent, ou combinent-elles des mots de manière très sophistiquée sans réel sens ? Les chercheurs ne sont pas d’accord entre eux, et c’est un débat qu’on ne tranchera probablement pas de sitôt.


Ce qu’il faut retenir

  • Les IA qui parlent sont le fruit d’une dizaine d’années de recherche, pas d’une invention unique.
  • Le Transformer (2017) est la fondation technique commune à ChatGPT, Claude, Gemini et tous les autres.
  • ChatGPT (novembre 2022) n’est pas une percée scientifique en soi — c’est le moment où un modèle puissant est devenu accessible à tout le monde via une interface simple.
  • La course actuelle porte sur des modèles qui “réfléchissent” étape par étape, et sur la démocratisation via des modèles ouverts.
  • La question de savoir si ces machines “comprennent” vraiment reste ouverte et débattue par les chercheurs.