En bref

La famille GPT est la ligne de modèles de langage développée par OpenAI depuis 2018. Elle a posé les bases du marché actuel des grands modèles de langage : GPT-3 a montré qu’un modèle suffisamment grand pouvait généraliser sur des tâches très diverses, ChatGPT a rendu ces capacités accessibles au grand public, et la série o a introduit une nouvelle façon de concevoir l’inférence — non plus comme une simple génération token par token, mais comme un processus de raisonnement étendu.

Deux branches ont longtemps coexisté : les modèles GPT (4o, 4.1) optimisés pour la polyvalence et la vitesse, et les modèles o (o1, o3, o4-mini) qui investissent du temps de calcul supplémentaire à l’inférence. Elles ont convergé dans GPT-5 (août 2025), dont l’argument était un routeur automatique : l’utilisateur n’avait plus à choisir.

Au 6 septembre 2026, le choix est revenu — sous d’autres noms. Le catalogue documenté aligne GPT-6 Astra en haut de gamme, et trois variantes nommées de GPT-5.6 en dessous : Sol, Terra, Luna, séparées par un facteur seize sur le prix de sortie — et plus de quarante entre la moins chère et le haut de gamme. S’y ajoutent des lignes spécialisées que la génération précédente n’avait pas : image, temps réel et voix, transcription, et une famille dédiée à la cybersécurité.

En clair : imaginez deux assistants au comptoir d’une banque. Le premier (GPT-4o, 4.1) répond du tac au tac — rapide, fluide, idéal pour les questions courantes. Le second (o1, o3) met votre dossier de côté, le compulse, prend des notes, vérifie par lui-même avant de revenir avec une réponse étayée — plus lent mais plus fiable sur les cas complexes. GPT-5 met les deux assistants côte à côte avec un standardiste qui dispatche la requête au bon profil selon la difficulté détectée. Le tout est un produit unifié pour l’utilisateur final.


Fiche d’identité

ChampValeur
OrganisationOpenAI
Première versionGPT-1 (2018)
TypeTransformer decoder-only, pré-entraîné et affiné par instructions
AccèsAPI (OpenAI), interface ChatGPT (gratuit et abonnement Pro)
Fenêtre de contexte1 050 000 tokens sur GPT-6 Astra et la gamme GPT-5.6 — 128 000 (GPT-4o, historique)
Gamme au 6 septembre 2026GPT-6 Astra · GPT-5.6 Sol · GPT-5.6 Terra · GPT-5.6 Luna (+ lignes image, temps réel, transcription, cyber)

Historique

2018–2022 : les fondations

GPT-1 (2018) introduit l’architecture Transformer decoder-only, pré-entraînée sur un corpus de livres. GPT-2 (2019) reprend ce principe à plus grande échelle, avec une publication initialement retenue par OpenAI par crainte d’usages abusifs. GPT-3 (2020), avec ses 175 milliards de paramètres, révèle l’émergence de capacités de généralisation inattendues : le modèle résout des tâches pour lesquelles il n’a pas été explicitement entraîné. GPT-3.5 / ChatGPT (novembre 2022) ajoute le fine-tuning par instruction (RLHF) et popularise l’accès grand public.

2023 : GPT-4

Lancé le 14 mars 2023, GPT-4 améliore significativement la fiabilité et la résolution de problèmes. Son architecture interne n’a jamais été confirmée officiellement, bien que des sources tierces évoquent une organisation de type Mixture of Experts. OpenAI a cessé de publier le nombre de paramètres à partir de cette version.

2024 : multimodalité et raisonnement

GPT-4o (mai 2024) est le premier modèle GPT nativement multimodal : il traite texte, audio et image dans un pipeline unifié, sans étape de transcription intermédiaire. La latence de réponse audio atteint 320 ms, comparable au temps de réaction humain. Fenêtre de contexte : 128 000 tokens.

o1-preview (septembre 2024) inaugure la série o. Ces modèles sont entraînés à “réfléchir” avant de répondre : un processus de chain-of-thought interne, invisible pour l’utilisateur, permet d’explorer plusieurs pistes avant de formuler une réponse. Ce n’est pas du simple prompting CoT — le raisonnement est intégré à l’entraînement et à l’inférence (“test-time compute”).

En clair : la rupture o1 n’est pas un nouveau modèle plus gros — c’est une nouvelle manière d’utiliser le calcul à l’inférence. Là où GPT-4o produit une réponse en moyenne en 2-3 secondes, o1 peut prendre 30 secondes à plusieurs minutes pour explorer mentalement plusieurs pistes avant de formuler la réponse finale. Cette “réflexion” multiplie le coût compute par 5 à 50× selon la difficulté. Le pari : sur les problèmes mathématiques et scientifiques, ce surcoût est justifié par un saut de qualité massif (74 % AIME contre 12 % pour GPT-4o, soit ×6).

2025 : extension des contextes et unification

GPT-4.1 (avril 2025) porte la fenêtre de contexte à 1 million de tokens. o3 et o4-mini (avril 2025) étendent les capacités de raisonnement aux outils (recherche web, exécution Python, génération d’images), avec une fenêtre de 200 000 tokens et 100 000 tokens en sortie.

GPT-5 (août 2025) unifie les deux branches : un routeur automatique distribue les requêtes entre un mode rapide et un mode thinking selon la complexité du problème.

En clair : la convergence GPT-5 est aussi une convergence économique. Avant, l’utilisateur devait choisir explicitement entre GPT-4o (1-2 $ / M tokens output) et o3 (8 $ / M tokens output). Devoir choisir le bon modèle est une charge cognitive — et un risque de payer trop cher pour une question simple. GPT-5 abstrait ce choix en routant automatiquement les requêtes : 80-90 % des prompts ne nécessitent pas le mode thinking et restent économiques, les 10-20 % complexes basculent en thinking sans intervention utilisateur.

2026 : retraite des anciens, puis retour du choix explicite

Le 13 février 2026, OpenAI a retiré de ChatGPT GPT-4o, GPT-4.1, GPT-4.1 mini et o4-mini. Ces modèles restent disponibles via l’API.

La gamme GPT-5.6 remplace le modèle unique par trois variantes nommées, toutes à 1,05 million de tokens de contexte : Sol pour le travail professionnel complexe (4 $/20 $ par million de tokens, alias gpt-5.6), Terra pour l’équilibre capacité-dépense (2 $/12 $), Luna pour les charges sensibles au coût (0,20 $/1,20 $). Entre Luna et Sol, le prix de sortie varie d’un facteur seize ; entre Luna et le haut de gamme, d’un facteur plus de quarante.

GPT-6 Astra (3 septembre 2026) prend la tête du catalogue — « notre modèle le plus capable, conçu pour le travail de bout en bout le plus difficile », identifiant gpt-6-astra, contexte de 1,05 million de tokens, 128 000 tokens en sortie, 10 $/50 $. Le déploiement est progressif : préversion pour partenaires de confiance le 3 septembre, ouverture aux offres payantes le lendemain dans une version restreinte qui refuse certaines demandes, notamment en cybersécurité. Les entreprises inscrites au programme cyber d’OpenAI ont été servies en premier.

Une ligne cybersécurité apparaît au catalogue — GPT-5.6 Cyber, Daybreak Red, Daybreak Blue — là où les générations précédentes n’exposaient aucun modèle dédié à ce domaine. C’est le signe d’un marché qui se segmente par métier et non plus seulement par taille.

En clair : l’argument de vente de GPT-5 en 2025 était « vous n’avez plus à choisir votre modèle, le routeur s’en charge ». Un an plus tard, le catalogue documente quatre modèles généralistes nommés et une demi-douzaine de spécialisés — le choix est revenu, déplacé du réglage technique vers le nom commercial. Pour qui décide d’une architecture, la question pratique n’a pas changé : entre Luna et Astra, le prix de sortie est multiplié par plus de quarante, et rien dans le nom ne dit à partir de quel moment l’écart se justifie. Cela se mesure, cela ne se lit pas sur une fiche.


Capacités

Benchmarks

Série o1 (septembre 2024)

Benchmarko1GPT-4o (référence)
AIME 202474 % (1 essai) / 93 % (1000 essais, reranking)12 %
GPQA Diamond78,1 %—

Le score GPQA Diamond de 78,1 % dépasse le niveau médian des doctorants humains experts dans leur domaine. Claude 3.5 Sonnet atteignait 67,2 % au même benchmark.

Source : OpenAI — Learning to reason with LLMs

o3 et o4-mini (avril 2025)

Benchmarko3o4-mini
AIME 2025 (avec Python)98,4 %99,5 %
SWE-bench Verified69,1 %68,1 %
GPQA Diamond87,7 %81,4 %

Source : OpenAI — Introducing o3 and o4-mini

GPT-5 (août 2025)

BenchmarkScore
AIME 2025 (sans outils)94,6 %
SWE-bench Verified74,9 %
Aider Polyglot88 %
MMMU84,2 %

Source : OpenAI — Introducing GPT-5

Multimodalité

GPT-4o accepte en entrée du texte, de l’audio, des images et de la vidéo (convertie en frames à 2–4 fps, sans piste audio). En sortie : texte, audio, image. Le traitement audio est natif — pas de pipeline séparé de transcription — ce qui réduit la latence et améliore la compréhension des nuances prosodiques.

Les modèles o3 et o4-mini ajoutent le raisonnement visuel approfondi et l’intégration des outils ChatGPT dans la chaîne de pensée.


Limites connues

Hallucinations

GPT-4o hérite des problèmes d’hallucinations des générations précédentes. La génération de voix haute-fidélité introduit un risque supplémentaire : la fluidité du rendu peut induire une confiance mal calibrée chez les utilisateurs. Le modèle de transcription audio d’OpenAI produit environ 90 % moins d’hallucinations que Whisper v2 selon les tests internes en environnement bruité — mais ce chiffre concerne la transcription, pas la génération de contenu.

Source : GPT-4o System Card

Knowledge cutoff

ModèleCutoff
GPT-4o (version initiale)Octobre 2023
GPT-4o (version mise à jour)Juin 2024
GPT-4.1, 4.1 mini, 4.1 nanoJuin 2024

Le cutoff des modèles o3 et o4-mini n’a pas été confirmé dans les sources primaires consultées, et la page modèles d’OpenAI n’en publie pas non plus pour la gamme 5.6 ni pour Astra. C’est une différence de pratique notable avec Anthropic, qui publie désormais une date de fin de connaissance par modèle : à catalogue comparable, l’information n’est pas disponible des deux côtés.

Coûts API

Les modèles de raisonnement sont significativement plus lents que les modèles standards : le temps de “réflexion” interne augmente la latence de façon non négligeable. Les tarifs reflètent cet investissement :

Catalogue au 6 septembre 2026 (documentation OpenAI) :

ModèleContexteEntrée ($/M tokens)Sortie ($/M tokens)Destination annoncée
GPT-6 Astra1,05 M10,00 $50,00 $le travail de bout en bout le plus difficile
GPT-5.6 Sol (gpt-5.6)1,05 M4,00 $20,00 $travail professionnel complexe
GPT-5.6 Terra1,05 M2,00 $12,00 $équilibre capacité / dépense
GPT-5.6 Luna1,05 M0,20 $1,20 $charges sensibles au coût

Génération précédente, toujours servie par l’API :

ModèleEntréeSortie
GPT-4.12,00 $8,00 $
GPT-4.1 mini0,40 $1,60 $
GPT-4.1 nano0,10 $0,40 $
o32,00 $8,00 $
o4-mini1,10 $4,40 $

Le fait marquant n’est pas le prix du haut de gamme mais l’étalement : à contexte identique de 1,05 million de tokens, la sortie va de 1,20 $ à 50 $ par million de tokens selon la variante. Le même volume de contexte coûte donc quarante fois plus cher à traiter d’un bout à l’autre du catalogue — c’est la capacité qui est facturée, pas la taille de la fenêtre.

Des réductions s’appliquent via la Batch API (–50 %, résultats sous 24 h) et le cache de prompts.

Source : OpenAI — Models

Date d’annonce de GPT-6 Astra : CNBC, « OpenAI announces rollout of GPT-6 Astra model », 3 septembre 2026 (référence non liée : le site refuse les requêtes automatiques, un lien y serait signalé mort par notre vérificateur).

Opacité architecturale

Depuis GPT-4, OpenAI ne publie plus le nombre de paramètres ni les détails architecturaux de ses modèles. L’architecture Mixture of Experts souvent citée pour GPT-4 n’a jamais été confirmée officiellement. Cette opacité rend difficile toute comparaison rigoureuse avec des modèles open-weight.

Quel modèle GPT pour quel usage

ContexteRecommandationPourquoi
Application grand public, latence critique, coût serréGPT-5.6 Luna0,20 $/1,20 $ pour le même contexte de 1,05 M que le haut de gamme. L’option la moins chère du catalogue courant.
Tâche bureautique standard, dialogue produit, rédaction couranteGPT-5.6 Terra2 $/12 $ — le point d’équilibre annoncé entre capacité et dépense.
Travail professionnel complexe, analyse longue, codeGPT-5.6 Sol4 $/20 $, l’alias gpt-5.6 pointe dessus : c’est le défaut implicite si vous n’avez pas choisi.
Tâche de bout en bout difficile, agentique longueGPT-6 Astra10 $/50 $, déploiement progressif et version restreinte sur certains sujets. À réserver aux cas où les variantes 5.6 ont été mesurées insuffisantes.
Problème mathématique, scientifique, code complexe nécessitant exactitudeo3 ou o4-mini98,4 % AIME 2025, 87,7 % GPQA. Le coût supplémentaire (8 $ / M tokens output) est justifié par le saut de qualité × 6 vs GPT-4o.
Analyse de très long document (rapport, base de code)GPT-5.6 Luna1,05 M de tokens — l’équivalent d’un livre de 700 pages — à 0,20 $/1,20 $. Tout le catalogue courant tient cette fenêtre ; GPT-4.1 (1 M, 2 $/8 $) reste servi mais coûte dix fois plus cher en entrée et près de sept fois en sortie, pour un contexte plus court.
Multimodal natif (audio temps réel, vidéo)GPT-4oPipeline audio sans transcription intermédiaire, latence 320 ms — comparable au temps de réaction humain.

Ce qu’il faut retenir

  • La famille GPT a traversé trois ruptures majeures : quantitative (mise à l’échelle), qualitative (instruction tuning), et algorithmique (raisonnement à l’inférence avec la série o).
  • GPT-5 représente la convergence de ces directions : un routeur automatique distribue les requêtes entre mode rapide et mode thinking selon la demande.
  • Les modèles de raisonnement (o1, o3) investissent du calcul supplémentaire à l’inférence — ce n’est pas du prompting, c’est intégré à l’entraînement.
  • L’architecture exacte, la taille réelle et les données d’entraînement restent opaques depuis GPT-4 : les benchmarks constituent la principale fenêtre d’observation externe.