En bref
La famille GPT est la ligne de modèles de langage développée par OpenAI depuis 2018. Elle a posé les bases du marché actuel des grands modèles de langage : GPT-3 a montré qu’un modèle suffisamment grand pouvait généraliser sur des tâches très diverses, ChatGPT a rendu ces capacités accessibles au grand public, et la série o a introduit une nouvelle façon de concevoir l’inférence — non plus comme une simple génération token par token, mais comme un processus de raisonnement étendu.
Deux branches ont longtemps coexisté : les modèles GPT (4o, 4.1) optimisés pour la polyvalence et la vitesse, et les modèles o (o1, o3, o4-mini) qui investissent du temps de calcul supplémentaire à l’inférence. Elles ont convergé dans GPT-5 (août 2025), dont l’argument était un routeur automatique : l’utilisateur n’avait plus à choisir.
Au 6 septembre 2026, le choix est revenu — sous d’autres noms. Le catalogue documenté aligne GPT-6 Astra en haut de gamme, et trois variantes nommées de GPT-5.6 en dessous : Sol, Terra, Luna, séparées par un facteur seize sur le prix de sortie — et plus de quarante entre la moins chère et le haut de gamme. S’y ajoutent des lignes spécialisées que la génération précédente n’avait pas : image, temps réel et voix, transcription, et une famille dédiée à la cybersécurité.
En clair : imaginez deux assistants au comptoir d’une banque. Le premier (GPT-4o, 4.1) répond du tac au tac — rapide, fluide, idéal pour les questions courantes. Le second (o1, o3) met votre dossier de côté, le compulse, prend des notes, vérifie par lui-même avant de revenir avec une réponse étayée — plus lent mais plus fiable sur les cas complexes. GPT-5 met les deux assistants côte à côte avec un standardiste qui dispatche la requête au bon profil selon la difficulté détectée. Le tout est un produit unifié pour l’utilisateur final.
Fiche d’identité
| Champ | Valeur |
|---|---|
| Organisation | OpenAI |
| Première version | GPT-1 (2018) |
| Type | Transformer decoder-only, pré-entraîné et affiné par instructions |
| Accès | API (OpenAI), interface ChatGPT (gratuit et abonnement Pro) |
| Fenêtre de contexte | 1 050 000 tokens sur GPT-6 Astra et la gamme GPT-5.6 — 128 000 (GPT-4o, historique) |
| Gamme au 6 septembre 2026 | GPT-6 Astra · GPT-5.6 Sol · GPT-5.6 Terra · GPT-5.6 Luna (+ lignes image, temps réel, transcription, cyber) |
Historique
2018–2022 : les fondations
GPT-1 (2018) introduit l’architecture Transformer decoder-only, pré-entraînée sur un corpus de livres. GPT-2 (2019) reprend ce principe à plus grande échelle, avec une publication initialement retenue par OpenAI par crainte d’usages abusifs. GPT-3 (2020), avec ses 175 milliards de paramètres, révèle l’émergence de capacités de généralisation inattendues : le modèle résout des tâches pour lesquelles il n’a pas été explicitement entraîné. GPT-3.5 / ChatGPT (novembre 2022) ajoute le fine-tuning par instruction (RLHF) et popularise l’accès grand public.
2023 : GPT-4
Lancé le 14 mars 2023, GPT-4 améliore significativement la fiabilité et la résolution de problèmes. Son architecture interne n’a jamais été confirmée officiellement, bien que des sources tierces évoquent une organisation de type Mixture of Experts. OpenAI a cessé de publier le nombre de paramètres à partir de cette version.
2024 : multimodalité et raisonnement
GPT-4o (mai 2024) est le premier modèle GPT nativement multimodal : il traite texte, audio et image dans un pipeline unifié, sans étape de transcription intermédiaire. La latence de réponse audio atteint 320 ms, comparable au temps de réaction humain. Fenêtre de contexte : 128 000 tokens.
o1-preview (septembre 2024) inaugure la série o. Ces modèles sont entraînés à “réfléchir” avant de répondre : un processus de chain-of-thought interne, invisible pour l’utilisateur, permet d’explorer plusieurs pistes avant de formuler une réponse. Ce n’est pas du simple prompting CoT — le raisonnement est intégré à l’entraînement et à l’inférence (“test-time compute”).
En clair : la rupture o1 n’est pas un nouveau modèle plus gros — c’est une nouvelle manière d’utiliser le calcul à l’inférence. Là où GPT-4o produit une réponse en moyenne en 2-3 secondes, o1 peut prendre 30 secondes à plusieurs minutes pour explorer mentalement plusieurs pistes avant de formuler la réponse finale. Cette “réflexion” multiplie le coût compute par 5 à 50× selon la difficulté. Le pari : sur les problèmes mathématiques et scientifiques, ce surcoût est justifié par un saut de qualité massif (74 % AIME contre 12 % pour GPT-4o, soit ×6).
2025 : extension des contextes et unification
GPT-4.1 (avril 2025) porte la fenêtre de contexte à 1 million de tokens. o3 et o4-mini (avril 2025) étendent les capacités de raisonnement aux outils (recherche web, exécution Python, génération d’images), avec une fenêtre de 200 000 tokens et 100 000 tokens en sortie.
GPT-5 (août 2025) unifie les deux branches : un routeur automatique distribue les requêtes entre un mode rapide et un mode thinking selon la complexité du problème.
En clair : la convergence GPT-5 est aussi une convergence économique. Avant, l’utilisateur devait choisir explicitement entre GPT-4o (1-2 $ / M tokens output) et o3 (8 $ / M tokens output). Devoir choisir le bon modèle est une charge cognitive — et un risque de payer trop cher pour une question simple. GPT-5 abstrait ce choix en routant automatiquement les requêtes : 80-90 % des prompts ne nécessitent pas le mode thinking et restent économiques, les 10-20 % complexes basculent en thinking sans intervention utilisateur.
2026 : retraite des anciens, puis retour du choix explicite
Le 13 février 2026, OpenAI a retiré de ChatGPT GPT-4o, GPT-4.1, GPT-4.1 mini et o4-mini. Ces modèles restent disponibles via l’API.
La gamme GPT-5.6 remplace le modèle unique par trois variantes nommées, toutes à 1,05 million de tokens de contexte : Sol pour le travail professionnel complexe (4 $/20 $ par million de tokens, alias gpt-5.6), Terra pour l’équilibre capacité-dépense (2 $/12 $), Luna pour les charges sensibles au coût (0,20 $/1,20 $). Entre Luna et Sol, le prix de sortie varie d’un facteur seize ; entre Luna et le haut de gamme, d’un facteur plus de quarante.
GPT-6 Astra (3 septembre 2026) prend la tête du catalogue — « notre modèle le plus capable, conçu pour le travail de bout en bout le plus difficile », identifiant gpt-6-astra, contexte de 1,05 million de tokens, 128 000 tokens en sortie, 10 $/50 $. Le déploiement est progressif : préversion pour partenaires de confiance le 3 septembre, ouverture aux offres payantes le lendemain dans une version restreinte qui refuse certaines demandes, notamment en cybersécurité. Les entreprises inscrites au programme cyber d’OpenAI ont été servies en premier.
Une ligne cybersécurité apparaît au catalogue — GPT-5.6 Cyber, Daybreak Red, Daybreak Blue — là où les générations précédentes n’exposaient aucun modèle dédié à ce domaine. C’est le signe d’un marché qui se segmente par métier et non plus seulement par taille.
En clair : l’argument de vente de GPT-5 en 2025 était « vous n’avez plus à choisir votre modèle, le routeur s’en charge ». Un an plus tard, le catalogue documente quatre modèles généralistes nommés et une demi-douzaine de spécialisés — le choix est revenu, déplacé du réglage technique vers le nom commercial. Pour qui décide d’une architecture, la question pratique n’a pas changé : entre Luna et Astra, le prix de sortie est multiplié par plus de quarante, et rien dans le nom ne dit à partir de quel moment l’écart se justifie. Cela se mesure, cela ne se lit pas sur une fiche.
Capacités
Benchmarks
Série o1 (septembre 2024)
| Benchmark | o1 | GPT-4o (référence) |
|---|---|---|
| AIME 2024 | 74 % (1 essai) / 93 % (1000 essais, reranking) | 12 % |
| GPQA Diamond | 78,1 % | — |
Le score GPQA Diamond de 78,1 % dépasse le niveau médian des doctorants humains experts dans leur domaine. Claude 3.5 Sonnet atteignait 67,2 % au même benchmark.
Source : OpenAI — Learning to reason with LLMs
o3 et o4-mini (avril 2025)
| Benchmark | o3 | o4-mini |
|---|---|---|
| AIME 2025 (avec Python) | 98,4 % | 99,5 % |
| SWE-bench Verified | 69,1 % | 68,1 % |
| GPQA Diamond | 87,7 % | 81,4 % |
Source : OpenAI — Introducing o3 and o4-mini
GPT-5 (août 2025)
| Benchmark | Score |
|---|---|
| AIME 2025 (sans outils) | 94,6 % |
| SWE-bench Verified | 74,9 % |
| Aider Polyglot | 88 % |
| MMMU | 84,2 % |
Source : OpenAI — Introducing GPT-5
Multimodalité
GPT-4o accepte en entrée du texte, de l’audio, des images et de la vidéo (convertie en frames à 2–4 fps, sans piste audio). En sortie : texte, audio, image. Le traitement audio est natif — pas de pipeline séparé de transcription — ce qui réduit la latence et améliore la compréhension des nuances prosodiques.
Les modèles o3 et o4-mini ajoutent le raisonnement visuel approfondi et l’intégration des outils ChatGPT dans la chaîne de pensée.
Limites connues
Hallucinations
GPT-4o hérite des problèmes d’hallucinations des générations précédentes. La génération de voix haute-fidélité introduit un risque supplémentaire : la fluidité du rendu peut induire une confiance mal calibrée chez les utilisateurs. Le modèle de transcription audio d’OpenAI produit environ 90 % moins d’hallucinations que Whisper v2 selon les tests internes en environnement bruité — mais ce chiffre concerne la transcription, pas la génération de contenu.
Source : GPT-4o System Card
Knowledge cutoff
| Modèle | Cutoff |
|---|---|
| GPT-4o (version initiale) | Octobre 2023 |
| GPT-4o (version mise à jour) | Juin 2024 |
| GPT-4.1, 4.1 mini, 4.1 nano | Juin 2024 |
Le cutoff des modèles o3 et o4-mini n’a pas été confirmé dans les sources primaires consultées, et la page modèles d’OpenAI n’en publie pas non plus pour la gamme 5.6 ni pour Astra. C’est une différence de pratique notable avec Anthropic, qui publie désormais une date de fin de connaissance par modèle : à catalogue comparable, l’information n’est pas disponible des deux côtés.
Coûts API
Les modèles de raisonnement sont significativement plus lents que les modèles standards : le temps de “réflexion” interne augmente la latence de façon non négligeable. Les tarifs reflètent cet investissement :
Catalogue au 6 septembre 2026 (documentation OpenAI) :
| Modèle | Contexte | Entrée ($/M tokens) | Sortie ($/M tokens) | Destination annoncée |
|---|---|---|---|---|
| GPT-6 Astra | 1,05 M | 10,00 $ | 50,00 $ | le travail de bout en bout le plus difficile |
GPT-5.6 Sol (gpt-5.6) | 1,05 M | 4,00 $ | 20,00 $ | travail professionnel complexe |
| GPT-5.6 Terra | 1,05 M | 2,00 $ | 12,00 $ | équilibre capacité / dépense |
| GPT-5.6 Luna | 1,05 M | 0,20 $ | 1,20 $ | charges sensibles au coût |
Génération précédente, toujours servie par l’API :
| Modèle | Entrée | Sortie |
|---|---|---|
| GPT-4.1 | 2,00 $ | 8,00 $ |
| GPT-4.1 mini | 0,40 $ | 1,60 $ |
| GPT-4.1 nano | 0,10 $ | 0,40 $ |
| o3 | 2,00 $ | 8,00 $ |
| o4-mini | 1,10 $ | 4,40 $ |
Le fait marquant n’est pas le prix du haut de gamme mais l’étalement : à contexte identique de 1,05 million de tokens, la sortie va de 1,20 $ à 50 $ par million de tokens selon la variante. Le même volume de contexte coûte donc quarante fois plus cher à traiter d’un bout à l’autre du catalogue — c’est la capacité qui est facturée, pas la taille de la fenêtre.
Des réductions s’appliquent via la Batch API (–50 %, résultats sous 24 h) et le cache de prompts.
Source : OpenAI — Models
Date d’annonce de GPT-6 Astra : CNBC, « OpenAI announces rollout of GPT-6 Astra model », 3 septembre 2026 (référence non liée : le site refuse les requêtes automatiques, un lien y serait signalé mort par notre vérificateur).
Opacité architecturale
Depuis GPT-4, OpenAI ne publie plus le nombre de paramètres ni les détails architecturaux de ses modèles. L’architecture Mixture of Experts souvent citée pour GPT-4 n’a jamais été confirmée officiellement. Cette opacité rend difficile toute comparaison rigoureuse avec des modèles open-weight.
Quel modèle GPT pour quel usage
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Application grand public, latence critique, coût serré | GPT-5.6 Luna | 0,20 $/1,20 $ pour le même contexte de 1,05 M que le haut de gamme. L’option la moins chère du catalogue courant. |
| Tâche bureautique standard, dialogue produit, rédaction courante | GPT-5.6 Terra | 2 $/12 $ — le point d’équilibre annoncé entre capacité et dépense. |
| Travail professionnel complexe, analyse longue, code | GPT-5.6 Sol | 4 $/20 $, l’alias gpt-5.6 pointe dessus : c’est le défaut implicite si vous n’avez pas choisi. |
| Tâche de bout en bout difficile, agentique longue | GPT-6 Astra | 10 $/50 $, déploiement progressif et version restreinte sur certains sujets. À réserver aux cas où les variantes 5.6 ont été mesurées insuffisantes. |
| Problème mathématique, scientifique, code complexe nécessitant exactitude | o3 ou o4-mini | 98,4 % AIME 2025, 87,7 % GPQA. Le coût supplémentaire (8 $ / M tokens output) est justifié par le saut de qualité × 6 vs GPT-4o. |
| Analyse de très long document (rapport, base de code) | GPT-5.6 Luna | 1,05 M de tokens — l’équivalent d’un livre de 700 pages — à 0,20 $/1,20 $. Tout le catalogue courant tient cette fenêtre ; GPT-4.1 (1 M, 2 $/8 $) reste servi mais coûte dix fois plus cher en entrée et près de sept fois en sortie, pour un contexte plus court. |
| Multimodal natif (audio temps réel, vidéo) | GPT-4o | Pipeline audio sans transcription intermédiaire, latence 320 ms — comparable au temps de réaction humain. |
Ce qu’il faut retenir
- La famille GPT a traversé trois ruptures majeures : quantitative (mise à l’échelle), qualitative (instruction tuning), et algorithmique (raisonnement à l’inférence avec la série o).
- GPT-5 représente la convergence de ces directions : un routeur automatique distribue les requêtes entre mode rapide et mode thinking selon la demande.
- Les modèles de raisonnement (o1, o3) investissent du calcul supplémentaire à l’inférence — ce n’est pas du prompting, c’est intégré à l’entraînement.
- L’architecture exacte, la taille réelle et les données d’entraînement restent opaques depuis GPT-4 : les benchmarks constituent la principale fenêtre d’observation externe.