En bref
Gemini est la famille de modèles de langage développée par Google DeepMind. Contrairement à ses prédécesseurs (PaLM, Bard), elle a été conçue dès le départ pour être multimodale : un seul flux de traitement unifié pour le texte, les images, l’audio, la vidéo et le code, sans routage vers des modèles spécialisés distincts.
Lancée en décembre 2023, la famille s’est rapidement imposée sur les benchmarks de raisonnement et de code. Son atout distinctif reste la fenêtre de contexte : Gemini 1.5 Pro a introduit 1 million de tokens dès février 2024, un record à sa sortie. Depuis, la gamme s’est étoffée sur plusieurs générations (1.0, 1.5, 2.0, 2.5, 3.x) et couvre l’ensemble du spectre, du modèle embarqué sur smartphone aux systèmes de raisonnement avancé.
Une particularité au 6 septembre 2026 : chez Google, le numéro de version n’ordonne plus les capacités entre les tiers. Le modèle présenté comme le plus avancé de la documentation est Gemini 3.8 Flash, en version stable, tandis que le tier Pro en est à 3.1 Pro, en préversion. Un lecteur habitué à « Pro > Flash » se trompera de modèle en se fiant au nom.
En clair : pensez à Gemini comme à un traducteur polyglotte de naissance. Là où la concurrence a commencé par maîtriser une seule langue (le texte) avant d’apprendre péniblement les autres modalités (image, audio, vidéo), Gemini a été élevé dès le départ avec toutes ces modalités mélangées dans un même bain. Conséquence : il n’y a pas de couture interne entre “comprendre une image” et “comprendre un texte” — c’est le même flux de pensée, ce qui facilite les questions qui croisent les modalités (“décris ce que dit cette personne dans la vidéo et résume-le sur le diagramme à côté”).
Fiche d’identité
| Champ | Valeur |
|---|---|
| Organisation | Google DeepMind |
| Première version | Décembre 2023 (Gemini 1.0) |
| Type | Transformer multimodal natif, architecture MoE (Mixture of Experts) |
| Accès | Google AI Studio, Vertex AI, Gemini API, application Gemini |
| Fenêtre de contexte | 1 million de tokens depuis Gemini 1.5 Pro — la documentation actuelle n’en publie aucune, modèle par modèle |
| Gamme au 6 septembre 2026 | Gemini 3.8 Flash (stable) · 3.1 Pro (préversion) · 3.7 Flash · 3.5 Flash-Lite · 2.5 Flash · 2.5 Pro |
Historique
Décembre 2023 — Gemini 1.0. Google DeepMind annonce trois variantes : Ultra, Pro et Nano. Gemini Pro est intégré à Bard, Nano déployé sur le Pixel 8 Pro. Ultra reste réservé aux développeurs partenaires dans un premier temps.
Février 2024 — Gemini 1.5 Pro. Rupture architecturale majeure : introduction du Mixture of Experts (MoE) et fenêtre de contexte portée à 1 million de tokens. En mai 2024, Gemini 1.5 Flash complète la gamme lors du Google I/O, comme variante rapide et économique.
Décembre 2024 – février 2025 — Gemini 2.0. Gemini 2.0 Flash Experimental est annoncé le 11 décembre 2024, puis devient le modèle par défaut le 30 janvier 2025. Gemini 2.0 Flash-Lite est positionné comme le modèle le plus rapide et le moins coûteux de la famille, destiné aux déploiements à grande échelle.
Mars – juin 2025 — Gemini 2.5. Gemini 2.5 Pro Experimental paraît le 25 mars 2025. Il introduit le raisonnement adaptatif (thinking) avec un paramètre thinking_level (low/high) permettant de calibrer la profondeur d’analyse. Gemini 2.5 Flash suit au Google I/O de mai 2025, avant d’atteindre la disponibilité générale en juin 2025. La variante Deep Think, avec raisonnement approfondi, est documentée dans une model card publiée en août 2025.
Fin 2025 – début 2026 — Gemini 3.x. Google annonce Gemini 3 Pro et 3 Deep Think en novembre 2025, suivis de Gemini 3.1 Pro (19 février 2026). La génération 3 introduit un dynamic thinking qui s’active automatiquement selon la complexité de la requête.
Septembre 2026 — la gamme documentée. La page modèles de l’API Gemini aligne, pour le texte et l’usage général : Gemini 3.8 Flash (gemini-3.8-flash, stable), présenté comme « notre modèle Flash le plus intelligent, conçu pour l’ingénierie logicielle de longue haleine, les agents autonomes et les workflows d’entreprise complexes » ; Gemini 3.1 Pro (préversion), pour l’intelligence avancée, la résolution de problèmes complexes et le code ; puis Gemini 3.7 Flash, 3.5 Flash-Lite, 2.5 Flash et 2.5 Pro.
Autour de ce noyau, un catalogue spécialisé beaucoup plus large que chez ses deux concurrents directs : audio (3.5 Transcribe pour la transcription, 3.1 Flash TTS pour la synthèse, 3.1 Flash Live pour le dialogue temps réel), image (Nano Banana 2, Nano Banana Pro), vidéo (Veo 3.1, Gemini Omni Flash), et des briques dédiées — Gemini Embedding 2, Computer Use pour l’automatisation d’interface, Deep Research pour la recherche autonome.
C’est la différence de fond avec OpenAI et Anthropic : Google n’expose pas une échelle de modèles généralistes mais un catalogue de produits par modalité, cohérent avec le fait que Gemini est né multimodal.
En clair : la trajectoire Gemini en deux ans tient en trois sauts. Le premier (1.0 → 1.5, février 2024) introduit le contexte 1M tokens — record continental sur la durée. Le second (2.0 → 2.5, mars-juin 2025) ajoute le raisonnement adaptatif réglable par paramètre (
thinking_level). Le troisième (2.5 → 3.x, fin 2025) bascule sur du raisonnement automatique : le modèle décide lui-même s’il doit “penser” plus longtemps selon la difficulté de la requête. Chaque saut a apporté une capacité que les concurrents ont mis 6 à 12 mois à reproduire.
Capacités
Benchmarks (Gemini 2.5 Pro — sources : rapport technique Google DeepMind, model card officielle)
| Benchmark | Score | Contexte |
|---|---|---|
| AIME 2024 | 92,0 % (pass@1) | Raisonnement mathématique |
| AIME 2025 | 86,7 % | Raisonnement mathématique |
| GPQA Diamond | 84,0 % | Raisonnement scientifique avancé |
| SWE-Bench Verified | 63,8 % | Résolution de bugs (avec agent) |
| MMMU | 81,7 % | Raisonnement multimodal (texte + images + diagrammes) |
| Humanity’s Last Exam | 18,8 % | Vs o3-mini : 14 %, Claude 3.7 Sonnet : 8,9 % |
| VideoMME | 84,8 % | Compréhension vidéo |
| MRCGP médical | 95,0 % | Vs performance humaine GP : 73,0 % |
| SimpleQA (factuel) | 52,9 % | Inférieur à GPT-4.5 : 62,5 % |
Multimodalité native
L’architecture Gemini traite en un seul flux le texte, les images, l’audio, la vidéo et le code. Il ne s’agit pas d’une assemblée de modèles spécialisés couplés a posteriori : la multimodalité est intégrée à l’entraînement. Gemini 2.5 Pro peut analyser jusqu’à trois heures de contenu vidéo en une seule requête.
Fenêtre de contexte
Gemini 1.5 Pro a introduit 1 million de tokens en 2024, un seuil inédit à l’époque. Gemini 2.5 Pro maintient 1 million de tokens en entrée ; certains déploiements via Vertex AI permettent 2 millions de tokens pour les usages enterprise.
Intégration Google
Les modèles Gemini bénéficient d’un accès natif à Google Search (grounding), ce qui réduit les hallucinations sur les faits courants en ancrant les réponses dans des résultats de recherche en temps réel. Gemini Nano est déployé directement sur les appareils Pixel, sans accès réseau nécessaire.
Capacités agentiques
Gemini 2.5 Pro prend en charge nativement le tool use : appels de fonctions, génération JSON structurée, exécution de code, recherche web. Il est explicitement optimisé par Google pour les workflows agentiques complexes.
En clair : ce qui ressort de la lecture des benchmarks Gemini, c’est une force massive sur les contenus structurés et les domaines à logique formelle (mathématiques 92 % AIME, sciences 84 % GPQA, médical 95 % MRCGP), et une fragilité sur les questions factuelles brutes (52,9 % SimpleQA — soit 37 % d’erreurs par défaut). En pratique : excellent assistant pour rédiger un rapport technique, exploiter une base documentaire, ou raisonner sur un problème complexe. Méfiance sur “qui a fait quoi en quelle année” sans grounding Google Search activé.
Limites connues
Factualité : le point faible documenté
Sur SimpleQA, benchmark mesurant la précision factuelle sur des questions factuelles simples, Gemini 2.5 Pro obtient 52,9 % contre 62,5 % pour GPT-4.5. C’est l’écart le plus net en faveur d’un concurrent sur un benchmark majeur. Le taux d’erreurs factuelles mesuré sur SimpleQA atteint 37,1 % pour Gemini 2.5 Pro. Un biais de surconfiance est documenté : lorsque le modèle se trompe, il maintient une confiance élevée dans sa réponse.
Hallucinations persistantes
Gemini 3 Pro, malgré des résultats supérieurs sur certains benchmarks de fiabilité, présente des taux d’hallucination qui demeurent élevés selon The Decoder [NON VÉRIFIÉ — source unique]. Le score de 3,3 % obtenu par Gemini 2.5 Flash-Lite sur le leaderboard Vectara doit être lu avec prudence : il mesure la tâche spécifique du résumé de documents courts et ne généralise pas à d’autres domaines.
Disponibilité partielle
Gemini Ultra 1.0 n’a jamais été accessible via une API ouverte au grand public, limité à l’abonnement Google AI Ultra. Certaines fonctionnalités de Gemini 2.5 Pro (Deep Think) étaient à accès restreint lors du lancement. Au 6 septembre 2026, le tier Pro le plus récent — Gemini 3.1 Pro — est documenté en préversion, pas en version stable : un statut à vérifier avant tout engagement de production.
Contexte long : performances non garanties, et taille non publiée
La fenêtre de 1 million de tokens est disponible depuis Gemini 1.5 Pro, mais la précision de rappel se dégrade sur certaines tâches au-delà de certains seuils. Ce phénomène est documenté qualitativement, pas quantifié précisément dans les sources consultées [NON VÉRIFIÉ].
S’y ajoute une limite d’information plutôt que de capacité : la page modèles de l’API Gemini ne publie ni fenêtre de contexte, ni limite de tokens en sortie, ni date de fin de connaissance pour aucun des modèles qu’elle liste. Ces valeurs se cherchent ailleurs, page par page.
En clair : en révisant les trois profils de laboratoires le même jour, on constate que ce que chacun publie diffère franchement. Anthropic donne, dans un seul tableau, la fenêtre, le prix, la fin de connaissance et une date de retrait au plus tôt par modèle. OpenAI donne la fenêtre et le prix, mais aucune fin de connaissance. Google, sur sa page modèles, ne donne ni l’une ni l’autre. Ce n’est pas un détail de documentation : pour un architecte qui doit estimer combien de temps une intégration tiendra et ce que le modèle ignore, le même travail de cadrage demande trois efforts très différents selon le fournisseur — et le plus bavard n’est pas forcément le plus capable, c’est simplement le plus vérifiable.
Quand Gemini est le bon choix — et quand il ne l’est pas
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Analyse multimodale unifiée (vidéo + texte + diagramme dans un même prompt) | Gemini 2.5/3.x Pro | Architecture native multimodale — pas de couture entre modalités. Trois heures de vidéo en une requête. |
| Raisonnement scientifique ou mathématique avancé | Gemini Deep Think | 92 % AIME 2024, 86,7 % AIME 2025, niveau médaille d’or IMO 2025. Un des deux meilleurs systèmes du marché sur ces tâches. |
| Application factuelle critique sans accès web (FAQ, support produit) | Éviter Gemini ou exiger grounding | 37 % d’erreurs sur SimpleQA. Surconfiance documentée — risque de réponse fausse mais assurée. |
| Déploiement on-device (mobile, IoT, latence faible) | Gemini Nano | Seul flagship lab à offrir une variante embarquée — déjà sur Pixel 8 Pro. Pas d’équivalent direct chez OpenAI ou Anthropic. |
| Ingénierie logicielle de longue haleine, agents autonomes, workflow d’entreprise | Gemini 3.8 Flash | C’est la destination annoncée par Google pour ce modèle, et c’est le plus avancé de sa documentation — malgré le nom « Flash », qui chez les concurrents désigne l’entrée de gamme. |
| Génération d’image, de vidéo, transcription ou synthèse vocale | Ligne spécialisée dédiée | Nano Banana 2 et Pro pour l’image, Veo 3.1 pour la vidéo, 3.5 Transcribe et 3.1 Flash TTS pour l’audio. C’est la principale différence de catalogue avec OpenAI et Anthropic. |
| Engagement de production sur le tier Pro | Vérifier le statut d’abord | Gemini 3.1 Pro est documenté en préversion au 6 septembre 2026. |
Ce qu’il faut retenir
- Gemini figure parmi les meilleurs systèmes disponibles sur le raisonnement mathématique et scientifique, avec Gemini 2.5 Pro en tête sur plusieurs benchmarks majeurs.
- Son architecture multimodale native — un seul flux pour texte, images, audio, vidéo et code — le distingue structurellement de la concurrence.
- La fenêtre de contexte d’un million de tokens, introduite dès 2024, reste un avantage concurrentiel documenté.
- Le principal angle mort est la factualité brute : Gemini sous-performe GPT-4.5 sur SimpleQA, avec un taux d’erreurs de 37,1 %.
- L’écosystème — Google AI Studio, Vertex AI, API, application grand public, déploiement on-device via Nano — forme un continuum que peu de concurrents peuvent répliquer à cette échelle.