En bref

Cohere est une entreprise canadienne fondée en 2019 à Toronto qui développe des grands modèles de langage destinés exclusivement aux entreprises. Contrairement à OpenAI ou Anthropic, elle ne propose aucun équivalent grand public de ChatGPT : son unique client est le marché B2B, et ses modèles sont conçus pour s’intégrer dans les infrastructures privées des organisations — VPC, on-premises, cloud souverain.

L’un de ses cofondateurs, Aidan Gomez, a contribué à l’adolescence à l’article fondateur de l’architecture Transformer. Cette origine technique se retrouve dans la stratégie produit : Cohere mise sur le RAG natif (le modèle cite ses sources automatiquement), le multilinguisme (jusqu’à 101 langues via son labo de recherche), et l’efficacité computationnelle (modèles nécessitant 2 GPU là où les concurrents en exigent 8).

En septembre 2025, Cohere est valorisée à environ 7 milliards de dollars avec des revenus annualisés de 150 millions de dollars, et prépare une introduction en bourse.


Fiche d’identité

CritèreValeur
Fondation2019, Toronto (Canada)
SiègeToronto, Ontario, Canada
Effectif~843 personnes (2025)
StatutSociété privée — IPO annoncée (horizon 2026)
FondateursAidan Gomez (CEO), Nick Frosst, Ivan Zhang
Valorisation~7 Mds USD (septembre 2025)
Revenus240 M$ annualisés (février 2026)
Total levé~1,6 Mds$ (2019–2025)

Histoire — de Google Brain à Toronto

2019 — Une fondation ancrée dans la recherche Transformer

Cohere naît en 2019 d’une idée simple : le marché enterprise a besoin de LLM souverains, sans produit concurrent, déployables dans ses propres infrastructures. Les trois fondateurs partagent un point commun — l’Université de Toronto et l’écosystème Google Brain.

Aidan Gomez (CEO) est l’un des huit co-auteurs de “Attention Is All You Need” (Vaswani et al., NeurIPS 2017), le papier fondateur de l’architecture Transformer. Il avait alors 20 ans et travaillait en stage chez Google Brain. Nick Frosst, chercheur chez Google Brain, et Ivan Zhang, lui aussi issu de cet écosystème, complètent le trio fondateur.

Toronto, pas San Francisco — ce choix n’est pas anodin. L’écosystème canadien bénéficie de l’Université de Toronto (où Geoffrey Hinton a formé une génération de chercheurs), de politiques d’immigration favorables aux talents IA, et d’un gouvernement actif dans le soutien à la souveraineté numérique nationale.

En clair : Cohere est fondée par des chercheurs issus du groupe qui a inventé l’architecture sur laquelle fonctionnent la quasi-totalité des LLM actuels. Le choix du Canada reflète une stratégie délibérée de différenciation géographique et de positionnement souverain.

2021-2024 — Montée en puissance par paliers

La Série A (40 M$, 2021) attire des noms qui valident la crédibilité technique : Geoffrey Hinton, Fei-Fei Li, Pieter Abbeel et Raquel Urtasun figurent parmi les investisseurs. La Série B (125 M$, 2022, lead Tiger Global) suit rapidement.

En juin 2022, Cohere crée Cohere For AI — une entité de recherche distincte, à but non lucratif, dirigée par Sara Hooker (ex-Google Brain). Cette séparation est structurelle : elle permet à l’entreprise commerciale de se concentrer sur les modèles enterprise payants, tandis que le labo de recherche produit des modèles open weights sur le multilinguisme (le projet Aya). En avril 2025, Cohere For AI est rebaptisée Cohere Labs.

La Série C (270 M$, juin 2023, valorisation 2,2 Mds$) est accompagnée d’un signal fort : Oracle, Salesforce et Nvidia sont co-investisseurs. Le partenariat Oracle est le plus profond — Oracle devient investisseur, distributeur prioritaire sur Oracle Cloud Infrastructure (OCI), et terrain d’expérimentation pour les modèles enterprise.

2024 — L’année Command R et la Série D

Mars 2024 marque le lancement de Command R (35B paramètres), premier modèle de la série R optimisé pour le RAG et le tool use, avec 128 000 tokens de contexte. Un mois plus tard, Command R+ (104B) positionne Cohere sur le segment haute performance.

En juillet 2024, la Série D atteint 500 M$ (valorisation confirmée à 6,8 Mds$), avec une liste d’investisseurs industriels remarquable : AMD, Nvidia, Cisco, Fujitsu, Salesforce Ventures, Export Development Canada, PSP Investments (fonds de pension des retraités du secteur public canadien). Simultanément, un partenariat stratégique avec Fujitsu est annoncé pour co-développer Takane, un LLM japonais enterprise.

En décembre 2024, le gouvernement canadien annonce un investissement de 240 M$ — signal de la dimension géopolitique de la souveraineté IA.

2025 — Agentic et préparation IPO

Mars 2025 : Command A (111B, 256K de contexte) est lancé comme modèle “agentic enterprise”, conçu pour les agents autonomes et les workflows multi-étapes. Août 2025 : Command A Reasoning, premier modèle reasoning de Cohere, avec un budget de tokens configurable pour doser profondeur vs rapidité.

Mai 2026 : Command A+, publié le 20 mai. C’est le premier modèle Mixture of Experts de la maison, multimodal et multilingue, orienté agents — et Cohere revendique qu’il tourne sur deux GPU H100. La revendication vaut d’être notée : elle n’est pas une performance de benchmark mais une contrainte de déploiement, ce qui est exactement l’argument de vente de Cohere depuis 2024. Un modèle qu’une banque peut héberger elle-même vaut plus, pour elle, qu’un modèle deux points au-dessus dans un classement mais impossible à installer derrière son pare-feu.

Sara Hooker quitte Cohere Labs en septembre 2025 après trois ans à la tête du labo research. Elle est remplacée par Marzieh Fadaee. En octobre 2025, Aidan Gomez annonce publiquement la préparation d’une IPO, avec des revenus annualisés de 150 M$ à cette date.

En février 2026, les revenus annualisés atteignent 240 M$.


Produits — une gamme structurée autour du cas d’usage enterprise

Attention aux confusions : Cohere n’a aucun lien avec Coherent (fabricant de composants optiques et semi-conducteurs) ni avec Cohesity (solutions de backup et gestion de données). Ces entreprises sont distinctes dans des secteurs différents.

Série Command R — RAG optimisé

La série Command R est la gamme principale de Cohere. Tous ces modèles partagent une conception RAG-native : ils produisent des réponses avec des citations inline qui renvoient explicitement aux chunks sources fournis en contexte. Cette fonctionnalité est intégrée au niveau du modèle, pas ajoutée par post-traitement.

Command R (mars 2024, 35B paramètres)

  • 128 000 tokens de contexte, 10 langues enterprise (EN, FR, ES, IT, DE, PT, JA, KO, AR, ZH)
  • Optimisé pour les pipelines RAG et le tool use en basse latence, haut débit
  • Disponible via API Cohere, AWS Bedrock, Azure AI Studio, Google Cloud Vertex AI

Command R+ (avril 2024, 104B paramètres)

  • Modèle phare enterprise haute performance
  • RAG avancé, tool use, raisonnement multi-étapes
  • Selon les évaluations internes de Cohere, surpasse GPT-4 Turbo et Claude 3 sur les benchmarks RAG et tool use [auto-publiés non-triangulés — aucune réplication indépendante retrouvée dans les sources consultées]
  • Mise à jour août 2024 : +50 % de throughput, −20 % de latence, empreinte GPU réduite de moitié

Command R7B (décembre 2024, 7B paramètres)

  • Plus compact de la série R, optimisé pour les déploiements haute fréquence (chatbots, assistants code)
  • Contexte 128 000 tokens, 23 langues
  • Open weights disponibles sur Hugging Face
  • Benchmarks Cohere (auto-déclaratifs) : premier sur IFeval, BBH, GPQA, MuSR, MMLU dans sa classe de taille [non répliqués indépendamment]

En clair : la série Command R est pensée pour brancher un LLM sur une base documentaire d’entreprise. Le modèle ne répond pas de mémoire — il lit les documents fournis et indique d’où vient chaque information. Cette transparence sur les sources est une valeur métier concrète pour les secteurs régulés.

Série Command A — agentic enterprise

Command A (mars 2025, 111B paramètres)

  • Conçu pour les agents autonomes enterprise : workflows multi-étapes, orchestration d’outils, longues tâches
  • 256 000 tokens de contexte, 32 000 tokens de longueur de sortie, 23 langues
  • Requiert 2 GPU A100/H100 — contre 8 pour des modèles concurrents de puissance comparable selon Cohere
  • Disponible sur Oracle OCI Generative AI, AWS Bedrock, Azure

Command A Reasoning (août 2025, 111B paramètres)

  • Premier modèle reasoning de Cohere
  • Token budget configurable : un budget faible produit une réponse rapide et économique ; un budget élevé active un raisonnement plus profond
  • Disponible sur Oracle OCI, AWS Bedrock
  • Aucun benchmark indépendant comparant Command A Reasoning à o3 (OpenAI) ou à Claude 3.7 (Anthropic) n’a été retrouvé dans les sources consultées

Command A Vision (2025)

  • Extension multimodale vision + texte de Command A
  • Disponible sur Oracle OCI Generative AI

Rerank et Embed — les briques RAG déployables on-premises

Au-delà des modèles conversationnels, Cohere propose deux composants qui s’intègrent dans les pipelines RAG existants :

Rerank 3 / Rerank v3.5

  • Modèle de reranking : après un premier retrieval large, il trie les documents candidats du plus au moins pertinent
  • Tarif : 2,00 $ pour 1 000 recherches (1 requête + jusqu’à 100 documents)
  • Déployable en VPC ou on-premises — le flux documentaire ne quitte pas l’infrastructure cliente

Embed v3 / v4.0

  • Modèle d’embeddings multilingue haute performance (encode jusqu’à 128 000 tokens par chunk en v4.0, contre 512 pour la génération précédente)
  • Tarif : 0,10 $ par million de tokens
  • Cité dans des benchmarks tiers comme MTEB parmi les embedders compétitifs, côte à côte avec OpenAI et Voyage

Vocabulaire

  • Embedding : représentation numérique d’un texte sous forme de vecteur (liste de nombres). Deux textes proches sémantiquement donnent deux vecteurs proches dans l’espace.
  • Reranking : étape d’affinage dans un pipeline RAG. Le retriever ramène 50 à 200 documents candidats ; le reranker les relit plus attentivement et ne conserve que les 5 à 10 meilleurs avant de les transmettre au modèle générateur.
  • VPC (Virtual Private Cloud) : environnement cloud cloisonné, accessible uniquement aux ressources de l’organisation. Les données ne transitent pas par l’infrastructure partagée du fournisseur.

En clair : Rerank et Embed sont les composants “silencieux” de Cohere — ils n’écrivent pas de réponses, mais ils rendent les réponses des autres modèles plus précises et mieux sourcées. Leur déploiement on-premises est l’argument décisif pour les secteurs où les données ne peuvent pas sortir du périmètre de l’organisation.

Cohere Labs et le projet Aya — multilinguisme open source

Cohere Labs (anciennement Cohere For AI, renommée en avril 2025) est une entité distincte de l’entreprise commerciale Cohere. C’est un laboratoire de recherche à but non lucratif, fondé en juin 2022 par Sara Hooker, puis dirigé par Marzieh Fadaee depuis septembre 2025.

La distinction est fondamentale : Cohere Labs produit des modèles open weights, gratuits, à vocation académique et de recherche. Cohere (l’entreprise) vend des modèles enterprise payants avec déploiement privé. Les deux entités ne sont pas interchangeables.

Aya 23 (mai 2024, 8B + 35B paramètres) — premier modèle Aya : 23 langues, open weights.

Aya Expanse (octobre 2024, 8B + 32B paramètres) — 101 langues, instruction tuning avancé, cross-lingual transfer. C’est le modèle multilingue open source le plus couvert de la famille Aya à ce jour. Selon TechCrunch, Cohere affirme qu’Aya Expanse surpasse les modèles comparables sur des benchmarks multilingues [claim rapporté par la presse, pas de validation indépendante retrouvée].

Aya Vision (mars 2025) — extension multimodale vision + texte, 23 langues, open weights.

La communauté Aya regroupe plus de 3 000 chercheurs dans 119 pays, avec un focus explicite sur les langues sous-représentées dans les LLM dominants.

En clair : quand on parle d’Aya, on parle de Cohere Labs (nonprofit, open source). Quand on parle de Command, on parle de Cohere (entreprise, API payante). Cette distinction est critique pour évaluer ce que Cohere rend réellement accessible et ce qui reste derrière un paywall enterprise.


Positionnement — trois paris stratégiques

Pari 1 — Enterprise-only, sans produit grand public concurrent

Aidan Gomez l’affirme explicitement : Cohere ne lancera pas d’équivalent grand public de ChatGPT. Ce n’est pas un manque de ressources — c’est un choix délibéré. La raison : un acteur qui vend des LLM à des entreprises et concurrence ces mêmes entreprises en leur marché final perd en crédibilité. Microsoft (OpenAI) vend Copilot aux entreprises tout en proposant des outils concurrents ; Google intègre Gemini dans Workspace. Cohere évite ce conflit.

Conséquence directe pour l’argument commercial : le LLM de Cohere n’accumule pas de données sur les usages clients pour entraîner ses propres produits. C’est une promesse de non-concurrence vérifiable.

CritèreCohereOpenAIAnthropic
Produit grand publicNonOui (ChatGPT)Oui (Claude.ai)
Déploiement on-premisesOui (natif)Non (API cloud)Non (API cloud)
Concurrence clients finauxNonPartielle (Microsoft)Non
Territoire prioritaireB2B enterpriseGrand public + B2BChercheurs + B2B

Pari 2 — Souveraineté des données et déploiement privé

Cohere est l’un des rares acteurs à permettre le déploiement de ses modèles en dehors de son infrastructure cloud. Les modèles Rerank et Embed peuvent tourner dans le VPC du client ou sur ses propres serveurs. Command R et Command A sont disponibles sur des plateformes cloud souveraines (Oracle OCI, Fujitsu Cloud), pas seulement sur les trois grands hyperscalers.

Cette architecture répond à une contrainte réelle pour les secteurs régulés : RGPD, HIPAA (santé), secret bancaire, données de défense. Un LLM dont les données ne quittent jamais l’infrastructure de l’organisation est juridiquement moins exposé qu’un LLM sur API cloud partagée.

Le gouvernement canadien a matérialisé cet argument en investissant 240 M$ dans Cohere en décembre 2024 — une reconnaissance explicite du rôle de l’entreprise dans la souveraineté IA nationale. Les partenariats avec Saab (défense suédoise), Thales Group et Hanwha Ocean (naval coréen) illustrent la portée internationale de cet argument.

En clair : Cohere ne vend pas seulement un modèle, elle vend la garantie que le modèle reste dans les murs de l’organisation. Pour un hôpital, une banque ou un gouvernement, c’est souvent la condition sine qua non de l’adoption.

Pari 3 — Multilinguisme et géographies émergentes

La plupart des LLM dominants sont fortement optimisés pour l’anglais. Command A couvre 23 langues enterprise ; Aya Expanse (via Cohere Labs) en couvre 101. Ce différenciateur vise plusieurs marchés sous-équipés en LLM natifs : Japon (partenariat Fujitsu + LLM Takane), Corée (LG CNS), marchés francophones, marchés arabophones.

La présence de gouvernements dans les tours de financement — Canada, et indirectement Japon via Fujitsu — n’est pas anecdotique : elle signale que certains États voient dans Cohere une alternative aux fournisseurs américains pour construire leur infrastructure IA nationale.


Forces

RAG intégré au niveau modèle Les citations dans Command R et Command A sont produites par le modèle lui-même, pas par un wrapper post-traitement. Le modèle attribue chaque passage de sa réponse au chunk source exact. Dans un contexte enterprise où l’auditabilité des réponses est critique (compliance, juridique, médicale), c’est une fonctionnalité différenciatrice.

Efficacité computationnelle Command A requiert 2 GPU A100/H100 pour l’inférence, selon Cohere — là où des modèles concurrents de puissance comparable en nécessitent 8. Command R7B tourne sur du hardware modeste. Cela réduit le coût total de possession (TCO) pour les organisations qui déploient on-premises.

Écosystème partenaires solide Oracle (investisseur + distribution prioritaire), Fujitsu (co-développement LLM japonais Takane), LG CNS (Corée), Saab, Thales, Dell, RBC (Banque Royale du Canada), Bell Canada, SAP. La couverture géographique — Amérique du Nord, Europe, Asie-Pacifique — est cohérente avec l’ambition globale.

Multi-cloud natif Cohere est présent simultanément sur AWS Bedrock, Azure AI Studio, Google Cloud Vertex AI, Oracle OCI et Fujitsu Cloud. Anthropic est prioritairement AWS + Google ; OpenAI est prioritairement Azure. Cohere offre aux organisations la flexibilité de ne pas s’enfermer dans un seul hyperscaler.


Limites et points d’attention

Échelle et financement vs frontier labs Cohere est valorisée à 7 Mds$ en septembre 2025, contre 380 Mds$ pour Anthropic et 730 Mds$ pour OpenAI en 2026. Cette différence d’échelle se traduit directement dans la capacité à financer les entraînements les plus coûteux et à attirer les chercheurs de pointe.

Benchmarks auto-déclaratifs — position épistémique Les claims de performance de Cohere méritent un traitement prudent :

  • Command R+ surpasse GPT-4 Turbo et Claude 3 sur RAG (avril 2024) : issu d’évaluations internes Cohere, aucune réplication indépendante publiée retrouvée dans les sources consultées [non répliqués indépendamment].
  • Command R7B premier sur IFeval, BBH, GPQA, MuSR, MMLU dans sa classe : évaluations Cohere [non répliqués indépendamment].
  • Command A Reasoning vs o3 ou Claude 3.7 : aucun benchmark indépendant retrouvé.

Ce pattern est commun à l’industrie, mais il impose de distinguer “Cohere affirme que” de “des tiers ont mesuré que”.

Visibilité publique moindre L’absence de produit grand public réduit la notoriété chez les développeurs individuels et les utilisateurs finaux. OpenAI et Anthropic construisent leur réputation aussi via des millions d’utilisateurs qui testent leurs modèles librement. Cohere ne bénéficie pas de ce canal de distribution et d’évaluation indirecte.

Rentabilité non déclarée 240 M$ de revenus annualisés (fév. 2026) pour ~1,6 Mds$ levés depuis 2019, avec ~843 employés et des coûts d’infrastructure significatifs. La rentabilité n’est pas déclarée publiquement. L’IPO annoncée suppose qu’elle sera atteinte ou proche avant la cotation.

Paradoxe de la souveraineté Cohere vend la souveraineté des données, mais ses modèles sont entraînés sur infrastructure cloud tierce (AWS, Oracle, Azure). Le déploiement on-premises concerne l’inférence (le modèle qui répond aux requêtes), pas l’entraînement (le processus qui crée le modèle). Cette nuance est rarement mise en avant dans les communications commerciales.

Positionnement RAG — risque de glissement En 2024-2026, les modèles à très long contexte (Gemini 2.0 Pro : 1 M tokens, Claude Opus 4.6 : 1 M tokens) absorbent une partie des cas d’usage adressés par le RAG. Cohere a anticipé ce risque en pivotant vers l’agentic avec Command A — mais le différenciateur “RAG natif” perd progressivement de son exclusivité.

Départ Sara Hooker Sara Hooker, directrice fondatrice de Cohere Labs, a quitté le labo en septembre 2025. Elle était une figure scientifique reconnue (Google Brain, architecture des papiers Aya). L’impact sur l’attractivité académique de Cohere Labs reste à mesurer sur les prochaines cohortes de recrutement.


Quand Cohere, quand un autre acteur ?

Le choix d’un fournisseur LLM enterprise dépend de contraintes spécifiques. Cohere répond à certaines mieux que ses concurrents, et moins bien à d’autres.

ContexteRecommandationPourquoi
Données sensibles, impossible de quitter l’infrastructureCohere (Rerank, Embed, Command A on-premises)Déploiement privé natif, pas seulement API cloud
Besoin de citations sources dans les réponsesCohere Command R/AGrounding natif au niveau modèle, pas post-traitement
Langues hors English dominantCohere Command A (23 langues) ou Aya Expanse (101 langues, open)Couverture multilingue supérieure aux concurrents enterprise
Maximiser les capacités de raisonnementOpenAI o3, Anthropic Claude 3.7Command A Reasoning sans benchmark indépendant comparatif disponible
Notoriété et adoption développeursOpenAI GPT-4/5, Anthropic ClaudeÉcosystème plus large, plus de documentation communautaire
Multilinguisme open source, rechercheAya Expanse (Cohere Labs)Open weights 101 langues, gratuit
Gouvernements et souveraineté nationaleCohereInvestissements gouvernementaux (Canada), partenariats défense (Saab, Thales)

Règles heuristiques

  • Si la donnée ne peut pas sortir de l’infrastructure, Cohere est l’un des rares acteurs enterprise à proposer une architecture on-premises réelle pour l’inférence. La solution existe aujourd’hui, sans workaround.
  • Si le use case est du RAG documentaire, la fonctionnalité de grounding native de Command R/A réduit le coût de développement du pipeline — moins de code à écrire pour gérer les citations.
  • Si le budget de raisonnement avancé est prioritaire, attendre des benchmarks indépendants sur Command A Reasoning avant de le comparer à o3 ou Claude 3.7.
  • Ne pas confondre Cohere (entreprise, modèles payants) et Cohere Labs (nonprofit, open weights Aya) — les droits d’usage, les prix et les contraintes de licences sont fondamentalement différents.

Ce qu’il faut retenir

Cohere occupe une niche stratégique claire dans l’écosystème LLM : l’entreprise qui refuse de concurrencer ses clients. Ce positionnement enterprise-only, déployable on-premises, avec grounding natif et multilinguisme étendu, répond à des contraintes réelles que les frontier labs (OpenAI, Anthropic, Google DeepMind) ne priorisent pas de la même manière.

Ses points forts sont documentés et vérifiables : l’architecture de déploiement, les partenariats industriels, la couverture linguistique. Ses claims de performance, en revanche, restent majoritairement auto-déclaratifs et méritent d’être traités avec prudence jusqu’à réplication indépendante.

La trajectoire 2024-2026 montre une entreprise qui anticipe l’évolution du marché — de RAG-first vers agentic — tout en maintenant son avantage différenciateur sur la souveraineté et le déploiement privé. L’IPO annoncée sera le premier test de marché réel pour ce positionnement.

La distinction Cohere / Cohere Labs reste une grille de lecture essentielle : l’un vend des solutions enterprise; l’autre produit de la recherche open source sur le multilinguisme. Ces deux entités ne sont pas substituables.