En bref
DeepSeek est un laboratoire d’intelligence artificielle fondé en juillet 2023 à Hangzhou (Chine), entièrement financé par High-Flyer, un fonds spéculatif quantitatif. Contrairement à la plupart des laboratoires de premier plan, DeepSeek n’a pas de modèle économique API ou cloud : sa mission est la recherche, et tous ses grands modèles sont publiés en open weights — les poids téléchargeables librement, sous licence MIT depuis janvier 2025.
En décembre 2024, DeepSeek publie V3, un modèle de 671 milliards de paramètres avec une architecture innovante. En janvier 2025, R1 devient le premier grand modèle de raisonnement open weights aux performances comparables aux meilleurs modèles propriétaires sur plusieurs benchmarks. Ces deux publications ont eu un impact mesurable sur les marchés financiers et ont relancé le débat sur le coût réel du développement de l’IA de frontière.
Fiche d’identité
| Champ | Valeur |
|---|---|
| Fondation | 17 juillet 2023, Hangzhou (Zhejiang, Chine) |
| Fondateur et PDG | Liang Wenfeng |
| Actionnaire majoritaire | High-Flyer (fonds quant, ~84 % via holdings) |
| Siège | Hangzhou |
| Modèles phares | DeepSeek-V3, DeepSeek-R1 |
| Accès | Open weights (MIT depuis janvier 2025) |
| Revenus modèle | Marginaux — pas le moteur économique |
Comprendre le contexte : un labo sorti d’un fonds quant
Pour saisir ce qu’est DeepSeek, il faut comprendre High-Flyer. Fondé en février 2016 par Liang Wenfeng, High-Flyer est un fonds spéculatif qui utilise des modèles quantitatifs — des algorithmes statistiques — pour trader sur les marchés financiers. Dès 2021, conscient du potentiel de l’IA pour le trading haute fréquence, Liang commence à acheter des puces Nvidia en masse, bien avant que la course aux GPU ne devienne un sujet d’actualité.
Cette décision d’anticipation a eu des conséquences structurelles : quand DeepSeek est créé en 2023, High-Flyer dispose déjà d’un parc GPU estimé à environ 50 000 Hopper (H800 et H100), partagé entre les activités de trading et la recherche IA. DeepSeek n’a donc pas à louer de capacité de calcul — il opère sur une infrastructure propriétaire déjà amortie.
En clair : DeepSeek n’est pas un startup cherchant une valorisation. C’est un labo de recherche adossé à un fonds qui n’a pas besoin de revenus immédiats et dispose déjà de l’infrastructure GPU nécessaire.
Un positionnement distinct dans l’écosystème
Cette structure détermine le positionnement de DeepSeek dans l’écosystème :
- Mistral (France) cherche un équilibre entre publication open weights et offre API commerciale.
- Meta publie Llama pour influencer l’écosystème et attirer des ingénieurs, sous une licence conditionnelle.
- DeepSeek publie en MIT, sans API premium, sans raison économique de retenir de la valeur derrière une barrière.
La motivation est explicitement la recherche et le prestige scientifique, pas la monétisation directe. Tous les modèles majeurs (V2, V3, R1) sont accompagnés de rapports techniques publiés sur arXiv, avec données d’entraînement, choix architecturaux et ablations documentées.
Timeline : deux ans de publications structurantes
Novembre 2023 — Premières publications : DeepSeek-Coder puis DeepSeek-LLM 67B, qui surpasse LLaMA-2 70B sur les benchmarks de raisonnement, code, mathématiques et compréhension du chinois.
Janvier 2024 — DeepSeek-MoE : premier modèle de recherche explorant l’architecture sparse avec experts partagés, avec seulement 40 % du calcul d’un modèle dense équivalent.
Avril 2024 — DeepSeek-Math : un modèle 7B atteignant 51,7 % sur le benchmark MATH (niveau compétition), sans outillage externe.
Mai–juin 2024 — DeepSeek-V2 : premier grand modèle MoE public, avec l’introduction de l’architecture MLA. Suivi de Coder-V2, aux performances comparables à GPT-4 Turbo en code.
Décembre 2024 — DeepSeek-V3 : 671B paramètres totaux, rapport technique arXiv (2412.19437). Soumis le 27 décembre, il introduit plusieurs innovations architecturales et affiche un coût marginal d’entraînement déclaré de 5,576 M$.
20 janvier 2025 — DeepSeek-R1 : modèle de raisonnement 671B, licence MIT, avec six variantes distillées de 1,5B à 70B. Impact marché immédiat.
Mars 2025 — V3-0324 : update post-entraînement intégrant les techniques RL de R1 sur la base V3.
Avril 2025 — Prover-V2-671B : modèle open source spécialisé en preuve formelle (Lean 4).
Août–décembre 2025 — Série de mises à jour : V3.1, V3.2-Exp, V3.2, et V3.2-Speciale. Cette dernière variante atteint selon DeepSeek le niveau médaille d’or aux IMO, CMO, ICPC World Finals et IOI 2025 — chiffre issu de la documentation officielle, non vérifié indépendamment.
Début 2026 — Discussion d’une levée de fonds de 300 M$ à une valorisation estimée à 10 milliards de dollars. En février 2026, Anthropic allègue que DeepSeek a utilisé des milliers de comptes frauduleux pour extraire des données de Claude à des fins d’entraînement — [NON VÉRIFIÉ], une seule source (partie impliquée), non confirmée de façon indépendante.
24 avril 2026 — DeepSeek-V4 en aperçu, publié et ouvert en open weights. La famille compte deux modèles, tous deux à un million de tokens de contexte : V4-Pro (1 600 milliards de paramètres au total, 49 milliards actifs) et V4-Flash (284 milliards au total, 13 milliards actifs). Deux nouveautés architecturales sont annoncées — une attention hybride combinant Compressed Sparse Attention et Heavily Compressed Attention, et trois niveaux d’effort de raisonnement (low / high / max) exposés à l’appelant.
31 juillet 2026 — V4-Flash-0731, point de contrôle de production orienté agents.
13 août 2026 — V4-Pro en disponibilité générale sur l’application, le web et l’API.
En clair : le ratio qui définit DeepSeek n’a pas bougé entre V3 et V4 — c’est toujours un modèle énorme dont on n’allume qu’une petite fraction à chaque token. V3 activait 37 des 671 milliards de paramètres, soit 5,5 %. V4-Pro en active 49 sur 1 600, soit 3,1 %. Le modèle a plus que doublé de taille, et le coût par token a baissé.
Architecture : ce que V3 et R1 ont changé
DeepSeek-V3 : trois innovations architecturales combinées
V3 est un modèle Mixture of Experts (MoE) : sur 671 milliards de paramètres au total, seuls 37 milliards sont activés pour chaque token traité. Cela signifie qu’à chaque opération, le modèle mobilise environ 5 % de sa capacité totale — une efficacité computationnelle qui distingue les MoE des modèles denses.
Vocabulaire
- MoE (Mixture of Experts) : architecture où plusieurs réseaux spécialisés (“experts”) coexistent. Pour chaque token, un mécanisme de routage sélectionne les experts les plus pertinents, les seuls à effectuer des calculs.
- Paramètres actifs : sous-ensemble de paramètres effectivement sollicités lors d’une inférence. Dans un modèle dense, tous les paramètres sont actifs à chaque token.
- KV cache : espace mémoire GPU stockant les résultats intermédiaires de l’attention pour éviter de les recalculer à chaque token généré.
Le rapport technique (arXiv:2412.19437) documente trois innovations architecturales :
MLA (Multi-head Latent Attention) — L’attention standard maintient un cache mémoire (KV cache) qui croît linéairement avec la longueur du contexte. MLA compresse ce cache via une projection latente de faible dimension, réduisant substantiellement la mémoire d’inférence sans perte de qualité mesurable.
DeepSeekMoE — Une architecture MoE raffinée avec deux catégories d’experts : des experts “fins” (fine-grained, plus nombreux et plus spécialisés) et des experts “partagés” (shared experts, actifs pour tous les tokens). Cette organisation permet un équilibrage des charges sans recourir à une fonction de perte auxiliaire — une simplification technique par rapport à la plupart des MoE existants.
FP8 mixed precision — L’entraînement en précision 8 bits (au lieu du standard 16 bits) réduit les besoins mémoire et accélère les calculs. Le rapport présente cette implémentation comme la première à grande échelle sans dégradation mesurable — claim documenté dans le papier, non vérifié indépendamment.
En clair : V3 combine trois optimisations simultanées — moins de mémoire pour l’attention (MLA), moins de calcul par token (MoE), moins de mémoire pour l’entraînement (FP8). L’effet combiné explique les performances par unité de coût déclarées.
V3 est entraîné sur 14,8 mille milliards de tokens. Le post-entraînement inclut SFT (Supervised Fine-Tuning) et RL (Reinforcement Learning). Le rapport indique qu’aucun rollback ni spike de perte n’a été observé pendant l’entraînement — déclaration non vérifiable de façon indépendante.
DeepSeek-R1 : faire émerger le raisonnement par renforcement
R1 repose sur la même base que V3 (671B) mais avec un objectif différent : produire un modèle capable de raisonnement en chaîne — développer explicitement des étapes intermédiaires avant de donner une réponse.
En clair : R1 est entraîné à “penser à voix haute” avant de répondre, comme un élève qui montre son travail. Cette stratégie améliore les performances sur les problèmes complexes qui nécessitent plusieurs étapes de raisonnement.
Deux variantes documentent le processus d’entraînement (arXiv:2501.12948) :
R1-Zero — Entraîné uniquement par RL (sans données supervisées préalables), en utilisant GRPO (Group Relative Policy Optimization). Le modèle apprend à raisonner par essai-erreur, sans avoir été guidé par des exemples humains. Le rapport montre que des comportements de raisonnement — comme la relecture et la correction d’erreurs — émergent spontanément du seul processus de renforcement.
R1 — Pipeline complet : données de démarrage à froid (cold start), plusieurs étapes de RL, puis une phase finale de SFT supervisé. Cette variante est celle publiée sous licence MIT.
Vocabulaire
- GRPO (Group Relative Policy Optimization) : variante de l’algorithme PPO utilisée pour l’alignement par renforcement. Au lieu de comparer une réponse à une baseline absolue, GRPO compare les réponses d’un même batch entre elles, réduisant la variance de l’estimation de l’avantage.
- Cold start data : petit ensemble de données supervisées de haute qualité utilisé pour initialiser le RL — évite que le modèle parte de comportements trop aléatoires.
Les modèles distillés : raisonnement dans de petits formats
Simultanément à R1, DeepSeek publie six modèles distillés — des modèles plus petits entraînés à imiter le comportement de R1 :
| Modèle distillé | Base | AIME 2024 | MATH-500 |
|---|---|---|---|
| R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | 28,9 % | 83,9 % |
| R1-Distill-Qwen-7B | Qwen2.5-Math-7B | 55,5 % | 92,8 % |
| R1-Distill-Llama-8B | Llama-3.1-8B | 50,4 % | 89,1 % |
| R1-Distill-Qwen-14B | Qwen2.5-14B | 69,7 % | 93,9 % |
| R1-Distill-Qwen-32B | Qwen2.5-32B | 72,6 % | 94,3 % |
| R1-Distill-Llama-70B | Llama-3.3-70B | 70,0 % | 94,5 % |
Scores auto-rapportés par DeepSeek. Les modèles distillés sont eux-mêmes open weights.
Le R1-Distill-Qwen-32B marque 72,6 % sur AIME 2024, contre 63,6 % pour o1-mini selon les benchmarks publiés par DeepSeek — chiffres répliqués par plusieurs sources reprenant le papier, mais non triangulés de façon indépendante.
En clair : la distillation permet de transférer les capacités de raisonnement d’un modèle géant (671B) vers des modèles accessibles sur GPU grand public. Le résultat est un ensemble de modèles de taille modérée aux performances de raisonnement inattendues pour leur taille.
L’initiative open-r1 de Hugging Face a partiellement reproduit les scores des modèles distillés sur MATH-500 (±1 à 3 écarts-types selon les tailles), sans reproduire la chaîne d’entraînement complète de R1 de bout en bout.
Benchmarks et comparaisons
Les benchmarks publiés par DeepSeek pour R1 complet :
- AIME 2024 : R1 = 79,8 %, OpenAI o1-1217 = 79,2 % (source : TechCrunch, DataCamp — reprenant le papier DeepSeek).
- MATH-500 : R1 = 97,3 %, OpenAI o1-1217 = 96,4 % (même sourçage).
- SWE-bench Verified : scores comparables à o1 selon le rapport.
Caveat important : tous ces benchmarks sont auto-rapportés. Le Wall Street Journal a signalé que sur 15 problèmes AIME 2024, o1 résoudrait les mêmes problèmes plus rapidement que R1, nuançant les claims de supériorité absolue. Ces données sont issues d’une seule source secondaire (WSJ, cité par Wikipedia) et n’ont pas été reproduites de façon systématique.
La controverse du coût d’entraînement
Le chiffre et sa signification exacte
Le rapport V3 déclare 2,788 millions de H800 GPU-heures pour l’entraînement, soit un coût marginal de 5,576 millions de dollars au prix de location des H800. Ce chiffre est le coût du run final d’entraînement, tel que défini dans le rapport lui-même.
En clair : 5,576 M$ est le coût de fabriquer la dernière version du modèle, une fois que tout le travail préalable (recherche, ablations, architecture) est terminé. Ce n’est pas le coût de développer la capacité de frontier.
Ce que ce chiffre exclut
Le rapport lui-même précise les exclusions : recherche architecturale préalable, ablations, expériences préliminaires, infrastructure, personnel. Les analyses indépendantes situent le vrai coût total à un niveau très différent :
- SemiAnalysis estime les dépenses d’infrastructure serveur de DeepSeek/High-Flyer à environ 1,6 milliard de dollars en CapEx, avec un opex annuel d’environ 944 millions de dollars.
- Le parc GPU estimé par SemiAnalysis : ~50 000 GPU Hopper (H100 + H800 + H20) partagés entre High-Flyer et DeepSeek.
- Martin Vechev (INSAIT, Sofia) a déclaré : “le chiffre 6M est trompeur — il ne représente pas le coût de développement d’une capacité de frontier”. D’autres analyses (Gregory Bufithis, Techstrong.ai) situent le coût total entre 1,3 et 1,6 milliard de dollars.
Dépendance circulaire des sources
Le claim “5,576 M$” est répliqué (au moins deux sources officielles : le rapport et l’arXiv), mais la plupart des sources reprenant ce chiffre citent uniquement le rapport technique DeepSeek. Il n’existe pas de vérification indépendante du coût déclaré — toutes les reprises presse pointent vers la même source primaire.
En clair : le chiffre de 5,576 M$ est factuel dans son périmètre étroit (run final), mais son utilisation comme mesure du coût de développement de V3 est incorrecte. Le débat est réel et documenté — les deux camps sont sourcés.
Open weights et contraintes hardware
La licence MIT et ses implications
Depuis janvier 2025, les modèles DeepSeek (V3, R1 et suivants) sont publiés sous licence MIT — la licence open source la plus permissive. À la différence de Llama (licence Meta avec clause des 700 millions d’utilisateurs) ou de Mistral (double stratégie open/propriétaire), les poids DeepSeek peuvent être intégrés dans des produits commerciaux sans restriction ni déclaration.
La distinction open weights / open source s’applique néanmoins : les données d’entraînement ne sont pas publiées, le code d’entraînement complet n’est pas disponible. La transparence est technique (rapports arXiv détaillés, poids téléchargeables) mais pas totale.
Les export controls comme contrainte technique
DeepSeek entraîne ses modèles sur des H800 — une version de la puce H100 de Nvidia spécifiquement conçue pour l’export en Chine, avec une bande passante NVLink réduite de moitié par rapport au H100. Les restrictions d’exportation américaines de 2022 ont interdit l’envoi de H100 et A100 en Chine.
Cette contrainte hardware a deux effets documentés. D’abord, elle a poussé DeepSeek à optimiser ses algorithmes pour compenser le handicap : la combinaison MLA + MoE + FP8 peut être interprétée comme une réponse ingénierie à des contraintes computationnelles réelles. Ensuite, le fait d’obtenir des résultats comparables avec des puces moins puissantes est techniquement remarquable, indépendamment de tout angle géopolitique.
Impact sur l’écosystème
L’événement du 27 janvier 2025
La publication de R1 le 20 janvier 2025 a provoqué une réaction de marché mesurable. Le 27 janvier 2025, le titre Nvidia a chuté de 16,9 % en une seule journée, effaçant 589 milliards de dollars de capitalisation boursière — la plus grande perte journalière de l’histoire des marchés financiers selon les données disponibles. Les hyperscalers (Microsoft, Google, Amazon, Meta) ont été interrogés sur la pertinence de leurs plans d’investissement en GPU, estimés à 527 milliards de dollars pour 2025-2026.
En pratique, aucun hyperscaler n’a réduit ses dépenses : les plans d’investissement 2025-2026 ont été maintenus voire accélérés. La logique est que si des modèles de qualité frontier sont moins chers à produire, la demande d’inférence — et donc de GPU — augmente proportionnellement.
L’effet de redistribution dans la communauté
Les licences MIT et la publication des poids ont eu deux effets concrets dans l’écosystème :
Adoption directe : R1 et ses distillés sont intégrés dans des produits tiers dès leur publication — applications de productivité, outils de code, interfaces locales. La disponibilité immédiate des poids sans délai d’accès API explique la vitesse d’adoption.
Reproduction communautaire : l’initiative open-r1 de Hugging Face a entrepris de reproduire les étapes d’entraînement de R1, en utilisant des datasets publics comme Numina-Math. Cette reproduction partielle — les scores des distillés sur MATH-500 ont été confirmés à ±1-3 écarts-types — constitue la validation externe la plus solide disponible à ce jour. La reproduction complète du pipeline R1 de bout en bout n’a pas encore été publiée.
Limites et zones d’ombre
Reproductibilité des benchmarks : les scores de R1 et V3 sont auto-rapportés. La validation indépendante systématique n’existe pas pour le modèle complet. Open-r1 couvre partiellement les distillés.
Opacité sur les données d’entraînement : comme pour Llama et Mistral, les corpus d’entraînement exacts ne sont pas publiés. Ce que DeepSeek appelle “données de qualité filtrées” reste non vérifiable.
Frontière DeepSeek / High-Flyer : la part des 50 000 GPU réellement allouée à DeepSeek versus au trading quantitatif de High-Flyer n’est pas divulguée. L’estimation des coûts est donc indirecte.
Allégation data scraping Claude [NON VÉRIFIÉ] : en février 2026, Anthropic a déclaré que DeepSeek avait utilisé des milliers de comptes frauduleux pour extraire des données de Claude. Ce claim n’est pas confirmé par une source indépendante — il émane de la partie adverse et doit être traité avec les précautions correspondantes.
Trajectoire 2026 incertaine : Reuters et des blogs techniques mentionnent une éventuelle V4 mi-2026, mais ces informations restent spéculatives à la date de publication.
Quand utiliser les modèles DeepSeek
| Contexte | Modèle | Pourquoi |
|---|---|---|
| Raisonnement mathématique, logique, code complexe | R1 complet ou distillé ≥ 32B | Performances de raisonnement compétitives avec o1 sur benchmarks publiés |
| Déploiement local sur GPU grand public | R1-Distill-Qwen-32B ou Llama-70B distillé | Rapport taille/performance favorable, licence MIT sans restriction |
| Production généraliste, multilingue, context long | V3 ou V3-0324 | Architecture MoE efficiente, forte capacité de contexte, 14,8T tokens d’entraînement |
| Preuve formelle, mathématiques de compétition | Prover-V2-671B | Spécialisé Lean 4, performances IMO/CMO déclarées (non vérifiées indépendamment) |
| Comparaison avec d’autres labs open weights | Voir aussi Llama 4, Mistral | Benchmarks hétérogènes — comparer sur la tâche cible, pas sur AIME seul |
Règles heuristiques
- Distillé vs base : si les ressources sont limitées, un distillé R1 de 32B offre un meilleur rapport performance/coût qu’un modèle généraliste de même taille non distillé pour les tâches de raisonnement.
- Vérifier le benchmark avant de conclure : AIME et MATH-500 mesurent le raisonnement mathématique, pas les capacités généralistes. Un score élevé sur ces métriques ne préjuge pas des performances sur du code de production ou de la compréhension de documents.
- Licence MIT ≠ open source complet : les poids sont libres, les données d’entraînement restent opaques.
- Coût d’entraînement déclaré ≠ coût de développement : utiliser les chiffres du rapport V3 comme mesure de l’investissement total est incorrect — voir la section Controverse.
Ce qu’il faut retenir
DeepSeek est un laboratoire atypique dans l’écosystème de l’IA : financé par un fonds quantitatif, sans pression de revenus immédiats, publiant systématiquement en open weights avec des rapports techniques détaillés. Cette configuration lui a permis de produire V3 et R1 en moins de deux ans d’existence, avec des innovations architecturales documentées (MLA, DeepSeekMoE, GRPO) et un impact mesurable sur les marchés et l’écosystème open weights.
Les limitations structurelles restent importantes : benchmarks auto-rapportés, données d’entraînement opaques, controverse sur le coût déclaré. Le chiffre de 5,576 M$ — largement relayé — est factuel dans son périmètre étroit (run final d’entraînement) mais ne représente pas le coût de développement de la capacité frontier. L’estimation réelle du coût total, selon les analystes indépendants, se situe dans un registre différent.
Ce que DeepSeek a apporté de plus solide à l’écosystème : la démonstration que des architectures MoE optimisées permettent d’atteindre des performances de premier plan avec moins de calcul actif, et que la distillation de raisonnement vers de petits modèles est plus efficace qu’on ne le pensait.