DeepSeek publie V4 Pro (1,6 T) et V4 Flash (284 Md) en open-source avec contexte d'un million de tokens, performances GPT-5.4 à prix cassé.
TL;DR — En résumé
DeepSeek publie le 24 avril 2026 V4 Pro et V4 Flash, deux modèles MoE open-source avec contexte 1 M de tokens, au niveau de GPT-5.4 et Claude Opus 4.6.
En bref
- DeepSeek a publié ce 24 avril les preview V4 Pro et V4 Flash, deux modèles Mixture-of-Experts ouverts avec fenêtre de contexte d'un million de tokens.
- V4 Pro embarque 1,6 T de paramètres (49 Md actifs), V4 Flash 284 Md (13 Md actifs), tous deux disponibles immédiatement sur Hugging Face et via l'API DeepSeek.
- Les benchmarks publiés placent V4 Pro au niveau de GPT-5.4 et Claude Opus 4.6 en raisonnement et coding, pour une fraction du prix — une nouvelle salve dans la guerre des modèles ouverts.
Ce qui s'est passé
Points clés à retenir
- Ce qui s'est passé
- Pourquoi c'est important
- Ce qu'il faut retenir
Le laboratoire chinois DeepSeek a levé le voile ce 24 avril 2026 sur les preview de ses deux modèles phares, DeepSeek V4 Pro et V4 Flash, présentés comme la plateforme open-source la plus puissante disponible à ce jour. Les deux déclinaisons partagent une fenêtre de contexte d'un million de tokens et une sortie maximale de 384 000 tokens, de quoi ingérer une base de code complète, un corpus documentaire entier ou des milliers de journaux d'événements en une seule requête. Pour les équipes sécurité, cette annonce change la donne : analyse de code à grande échelle, revue de configurations, corrélation d'incidents et automatisation du triage deviennent envisageables sans dépendre d'une API propriétaire américaine. Reste à mesurer les implications en matière de souveraineté des données, de conformité réglementaire et de risques liés à un déploiement auto-hébergé.
V4 Pro pèse 1,6 téraparamètre en architecture MoE, avec 49 milliards de paramètres activés par token. V4 Flash tourne à 284 milliards de paramètres dont 13 milliards actifs, positionné comme l'option économique à latence basse. Les deux supportent les modes thinking et non-thinking, la sortie JSON, le tool calling et le chat prefix completion en bêta. Côté benchmarks publiés par DeepSeek, V4 Pro dépasse Claude Sonnet 4.5 sur les tâches agentiques et rivalise avec les modèles propriétaires sur SWE-Bench et Aider.
L'innovation centrale tient dans l'architecture d'attention hybride qui combine Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). Sur un contexte d'un million de tokens, DeepSeek annonce seulement 27 % des FLOPs d'inférence par token et 10 % du cache KV par rapport à la génération V3.2, un gain d'efficience qui rend le long contexte économiquement viable en production.
Pourquoi c'est important
La sortie simultanée de deux modèles MoE à contexte 1 M sous licence ouverte rebat les cartes pour les équipes qui construisent des agents ou traitent de gros volumes documentaires. Le coût par token des modèles fermés équivalents reste plusieurs fois supérieur, et l'auto-hébergement devient crédible pour les entreprises soumises à des contraintes de souveraineté ou de conformité. Dans un marché où Anthropic verrouille des gigawatts de TPU pour tenir la cadence d'inférence, la stratégie DeepSeek — optimiser l'architecture plutôt que multiplier le silicium — confirme que le rapport qualité/prix reste un levier majeur.
Le timing n'est pas anodin. Un an après la sortie V3 qui avait secoué la Silicon Valley, DeepSeek relance la pression sur OpenAI et Anthropic pile au moment où ces derniers industrialisent leurs offres entreprise. Pour les équipes sécurité, la banalisation du contexte 1 M pose des questions concrètes : exfiltration de code par prompt unique, empoisonnement par documents injectés, traçabilité des requêtes, gouvernance des accès API. Les DSI qui évaluent des plateformes d'agents d'entreprise devront intégrer l'option open-source dans leurs grilles de comparaison.
Ce qu'il faut retenir
- V4 Pro (1,6 T / 49 B actifs) et V4 Flash (284 B / 13 B actifs) avec contexte 1 M tokens, disponibles immédiatement sous licence ouverte sur Hugging Face.
- Architecture d'attention hybride CSA + HCA qui réduit les FLOPs d'inférence de 73 % et le cache KV de 90 % sur contexte long par rapport à V3.2.
- Les équipes cloud et sécurité doivent évaluer l'option d'auto-hébergement pour les usages soumis à contraintes de souveraineté, en tenant compte des risques propres au contexte long.
Quelle différence pratique entre V4 Pro et V4 Flash ?
V4 Pro cible les tâches agentiques complexes, le raisonnement long et le code à forte exigence ; V4 Flash vise les workloads à volume, la latence basse et les agents à coût contrôlé. Les deux partagent le contexte 1 M et l'API, le choix se joue sur le ratio qualité/prix selon la charge.
Cette accélération s'inscrit dans une trajectoire entamée en janvier 2025, lorsque DeepSeek R1 avait provoqué une correction boursière de plus de 600 milliards de dollars sur les valeurs technologiques américaines en démontrant qu'un modèle de raisonnement compétitif pouvait être entraîné pour une fraction du budget d'OpenAI ou de Google. Dix-huit mois plus tard, V4 Pro et V4 Flash confirment que l'écart de performance entre modèles ouverts chinois et modèles propriétaires occidentaux continue de se resserrer, tandis que le coût d'inférence par token reste, selon les chiffres publiés par DeepSeek, cinq à dix fois inférieur à celui de GPT-5.4 ou Claude Opus 4.6 sur des charges de travail comparables. Pour les RSSI et directions IT, cette dynamique change concrètement l'équation build-or-buy : l'auto-hébergement d'un modèle à un million de tokens de contexte devient économiquement crédible pour des cas d'usage sensibles — revue de code interne, analyse de logs volumineux, traitement de documentation classifiée — sans dépendance à une API tierce.
Le sujet n'est toutefois pas neutre sous l'angle cybersécurité et conformité. L'origine chinoise de DeepSeek soulève des interrogations récurrentes de souveraineté numérique et de conformité RGPD/NIS 2 pour les organisations qui envisageraient d'utiliser l'API hébergée plutôt que les poids en self-hosting : plusieurs autorités de protection des données européennes, dont la CNIL, ont déjà rappelé en 2025 la nécessité d'évaluer les flux de données transfrontaliers avant tout déploiement en production. Le déploiement on-premise des poids ouverts contourne ce risque de transfert, mais déplace la charge de sécurisation vers l'entreprise elle-même : durcissement de l'infrastructure d'inférence, contrôle des dépendances de la chaîne d'approvisionnement logicielle et audit du code d'inférence publié sur Hugging Face restent indispensables avant toute mise en production, en particulier pour les secteurs régulés (finance, santé, OIV) déjà soumis à des exigences renforcées par la directive NIS 2.
Besoin d'un accompagnement expert ?
Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.
Prendre contact📎 Articles complémentaires
Sources et références
À propos de l'auteur
Ayi NEDJIMI
Auditeur Senior Cybersécurité & Consultant IA
Expert Judiciaire — Cour d'Appel de Paris
Habilitation Confidentiel Défense
ayi@ayinedjimi-consultants.fr
Ayi NEDJIMI est un vétéran de la cybersécurité avec plus de 25 ans d'expérience sur des missions critiques. Ancien développeur Microsoft à Redmond sur le module GINA (Windows NT4) et co-auteur de la version française du guide de sécurité Windows NT4 pour la NSA.
À la tête d'Ayi NEDJIMI Consultants, il réalise des audits Lead Auditor ISO 42001 et ISO 27001, des pentests d'infrastructures critiques, du forensics et des missions de conformité NIS2 / AI Act.
Conférencier international (Europe & US), il a formé plus de 10 000 professionnels.
Domaines d'expertise
Ressources & Outils de l'auteur
Articles connexes
Pentagone : prêt de 5 milliards à la startup IA Fluidstack
Le Pentagone négocie un prêt de 5 milliards de dollars avec la startup cloud IA Fluidstack pour sécuriser la chaîne d'approvisionnement américaine en composants de datacenters. Ce serait le plus grand engagement de l'Office of Strategic Capital du DoD.
DOJ : Xinbi Guarantee démantelé, 52 M$ de crypto saisis
Le DOJ américain a démantelé Xinbi Guarantee, une marketplace criminelle sur Telegram ayant traité plus de 24 milliards de dollars. 52,8 millions en crypto ont été gelés et 13 complexes d'arnaque visés en Asie du Sud-Est et à Madagascar.
GitLab CVE-2026-85706 : faille CVSS 10 exploitée activement
Une faille de traversée de chemin notée CVSS 10.0 dans GitLab permet à des attaquants non authentifiés de lire des fichiers arbitraires sur le serveur. Des sondes actives ont été confirmées dès le 11 septembre 2026, moins de 24 heures après la publication du correctif.
Un projet cybersécurité ? Parlons-en.
Pentest, conformité NIS 2, ISO 27001, audit IA, RSSI externalisé… nos experts répondent sous 24h pour évaluer votre besoin et vous proposer un accompagnement sur mesure.
Commentaires
Aucun commentaire pour le moment. Soyez le premier à commenter !
Laisser un commentaire