TL;DR
- V4 Pro : 1,6T de paramètres totaux, 49B actifs (MoE) — 0,43 $/M en entrée, 1,74 $/M en sortie — raisonnement renforcé
- V4 Flash : 284B de paramètres totaux, 13B actifs (MoE) — 0,09 $/M en entrée, 0,36 $/M en sortie — 4,8× moins cher
- Fenêtre de contexte de 1M de tokens sur les deux variantes
- Flash conserve environ 80 à 85 % de la qualité de Pro pour 21 % du coût
- Verdict : Utilisez Flash pour les tâches à fort volume, sensibles à la latence et simples. Utilisez Pro pour le raisonnement complexe, le codage et les workflows agentiques
- Les deux sont open-weight (licence MIT), publiés le 24 avril 2026
Les Deux Variantes, Côte à Côte
DeepSeek a bouleversé le marché des modèles open-source le 24 avril 2026 en publiant non pas une, mais deux variantes simultanément — une stratégie qui a forcé tous les autres laboratoires à répondre à la même question : avez-vous besoin de la version Pro complète, ou Flash suffira-t-il ?
| Spécification | V4 Pro | V4 Flash |
|---|---|---|
| Paramètres totaux | 1,6T | 284B |
| Paramètres actifs | 49B (3,1 %) | 13B (4,6 %) |
| Architecture | MoE (256 experts, 8 actifs) | MoE (64 experts, 8 actifs) |
| Fenêtre de contexte | 1M tokens | 1M tokens |
| Tarification entrée | 0,43 $ / M tokens | 0,09 $ / M tokens |
| Tarification sortie | 1,74 $ / M tokens | 0,36 $ / M tokens |
| Entrée en cache | 0,08 $ / M tokens | 0,02 $ / M tokens |
| Licence | MIT | MIT |
| Date de publication | 24 avril 2026 | 24 avril 2026 |
(Source : DeepSeek officiel, Comparaison BenchLM)
Résultats des Benchmarks sur 22 Catégories
Les données de benchmarks indépendants provenant de plusieurs évaluateurs racontent une histoire cohérente. Voici les résultats clés par grandes catégories :
1. Connaissances Générales et Raisonnement
| Benchmark | V4 Pro | V4 Flash | Δ |
|---|---|---|---|
| MMLU-Pro | 85,3 % | 82,1 % | -3,2 |
| GPQA Diamond | 71,8 % | 66,4 % | -5,4 |
| BBH (BigBench) | 91,2 % | 87,6 % | -3,6 |
| ARC-Challenge | 96,1 % | 94,8 % | -1,3 |
2. Codage
| Benchmark | V4 Pro | V4 Flash | Δ |
|---|---|---|---|
| HumanEval | 92,7 % | 89,4 % | -3,3 |
| MBPP | 88,5 % | 85,1 % | -3,4 |
| SWE-Bench Verified | 62,3 % | 52,1 % | -10,2 |
| LiveCodeBench | 67,8 % | 56,4 % | -11,4 |
3. Mathématiques
| Benchmark | V4 Pro | V4 Flash | Δ |
|---|---|---|---|
| MATH-500 | 96,2 % | 92,8 % | -3,4 |
| AIME 2024 | 76,8 % | 63,5 % | -13,3 |
| GSM8K | 96,8 % | 95,1 % | -1,7 |
4. Agentique et Utilisation d’Outils
| Benchmark | V4 Pro | V4 Flash | Δ |
|---|---|---|---|
| BFCL (Utilisation d’outils) | 85,2 % | 78,9 % | -6,3 |
| AgentBench | 72,4 % | 62,3 % | -10,1 |
| Terminal-Bench | 76,2 % | 64,8 % | -11,4 |
(Sources : BenchLM, DeepSeek V4 DataCamp, 1min.AI)
Le Schéma : Flash Perd du Terrain sur le Raisonnement Multi-Étapes
Les données révèlent un schéma clair. Sur les benchmarks de forme courte (MMLU-Pro, HumanEval, GSM8K), Flash accuse un retard de 1 à 3 points de pourcentage par rapport à Pro — à peine perceptible en pratique. Sur les tâches de raisonnement multi-étapes nécessitant des chaînes plus profondes (AIME, SWE-Bench, AgentBench, Terminal-Bench), l’écart se creuse jusqu’à 10-13 points.
Cela a du sens intuitivement compte tenu de l’architecture. Flash dispose de 13B paramètres actifs contre 49B pour Pro. Pour une prédiction d’un seul token sur une question simple, cette différence est gérable. Mais à mesure que la chaîne de raisonnement s’allonge et que le modèle doit maintenir un état à travers plusieurs appels d’outils ou dérivations mathématiques, le nombre plus faible de paramètres actifs devient un goulot d’étranglement.
Pro dispose également de 256 experts au total (contre 64 pour Flash), ce qui lui offre un réservoir plus large de connaissances spécialisées pour des tâches diverses. Seuls 8 sont actifs par token dans les deux variantes, mais le pool d’experts de Pro est 4× plus profond, ce qui signifie que les chances d’avoir un expert spécialisé pour une sous-tâche donnée sont plus élevées.
Tarification en Pratique
La différence de tarification brute est spectaculaire :
- Flash : 0,09 $/M en entrée → 1M tokens d’entrée = 0,09 $
- Pro : 0,43 $/M en entrée → 1M tokens d’entrée = 0,43 $
Mais le coût effectif par tâche accomplie dépend de ce que vous faites :
| Cas d’utilisation | Coût Flash/tâche | Coût Pro/tâche | Meilleur choix |
|---|---|---|---|
| Classification simple Q&A | 0,001 $ | 0,004 $ | Flash |
| Complétion de code (courte) | 0,005 $ | 0,02 $ | Flash |
| Revue de code (PR complexe) | 0,04 $ | 0,15 $ | Flash (si qualité acceptable) |
| Tâche SWE-Bench | 0,50 $ | 2,00 $ | Pro (taux de réussite 10 %+ meilleur) |
| Problème de compétition mathématique | 0,03 $ | 0,12 $ | Pro (13 % meilleur sur AIME) |
| Workflow agentique (20+ étapes) | 0,30 $ | 1,00 $ | Pro (la fiabilité prime) |
(Coûts estimés par tâche basés sur la consommation typique de tokens)
Quand Utiliser Quoi
La décision n’est pas binaire. De nombreuses configurations de production utilisent les deux : Flash pour le chemin rapide, Pro pour les cas difficiles :
Utilisez DeepSeek V4 Flash quand :
- Volume élevé : Chatbots orientés clients, classification, tâches de type embedding
- Sensible à la latence : Flash est plus rapide (13B actifs contre 49B) et moins cher par appel
- Raisonnement simple : Q&A factuelle, résumé, traduction, extraction de données
- Startups à budget limité : À 0,09 $/M en entrée, Flash est compétitif avec la tarification de GPT-4o mini
Utilisez DeepSeek V4 Pro quand :
- Codage complexe : Refactorisation multi-fichiers, génération de tests, revue de code
- Mathématiques et sciences : Problèmes de niveau compétition, démonstration de théorèmes, dérivations multi-étapes
- Workflows agentiques : Agents utilisant des outils nécessitant un raisonnement multi-étapes fiable
- Tout ce qui implique de longues chaînes : L’écart de 10-13 % sur les tâches multi-étapes est réel
- Agents de production : Quand un seul échec coûte plus cher que les économies sur les appels API
Comment Ils Se Comparent à la Concurrence
| Modèle | Coût entrée / M | Coût sortie / M | SWE-Bench Verified | MMLU-Pro |
|---|---|---|---|---|
| DeepSeek V4 Flash | 0,09 $ | 0,36 $ | 52,1 % | 82,1 % |
| DeepSeek V4 Pro | 0,43 $ | 1,74 $ | 62,3 % | 85,3 % |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ | 69,2 % | 87,5 % |
| GPT-5.5 | 5,00 $ | 30,00 $ | ~65 % | 86,0 % |
| Grok 4.5 | 2,00 $ | 6,00 $ | 61,4 % | 83,0 % |
Flash est dans une catégorie à part en termes de prix. Le concurrent le plus proche dans sa fourchette de coût — GPT-4o mini à 0,15 $/M en entrée — obtient environ 15 points de moins sur MMLU-Pro et ne dispose pas de la fenêtre de contexte de 1M. Pro concurrence dans la même catégorie que Grok 4.5 en termes de prix, mais est en retrait sur les benchmarks haut de gamme.
FAQ
Quel est le meilleur pour le codage ? — Pro, surtout pour les tâches complexes multi-fichiers. L’écart de 10 % sur SWE-Bench Verified est significatif. Pour la complétion de code simple, Flash convient.
Puis-je utiliser Flash pour des workflows agentiques ? — Oui, mais attendez-vous à des taux d’achèvement de tâches environ 10 % inférieurs sur les workflows multi-étapes. Pour les agents de production gérant des tâches critiques, payez pour Pro.
Les deux sont-ils open-source ? — Oui, licence MIT. Les poids complets sont disponibles sur Hugging Face.
Existe-t-il un mode de raisonnement ? — Oui, les deux prennent en charge l’approche think-in-prompt de DeepSeek, mais le nombre plus élevé de paramètres actifs de Pro lui donne des résultats nettement meilleurs sur les tâches lourdes en raisonnement.
Quelle est la fenêtre de contexte ? — Les deux prennent en charge 1M tokens. C’est un différenciateur clé par rapport à GPT-5.5 (128K) et Claude Opus 4.8 (200K).