DeepSeek V4.1 Flash : le meilleur rapport qualité-prix du moment ?

DeepSeek a publié le 10 septembre 2026 DeepSeek V4.1 Flash, le plus petit modèle de sa nouvelle famille d'architecture. Sur le papier, la promesse est simple : faire mieux que son propre modèle phare, V4 Pro, pour une fraction du prix. DeepSeek va plus loin et affiche des scores au niveau de Claude Opus 5 sur plusieurs benchmarks de code et d'agents, pour 0,30 $ le million de tokens en entrée et 1,20 $ en sortie, la moitié en heures creuses.
Les annonces de ce genre se multiplient, et elles résistent rarement à une mesure indépendante. Cet article fait donc le tri : ce qui change techniquement, ce que valent les chiffres de DeepSeek, ce qu'en disent les évaluations tierces, et où ce modèle se place réellement face à GLM, Qwen, OpenAI, Google, Moonshot et Anthropic. Réponse courte : il ne bat pas les modèles phares, mais il s'installe dans le trio de tête du rapport qualité-prix, avec un avantage net sur la vitesse.
L'essentiel de DeepSeek V4.1 Flash en trente secondes
Poids ouverts sous licence MIT, publiés sur Hugging Face avec le rapport technique.
552 milliards de paramètres, dont seulement 8 milliards actifs pour lire le prompt et 16 milliards pour générer la réponse.
Contexte d'un million de tokens, jusqu'à 384 000 tokens en sortie, et compréhension d'image native.
40 points sur l'Artificial Analysis Intelligence Index v4.3, contre 36 pour V4 Pro et 35 pour l'ancien V4 Flash.
Environ 215 tokens par seconde en sortie mesurés par Artificial Analysis, quatre fois le débit d'Opus 5.
477 $ pour faire passer l'intégralité de l'indice, contre 1 623 $ pour Gemini 3.8 Flash et 7 275 $ pour Claude Opus 5.
Ce qui change sous le capot
Une architecture encodeur-décodeur causale
V4.1 Flash inaugure ce que DeepSeek appelle l'architecture CED, pour Causal Encoder-Decoder. Le réseau compte 40 couches : un encodeur causal de 20 couches suivi d'un décodeur de 20 couches. C'est toujours un mélange d'experts, 384 experts routés et un expert partagé par couche, dont 6 activés par token mais le coût de calcul n'est plus le même selon le sens du flux.
La lecture du prompt, la phase dite de prefill, mobilise 8 milliards de paramètres actifs. La génération, 16 milliards. Ce découpage n'a rien d'anecdotique : dans un usage agentique, un modèle lit beaucoup plus qu'il n'écrit. Chaque tour de boucle relit l'historique, les fichiers ouverts, les sorties d'outils. Rendre la lecture deux fois moins chère que l'écriture, c'est attaquer le poste de dépense principal de ces charges de travail.
Un cache KV divisé par quatre
C'est l'autre levier économique, et probablement le plus important. DeepSeek stocke le cache clé-valeur principal en FP4, avec un mécanisme de partage entre couches baptisé CSA2. Résultat annoncé : environ 890 octets par token, soit le quart de V4 Flash. Un contexte d'un million de tokens tient donc dans moins d'un gigaoctet de cache principal. L'empreinte persistante sur SSD, elle, tombe au huitième de la génération précédente.
Pour l'utilisateur de l'API, cela se traduit directement sur la facture : un token d'entrée servi depuis le cache coûte 0,006 $ le million en heures pleines, cinquante fois moins qu'un token non caché.
La vision native
La compréhension d'image n'est pas un module greffé après coup. Les représentations visuelles et textuelles sont entraînées ensemble dès le début du pré-entraînement, sur un corpus multimodal de 45 000 milliards de tokens. DeepSeek avait testé l'approche en août avec un modèle expérimental, V4 Flash Vision Exp, désormais retiré au profit de V4.1 Flash.
Un raisonnement réglable
Le modèle fonctionne en mode raisonnement, avec un effort réglable. La fiche Hugging Face décrit un réglage continu de 1 à 100 ; l'API officielle expose pour l'instant un paramètre reasoning_effort à niveaux nommés. Tous les scores publiés par DeepSeek sont obtenus à l'effort maximal, un détail qui compte au moment de comparer les coûts, on y reviendra.
Les chiffres de DeepSeek
Voici les scores publiés par DeepSeek, comparés à ses deux modèles précédents.
Benchmark | V4.1 Flash | V4 Flash | V4 Pro |
|---|---|---|---|
Terminal-Bench 2.1 | 90,6 | 82,7 | 87,9 |
DeepSWE v1.1 | 74,2 | 54,4 | 62,7 |
AutomationBench | 54,8 | 37,7 | 43,2 |
Le saut est spectaculaire sur les tâches de génie logiciel : vingt points de plus que V4 Flash sur DeepSWE, douze de plus que V4 Pro. DeepSeek met aussi en avant la comparaison avec les modèles phares américains : 90,6 sur Terminal-Bench 2.1, contre 89,1 pour Claude Opus 5 et 88,8 pour GPT-5.6 Sol ; 74,2 % sur DeepSWE, au coude-à-coude avec les 74 % d'Opus 5.
La fiche du modèle complète le tableau : 90,9 sur GPQA Diamond, 36,8 sur Humanity's Last Exam, 88,1 sur CyberGym, un classement Codeforces à 3 471.
Deux réserves avant de s'emballer.
Ce sont des chiffres auto-déclarés. Choix des benchmarks, conditions d'exécution, effort de raisonnement : tout est contrôlé par l'éditeur, qui publie naturellement les résultats flatteurs.
Terminal-Bench 2.1 est saturé. Quand trois modèles se tiennent entre 88 et 91, le benchmark ne discrimine plus grand-chose. Les versions plus récentes du même test racontent une autre histoire : V4.1 Flash y obtient 30,0 sur Terminal-Bench 3.0 et 31,2 sur la 4.0. Le modèle reste bien placé, mais le « niveau Opus 5 » tient beaucoup au choix d'un test où tout le monde plafonne.
Ce que disent les mesures indépendantes
Artificial Analysis fait passer à chaque modèle la même batterie de dix évaluations : agents, terminal, raisonnement scientifique, contexte long, connaissances et publie le score agrégé, le débit mesuré et surtout le coût réel de l'évaluation complète. Ce dernier chiffre est le plus utile pour juger un rapport qualité-prix : il intègre le prix au token et la verbosité du modèle, c'est-à-dire le nombre de tokens qu'il consomme pour arriver au résultat.
Modèle | Indice v4.3 | Coût de l'évaluation | Tokens générés | Débit (tokens/s) | Poids ouverts |
|---|---|---|---|---|---|
Claude Opus 5 (max) | 51 | 7 275 $ | 140 M | 50 | Non |
Kimi K3 (max) | 44 | 3 658 $ | 160 M | 37 | Oui |
GLM-5.3-Flash | 42 | 280 $ | 180 M | 104 | Oui |
Gemini 3.8 Flash (high) | 41 | 1 623 $ | 170 M | 272 | Non |
DeepSeek V4.1 Flash (max) | 40 | 477 $ | 250 M | 217 | Oui |
Qwen3.8-Flash-Next | 40 | 363 $ | 240 M | 52 | Oui |
GPT-5.6 Luna (max) | 38 | 320 $ | 150 M | 116 | Non |
Claude Sonnet 5 (max) | 38 | 6 998 $ | 370 M | 74 | Non |
DeepSeek V4 Pro 0813 (max) | 36 | 1 122 $ | 160 M | 69 | Oui |
Relevé du 12 septembre 2026. Artificial Analysis facture DeepSeek au tarif heures pleines.
xychart-beta horizontal
title "Coût pour faire passer l'Intelligence Index (USD)"
x-axis ["GLM-5.3-Flash - 42 pts", "GPT-5.6 Luna - 38 pts", "Qwen3.8-Flash-Next - 40 pts", "DeepSeek V4.1 Flash - 40 pts", "DeepSeek V4 Pro - 36 pts", "Gemini 3.8 Flash - 41 pts", "Kimi K3 - 44 pts", "Claude Sonnet 5 - 38 pts", "Claude Opus 5 - 51 pts"]
y-axis "Dollars" 0 --> 7500
bar [280, 320, 363, 477, 1122, 1623, 3658, 6998, 7275]Quatre enseignements se dégagent.
Le gain sur la génération précédente est réel. Cinq points de plus que V4 Flash pour un coût d'évaluation identique à trois dollars près, quatre points de plus que V4 Pro; un modèle de 1 600 milliards de paramètres, trois fois plus gros pour 2,4 fois moins cher. Sur ce point, l'annonce de DeepSeek est confirmée.
L'écart avec les modèles phares aussi. Onze points séparent V4.1 Flash d'Opus 5 sur un indice agrégé. L'égalité affichée sur DeepSWE ne se généralise pas : on n'achète pas un Opus 5 à 15 fois moins cher, on achète un excellent modèle de milieu de gamme au prix d'un modèle d'entrée de gamme.
Il n'est pas seul dans sa catégorie. GLM-5.3-Flash obtient deux points de plus pour 280 $, et GPT-5.6 Luna fait presque aussi bien pour 320 $. En heures pleines, V4.1 Flash n'est donc pas le moins cher de son niveau.
Il est verbeux. 250 millions de tokens générés pour passer l'indice, contre 140 à 180 millions pour la plupart des concurrents. Une partie de l'avantage tarifaire au token est mangée par la longueur des raisonnements.
Mais deux éléments rééquilibrent nettement la comparaison. D'abord, en heures creuses, tous les tarifs sont divisés par deux : la même évaluation reviendrait à environ 240 $, ce qui en ferait le moins cher du tableau à ce niveau de score. Ensuite, le débit : à plus de 200 tokens par seconde, V4.1 Flash va environ deux fois plus vite que GLM-5.3-Flash et GPT-5.6 Luna, et quatre fois plus vite que Qwen3.8-Flash-Next. Pour un agent qui enchaîne des dizaines de tours, c'est la différence entre attendre une minute et en attendre quatre.
La grille tarifaire, et le piège des heures pleines
Tarif par million de tokens | Heures pleines | Heures creuses |
|---|---|---|
Entrée servie depuis le cache | 0,006 $ | 0,003 $ |
Entrée hors cache | 0,30 $ | 0,15 $ |
Sortie | 1,20 $ | 0,60 $ |
Les heures pleines de DeepSeek s'étendent de 01 h 00 à 04 h 00 et de 06 h 00 à 10 h 00 UTC, du lundi au vendredi. Tout le reste : soirées, week-ends, après-midi européens est facturé au tarif réduit.
Pour un utilisateur en France, la conversion n'est pas neutre : en heure d'été, les heures pleines tombent de 3 h à 6 h et de 8 h à 12 h. À partir du 25 octobre 2026, avec le passage à l'heure d'hiver, elles glissent d'une heure plus tôt : de 2 h à 5 h et de 7 h à 11 h. Autrement dit, la matinée de travail européenne est intégralement au prix fort, et l'après-midi à moitié prix.
Globalement je trouve la grille horaire plutôt intéressante pour la France Métropolitaine.
Pour un usage professionnel, on subit certes un peu la grille tarifaire le matin. Pour les traitements par lots : indexation, classification, génération de contenu, évaluations, il suffit de planifier les tâches l’après-midi ou la nuit pour diviser la facture par deux sans rien changer d’autre. Cependant, pour une utilisation hobbyiste, cela me semble relativement parfait.
Côté concurrence, la comparaison au token s'établit ainsi.
Modèle | Entrée | Sortie | Contexte | Licence |
|---|---|---|---|---|
DeepSeek V4.1 Flash | 0,15 à 0,30 $ | 0,60 à 1,20 $ | 1 M | MIT |
GLM-5.3-Flash | 0,15 $ | 0,50 $ | 1 M | MIT |
Qwen3.8-Flash-Next | 0,15 $ | 0,47 $ | 256 K | Poids ouverts |
GPT-5.6 Luna | 0,20 $ | 1,20 $ | 1 M | Propriétaire |
Gemini 3.8 Flash | 0,75 $ | 3,75 $ | 1 M | Propriétaire |
Kimi K3 | 3,00 $ | 15,00 $ | 1 M | Poids ouverts, licence Kimi |
Claude Sonnet 5 | 2,00 $ | 10,00 $ | 1 M | Propriétaire |
Claude Opus 5 | 5,00 $ | 25,00 $ | 1 M | Propriétaire |
Un point de vigilance sur Gemini 3.8 Flash : son tarif est promotionnel jusqu'au 31 décembre 2026. Au 1er janvier 2027, il double pour passer à 1,50 $ en entrée et 7,50 $ en sortie. L'écart avec DeepSeek passera alors de trois à six fois sur la sortie.
Les limites à connaître
Des benchmarks flatteurs. Les comparaisons avec Opus 5 reposent sur des tests choisis par DeepSeek, dont un saturé. L'indice indépendant ramène le modèle à sa vraie place : excellent dans sa gamme, pas au niveau des modèles phares.
Des ratés hors du code. Des tests pratiques publiés dans la foulée de la sortie rapportent des échecs sur des tâches créatives ou visuelles, une simulation de Rubik's Cube, la reproduction d'un portrait alors que le même modèle brille sur le génie logiciel. Le profil est clairement optimisé pour le code et les agents. Sur le terrain offensif de la sécurité, il décroche aussi : 15,3 sur ExploitGym, bien en dessous des modèles phares, malgré un excellent 88,1 sur CyberGym.
La verbosité. À l'effort maximal, le modèle raisonne longuement. Sur des tâches simples, baisser reasoning_effort est le premier réglage à tester avant de conclure qu'un modèle concurrent est plus économique.
La localisation des données. L'API officielle est opérée par une société chinoise, et la politique de confidentialité de DeepSeek prévoit un stockage en Chine, ce qui avait valu à son application un blocage par le régulateur italien début 2025. Pour des données personnelles ou confidentielles, l'API officielle n'est pas une option raisonnable dans un cadre RGPD. La licence MIT offre heureusement une porte de sortie : auto-héberger les poids, ou passer par un fournisseur dont l'hébergement est maîtrisé.
L'auto-hébergement n'est pas à la portée de tous. Seize milliards de paramètres actifs ne font pas un petit modèle : les poids complets représentent plusieurs centaines de gigaoctets et demandent un nœud multi-GPU. « Poids ouverts » signifie ici souveraineté possible, pas exécution sur un poste de travail.
Une gamme qui bouge vite. DeepSeek avait annoncé qu'à partir du 14 septembre, les appels à V4 Pro seraient redirigés vers V4.1 Flash. L'éditeur est revenu sur cette décision peu après : V4 Pro reste servi, au même tarif. Les anciens identifiants deepseek-v4-flash et deepseek-v4-flash-vision-exp pointent quant à eux temporairement vers V4.1 Flash. Mieux vaut passer dès maintenant à l'identifiant stable plutôt que de dépendre d'une redirection provisoire.
L'utiliser dès aujourd'hui
L'API officielle est compatible avec le format OpenAI. Le modèle s'appelle désormais simplement deepseek-flash.
import OpenAI from 'openai'
const client = new OpenAI({
baseURL: 'https://api.deepseek.com',
apiKey: process.env.DEEPSEEK_API_KEY,
})
const completion = await client.chat.completions.create({
model: 'deepseek-flash',
messages: [{ role: 'user', content: 'Résume ce ticket en trois points.' }],
thinking: { type: 'enabled' },
reasoning_effort: 'high',
})
console.log(completion.choices[0].message.content)Trois autres portes d'entrée méritent d'être connues :
Un endpoint au format Anthropic,
https://api.deepseek.com/anthropic, qui permet de brancher le modèle sur les outils conçus pour l'API de Claude.OpenRouter, sous l'identifiant
deepseek/deepseek-v4.1-flash, pratique pour comparer plusieurs modèles avec une seule clé.Baseten, qui l'a ajouté à ses Model APIs dès le 11 septembre, avec le contexte complet d'un million de tokens.
Côté outils de développement, OpenCode et WorkBuddy font partie des partenaires qui le prennent en charge dès la sortie.
Pour quels usages le choisir
flowchart TD
A["Choisir un modèle économique"] --> B{"Données personnelles ou confidentielles ?"}
B -- "oui" --> C{"Hébergement maîtrisé des poids possible ?"}
C -- "non" --> R1["GPT-5.6 Luna ou Gemini 3.8 Flash"]
C -- "oui" --> D
B -- "non" --> D{"Tâche où chaque erreur coûte cher ?"}
D -- "oui" --> R2["Un modèle phare : Claude Opus 5, GPT-6 Astra"]
D -- "non" --> E{"Latence importante ?"}
E -- "oui" --> R3["DeepSeek V4.1 Flash"]
E -- "non" --> F{"Traitement planifiable l'après-midi ou la nuit ?"}
F -- "oui" --> R3
F -- "non" --> R4["GLM-5.3-Flash ou DeepSeek V4.1 Flash, à départager sur vos données"]En résumé, V4.1 Flash est un choix de premier plan pour :
les agents de code et d'automatisation, là où ses scores sont les plus solides et où son débit raccourcit chaque boucle ;
les traitements à fort volume planifiables, où le tarif heures creuses en fait le moins cher de sa catégorie ;
l'analyse de longs contextes, grâce au million de tokens et au cache à 0,003 $ le million ;
les projets qui exigent des poids ouverts, pour l'auto-hébergement, l'affinage ou l'indépendance vis-à-vis d'un fournisseur.
Il est moins indiqué pour les tâches créatives ou visuelles complexes, pour les données sensibles via l'API officielle, et pour les problèmes difficiles où un modèle phare rembourse son surcoût en erreurs évitées.
Ce que je retiens
DeepSeek V4.1 Flash ne tient pas la promesse la plus spectaculaire de son annonce : il n'est pas un Opus 5 à quinze fois moins cher. Les benchmarks qui le placent à ce niveau sont soigneusement choisis, et une mesure indépendante le ramène onze points plus bas.
Il tient en revanche une promesse plus utile au quotidien. À 40 points sur l'Intelligence Index, il fait partie du trio de tête du rapport qualité-prix avec GLM-5.3-Flash et GPT-5.6 Luna, il va environ deux fois plus vite qu'eux, il est le seul des trois à combiner poids ouverts, un million de tokens de contexte et plus de 200 tokens par seconde et dès que l'on peut décaler ses traitements hors des matinées européennes, il devient le moins cher de tous.
Et d’après mes essais, j’ai pu faire développer une application, certes simple, pour moins de 2 $, malgré l’utilisation d’OpenCode, qui augmente légèrement la facture. Pour le code, le niveau est tout à fait convenable, à condition de bien le cadrer. Je n’ai toutefois pas encore testé le développement à partir d’une image. Je suis en revanche un peu déçu par ses capacités en design, que je trouve légèrement en retrait, même si l’ajustement de quelques skills pourrait éventuellement résoudre ce problème.
Questions fréquentes
DeepSeek V4.1 Flash est-il au niveau de Claude Opus 5 ?
Non. Il atteint 40 points sur l'Artificial Analysis Intelligence Index, contre 51 pour Claude Opus 5.
Quel est le prix de DeepSeek V4.1 Flash ?
Le tarif est de 0,30 dollar par million de tokens en entrée et 1,20 dollar en sortie en heures pleines, moitié moins en heures creuses.
Quels sont les principaux atouts de DeepSeek V4.1 Flash ?
Il combine des poids ouverts sous licence MIT, un contexte d'un million de tokens et un débit supérieur à 200 tokens par seconde.
Pour quels usages DeepSeek V4.1 Flash est-il recommandé ?
Il convient surtout aux agents de code, à l'automatisation, aux traitements volumineux planifiables et à l'analyse de longs contextes.
