DeepSeek-V4.1-Flash : un modèle ouvert pensé pour tourner léger, analysé pour l’entreprise
DeepSeek-V4.1-Flash, sous licence MIT : 552 milliards de paramètres, 8 à 16 milliards actifs et une mémoire de contexte réduite. Ce qu’il vaut pour une PME.

Ce qui est sorti
Le 10 septembre 2026, DeepSeek a présenté DeepSeek-V4.1-Flash comme « plus intelligent, plus rapide, plus efficace ». Les poids ont été publiés le jour même sur Hugging Face sous licence MIT, avec un article technique. Dans l’API de l’éditeur, le modèle s’appelle simplement « deepseek-flash » et il absorbe les anciens modèles : les requêtes adressées à V4-Flash y sont redirigées et celles adressées à V4-Pro le sont depuis le 14 septembre.
Ce remplacement dit tout de l’ambition du modèle. Selon DeepSeek, ce « Flash » dépasse sur les tests d’agent l’ancien modèle haut de gamme de la maison. Si la mesure se confirme, le modèle le moins cher de l’éditeur devient aussi son meilleur.
Une architecture pensée pour la sobriété
DeepSeek-V4.1-Flash compte 552 milliards de paramètres répartis en 384 experts, dont 6 sont sollicités par jeton. Sa nouveauté est une architecture « encodeur-décodeur causal » : 20 couches lisent le texte d’entrée, 20 autres écrivent la réponse. Résultat, seuls 8 milliards de paramètres travaillent pendant la lecture et 16 milliards pendant l’écriture.
Le gain principal porte sur le cache KV, la mémoire que le modèle garde de la conversation en cours. DeepSeek annonce qu’il occupe le quart de la mémoire GPU et le huitième du stockage SSD qu’exigeait la génération précédente. Selon The Register, cela permet de servir quatre à huit fois plus d’utilisateurs dans la même empreinte mémoire. Pour une entreprise, c’est la bonne métrique : combien d’employés un serveur peut-il servir en même temps?
Le modèle accepte texte et images, avec une fenêtre de contexte d’environ un million de jetons et des réponses pouvant atteindre 384 000 jetons dans l’API. Son effort de raisonnement se règle finement, sur une échelle de 1 à 100, ce qui permet de répondre vite aux questions simples et de réfléchir longtemps aux problèmes difficiles.
8 G
paramètres actifs pour lire le texte, 16 milliards pour écrire la réponse
¼
mémoire GPU du cache KV comparée à la génération précédente, selon DeepSeek
235
jetons par seconde mesurés par Artificial Analysis sur l’API
| Caractéristique | Valeur |
|---|---|
| Paramètres | 552 milliards au total, 8 milliards actifs en lecture, 16 en écriture |
| Entrées | Texte et images |
| Contexte | 1 million de jetons, 384 000 en sortie (API) |
| Licence | MIT |
| Poids officiels | 510 Go |
| Prix de l’API, heures creuses | 0,15 $ US en entrée, 0,60 $ US en sortie, par million de jetons |
| Prix de l’API, heures de pointe | 0,30 $ US en entrée, 1,20 $ US en sortie, par million de jetons |
Les performances, du communiqué à la mesure indépendante
La fiche du modèle publie un score de 74,2 au test DeepSWE 1.1, qui mesure la capacité à résoudre de vraies tâches de programmation. Comme toujours, ce chiffre vient de l’éditeur.
Artificial Analysis donne un portrait indépendant : 39 à l’Intelligence Index, au septième rang sur 115 modèles comparables, pour une vitesse de 235,1 jetons par seconde. C’est un peu moins que GLM-5.3-Flash sur l’indice (42), mais plus de cinq fois plus rapide. Pour un assistant utilisé toute la journée par une équipe, la vitesse compte souvent davantage que quelques points de classement.
Comme pour les autres modèles chinois récents, nous n’avons trouvé aucune évaluation publiée sur la qualité de son français. Un banc d’essai sur vos documents reste indispensable.
L’héberger chez vous, concrètement
Les poids officiels pèsent 510 Go. Une partie importante de ce volume est une table de mémoire que DeepSeek appelle « Engram » : environ 189 Gio en FP8 que le modèle consulte ligne par ligne plutôt que de la garder entièrement en mémoire.
C’est ce qui rend possible une installation modeste. Le développeur Salvatore Sanfilippo (antirez) publie une version 2 bits dont les poids principaux font 152 Gio. Selon sa documentation, elle tourne sur un seul Mac de 128 Go en lisant la table Engram directement depuis un SSD rapide. Une version 4 bits exige plutôt une machine de 512 Go pour tout garder en mémoire. En production, avec plusieurs employés en même temps, un serveur à plusieurs GPU professionnels reste la configuration de référence.
- Poids officiels : 510 Go
- Table Engram : environ 189 Gio, lue depuis le disque
- Version 2 bits (antirez) : 152 Gio de poids principaux, un Mac de 128 Go avec SSD rapide
- Version 4 bits (antirez) : 294 Gio de poids principaux, une machine de 512 Go pour tout garder en mémoire
Poids ouverts ou API : deux réponses différentes
Les poids ouverts de DeepSeek-V4.1-Flash, exécutés sur votre serveur, ne transmettent rien à DeepSeek. Sous licence MIT, le modèle est un fichier que vous contrôlez entièrement, sans abonnement ni dépendance à l’éditeur.
L’API est tentante par son prix, surtout en heures creuses. Mais DeepSeek traite les requêtes sur sa propre infrastructure, en Chine. Y envoyer des renseignements personnels suppose, sous la Loi 25, une évaluation des facteurs relatifs à la vie privée préalable. Pour des contrats, des soumissions ou des dossiers d’employés, l’hébergement local règle la question à la source.
Ce que nous recommandons
DeepSeek-V4.1-Flash est le modèle ouvert le plus intéressant de la rentrée pour une entreprise qui veut servir beaucoup d’utilisateurs sur un même serveur : sa mémoire de contexte réduite et sa vitesse en font un bon candidat pour un assistant partagé par toute une équipe.
Il n’est pas pour autant le point de départ d’une petite entreprise. Un modèle d’environ 27 milliards de paramètres sur un GPU de 24 Go couvre la plupart des besoins documentaires pour une fraction du coût matériel, comme l’explique notre analyse de Qwen3.8. Si vous hésitez entre DeepSeek-V4.1-Flash et GLM-5.3-Flash, la vitesse penche pour le premier, le score à l’indice pour le second. Seul un banc d’essai sur vos documents tranche vraiment.
Questions fréquentes
DeepSeek-V4.1-Flash peut-il tourner sur un seul ordinateur?
Oui, avec des compromis. Selon la documentation de la version 2 bits publiée par antirez, un Mac de 128 Go le fait tourner en lisant une partie du modèle depuis un SSD rapide. C’est suffisant pour tester ou pour un usage individuel. Pour servir une équipe entière, un serveur à plusieurs GPU professionnels est plus adapté.
Que signifie « 8 milliards de paramètres actifs en lecture, 16 en écriture »?
Le modèle compte 552 milliards de paramètres, mais n’en sollicite qu’une petite partie à chaque étape. Sa nouvelle architecture sépare la lecture du texte (8 milliards actifs) de l’écriture de la réponse (16 milliards actifs). Cela réduit le calcul nécessaire et accélère la génération.
La licence MIT permet-elle un usage commercial?
Oui, sans restriction de taille ni de revenus. La licence MIT autorise l’usage, la modification et la redistribution commerciale, à condition de conserver l’avis de droit d’auteur.
Utiliser DeepSeek envoie-t-il nos données en Chine?
Seulement si vous passez par l’API de DeepSeek, qui traite les requêtes sur son infrastructure. Les poids ouverts hébergés sur votre serveur ne se connectent à aucun service. Pour des renseignements personnels, l’hébergement local évite la communication hors Québec et l’évaluation préalable que la Loi 25 exigerait.
Vaut-il mieux choisir DeepSeek-V4.1-Flash ou GLM-5.3-Flash?
Selon Artificial Analysis, GLM-5.3-Flash obtient un score un peu plus élevé (42 contre 39), mais DeepSeek-V4.1-Flash génère plus de cinq fois plus vite sur l’API (235 contre 43,8 jetons par seconde). Pour un assistant partagé, la vitesse et la mémoire de contexte réduite de DeepSeek pèsent lourd. Le choix final se fait sur vos propres documents.
Sources et références
- DeepSeek, annonce de DeepSeek-V4.1-Flash (10 septembre 2026)
- Fiche Hugging Face officielle de DeepSeek-V4.1-Flash (architecture, licence MIT, benchmarks)
- DeepSeek, tarifs de l’API (heures de pointe et heures creuses)
- antirez, version GGUF de DeepSeek-V4.1-Flash pour DwarfStar (tailles, lecture depuis le SSD)
- Artificial Analysis, évaluation indépendante de DeepSeek-V4.1-Flash
- The Register, le nouveau modèle de DeepSeek et la réduction du cache KV (11 septembre 2026)
Cet article est une synthèse de vulgarisation, à jour à la date indiquée. Il ne constitue pas un avis juridique : pour votre situation particulière, consultez un conseiller juridique ou communiquez avec la Commission d’accès à l’information.
À lire ensuite
Souveraineté
GLM-5.3-Flash : ce que le modèle ouvert de Zhipu change pour l’IA locale en entreprise
Lire →
Souveraineté
Qwen3.8 : ce que la nouvelle famille d’Alibaba change pour l’IA locale en entreprise
Lire →
Souveraineté
Top 5 des modèles d’IA à héberger chez vous en 2026 : un comparatif honnête
Lire →
Une question sur votre propre conformité?
L’appel de qualification est gratuit et dure une demi-heure. Vous repartez avec une lecture honnête de votre situation.
Discutons-en