GLM-5.3-Flash : ce que le modèle ouvert de Zhipu change pour l’IA locale en entreprise
GLM-5.3-Flash de Zhipu, sous licence MIT : 320 milliards de paramètres, multimodal et très bon marché. Le serveur qu’il exige et ce qu’il vaut pour une PME.

Ce qui est sorti et comment
Le lancement de GLM-5.3-Flash a pris une forme inhabituelle. Pendant des semaines, un modèle anonyme baptisé « Ox Alpha » a circulé sur la place de marché OpenRouter et sur la plateforme d’agents OpenCode. Selon le South China Morning Post, il y a traité 62 000 milliards de jetons avant que Zhipu AI n’en revendique la paternité, le mercredi 26 août 2026, en publiant les poids sur Hugging Face sous licence MIT.
L’autre fait marquant est industriel : l’essai a tourné entièrement sur une grappe de 100 000 puces de fabrication chinoise, rapporte le même quotidien. L’action de Zhipu a bondi de plus de 12 % à la Bourse de Hong Kong le lendemain. Pour une entreprise d’ici, l’enjeu n’est pas géopolitique mais pratique : un modèle de ce calibre, gratuit et librement modifiable, peut-il remplacer un abonnement ou s’installer sur votre serveur?
La fiche technique en clair
GLM-5.3-Flash est un modèle à mélange d’experts : 320 milliards de paramètres au total, dont 18 milliards seulement travaillent pour chaque jeton produit. La configuration publiée compte 288 experts, dont 8 sont sollicités à chaque étape. C’est ce qui explique son prix d’API très bas : on paie le calcul de 18 milliards de paramètres, pas de 320.
Zhipu a aussi revu l’architecture en profondeur. Pour la première fois dans la série GLM, trois couches sur quatre utilisent une attention linéaire et la quatrième une attention clairsemée, un montage qui réduit fortement le coût des longs contextes. La configuration déclare une fenêtre d’environ un million de jetons (1 048 576). Le modèle a été préentraîné sur un corpus multimodal de 30 000 milliards de jetons, selon sa fiche Hugging Face.
18 G
paramètres actifs par jeton, sur 320 milliards au total
MIT
licence des poids, sans restriction commerciale
42
score à l’Intelligence Index d’Artificial Analysis, quatrième de 115 modèles comparables
| Caractéristique | Valeur |
|---|---|
| Paramètres | 320 milliards au total, 18 milliards actifs |
| Entrées | Texte, images, vidéo, documents numérisés |
| Contexte déclaré | 1 048 576 jetons |
| Licence | MIT |
| Poids officiels (FP8) | 328 Go |
| Quantification 4 bits (Unsloth) | 200 Go |
| Prix de l’API Z.ai | 0,15 $ US en entrée, 0,50 $ US en sortie, par million de jetons |
Les performances, du communiqué à la mesure indépendante
Zhipu affirme que GLM-5.3-Flash dépasse GLM-5.2 à un dixième du prix et qu’il s’approche des meilleurs modèles commerciaux sur la programmation et les tâches d’agent. Sa fiche publie notamment 84,3 au Terminal-Bench 2.1 et 63,4 au test DeepSWE. Ce sont des chiffres de l’éditeur, mesurés dans ses propres conditions.
La mesure indépendante d’Artificial Analysis nuance le tableau. Le modèle obtient 42 à l’Intelligence Index, bien au-dessus de la médiane de 18 des modèles comparables, ce qui le place au quatrième rang sur 115. Mais il génère lentement, à 43,8 jetons par seconde contre une médiane de 74. Il est aussi bavard : 180 millions de jetons produits pendant l’évaluation, contre une médiane de 140 millions. Pour un employé qui attend une réponse, cette lenteur se sent.
Aucune évaluation publiée ne porte sur la qualité de son français, du moins à notre connaissance au moment d’écrire ces lignes. C’est le premier point à vérifier sur vos propres documents avant tout déploiement.
Le serveur qu’il faut pour l’héberger
C’est ici que GLM-5.3-Flash se distingue des modèles que nous recommandons habituellement aux PME. Les poids officiels pèsent 328 Go en FP8. La quantification 4 bits la plus utilisée, publiée par Unsloth, descend à 200 Go et la version 2 bits à 102 Go, au prix d’une perte de qualité sensible. On est loin des 17 à 19 Go qu’exige un modèle de 27 milliards de paramètres en 4 bits.
Deux familles de machines conviennent. La première : une station à mémoire unifiée de 256 Go ou plus, où le faible nombre de paramètres actifs garde une vitesse de génération raisonnable. La seconde : un serveur à plusieurs GPU professionnels, ou un moteur hybride comme KTransformers, cité dans la fiche du modèle, qui place les experts en mémoire vive et le reste sur la carte graphique. Dans les deux cas, le budget matériel change d’ordre de grandeur par rapport à un serveur à GPU unique.
- Poids FP8 officiels : 328 Go
- Quantification 4 bits d’Unsloth : 200 Go
- Quantification 2 bits d’Unsloth : 102 Go, qualité dégradée
- Encodeur de vision : environ 1 Go de plus pour lire les images
Un modèle chinois sur votre serveur, est-ce un risque?
Il faut distinguer deux usages. Les poids ouverts, téléchargés et exécutés sur votre serveur, ne transmettent rien à Zhipu : le modèle est un fichier, il ne se connecte à aucun service. Sous licence MIT, vous pouvez l’inspecter, l’adapter et le faire tourner sans dépendre de l’éditeur. C’est exactement la logique de l’IA locale.
L’API de Z.ai est une autre affaire. Y envoyer des renseignements personnels, c’est les communiquer à l’extérieur du Québec. La Loi 25 exige alors une évaluation des facteurs relatifs à la vie privée avant la communication, comme l’explique notre guide pratique de l’EFVP. Pour des données d’entreprise sensibles, le prix très bas de l’API ne compense pas ce travail de conformité.
Reste la question de l’alignement : les modèles entraînés en Chine suivent des consignes de prudence sur certains sujets politiques. Pour lire des factures, résumer des procédures ou préparer des soumissions, l’effet est nul en pratique. Un banc d’essai sur vos propres documents le confirme en une journée.
Ce que nous recommandons
Pour la majorité des PME québécoises, un modèle d’environ 27 milliards de paramètres sur un GPU de 24 Go reste le meilleur point de départ : moins cher, plus rapide et suffisant pour les tâches documentaires. Notre analyse de Qwen3.8 détaille ce palier.
GLM-5.3-Flash devient intéressant dans deux cas. D’abord pour une entreprise qui fait tourner des agents longs et complexes, où son niveau sur les tâches d’agent justifie un serveur à grande mémoire. Ensuite pour lire des documents visuels en volume, grâce à sa multimodalité native. Dans les deux cas, le choix se fait sur banc d’essai, avec vos documents et en français, pas sur un classement public.
Le matériel d’un tel projet reste admissible au crédit d’impôt C3I et le diagnostic qui le précède peut être financé par ESSOR. Notre comparatif des modèles locaux situe GLM-5.3-Flash parmi les autres options ouvertes.
Questions fréquentes
GLM-5.3-Flash peut-il tourner sur un GPU de 24 Go?
Non. Même la quantification 1 bit la plus agressive d’Unsloth pèse 93 Go. La version 4 bits en pèse 200. Il faut une station à mémoire unifiée de 256 Go ou plus, un serveur à plusieurs GPU professionnels, ou un moteur hybride qui place les experts en mémoire vive.
La licence MIT permet-elle un usage commercial?
Oui, sans restriction. La licence MIT autorise l’usage, la modification et la redistribution, y compris commerciale, à condition de conserver l’avis de droit d’auteur. Aucun seuil d’utilisateurs ni de revenus ne s’applique.
Utiliser GLM-5.3-Flash envoie-t-il nos données en Chine?
Pas si vous hébergez les poids vous-même : le modèle tourne sur votre serveur et ne communique avec aucun service. En revanche, l’API de Z.ai traite vos requêtes sur l’infrastructure de l’éditeur. Pour des renseignements personnels, la Loi 25 impose alors une évaluation des facteurs relatifs à la vie privée avant la communication.
Est-il meilleur que Qwen3.8-27B?
Sur les tâches d’agent, les scores publiés le placent au-dessus, mais ils viennent des éditeurs et ne sont pas mesurés dans les mêmes conditions. Surtout, les deux modèles ne jouent pas dans la même catégorie matérielle : Qwen3.8-27B tient sur un GPU de 24 Go, GLM-5.3-Flash demande environ dix fois plus de mémoire. La bonne comparaison se fait sur vos documents et votre budget.
Pourquoi le modèle est-il si lent selon Artificial Analysis?
L’évaluation mesure l’API de Z.ai, qui produit 43,8 jetons par seconde contre une médiane de 74 pour les modèles comparables. Le modèle est aussi verbeux, ce qui allonge les réponses. Sur votre propre serveur, la vitesse dépend du matériel et de la quantification choisie.
Sources et références
- Fiche Hugging Face officielle de GLM-5.3-Flash (architecture, benchmarks, licence MIT)
- Configuration publiée de GLM-5.3-Flash (experts, couches, contexte)
- Z.ai, grille tarifaire de l’API (GLM-5.3-Flash et GLM-5.3)
- Unsloth, quantifications GGUF de GLM-5.3-Flash (tailles des fichiers)
- Artificial Analysis, évaluation indépendante de GLM-5.3-Flash
- South China Morning Post, Ox Alpha révélé comme GLM-5.3-Flash sur des puces chinoises
- TechNode, Zhipu identifie Ox Alpha et publie les poids (27 août 2026)
Cet article est une synthèse de vulgarisation, à jour à la date indiquée. Il ne constitue pas un avis juridique : pour votre situation particulière, consultez un conseiller juridique ou communiquez avec la Commission d’accès à l’information.
À lire ensuite
Souveraineté
Qwen3.8 : ce que la nouvelle famille d’Alibaba change pour l’IA locale en entreprise
Lire →
Souveraineté
Top 5 des modèles d’IA à héberger chez vous en 2026 : un comparatif honnête
Lire →
Souveraineté
DeepSeek-V4.1-Flash : un modèle ouvert pensé pour tourner léger, analysé pour l’entreprise
Lire →
Une question sur votre propre conformité?
L’appel de qualification est gratuit et dure une demi-heure. Vous repartez avec une lecture honnête de votre situation.
Discutons-en