Aller au contenu
Cogio
Souveraineté· 14 min de lecture· par Alexandre Sauvageau

Top 5 des modèles d’IA à héberger chez vous en 2026 : un comparatif honnête

Les cinq meilleurs modèles d’IA à poids ouverts pour une PME en juillet 2026 : Qwen3.6, Gemma 4, Qwen3.5, Mistral Small 4 et GPT-OSS. VRAM, licences, français.

Cartes graphiques posées côte à côte
Photo : Nana Dua, Pexels

Pourquoi héberger le modèle chez vous, et comment nous avons choisi

Un modèle d’IA hébergé sur votre serveur, c’est un assistant qui lit vos soumissions, vos procédures et vos contrats sans qu’aucun octet ne quitte votre entreprise. Pas d’abonnement au jeton, pas de conditions d’utilisation qui changent, pas de CLOUD Act : le modèle vous appartient, au sens littéral, et la conformité à la Loi 25 s’en trouve simplifiée d’autant.

Le marché des modèles à poids ouverts a beaucoup bougé depuis un an : Google a fait passer Gemma sous licence Apache 2.0, Alibaba a publié deux générations de Qwen, Mistral a remplacé son petit modèle dense par un gros modèle à experts, et les géants ouverts (DeepSeek, GLM, Kimi, Llama 5) ont grossi au point de sortir du gabarit d’un serveur de PME. Ce comparatif retient cinq modèles selon quatre critères : la qualité du français, la mémoire vidéo requise en quantification 4 bits, la licence, et l’aptitude au RAG, cette approche où le modèle répond à partir de vos documents plutôt que de sa mémoire.

Les chiffres de mémoire vidéo proviennent des fiches officielles Ollama ou Hugging Face de chaque modèle, vérifiées en juillet 2026. Les modèles évoluent vite : validez les paramètres du moment avant tout achat de matériel.

1. Qwen3.6-27B : le meilleur rapport qualité-mémoire sur un seul GPU

Publié par Alibaba en avril 2026, Qwen3.6-27B est le modèle que nous recommandons par défaut pour une PME équipée d’un seul GPU de 24 Go. Sa fiche Ollama annonce environ 17 Go en quantification Q4 : il tourne à l’aise sur une carte grand public haut de gamme, avec de la marge pour le contexte.

Ses forces : un contexte natif de 262 000 jetons (assez pour avaler un appel d’offres complet avec ses annexes), un raisonnement de premier plan pour sa taille (sa fiche Hugging Face affiche 86,2 au test MMLU-Pro et 87,8 au GPQA Diamond), une licence Apache 2.0 sans restriction commerciale et un excellent comportement multilingue, français compris.

Ses limites : son mode de réflexion pas à pas est verbeux, ce qui allonge les réponses quand on ne le bride pas, et le modèle est récent, donc le recul terrain est mince. Rien de bloquant pour un assistant documentaire interne.

2. Gemma 4 : le français soigné qui tient dans 8 Go

La famille Gemma 4 de Google, sortie fin mars 2026, marque un tournant : c’est la première génération de Gemma publiée sous Apache 2.0, sans les conditions d’utilisation restrictives qui compliquaient l’usage commercial des versions précédentes. Trois tailles nous intéressent : 12B (7,6 Go en Q4 selon Ollama), 26B (18 Go) et 31B (20 Go).

Le 12B est notre choix pour les budgets serrés et les mini-PC à mémoire unifiée : son français est remarquablement naturel pour la taille, avec plus de 140 langues supportées et un contexte de 256 000 jetons. Le 31B rivalise avec les meilleurs du gabarit : Google le classe troisième des modèles ouverts sur l’arène comparative LMArena, une revendication de son annonce officielle que nous n’avons pas pu vérifier indépendamment.

Ses limites : pas de mode de raisonnement long comparable à celui de Qwen, et une couverture linguistique moindre que les 201 langues de Qwen3.5. Pour du RAG en français sur des documents d’entreprise, ces limites pèsent peu.

3. Qwen3.5-35B-A3B : le champion du débit pour le RAG à fort volume

Le 35B-A3B de la famille Qwen3.5 (février 2026, Apache 2.0) est un modèle à mélange d’experts : 35 milliards de paramètres au total, mais seulement 3 milliards activés par jeton. Résultat : la vitesse d’un petit modèle avec la culture d’un moyen, pour environ 20 Go de mémoire vidéo en quantification 4 bits selon les guides de dimensionnement.

C’est le choix du débit : quand l’assistant doit traiter des centaines de requêtes par jour, résumer des lots de documents ou alimenter plusieurs services en parallèle, les 3 milliards de paramètres actifs font la différence sur la facture d’électricité comme sur les temps de réponse. La famille revendique 201 langues et dialectes, du jamais vu dans l’open source, et le même contexte de 262 000 jetons que son grand frère.

Ses limites : à mémoire égale, un modèle dense comme Qwen3.6-27B ou Gemma 4 26B raisonne plus profondément sur les cas ambigus. Le MoE gagne au volume, le dense gagne à la nuance.

4. Mistral Small 4 : le meilleur français, si vous avez deux GPU

Mistral Small 4, publié le 16 mars 2026, n’a de « Small » que le nom : 119 milliards de paramètres à mélange d’experts (6 milliards actifs), qui fusionnent raisonnement, vision et usage d’outils. C’est, à notre connaissance, le meilleur français natif du marché ouvert : l’éditeur est parisien et cela s’entend dans chaque tournure.

Le prix de cette qualité se paie en mémoire : environ 58 Go en quantification IQ4_XS d’après les fichiers GGUF publiés par la communauté, soit deux GPU professionnels de 48 Go pour être confortable. Licence Apache 2.0, contexte de 256 000 jetons, sorties remarquablement concises. Pour un cabinet comptable, un assureur ou un cabinet d’avocats dont chaque virgule compte, l’investissement se défend.

Ses limites : au moment de vérifier, aucune fiche Ollama officielle n’était en ligne, il faut passer par vLLM ou llama.cpp, ce qui suppose une équipe technique à l’aise. Et le matériel requis double le budget serveur par rapport aux trois premiers choix.

5. GPT-OSS : le raisonnement d’OpenAI, mais un français en retrait

GPT-OSS, la paire de modèles ouverts d’OpenAI publiée en août 2025 (20B et 120B, Apache 2.0), reste une référence : raisonnement excellent pour la taille, appels de fonctions fiables, écosystème très mûr avec des millions de téléchargements sur Ollama. Le 20B tourne dans 14 Go de mémoire vidéo selon sa fiche Ollama, le 120B demande 65 Go.

Alors pourquoi cinquième? Le français. La fiche technique officielle d’OpenAI situe gpt-oss-20b entre 73,2 et 80,2 % au test multilingue MMMLU en français selon l’effort de raisonnement, un cran net sous Qwen, Gemma et Mistral. Sur des documents d’entreprise québécois, cet écart se voit : anglicismes, tournures calquées, terminologie approximative. Le contexte plafonne aussi à 128 000 jetons, la moitié des concurrents.

Le bon usage : les flux où le raisonnement et l’outillage priment sur la langue, comme un agent qui interroge des bases de données ou orchestre des appels d’API, avec des réponses courtes ou en anglais. Aucun successeur n’était sorti en juillet 2026, malgré les rumeurs.

Quel modèle pour quelle situation

Aucun classement ne remplace la question de départ : quel matériel, quelle langue, quel volume? Voici la grille que nous utilisons en cadrage.

  • Pour le RAG en français, le modèle de plongements (embeddings) compte autant que le modèle de génération : Qwen3-Embedding et BGE-M3 dominent les comparatifs publics en 2026.
  • Les géants ouverts (GLM-5.2, DeepSeek V4, Kimi K2.6, Llama 5) sont hors gabarit PME : de 600 milliards à plus de 1 000 milliards de paramètres, et la licence de Llama demeure restrictive.
  • Mention honorable : Nemotron 3 Nano de NVIDIA, très rapide, mais sa licence maison est moins simple qu’Apache 2.0 et son français n’est pas documenté.
Recommandations par palier de mémoire vidéo (quantification 4 bits, chiffres des fiches officielles, juillet 2026)
Votre matérielPremier choixSolution de rechangeÀ retenir
8 à 16 Go (GPU grand public, mini-PC)Gemma 4 12B (7,6 Go)GPT-OSS 20B (14 Go) si le raisonnement primeLe 12B suffit à un assistant documentaire de PME
24 à 32 Go (un GPU haut de gamme)Qwen3.6-27B (17 Go)Gemma 4 26B ou 31B; Qwen3.5-35B-A3B pour le débitLe cœur de cible : qualité, français et marge de contexte
48 à 64 Go (deux GPU, serveur dédié)Mistral Small 4 (58 Go)GPT-OSS 120B (65 Go) si le français n’est pas critiqueLe palier du français irréprochable et des gros volumes

Ce que ça change pour une PME québécoise

D’abord la conformité : un modèle local transforme votre analyse Loi 25. Les renseignements personnels ne quittent ni votre entreprise ni le Québec, ce qui simplifie l’évaluation des facteurs relatifs à la vie privée et élimine la question des transferts hors province. Vos documents ne servent jamais à entraîner le modèle d’un tiers, par construction.

Ensuite la facture : un serveur capable de faire tourner Qwen3.6-27B se trouve sous les 10 000 $, et un serveur bi-GPU pour Mistral Small 4 autour de 25 000 $ à 35 000 $ selon la configuration. Ce matériel peut se qualifier au crédit d’impôt C3I (15 à 25 % selon la zone, sur la portion excédant le seuil de 5 000 $), et le projet d’implantation lui-même se finance : nos panoramas des aides québécoises et fédérales détaillent les leviers.

Transparence : Cogio déploie ces modèles chez ses clients, c’est notre métier, et ce classement reflète notre expérience de terrain autant que les fiches techniques. Les paramètres cités ont été vérifiés en juillet 2026 sur les pages officielles des éditeurs; ils changeront. Pour un avis indépendant, les classements publics comme LMArena ou l’Artificial Analysis Intelligence Index sont de bons contrepoids.

17 Go

mémoire vidéo de Qwen3.6-27B en Q4 selon sa fiche Ollama : un seul GPU de 24 Go suffit

262 000

jetons de contexte natif chez Qwen3.6 et Qwen3.5 : un appel d’offres entier d’un coup

Apache 2.0

licence des cinq modèles retenus : usage commercial libre, sans redevance

Questions fréquentes

Qu’est-ce qu’un modèle « à poids ouverts », au juste?

Un modèle dont les paramètres (les poids) se téléchargent et s’exécutent sur votre propre matériel, sans passer par l’API d’un fournisseur. Ouvert ne veut pas dire libre de droits : c’est la licence qui tranche. Apache 2.0, la licence des cinq modèles retenus ici, permet l’usage commercial sans redevance; la licence de Llama, elle, impose encore des conditions.

Quel matériel faut-il vraiment pour commencer?

Un seul GPU de 24 Go de mémoire vidéo couvre le cœur de cible : Qwen3.6-27B y tourne en quantification 4 bits avec de la marge pour le contexte. Pour un premier projet pilote, un GPU de 16 Go et Gemma 4 12B suffisent. Le bi-GPU ne devient nécessaire que pour Mistral Small 4 ou GPT-OSS 120B.

La quantification 4 bits dégrade-t-elle la qualité?

Marginalement, pour la plupart des usages d’entreprise. La quantification compresse les poids du modèle pour réduire la mémoire requise; en Q4, la perte de qualité est généralement imperceptible sur du RAG documentaire. Pour des tâches de raisonnement pointues, une quantification plus fine (Q8) peut se justifier si la mémoire le permet.

Faut-il réentraîner le modèle sur nos données?

Presque jamais. L’approche RAG (le modèle consulte vos documents indexés au moment de répondre) couvre la grande majorité des besoins, se met à jour en continu et ne modifie pas le modèle. Le réglage fin (fine-tuning) se réserve aux cas où un style ou un vocabulaire très spécifique doit être intériorisé, et il complique la conformité.

Pourquoi Llama ne figure-t-il pas dans le classement?

Deux raisons. Meta n’offre plus de version récente au gabarit PME : Llama 5 compte 600 milliards de paramètres, hors de portée d’un serveur d’entreprise ordinaire. Et sa licence n’est toujours pas une licence libre reconnue, contrairement à l’Apache 2.0 des cinq modèles retenus.

Ollama, vLLM, llama.cpp : lequel choisir pour servir le modèle?

Ollama pour démarrer et pour les postes individuels : installation en minutes, catalogue intégré. vLLM pour la production multi-utilisateurs : meilleur débit, gestion fine de la mémoire. llama.cpp quand le modèle n’existe qu’en GGUF communautaire, comme Mistral Small 4 au moment d’écrire ces lignes.

Sources et références

Cet article est une synthèse de vulgarisation, à jour à la date indiquée. Il ne constitue pas un avis juridique : pour votre situation particulière, consultez un conseiller juridique ou communiquez avec la Commission d’accès à l’information.