RAG, réglage fin, agent, automatisation : le lexique décisionnel du dirigeant
RAG, réglage fin, agent, jetons, inférence locale : chaque terme expliqué en langage d’affaires, avec quand c’est le bon choix et quand ce n’en est pas un.

Pourquoi un lexique décisionnel, et pas un glossaire de plus
Vous n’avez pas besoin de savoir programmer pour décider d’un projet d’IA. Vous avez besoin de comprendre une douzaine de mots, parce que ces mots déterminent des choix qui coûtent ou qui rapportent : héberger chez vous ou louer une API, indexer vos documents ou réentraîner un modèle, acheter un chatbot ou construire un agent. Quand le vocabulaire est flou, c’est rarement l’acheteur qui en profite.
Ce lexique est donc décisionnel : chaque terme est expliqué en langage d’affaires, avec le moment où c’est le bon choix et celui où ce n’en est pas un. Beaucoup de projets qui déraillent commencent par un malentendu de vocabulaire, comme nous le montrons dans notre analyse des projets d’IA qui échouent en PME.
Modèle de langage, poids ouverts, paramètres : ce que vous achetez, au juste
Un modèle de langage est un logiciel entraîné sur d’immenses corpus de textes pour produire la suite la plus plausible d’une phrase. C’est une mécanique de probabilité, pas une base de données : il rédige, résume, reformule et raisonne, mais il ne « sait » rien de votre entreprise tant qu’on ne lui montre pas vos documents.
Un modèle à poids ouverts se télécharge et s’exécute sur votre propre serveur, comme ceux de notre comparatif des modèles à héberger chez vous. Les paramètres, ces milliards de valeurs numériques qui composent le modèle, en sont la « taille de cerveau » : plus il y en a, plus le modèle est nuancé, et plus il exige de mémoire. La quantification compresse ces paramètres pour qu’un modèle tienne sur un matériel raisonnable, avec une perte de qualité marginale dans la plupart des usages d’entreprise.
- Modèle à poids ouverts : le bon choix quand vos documents sont sensibles ou que vous visez un coût prévisible; un détour inutile si votre usage se limite à des textes publics et occasionnels.
- Beaucoup de paramètres : le bon choix pour la nuance et le raisonnement; un gaspillage pour classer des courriels ou extraire des champs simples.
- Quantification : le bon choix par défaut pour respecter un budget matériel; à éviter dans sa forme la plus agressive quand chaque virgule d’un texte juridique compte.
RAG, réglage fin, entraînement : trois mots que les vendeurs confondent, parfois exprès
Le RAG (génération augmentée par récupération) fait consulter vos documents au modèle au moment où il répond : il repère les passages pertinents, puis rédige à partir d’eux. Vos fichiers restent des fichiers, le modèle ne change pas. C’est l’approche par défaut pour interroger le savoir d’une entreprise, parce qu’elle se met à jour en continu et qu’elle peut citer ses sources.
Le réglage fin (fine-tuning) modifie le modèle lui-même à partir d’exemples choisis. Il excelle à intérioriser un style, un format ou une terminologie de métier; il est médiocre pour apprendre des faits, qui se périment et se corrigent mal. L’entraînement complet, lui, consiste à bâtir un modèle depuis zéro : c’est l’affaire de grands laboratoires, pas d’une PME, et ce n’est presque jamais la bonne réponse à votre besoin.
- RAG : le bon choix pour répondre à partir de vos procédures, contrats et historiques; insuffisant seul quand le problème est le ton ou le format des sorties.
- Réglage fin : le bon choix pour un style maison ou un vocabulaire pointu répété à grande échelle; le mauvais choix pour « apprendre » des informations qui changent chaque mois.
- Entraînement complet : à écarter d’office; si un fournisseur vous le propose, demandez-lui pourquoi le RAG ne suffit pas, et notez la réponse.
Agent, assistant, chatbot, RPA : qui fait quoi pendant que vous dormez
Un chatbot converse : il répond aux questions dans une fenêtre de clavardage, généralement sur un périmètre étroit. Un assistant aide une personne dans sa tâche : il rédige, résume, prépare, mais n’agit pas seul. Un agent, lui, enchaîne des actions : il consulte vos systèmes, croise des données, prépare un livrable complet, puis le soumet à validation. C’est le sens que nous donnons au mot chez Cogio : l’IA prépare, l’humain décide.
L’automatisation classique (la RPA, pour automatisation robotisée des processus) n’a rien d’intelligent, et c’est sa force : elle rejoue des étapes identiques, vite et sans se lasser. Quand un processus est parfaitement répétitif, la RPA est plus fiable et moins chère qu’un agent. L’agent devient pertinent quand il faut comprendre un document, juger un cas particulier ou combiner plusieurs sources; son coût dépend surtout du nombre de systèmes à connecter, comme le détaille notre article sur le coût réel d’un agent IA au Québec.
- Chatbot : le bon choix pour la première ligne de questions répétitives; frustrant dès qu’on lui demande d’agir.
- Assistant : le bon choix pour outiller une personne dans ses textes et ses recherches; il ne remplace aucun processus.
- Agent : le bon choix quand un livrable exige de consulter plusieurs systèmes; exagéré pour une tâche qu’une règle simple accomplit déjà.
- RPA : le bon choix pour les gestes répétitifs et identiques; fragile dès que les documents varient ou que l’interface change.
Jetons, fenêtre de contexte, hallucination : les limites qu’on ne vous vend pas
Les modèles ne lisent pas des mots, mais des jetons : des fragments de texte, souvent plus courts qu’un mot. La facturation des API se compte au jeton, et la fenêtre de contexte, c’est-à-dire la quantité de texte que le modèle peut considérer d’un seul coup, se mesure en jetons elle aussi. Une grande fenêtre permet d’avaler un appel d’offres entier avec ses annexes; une petite oblige à découper, au risque de perdre le fil.
L’hallucination est le défaut le plus commenté : le modèle affirme avec aplomb une chose fausse. Elle survient surtout quand on le fait répondre au-delà de ce qu’on lui a montré. On ne l’élimine pas, on la contient : un RAG qui cite ses sources, des périmètres bien définis et une validation humaine sur tout ce qui engage l’entreprise.
Inférence locale ou API infonuagique : où vos données ont-elles le droit d’aller?
L’inférence, c’est le moment où le modèle travaille : il lit votre demande et produit sa réponse. Elle peut se faire sur votre serveur (inférence locale) ou chez un fournisseur, par API infonuagique. La différence fondamentale n’est pas la qualité brute : c’est le trajet de vos données.
En local, vos documents ne quittent jamais l’entreprise : l’analyse de conformité à la Loi 25 s’en trouve simplifiée et le CLOUD Act américain sort de l’équation. Par API, vous accédez aux modèles les plus puissants sans acheter de matériel, mais vous devez examiner le contrat, la résidence des données et l’usage qui en est fait. Notre comparaison IA locale ou ChatGPT en entreprise aide à trancher selon la sensibilité de vos documents.
- Inférence locale : le bon choix pour les documents sensibles, les volumes réguliers et les coûts prévisibles; un investissement injustifié pour un usage sporadique sur des contenus publics.
- API infonuagique : le bon choix pour prototyper vite et accéder aux modèles de pointe; le mauvais choix par défaut pour des renseignements personnels, tant que l’analyse n’a pas été faite.
Embeddings et recherche sémantique : retrouver par le sens, pas par le mot exact
Les embeddings (plongements, en bon français) transforment chaque passage de texte en une suite de nombres qui capture son sens. Deux passages qui parlent de la même chose obtiennent des nombres voisins, même s’ils n’ont aucun mot en commun. C’est le moteur de la recherche sémantique : taper « bris de convoyeur » et retrouver la fiche intitulée « arrêt de la ligne 3 ».
C’est aussi la moitié cachée d’un projet RAG : la qualité des réponses dépend autant du modèle qui cherche que du modèle qui rédige. Le bon choix quand vos employés perdent du temps à fouiller le serveur partagé; d’un intérêt limité si votre parc documentaire tient dans un classeur.
Vous voulez quoi? La grille de correspondance
Le vocabulaire n’a d’intérêt que s’il mène à une décision. Voici la grille que nous utilisons en cadrage : partez de ce que vous voulez obtenir, le reste suit.
RAG
l’approche par défaut pour interroger le savoir de l’entreprise, sans réentraîner de modèle
Agent
le mot à réserver aux systèmes qui agissent : l’IA prépare, l’humain décide
Local
l’inférence chez vous : vos documents ne quittent jamais l’entreprise
| Vous voulez… | La bonne approche | Ce que ça implique |
|---|---|---|
| Interroger vos procédures, contrats et soumissions en langage naturel | RAG sur un modèle existant | Préparer et indexer les documents; aucun réentraînement du modèle |
| Un ton ou un vocabulaire maison très précis dans chaque texte produit | Réglage fin, en complément du RAG | Constituer des exemples de qualité; refaire l’exercice quand le modèle change |
| Répondre aux questions répétitives des clients sur votre site web | Chatbot branché sur votre contenu (RAG) | Encadrer les sujets couverts; prévoir le relais vers un humain |
| Copier des données d’un système à l’autre, toujours de la même façon | Automatisation classique (RPA), sans IA | Moins cher et plus prévisible; fragile si l’interface change |
| Des livrables complets (soumission, compte rendu, dossier) préparés pour validation | Agent IA sur mesure | Connecter vos systèmes; définir qui valide quoi : l’IA prépare, l’humain décide |
| Garder les données sensibles à l’interne, Loi 25 oblige | Inférence locale sur un modèle à poids ouverts | Un serveur adapté; un choix de modèle selon votre matériel |
| Retrouver un document par son sens, pas par le mot exact | Embeddings et recherche sémantique | Indexer le parc documentaire; entretenir l’index à chaque ajout |
Par où commencer
Choisissez un irritant concret (des soumissions trop lentes, un savoir qui dort dans les courriels, des questions répétitives) et reformulez-le avec les mots de ce lexique : voulez-vous chercher, rédiger, converser ou agir? Cette phrase d’une ligne vaut mieux qu’un long cahier des charges, et elle vous protège des solutions vendues avant le problème.
Chez Cogio, c’est ainsi que démarre chaque cadrage : le besoin d’affaires d’abord, le vocabulaire ensuite, la technique en dernier. Nous concevons des agents sur mesure hébergés chez le client, une forme de cerveau d’entreprise qui prépare le travail pendant que vos gens décident. Si vous voulez valider votre lecture d’un besoin, écrivez-nous : une conversation suffit souvent à reformuler un problème en langage d’IA, et elle n’engage à rien.
Questions fréquentes
Faut-il réentraîner un modèle sur nos données pour qu’il soit utile?
Presque jamais. Le RAG, qui fait consulter vos documents au modèle au moment de répondre, couvre la grande majorité des besoins d’une PME : il se met à jour en continu, cite ses sources et ne modifie pas le modèle. Le réglage fin se réserve aux styles et vocabulaires très spécifiques, et l’entraînement complet n’est pas une option réaliste pour une entreprise.
Un agent IA peut-il prendre des décisions à notre place?
Techniquement, on peut le configurer ainsi; nous le déconseillons. Notre règle de conception est constante : l’agent consulte, croise et prépare, puis un humain valide tout ce qui engage l’entreprise, qu’il s’agisse d’un prix, d’un contrat ou d’une communication à un client. La responsabilité ne se délègue pas à un logiciel.
Qu’est-ce qui cause les hallucinations, et peut-on les éliminer?
Un modèle de langage produit la suite la plus plausible d’un texte, pas la plus vraie. Quand la question dépasse ce qu’on lui a montré, il comble les trous avec du plausible. On ne peut pas éliminer le phénomène, mais on le contient bien : RAG avec citations des sources, périmètre défini, consignes de refus quand l’information manque, et validation humaine en sortie.
La quantification, est-ce une version au rabais du modèle?
C’est une compression, pas une amputation. Elle réduit la précision numérique des paramètres pour que le modèle tienne dans moins de mémoire, avec une perte de qualité généralement marginale sur les usages documentaires d’une entreprise. Pour des tâches très pointues, une quantification moins agressive peut se justifier si le matériel le permet.
RPA ou agent IA : comment trancher pour un processus donné?
Posez une seule question : ce processus exige-t-il de comprendre ou seulement de répéter? Si chaque exécution est identique (mêmes champs, mêmes écrans, mêmes règles), la RPA est plus simple, moins chère et plus prévisible. Dès qu’il faut lire un document variable, juger un cas particulier ou combiner plusieurs sources, l’agent IA devient pertinent.
Les modèles à poids ouverts sont-ils moins bons que les grands modèles commerciaux?
Sur certaines tâches de pointe, les grands modèles commerciaux gardent une avance. Pour les usages courants d’une PME (interroger ses documents, résumer, rédiger, extraire), les meilleurs modèles ouverts livrent une qualité largement suffisante, avec un avantage décisif : ils tournent chez vous, sur votre matériel, sans que vos données voyagent.
Cet article est une synthèse de vulgarisation, à jour à la date indiquée. Il ne constitue pas un avis juridique : pour votre situation particulière, consultez un conseiller juridique ou communiquez avec la Commission d’accès à l’information.
À lire ensuite
Souveraineté
Top 5 des modèles d’IA à héberger chez vous en 2026 : un comparatif honnête
Lire →
Souveraineté
IA locale ou ChatGPT Entreprise : le comparatif honnête pour une PME québécoise
Lire →
Stratégie
Vos données sont-elles prêtes pour l’IA? L’auto-diagnostic en 10 points
Lire →
Une question sur votre propre conformité?
L’appel de qualification est gratuit et dure une demi-heure. Vous repartez avec une lecture honnête de votre situation.
Discutons-en