.png)
L'essentiel à retenir
- Un agent IA n'est pas un modèle d'IA. C'est un assemblage : moteur de raisonnement, mémoire, planification, capacité d'action sur vos systèmes.
- Ce qui change : l'IA générative produit du texte. L'agent IA déclenche des actions réelles.
- Ce que dit la science : architecture stabilisée, mais taux de réussite modestes en conditions réelles — 42 % au mieux.
- La condition de réussite : base documentaire structurée, droits maîtrisés, supervision calibrée.
Votre GPS recalcule l'itinéraire dès qu'un bouchon se forme. Votre messagerie apprend à reconnaître les indésirables. Votre thermostat anticipe votre retour du bureau. Trois objets banals, un même principe : observer, décider, agir — sans vous solliciter à chaque étape.
C'est la définition d'un agent intelligent. Ajoutez-y un grand modèle de langage capable de comprendre vos instructions en langage naturel, et vous obtenez ce que la recherche appelle l'IA agentique. Un état de l'art scientifique publié en septembre 2026, fondé sur 15 études analysées intégralement, qualifie ce basculement de « tournant paradigmatique majeur ».
Qu'est-ce qu'un agent IA ?
Un agent d'intelligence artificielle — aussi appelé agent intelligent — est une entité informatique située dans un environnement, capable de l'observer, de délibérer grâce à un moteur de raisonnement, et d'agir de façon autonome vers un objectif précis (Cheng et al., 2026 ; Li et al., 2024).
Ce n'est pas un modèle. La littérature est catégorique : « un agent IA autonome ne se réduit pas à un modèle de fondation ».
Les quatre propriétés qui définissent un agent
.t1ag-wrapper{font-family:inherit}.t1ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t1ag-t{width:100%;border-collapse:collapse}.t1ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t1ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t1ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t1ag-t tbody td:first-child{font-weight:700}.t1ag-t tbody tr{border-bottom:1px solid #ede9fe}.t1ag-t tbody tr:last-child{border-bottom:none}.t1ag-t tbody tr:hover{background:#faf9ff}
PropriétéDéfinitionAnalogie quotidienneAutonomieOpérer sur de longues séquences sans guidage à chaque étapeUn robot aspirateur qui cartographie et nettoie seulRéactivitéPercevoir les changements et y répondre à tempsUn GPS qui recalcule dès qu'un accident est signaléProactivitéDécomposer un objectif large en sous-objectifsUn assistant qui, pour « organiser une réunion », vérifie les agendas, réserve la salle, envoie les invitationsCapacité socialeCoopérer et échanger avec des humains ou d'autres agentsDes applications qui se coordonnent pour livrer un colis
(Cheng et al., 2026 ; Botti, 2025 ; Molinari & Ciravegna, 2026)
Combinées, ces propriétés produisent une autonomie et une adaptation continues : face à l'imprévu, l'agent réévalue et ajuste son plan. Cette prise de décision autonome le distingue d'un programme classique — et rend sa supervision indispensable.
Les évolutions récentes, du bot à l’agent, 3 niveaux d’autonomie
.t2ag-wrapper{font-family:inherit}.t2ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t2ag-t{width:100%;border-collapse:collapse}.t2ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t2ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t2ag-t thead th:not(:first-child){text-align:center}.t2ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t2ag-t tbody td:first-child{font-weight:700;min-width:160px}.t2ag-t tbody td:not(:first-child){text-align:center}.t2ag-t tbody tr{border-bottom:1px solid #ede9fe}.t2ag-t tbody tr:last-child{border-bottom:none}.t2ag-t tbody tr:hover{background:#faf9ff}
BotAssistant IAAgent IAFonctionnementRéactif — script figéRéactif — répond aux sollicitationsProactif — prend des initiativesAutonomieFaibleMoyenneÉlevéeLangage naturelMots-clés, arbres de décisionNativeNative, avec décomposition d'intentionApprentissageNulPartielContinuExempleFAQ automatisée, serveur vocalCopilot, ChatGPT, agents conversationnels avancésAgent documentaire, agent d'orchestration de processus
Un bot exécute. Un assistant conseille. Un agent IA décide et agit. Le critère qui tranche : peut-il modifier quelque chose dans vos systèmes sans qu'on le lui demande à chaque fois ?
Un débat qu'il faut connaître
Botti (2025) rappelle que l'« IA agentique » réinvestit des concepts formalisés dès les années 1990 — architectures BDI, réactivité, proactivité, protocoles d'accord. Les grands modèles de langage apportent une flexibilité inédite pour interpréter le langage naturel, mais « manquent de garanties déterministes de terminaison et de cohérence logique ».
Pour un décideur : la nouveauté porte sur la souplesse d'usage, pas sur la fiabilité.
Quel est le rôle d'un agent IA ?
Cinq domaines de déploiement dominent la littérature 2024-2026 (Cheng et al., 2026 ; Chowa et al., 2026 ; Molinari & Ciravegna, 2026) : le génie logiciel (résolution de bugs, génération de tests), la recherche scientifique (revues de littérature, génération d'hypothèses), les services financiers et flux de travail d'entreprise (détection de fraude, audit d'acquisitions, orchestration ERP), la simulation sociale (test de politiques publiques) et les agents incarnés (robotique, navigation web).
À quoi ressemblent les agents IA déployés aujourd'hui
.t3ag-wrapper{font-family:inherit}.t3ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t3ag-t{width:100%;border-collapse:collapse}.t3ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t3ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t3ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t3ag-t tbody td:first-child{font-weight:700}.t3ag-t tbody tr{border-bottom:1px solid #ede9fe}.t3ag-t tbody tr:last-child{border-bottom:none}.t3ag-b{display:inline-flex;font-size:12px;font-weight:600;padding:3px 10px;border-radius:8px}.t3ag-h{background:#ecfdf5;color:#065f46;border:1px solid #6ee7b7}.t3ag-m{background:#fffbeb;color:#92400e;border:1px solid #fcd34d}
Famille d'agentsCe qu'ils fontMaturitéAgents de codeCorrigent des bugs, écrivent des tests, revoient du codeÉlevée — cas le plus documentéAgents de support clientTraitent une demande de bout en bout : diagnostic, action, réponseÉlevéeAgents documentairesExtraient, classent, recoupent et contrôlent des documents entrantsÉlevée sur périmètre cadréAgents d'analyse de donnéesInterrogent des bases, produisent des synthèses, détectent des anomaliesMoyenneAgents d'orchestration de processusCoordonnent plusieurs applications métiers sur un flux completMoyenne — dépend des connecteursAgents de rechercheCompilent, comparent et synthétisent des sourcesMoyenne
Le rôle d'un agent IA n'est pas de remplacer le jugement : il absorbe le travail de préparation qui le précède : collecter, extraire, recouper, signaler. Votre expert arrive sur un dossier déjà instruit. Le gain réel se situe là : l'automatisation des tâches complexes mais répétitives, qui mobilisent du temps d'expert sans mobiliser son expertise.
Comment fonctionne un agent d'Intelligence Artificielle ?
Quatre modules interconnectés (Cheng et al., 2026 ; Molinari & Ciravegna, 2026 ; Sarkar & Sarkar, 2025).
1. Le profilage — « qui suis-je ? » Rôle métier, périmètre, contraintes de comportement. Sa fiche de poste, en somme. Un agent « contrôleur de conformité » ne raisonne pas comme un agent « assistant commercial », même adossé au même modèle.
2. La mémoire — « qu'est-ce que je sais ? » Le module le plus sous-estimé, et pourtant décisif. Il se structure en trois couches : la mémoire de travail (état courant, instructions immédiates), la mémoire épisodique et sémantique (expériences passées, connaissances déclaratives — c'est ici qu'intervient le RAG, qui va chercher l'information dans une base documentaire plutôt que dans les paramètres du modèle), et la mémoire procédurale (schémas d'utilisation d'outils, règles métier apprises) (Xu et al., 2026).
Retenez ceci : la mémoire long terme d'un agent, c'est votre fonds documentaire.
Vos contrats, vos procédures, vos dossiers. C'est à ce niveau que votre GED couplée à l'IA devient l'infrastructure de l'agent, et non un simple espace de stockage.
3. Le raisonnement et la planification — « comment j'y arrive ? » Trois approches coexistent : la planification en contexte (chaînes, arbres et graphes de pensée — l'agent explore plusieurs pistes et élague les impasses), la planification symbolique externe (traduction en langage formel PDDL puis résolution par solveur) et les boucles d'autoréflexion (paradigmes ReAct et Reflexion : l'agent diagnostique ses erreurs et ajuste sa trajectoire).
4. L'action et les outils — « j'exécute » Appels d'API, exécution de scripts, interrogation de bases, manipulation d'interfaces. Ce module gère aussi l'intégration de données externes : aller chercher une information dans un système qui n'appartient pas à l'agent. Sans lui, l'agent reste un bavard brillant.
.s1ag-w{font-family:inherit;padding:24px 0}.s1ag-c{max-width:580px;margin:0 auto;padding:20px}.s1ag-g{display:grid;grid-template-areas:". top ." "left center right" ". bottom .";grid-template-columns:1fr 160px 1fr;grid-template-rows:auto 160px auto;gap:16px;align-items:center;justify-items:center}.s1ag-center{grid-area:center;background:#5b21b6;color:#fff;border-radius:50%;width:160px;height:160px;display:flex;flex-direction:column;align-items:center;justify-content:center;text-align:center;font-weight:800;font-size:14px;line-height:1.3;box-shadow:0 4px 20px rgba(91,33,182,.35)}.s1ag-mod{background:#f5f3ff;border:1.5px solid #c4b5fd;border-radius:12px;padding:14px 16px;text-align:center;width:100%}.s1ag-ic{font-size:22px;display:block;margin-bottom:6px}.s1ag-mod h4{font-size:13px;font-weight:700;color:#5b21b6;margin:0 0 4px}.s1ag-mod p{font-size:11px;color:#374151;margin:0;line-height:1.4}.s1ag-top{grid-area:top;width:220px;max-width:100%}.s1ag-right{grid-area:right}.s1ag-bottom{grid-area:bottom}.s1ag-left{grid-area:left}
🎯
Profilage
Rôle, périmètre, contraintes comportementales
⚙️
Raisonnement & Planification
Décomposition, chaînes de pensée, autoréflexion
🤖Agent IA
🧠
Mémoire
Travail, épisodique, sémantique, procédurale
🔧
Action & Outils
API, scripts, bases de données, interfaces
La formule scientifique, en clair
Cheng et al. (2026) formalisent l'agent en un quintuplet : V = (L, O, M, A, R)
.t4ag-wrapper{font-family:inherit}.t4ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t4ag-t{width:100%;border-collapse:collapse}.t4ag-t thead tr{background:#f5f3ff}.t4ag-t thead th{color:#5b21b6;font-size:22px;font-weight:800;padding:18px 12px;text-align:center;border-right:1px solid #7c3aed}.t4ag-t thead th:last-child{border-right:none}.t4ag-t tbody td{color:#111827;font-size:14px;padding:16px 12px;text-align:center;vertical-align:top;border-right:1px solid #ede9fe;line-height:1.5}.t4ag-t tbody td:last-child{border-right:none}
LOMARMoteur de raisonnementMission assignéeCe qu'il sait et retientOutils disponiblesCapacité à se corriger
Retirez un seul élément : vous n'avez plus un agent, vous avez un chatbot.
Quels sont les différents types d'agents IA ?
Deux grilles complémentaires : la topologie de contrôle et le degré d'autonomie.
Mono-agent ou systèmes multi-agents ?
L'architecture mono-agent résout tout dans une boucle unique — communication minimale, mais saturation du contexte et confusion des rôles sur les problèmes complexes. Les systèmes multi-agents répartissent le travail entre agents spécialisés selon trois modèles (Mohamed et al., 2026) :
.t5ag-wrapper{font-family:inherit}.t5ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t5ag-t{width:100%;border-collapse:collapse}.t5ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t5ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t5ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t5ag-t tbody td:first-child{font-weight:700}.t5ag-t tbody tr{border-bottom:1px solid #ede9fe}.t5ag-t tbody tr:last-child{border-bottom:none}
ModèlePrincipeAnalogieHiérarchiqueUn planificateur décompose et délègueUn chef de projet qui répartit le travailPair-à-pairLes agents débattent jusqu'à convergenceUn comité qui délibère avant de trancherPar rôles fonctionnelsChaque agent incarne une spécialitéUne équipe pluridisciplinaire
Ces architectures permettent des flux de travail autonomes de bout en bout — au prix d'une complexité de coordination qui croît vite.
.s2ag-w{font-family:inherit}.s2ag-g{display:flex;flex-wrap:wrap;gap:16px}.s2ag-card{flex:1 1 180px;background:#f5f3ff;border:1.5px solid #c4b5fd;border-radius:12px;padding:20px}.s2ag-card h4{font-size:15px;font-weight:700;color:#111827;margin:12px 0 6px}.s2ag-card p{font-size:13px;color:#374151;line-height:1.5;margin:0 0 10px}.s2ag-tag{font-size:11px;font-weight:700;color:#5b21b6}.s2ag-hi{display:flex;flex-direction:column;align-items:center;gap:4px;margin-bottom:12px}.s2ag-nd{background:#5b21b6;color:#fff;border-radius:6px;padding:4px 10px;font-size:11px;font-weight:700}.s2ag-ns{background:#c4b5fd;color:#5b21b6;border-radius:6px;padding:3px 8px;font-size:10px;font-weight:600}.s2ag-arr{font-size:14px;color:#7c3aed;line-height:1}.s2ag-row{display:flex;gap:6px;justify-content:center}.s2ag-mesh{display:flex;align-items:center;justify-content:center;gap:8px;margin-bottom:12px}.s2ag-dot{background:#5b21b6;width:28px;height:28px;border-radius:50%;display:flex;align-items:center;justify-content:center;color:#fff;font-size:10px;font-weight:700}.s2ag-lk{font-size:12px;color:#a78bfa}.s2ag-roles{display:flex;gap:6px;margin-bottom:12px;flex-wrap:wrap;justify-content:center}.s2ag-role{background:#fff;border:1.5px solid #c4b5fd;border-radius:8px;padding:4px 8px;font-size:10px;font-weight:700;color:#5b21b6}.s2ag-hi,.s2ag-mesh,.s2ag-roles{min-height:84px;}
Orchestrateur
↓
Agent A
Agent B
Agent C
Hiérarchique
Un planificateur central décompose et délègue.
Chef de projet → équipe
A
⇄
B
⇄
C
Pair-à-pair
Tous les agents débattent et convergent sans leader fixe.
Comité qui délibère
📋 Analyste✍️ Rédacteur🔍 Vérificateur📊 Rapport
Par rôles fonctionnels
Chaque agent incarne une spécialité.
Équipe pluridisciplinaire
Les cinq niveaux d'autonomie
La grille la plus utile pour un décideur pour choisir ce que vous déléguez et combien de supervision humaine vous budgétez. Su et al. (2026) découpe cette grille en 5 paliers.
.t6ag-wrapper{font-family:inherit}.t6ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t6ag-t{width:100%;border-collapse:collapse}.t6ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t6ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t6ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t6ag-t tbody td:first-child{font-weight:700;white-space:nowrap}.t6ag-t tbody tr{border-bottom:1px solid #ede9fe}.t6ag-t tbody tr:last-child{border-bottom:none}.t6ag-b{display:inline-flex;font-size:12px;font-weight:600;padding:3px 9px;border-radius:6px}.t6ag-r{background:#fef2f2;color:#991b1b;border:1px solid #fca5a5}.t6ag-o{background:#fffbeb;color:#92400e;border:1px solid #fcd34d}.t6ag-bl{background:#dbeafe;color:#1e40af;border:1px solid #93c5fd}.t6ag-p{background:#f5f3ff;color:#5b21b6;border:1px solid #c4b5fd}.t6ag-g{background:#f9fafb;color:#374151;border:1px solid #d1d5db}
NiveauNature de l'agentSupervision humaineL1 — PartielleAgent-outil déterministe, instructions isoléesTotaleL2 — ConditionnelleAgent-consultant, contexte courtSystématiqueL3 — HauteAgent-collaborateur, boucles complètesPar échantillonnageL4 — Quasi-totaleAgent réflexif, redéfinit ses sous-objectifsExceptionnelleL5 — TotaleAutonome sur horizon indéterminéThéorique
Point d'alerte : le passage de L2/L3 vers L4/L5 entraîne « un changement qualitatif de la surface de risque ». Pas une progression linéaire. Un seuil.
Notre lecture : pour la majorité des cas d'usage métiers, L2 et L3 suffisent et restent maîtrisables. La question n'est pas de viser le niveau le plus élevé, mais le niveau juste.
Comment créer et déployer un agent IA ?
Étape 1 — Formuler un objectif vérifiable
C'est ici que la plupart des projets se jouent. Dantas et al. (2026) identifient un goulot d'étranglement de la spécification : quand on traduit une intention en langage naturel vers une spécification formelle, la validité syntaxique dépasse 96 %, mais la correction sémantique réelle plafonne entre 24,8 % et 35,1 %. Les auteurs parlent d'un « risque critique d'assurance fallacieuse ». Vous croyez avoir été compris. Vous ne l'avez pas été.
Écrivez donc un objectif qu'un tiers pourrait vérifier sans vous :
❌ « Automatiser la gestion des factures »
✅ « Extraire le numéro, le montant HT, la date d'échéance et le fournisseur de chaque facture PDF reçue sur compta@, puis signaler tout doublon sur les 90 derniers jours »
Étape 2 — Structurer la mémoire avant l'intelligence
He et al. (2025) documentent l'empoisonnement des connaissances (Knowledge Poisoning) : l'altération des documents ingérés dans les bases RAG pour biaiser la délibération de l'agent. Branchez votre agent sur un fonds désordonné, et le résultat ne sera pas approximatif. Il sera faux, avec assurance.
La structuration documentaire est donc un préalable non négociable. Chez Efalia, trois profondeurs de connexion entre votre gestion documentaire et vos agents :
.t7ag-wrapper{font-family:inherit}.t7ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t7ag-t{width:100%;border-collapse:collapse}.t7ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t7ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t7ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t7ag-t tbody td:first-child{font-weight:700;white-space:nowrap}.t7ag-t tbody tr{border-bottom:1px solid #ede9fe}.t7ag-t tbody tr:last-child{border-bottom:none}
NiveauCe que fait l'agentQuand l'activerInstant MemoryLit un ou quelques documents à la demande, sans indexation préalableUsage ponctuel : résumer un contrat, extraire des clauses, comparer deux devisSemantic MemoryExplore un corpus pré-indexé par recherche sémantiqueCorpus volumineux et stable : procédures, FAQ interne, helpdeskEntity MemoryExtrait et structure les entités métier (montants, échéances, clauses, acteurs)Décisions sans approximation tolérable : appels d'offres, conformité, veille contractuelle
Instant lit. Semantic explore. Entity raisonne. Trois profondeurs pour trois besoins — parce que vos cas d'usage sont graduels.
Étape 3 — Normaliser les connexions via des protocoles ouverts
Recommandation explicite de l'état de l'art : standardiser les interfaces agents-outils via le Model Context Protocol (MCP). Sarkar & Sarkar (2025) montrent qu'il résout le verrou d'intégration N × M et fait chuter la complexité des liens de O(N²) à O(N).
Pour un DSI : moins de connecteurs propriétaires, moins de dette d'intégration, pas de dépendance à un fournisseur unique. Notre article détaille comment transformer votre entreprise avec un système de gestion de documents réellement compatible avec l'IA agentique.
Étape 4 — Choisir une plateforme et calibrer les droits
L'environnement d'exécution : DUST, Microsoft Copilot Studio, Google Agentspace, IBM watsonx Orchestrate. Efalia s'y intègre via MCP.
Reste le sujet qu'on traite toujours trop tard : les droits d'accès. He et al. (2025) décrivent la manipulation fonctionnelle — l'exploitation des droits d'un agent pour exécuter des actions surprivilégiées, jusqu'à l'exfiltration de données vers des serveurs tiers. Notre réponse est structurelle : les droits utilisateurs définis dans la GED sont propagés à l'agent. Agissant pour le compte d'un collaborateur, il n'accède qu'à ce que ce collaborateur peut légitimement consulter.
Étape 5 — Tester l'agent avant de lui faire confiance
Une démo réussie ne prouve rien. Ce qui compte, c'est le comportement sur des tâches réelles : longues, outillées, sous contrainte de délai.
Froger et al. (2026) l'ont mesuré avec le benchmark GAIA-2 — 1 120 scénarios, 12 applications, 101 outils. Réussite du premier coup (Pass@1) :
.t8ag-wrapper{font-family:inherit;max-width:500px}.t8ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t8ag-t{width:100%;border-collapse:collapse}.t8ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t8ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t8ag-t thead th:last-child{text-align:right}.t8ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5}.t8ag-t tbody td:first-child{font-weight:700}.t8ag-t tbody td:last-child{text-align:right}.t8ag-t tbody tr{border-bottom:1px solid #ede9fe}.t8ag-t tbody tr:last-child{border-bottom:none}.t8ag-sc{font-size:18px;font-weight:800;color:#5b21b6;display:block}.t8ag-bw{width:100%;background:#ede9fe;border-radius:4px;height:5px;margin-top:5px}.t8ag-br{height:5px;border-radius:4px;background:#7c3aed}
ModèleRéussiteGPT-542,1 %██████████░░░░░░░░░░░░░░░Claude-4 Sonnet Thinking37,8 %█████████░░░░░░░░░░░░░░░░Kimi-K220,1 %█████░░░░░░░░░░░░░░░░░░░░
Les meilleurs modèles échouent sur plus d'une tâche sur deux. Raison de plus pour cadrer, tester et superviser. Deux enseignements en découlent.
1. Ne choisissez pas (forcément) le modèle le plus intelligent. GAIA-2 observe une « mise à l'échelle inverse sur le temps » : ceux qui raisonnent le plus longtemps échouent dès qu'un délai s'applique. Brillants, mais trop tard. Arbitrez par tâche — rapidité pour l'extraction et le tri, profondeur pour l'analyse d'un contrat.
2. Faites vérifier les étapes, pas le résultat. Faire noter un agent par un autre modèle n'atteint que 0,52 de précision. La vérification causale des actions réellement exécutées: 0,99. Un modèle-juge évalue un récit, pas un fait.
Dès le pilote :
- ☐ Journaliser chaque appel d'outil : lequel, quels paramètres, quel retour.
- ☐ Comparer l'état de vos systèmes avant / après, pas le texte de l'agent.
- ☐ Rejouer les échecs pour situer l'étape qui a dévié.
Ne demandez pas à une IA si votre agent a bien travaillé. Vérifiez ce qu'il a modifié.
Risques et points d'attention
Le basculement du risque
Une hallucination de modèle classique produit « une simple inexactitude textuelle dans une fenêtre de chat ». Une hallucination d'agent « se traduit directement par des actions matérielles destructrices, persistantes et irréversibles dans des bases de données, des environnements cloud ou des systèmes cyber-physiques » (Su et al., 2026).
Ce n'est plus un problème de qualité rédactionnelle. C'est un problème d'intégrité de votre système d'information.
Les cinq familles d'hallucinations
Lin et al. (2025) établissent la première taxonomie systématique : 5 catégories, 18 causes racines.
.t9ag-wrapper{font-family:inherit}.t9ag-tw{border:1.5px solid #c4b5fd;border-radius:12px;overflow:hidden}.t9ag-t{width:100%;border-collapse:collapse}.t9ag-t thead tr{background:#f5f3ff;border-bottom:1.5px solid #c4b5fd}.t9ag-t thead th{color:#5b21b6;font-size:11px;font-weight:700;letter-spacing:.08em;text-transform:uppercase;padding:14px 20px;text-align:left}.t9ag-t tbody td{color:#111827;font-size:15px;padding:14px 20px;line-height:1.5;vertical-align:top}.t9ag-t tbody td:first-child{font-weight:700}.t9ag-t tbody tr{border-bottom:1px solid #ede9fe}.t9ag-t tbody tr:last-child{border-bottom:none}
FamilleManifestationRaisonnementMauvaise interprétation du but, décomposition défaillanteExécutionInvocation d'outils inexistants, paramètres fabriquésPerceptionErreurs d'ancrage visuel, fusion sensorielle contradictoireMémorisationExtraction vectorielle tronquée, déformation des historiquesCommunicationPropagation de messages faux en réseau multi-agents, effet cascade
À cela s'ajoute la dérive d'agent (Xu et al., 2026) : sur une trajectoire longue, une imprécision initiale se propage et transforme les outils suivants en « mandataires confus exécutant des actions aberrantes mais syntaxiquement valides ». Le piège : tout semble fonctionner. Les appels sont valides, aucune erreur ne remonte. Le résultat est faux.
Sécurité : L’IA n’est pas encore très sûre
1. Les agents restent peu fiables en sécurité. Leur score de sécurité global est inférieur à 60 % en moyenne, certains passant sous les 20 %. Et quand ils utilisent des outils, ils ne respectent les règles de sécurité qu'environ une fois sur trois (38,5 %) (He et al., 2025).
2. Ils sont faciles à manipuler. C'est le principe de l'injection de prompt : une instruction malveillante est dissimulée dans un document, la description d'un outil ou un message que l'agent va lire. Weng et al. (2026) en recensent six points d'entrée possibles. Et les consignes du type « ignore les instructions suspectes » n'y changent presque rien : plus d'une attaque sur trois passe quand même.
3. La solution passe par l'architecture, pas par les consignes. Ce qui marche, c'est de tracer l'origine de chaque information. Le framework ARGUS tient une sorte d'arbre généalogique des actions de l'agent : « cette action vient de telle demande de l'utilisateur », « ce paramètre vient d'un document extérieur non vérifié ». Si une action sensible s'appuie sur une source douteuse, elle est bloquée.
Résultat : les attaques réussies passent de 28,8 % à 3,8 %. Et l'agent reste utile dans 87,5 % des cas — il perd un peu en efficacité, mais peu.
L'analogie : dire à un stagiaire « ne te fais pas avoir par les faux mails » ne suffit pas. Mieux vaut une règle simple — tout virement doit être rattaché à une demande signée de son manager. On ne compte plus sur sa vigilance. On vérifie d'où vient l'ordre.
Bloquer ne suffit pas, il faut guider
Le réflexe paraît sain : installer un filtre qui intercepte les actions dangereuses. Dantas et al. (2026) l'ont testé. Le filtre fonctionne — il bloque jusqu'à 94 % des actions à risque. Mais la tâche n'est menée à bien que dans moins de 5 % des cas.
Que se passe-t-il ? L'agent reçoit un refus sec, sans explication ni solution de repli. Alors il improvise. Il tente un autre chemin, souvent moins sûr, ou tourne en boucle jusqu'à l'échec.
Pensez à un guichet qui répond « ce n'est pas possible » sans jamais dire pourquoi ni vers qui vous orienter. Vous finirez par contourner.
Un garde-fou utile fait donc trois choses :
- ☐ Il indique pourquoi l'action est refusée.
- ☐ Il propose une alternative acceptable.
- ☐ Il remonte à un humain quand aucune voie ne convient.
La question de la souveraineté
Faut-il confier ses documents à un grand modèle américain pour obtenir un agent efficace ? Non.
Chowa et al. (2026) ont croisé 108 études et 68 jeux de données publics. Leur constat : des modèles ouverts de taille intermédiaire (7 à 70 milliards de paramètres), affinés sur votre domaine et branchés sur votre base documentaire, atteignent 60 % à 95 % des performances de GPT-4 — pour un coût d'inférence bien plus faible, sans que vos données quittent votre infrastructure.
Sur un périmètre ciblé — factures, contrats, dossiers RH — cet écart de performance ne se voit pas dans le résultat final.
C'est la logique de notre architecture : interopérabilité avec les principaux moteurs (Claude, GPT, Gemini, Mistral), déploiement on-premise ou en cloud souverain, aucune copie de vos documents vers un service tiers. Notre article sur comment l'IA améliore la gestion documentaire en entreprise détaille cette approche.
Conclusion
Les agents IA ne sont ni une promesse marketing, ni une révolution accomplie. Des systèmes documentés, à l'architecture stabilisée — et aux limites précisément mesurées.
L'agent n'est pas le modèle. Un projet qui se résume au choix d'un LLM ignore les trois quarts de l'architecture. Or c'est la mémoire — vos documents structurés — qui détermine la qualité du résultat.
L'autonomie maximale n'est pas l'objectif. L2 et L3 couvrent l'essentiel des besoins métiers avec une surface de risque maîtrisable.
La sécurité se conçoit en amont. Les défenses textuelles échouent, les blocages aveugles dégradent le taux de réussite. Ce qui fonctionne : droits propagés depuis la source, traçabilité causale, replanification guidée.
D'où notre recommandation constante : commencez par structurer, pas par automatiser. Une GED bien organisée, des droits clairs, un objectif vérifiable — et votre premier agent peut être opérationnel en quelques jours.
👉 Vous voulez évaluer votre maturité documentaire avant de déployer un agent IA ? Découvrez notre plateforme GED IA sur efalia.com/start-ia.
Questions fréquentes
Quelle est la différence entre un agent IA et un assistant IA ?
Un assistant IA répond à vos sollicitations : vous demandez, il produit. Un agent IA poursuit un objectif et agit de sa propre initiative — il enchaîne plusieurs étapes, appelle des outils et modifie des données sans validation à chaque geste. L'assistant propose, l'agent exécute.
Quelle est la différence entre un agent IA et un LLM ?
Le modèle de langage produit du texte ; l'agent s'en sert comme moteur de raisonnement. Autour, il faut encore un profil de rôle, une mémoire structurée, un module de planification et des outils pour agir. le quintuplet V = (L, O, M, A, R) (Cheng et al., 2026).
Quels sont les exemples d'agents IA les plus répandus aujourd'hui ?
Les familles les plus matures : agents de code (correction de bugs, génération de tests), agents de support client (traitement d'une demande de bout en bout) et agents documentaires (extraction, classement, contrôle). Viennent ensuite les agents d'analyse de données et d'orchestration de processus, dont la maturité dépend des connecteurs disponibles.
Un agent IA peut-il fonctionner sans base documentaire structurée ?
Techniquement oui, mais le risque est documenté. He et al. (2025) décrivent l'empoisonnement des connaissances : des documents mal contrôlés biaisent directement la délibération de l'agent. La qualité de votre base documentaire plafonne la fiabilité de l'agent — quel que soit le modèle choisi.
Quel niveau d'autonomie choisir pour un premier projet ?
L2 ou L3 de la taxonomie de Su et al. (2026) : agent-consultant avec validation humaine, ou agent-collaborateur avec supervision par échantillonnage. Le passage aux niveaux supérieurs entraîne un changement qualitatif — et non progressif — de la surface de risque.
Faut-il des compétences techniques pour créer un agent IA ?
Les plateformes agentiques actuelles permettent de configurer un agent sans développement. La compétence déterminante est ailleurs : formuler un objectif sémantiquement vérifiable. Dantas et al. (2026) mesurent que cette traduction ne réussit que dans 24,8 % à 35,1 % des cas.
Comment savoir si mon agent IA fonctionne correctement ?
Surtout pas en demandant à une IA de l’évaluer : Froger et al. (2026) mesurent une précision de 0,52 pour cette méthode, contre 0,99 en contrôlant directement les écritures produites. Auditez les modifications réelles dans vos bases, vos fichiers, vos tickets. Pas la qualité apparente des réponses.
Les agents IA sont-ils compatibles avec le RGPD et la souveraineté des données ?
Cela dépend de l'architecture. Un agent qui transmet vos documents hors UE relève des règles de transfert du RGPD. Chowa et al. (2026) établissent que des modèles ouverts atteignent 60 % à 95 % des performances des modèles propriétaires : un déploiement souverain n'implique pas de renoncer à la performance.
Sources
Revue de littérature : État de l'Art Scientifique 2026 sur les Agents d'Intelligence Artificielle, 17 septembre 2026. Corpus : 220 enregistrements → 148 après déduplication → 21 retenus, dont 15 études analysées sur texte intégral.
- Botti, V. (2025). Agentic AI and Multiagentic: Are We Reinventing the Wheel? arXiv:2506.01463
- Cheng, Y., et al. (2026). Exploring LLM-Based Intelligent Agents. WIREs DMKD. doi:10.1002/widm.70111
- Chowa, S. S., et al. (2026). From language to action. Artificial Intelligence Review. doi:10.1007/s10462-025-11471-9
- Dantas, P., et al. (2026). Toward Safe LLM Agents. arXiv:2608.14590
- Froger, R., Andrews, P., & Bettini, M. (2026). GAIA-2. ICLR 2026
- He, F., et al. (2025). The Emerged Security and Privacy of LLM Agent. ACM CSUR. doi:10.1145/3773080
- Li, X., et al. (2024). A survey on LLM-based multi-agent systems. Vicinagearth. doi:10.1007/s44336-024-00009-2
- Lin, X., et al. (2025). LLM-Based Agents Suffer from Hallucinations. arXiv:2509.18970
- Mohamed, N., et al. (2026). A Systematic Survey of LLM-Based Agentic AI Frameworks. JSSA. doi:10.66279/y29vex64
- Molinari, G., & Ciravegna, F. (2026). Towards Pervasive Distributed Agentic Generative AI. ACM CSUR. doi:10.1145/3821566
- Sarkar, A., & Sarkar, S. (2025). Survey of LLM Agent Communication with MCP. arXiv:2506.05364
- Su, H., et al. (2026). Autonomy-Induced Security Risks in Large Model-Based Agents. IEEE TDSC. doi:10.1109/TDSC.2026.11498611
- Weng, S., et al. (2026). ARGUS. arXiv:2605.03378
- Xu, H., et al. (2026). The Evolution of Tool Use in LLM Agents. arXiv:2603.22862
- Yang, Y., et al. (2026). AgentNet. NeurIPS
