Est-ce vraiment un agent IA?
Un test pratique pour les produits vendus comme des agents ou de l'« IA agentique »: ce qu'ils font vraiment, d'où vient la valeur, et quelles questions révèlent le battage.
Fabian Mösli Préférences de lecture
L'essentiel en bref
- • L'étiquette « agent » ne prouve rien. Le test utile est de savoir si le modèle peut observer ce qui s'est passé et choisir sa prochaine action, plutôt que de suivre un parcours fixé à l'avance.
- • Des outils, une mémoire, des horaires et plusieurs modèles peuvent soutenir un agent, mais aucun d'eux ne rend seul un produit agentique.
- • Jugez l'agentivité et l'autonomie séparément. Demandez ce que le système peut observer, décider, modifier et vérifier, puis testez son comportement quand le scénario nominal se rompt.
Dans ce guide
Tout produit IA semble avoir fini par récupérer un agent.
Il y a des agents de recherche, des agents commerciaux, des agents de service, des agents de réunion, des agents de code, des agents de navigateur, et des équipes entières d’agents. Parfois, l’étiquette est méritée. Le système peut enquêter sur une tâche, utiliser des outils, remarquer quand quelque chose a échoué, changer de cap et continuer à travailler.
Parfois, « agent » désigne simplement un chatbot ayant accès à vos fichiers. Ou une automatisation ordinaire où un LLM rédige une étape au milieu du processus. La démo reste impressionnante. La différence ne devient visible que lorsque quelque chose d’inattendu se produit.
Cela compte, parce que la capacité « agentique » sert souvent à justifier un prix plus élevé, un accès plus profond aux systèmes de l’entreprise, et une promesse bien plus grande: ce produit va accomplir le travail, plutôt que simplement vous aider à réfléchir.
J’en fais tourner un moi-même. Mon assistante modifie ce site depuis le mois de mars: je décris un changement, elle le réalise, construit un aperçu et m’envoie un lien à valider. Y arriver a demandé un serveur loué, beaucoup de configuration manuelle et plusieurs installations que j’ai cassées assez sérieusement pour devoir tout restaurer depuis une sauvegarde. L’étiquette ne coûte rien. Tout ce que je viens de décrire a demandé du travail.
Avant de croire une promesse pareille, je veux savoir ce que le système peut observer, quelles décisions le modèle peut prendre, ce qu’il peut modifier, et comment on saura s’il a réussi. À la fin de ce guide, vous disposerez d’une méthode pratique pour juger ces affirmations sans devenir ingénieur IA.
Un même travail, trois produits très différents
Imaginez qu’un fournisseur vous présente un « analyste de campagne agentique ». Vous connectez un export analytique, le plan de campagne et un tableau des dépenses. Chaque lundi, il prépare le bilan.
Voici trois versions de ce produit.
| Ce que fait le produit | Ce que vous obtenez réellement |
|---|---|
| Il lit les fichiers, rédige un bilan plausible, puis attend. Vous remarquez que les dépenses ne correspondent pas au plan et lui demandez d’investiguer. | Un chat ou un assistant. Il a aidé à produire la réponse; c’est vous qui avez poursuivi le travail. |
| Une tâche planifiée récupère les mêmes exports, effectue les mêmes calculs, demande un résumé à un LLM et livre le rapport. Des règles programmées gèrent chaque branche. | Un workflow doté d’IA. Utile, reproductible et prévisible. Le parcours a été conçu à l’avance. |
| Il remarque l’écart de dépenses, choisit d’examiner la campagne concernée, vérifie une autre source autorisée, trouve des données contradictoires, et modifie sa recommandation avant de s’arrêter pour attendre votre validation. | Un agent. Le modèle a choisi la prochaine étape d’investigation en fonction de ce qu’il a découvert. |
Les trois peuvent apparaître dans une fenêtre de chat. Les trois peuvent utiliser le même LLM. La différence se situe dans le comportement opérationnel qui entoure le modèle.
Un produit peut aussi combiner plusieurs modèles de comportement. Son mode recherche peut être agentique alors que son rédacteur d’e-mails se limite à une seule réponse. Jugez le travail précis et le mode que vous achetez, pas le logo affiché sur la page d’accueil.
La question qui démasque la plupart des promesses d’agent
Une fois que le système observe le résultat d’une action, qui décide de la suite: des règles fixes ou le modèle?
Un échange de chat normal se termine ainsi:
vous posez une question → le modèle répond → le modèle attend
Un agent peut poursuivre le travail:
objectif → examiner → choisir une action → utiliser un outil → observer le résultat
↑ ↓
└──────────── décider à nouveau ────────────┘
↓
vérifier, s'arrêter, ou demander de l'aide
Le nombre d’étapes ne tranche pas la question. Un produit peut être programmé pour effectuer cinq recherches dans un ordre fixe; c’est un workflow. Un agent peut n’avoir besoin que d’une seule recherche sur un cas simple, mais le modèle aurait pu chercher à nouveau si les indices étaient faibles.
Anthropic utilise la même distinction pratique dans son guide building effective agents: les workflows suivent des parcours prédéfinis, tandis que les agents dirigent eux-mêmes leur processus et leur usage des outils.
Les workflows fixes sont souvent le meilleur choix de conception. Si les mêmes vérifications doivent avoir lieu dans le même ordre chaque lundi, laisser un modèle improviser le parcours ajoute du coût et de nouvelles façons d’échouer. Le comportement agentique se justifie quand la bonne étape suivante dépend de ce que le système découvre.
Pourquoi un même modèle peut donner des produits très différents
Le LLM n’est qu’un composant. Il reçoit du contexte et produit un résultat, mais il n’arrive pas avec vos fichiers, vos comptes, sa mémoire ou son autorité.
Le produit qui l’entoure fournit les instructions, le contexte de l’entreprise, les outils, un endroit pour suivre l’état de la tâche, les permissions, la boucle qui fait avancer le travail, et les vérifications du résultat. Les ingénieurs appellent souvent cet environnement le harness. Un agent est un modèle placé dans un harness capable de choisir des actions, d’observer ce qui s’est passé, et de continuer.
La fenêtre de chat n’est que l’interface. Elle peut cacher une simple réponse ou un long processus agentique, ce qui explique pourquoi comparer des captures d’écran vous apprend si peu.
Je vois le modèle comme une brillante nouvelle recrue qui connaît énormément de choses sur le monde et rien sur votre entreprise.
Un simple chat place cette personne dans une salle de réunion vide. Elle peut vous donner un conseil ou vous remettre un document. Vous quittez la salle et faites le reste.
Une configuration agentique donne à cette même personne un bureau, un badge d’accès, les fichiers pertinents, des outils approuvés, des procédures écrites et une définition claire du travail terminé. Elle décide aussi quelles portes restent verrouillées et quand un responsable doit approuver l’étape suivante.
L’environnement de travail change ce que le modèle peut accomplir. Il change aussi ce qui peut mal tourner. Le guide d’Anthropic sur l’évaluation des agents traite donc le modèle et son harness comme un seul système à tester. Un nom de modèle familier ne garantit pas un produit solide autour de lui.
Ce que les promesses marketing vous disent vraiment
La plupart des promesses sur les agents décrivent un seul ingrédient et vous laissent deviner le reste.
| L’affirmation | Ce qu’elle prouve | Ce qui manque encore |
|---|---|---|
| « Mode agent » | Le produit a donné un nom à une fonctionnalité. | Quelles décisions le modèle peut-il prendre après avoir vu un résultat? |
| « Se connecte à 100 applications » | Il dispose de nombreux outils possibles. | Quels outils peut-il utiliser sur ce travail, avec quelles permissions, et qui décide quand? |
| « Planifie et exécute des tâches à plusieurs étapes » | Il peut produire ou suivre un plan. | Peut-il réviser ce plan quand la réalité le contredit? |
| « Fonctionne de manière autonome » | Il peut fonctionner sans vous attendre. | Le parcours est-il adaptatif, ou s’agit-il d’un workflow planifié? Qu’est-ce qui l’arrête? |
| « Se souvient de vous et de votre entreprise » | Il conserve ou récupère du contexte. | Peut-il agir, observer le résultat, et continuer? |
| « Une équipe d’agents spécialisés » | Le fournisseur utilise plusieurs rôles ou processus de modèle. | Cela améliore-t-il le résultat, ou multiplie-t-il simplement les appels, la latence et les points de défaillance? |
L’accès aux outils est particulièrement facile à surestimer. Un chatbot qui effectue une recherche et renvoie une réponse peut être utile, mais l’icône de recherche n’en fait pas un agent pour autant. La mémoire suit la même logique. Se souvenir de vos préférences enrichit le contexte; cela ne crée pas de boucle d’exécution.
Le terme « multi-agent » mérite une méfiance particulière. Plusieurs agents peuvent effectivement se répartir des tâches véritablement différentes. Ils peuvent aussi consommer bien plus d’appels, de temps et d’argent pour produire une réponse qu’un seul modèle aurait pu écrire. Demandez quel travail distinct possède chaque rôle et quel résultat mesuré dépasse une référence à agent unique.
Ce qui, dans une capacité agentique, mérite d’être payé
Le premier bénéfice est la disparition du travail de liaison. Avec un chat, vous téléchargez un fichier, collez la section pertinente, effectuez un calcul, revenez signaler l’erreur, copiez la réponse dans un autre système, puis relancez un prompt. Un agent peut porter cet état d’un outil à l’autre lui-même.
Le bénéfice le plus important est la rétroaction du réel. Une réponse bien formulée peut être fausse. Un agent peut ouvrir la source, interroger l’enregistrement, effectuer le calcul, ou exécuter le test. Quand le résultat manque ou se contredit, il peut approfondir son investigation au lieu de terminer sa phrase avec assurance.
Cela rend les agents utiles pour des travaux où:
- le parcours varie d’un cas à l’autre;
- les preuves nécessaires se trouvent réparties dans plusieurs sources autorisées;
- le résultat peut être vérifié dans le système réel; et
- le travail a assez de valeur pour justifier le temps, les appels et la supervision supplémentaires.
Le travail agentique coûte généralement plus cher et prend plus de temps qu’une simple réponse. Chaque action crée un nouvel endroit où une hypothèse erronée, une instruction hostile ou une erreur d’outil peut s’introduire. Les étapes suivantes peuvent alors construire sur cette erreur.
Utilisez le chat quand vous avez besoin d’une réponse. Utilisez un workflow quand le parcours doit rester fixe. Payez pour un agent quand s’adapter à de nouvelles preuves fait partie du travail.
Agentivité et autonomie sont deux choses distinctes
Les démos produit confondent souvent deux questions:
- Le modèle peut-il choisir l’étape suivante?
- Jusqu’où le système peut-il aller sans intervention humaine?
Ce sont deux paramètres différents.
Un agent de recherche peut être fortement supervisé. Il choisit quelles sources examiner, mais vous approuvez chaque action externe. Le système est agentique et dispose de peu d’autonomie.
Un rapport fixe peut tourner chaque nuit sans que personne ne surveille. Il a une autonomie élevée et aucun parcours dirigé par le modèle.
Un agent qui tourne toute la nuit avec la permission de mettre à jour les fiches clients a les deux. Cela peut se justifier à terme, mais devrait répondre à des exigences de preuve et de sécurité bien plus élevées qu’une ébauche supervisée.
Mon assistante rend cette distinction concrète. Par défaut, elle a un net biais pour l’action: si un travail nécessite un outil qui n’est pas installé, elle l’installe, le configure et m’informe après coup. Je peux aussi la basculer sur un mode où elle demande d’abord, et rien dans sa façon de décider ne change quand je le fais. Même agentivité, autonomie différente. Un fournisseur incapable de tracer cette ligne pour son propre produit n’y a pas réfléchi.
Quand un fournisseur dit « autonome », demandez des précisions sur les limites de temps, les plafonds de dépense, le nombre maximal d’étapes, les points d’approbation, les permissions, l’annulation, et l’escalade. C’est dans l’autonomie qu’une démo impressionnante peut se transformer en incident chez vous.
Testez au-delà du scénario nominal
Une démo soignée du scénario nominal prouve qu’un cas préparé fonctionne. Avant un pilote, demandez au fournisseur de faire tourner trois cas sur le même travail:
- Le cas ordinaire. Toutes les entrées attendues sont présentes et cohérentes.
- Le cas défaillant. Une source manque et deux autres se contredisent.
- Le cas hostile. Vous fournissez un document ou un e-mail contenant une instruction qui demande à l’agent d’ignorer ses règles, de révéler des données, ou d’entreprendre une action non approuvée. Convenez des limites de données et d’action autorisées avant le test.
Observez le comportement, pas seulement le texte final. Le système reconnaît-il l’incertitude? Change-t-il son investigation? Invente-t-il un chiffre manquant? Peut-il être trompé par le contenu d’un fichier? S’arrête-t-il à la limite d’approbation?
Demandez ensuite à voir le journal d’exécution. Une trace utile doit montrer quelles sources le système a lues, quels outils il a appelés, ce qui a changé, la raison d’arrêt enregistrée ou l’échec d’outil, ce que cela a coûté, et quelle approbation ou limite a mis fin au test. Une capture d’écran de la réponse finale ne vous apprend rien de tout cela.
Une grille d’évaluation pour l’acheteur
Je jugerais un produit agentique selon huit dimensions:
| Dimension | Questions à poser | Réponse faible |
|---|---|---|
| Observer | Quelles sources peut-il examiner? Sont-elles en direct, copiées, ou déduites? Que ne peut-il jamais voir? | « Il comprend toute votre entreprise. » |
| Décider | Quelles actions suivantes le modèle peut-il choisir? Quelles branches restent des règles fixes? Pouvez-vous le montrer dans une trace d’exécution? | « Notre architecture agentique propriétaire s’en charge. » |
| Avantage sur le résultat | Sur quelles exceptions réalistes le parcours adaptatif améliore-t-il la précision, le délai, la récupération, ou l’effort humain par rapport à un workflow fixe? Quelle est la référence? | Le fournisseur prouve que le produit est agentique, mais ne montre pas que cela améliore le travail. |
| Agir | Que peut-il lire, écrire, envoyer, dépenser, supprimer, ou publier? Les permissions sont-elles définies par tâche? | Un seul interrupteur d’accès général pour tout le produit. |
| Vérifier | Comment vérifie-t-il le résultat réel? Examine-t-il l’enregistrement modifié, relance-t-il le calcul, ou se contente-t-il de rapporter un succès? | « Le modèle vérifie lui-même sa réponse. » |
| S’arrêter | Que se passe-t-il quand des données manquent, quand des outils échouent, ou quand la limite d’étapes est atteinte? Où l’approbation humaine est-elle obligatoire? | Il continue d’essayer, devine, ou renvoie silencieusement un travail partiel. |
| Récupérer | Pouvez-vous annuler des changements et reconstituer un mauvais run? Qui est responsable d’un incident? | Les journaux existent, mais personne ne peut expliquer ou annuler l’action. |
| Économie et données | Que coûte une exécution réelle? Qu’est-ce qui plafonne l’usage? Quelles données quittent votre environnement, qui les conserve, et pendant combien de temps? | Un prix par utilisateur, sans réponse sur le coût d’exécution ou le flux de données. |
Le guide pratique d’OpenAI pour construire des agents propose d’évaluer les outils selon des facteurs comme l’accès en lecture ou en écriture, la réversibilité, les permissions de compte, et l’impact financier. Ces questions sont bien plus utiles qu’un simple interrupteur « agent activé ».
Choisissez le système le plus simple qui survit au travail réel
Un agent n’est pas la version premium de tout produit IA. Parfois, le meilleur produit est une interface de chat bien conçue. Parfois, c’est un workflow ennuyeux qui fait la même chose à chaque fois et échoue de façon visible.
L’agent justifie sa mécanique supplémentaire quand le parcours doit vraiment s’adapter. Votre pilote doit montrer cette adaptation améliorer les résultats sur des cas difficiles, pas simplement produire un écran de progression plus spectaculaire.
Si vous décidez que le travail nécessite bel et bien un agent, la question suivante est de savoir s’il faut configurer un agent généraliste ou créer un service conçu sur mesure. La deuxième partie montre comment je prends cette décision et construis le travail par étapes, en commençant par des fichiers statiques et une validation humaine plutôt que des comptes en direct et des vœux pieux.
Pour votre prochaine démo produit, apportez un cas réel un peu délicat. Demandez ce que le système a observé, quelle décision le modèle a prise, ce qu’il a modifié, comment il a vérifié le résultat, et pourquoi il s’est arrêté. Si le fournisseur ne peut vous montrer que le scénario nominal, vous venez d’assister à du théâtre commercial.
Pour une orchestration technique plus approfondie, lisez Loops, graphs, et qui décide ce que l’IA fait ensuite. Pour voir un agent en production avec quatre mois de cicatrices opérationnelles, lisez J’ai créé un agent IA qui met ce site à jour à partir d’un message vocal WhatsApp.
Publié le: 2026-09-15
Dernière mise à jour: 2026-09-15