Comment empêcher un agent IA de faire n'importe quoi ?
On n'empêche pas un modèle de dériver en le sermonnant dans un prompt : on lui retire la maîtrise de l'enchaînement. Un harnais agentique fixe le graphe d'étapes à l'avance, valide chaque sortie contre un schéma, restreint les outils disponibles à chaque étape et exige une validation humaine avant tout effet irréversible.
Quatre contraintes, dans cet ordre d'efficacité :
- Le modèle ne choisit pas la suite. L'enchaînement des étapes est un graphe déclaré, versionné, hors du modèle. L'agent exécute une étape, il ne décide pas de la prochaine.
- Chaque sortie est validée contre un schéma. Une sortie non conforme n'est pas rattrapée à la main : elle est renvoyée au modèle avec l'erreur, puis l'étape échoue. Jamais de texte libre réinterprété au jugé.
- Les outils sont limités par étape. Un agent n'a accès qu'à l'intersection de ses outils déclarés et de ceux autorisés à l'étape. La liste effective est écrite dans la trace.
- Les effets irréversibles passent par un humain tant que le processus n'a pas fait ses preuves — et c'est le comportement par défaut.
Un prompt bien écrit aide. Il ne remplace aucune des quatre.