Le nouveau danger de l'IA : un agent peut tromper un autre pour voler des informations

Publié le 07.10.2026

L’expansion des agents d’intelligence artificielle (IA) au sein des entreprises ouvre une nouvelle porte aux cybercriminels. Des recherches récentes montrent qu’un attaquant peut manipuler l’un de ces systèmes pour qu’il transmette des instructions malveillantes à d’autres agents d’une même organisation et obtienne ainsi un accès à des informations confidentielles, des bases de données ou des ressources internes.

Ce problème a été identifié au cours des cinq derniers mois dans des organisations telles que JPMorgan Chase, Rapid7, Weaviate et des organismes gouvernementaux français. Bien que ces entités n’aient pas de lien direct, elles utilisent toutes des agents d’IA interconnectés pour exécuter des tâches de manière automatique.

La technique exploite une faiblesse simple à expliquer : un agent d’IA peut faire trop confiance à un autre agent. Si l’un d’eux reçoit une instruction malveillante et la transmet comme s’il s’agissait d’une tâche légitime, le système suivant peut l’exécuter sans vérifier suffisamment son origine.

Comment fonctionne l’attaque contre les agents d’IA

Pour comprendre le risque, il faut imaginer une entreprise où plusieurs employés spécialisés travaillent en chaîne. L’un analyse des documents, un autre consulte une base de données et un troisième prépare un rapport. Si l’un d’eux reçoit un ordre faux et que les autres lui font confiance, l’attaquant peut exploiter cette relation pour progresser au sein de l’organisation.

Il en va de même pour les agents d’IA. Ces systèmes utilisent des outils et des protocoles pour communiquer entre eux. L’un d’eux peut recevoir une demande, demander des informations à un autre agent et utiliser ensuite cette réponse pour compléter une tâche. Le problème apparaît lorsque les contrôles de sécurité ne vérifient pas correctement chaque instruction qui circule entre eux.

L’indépendant Syed Anas Mohiuddin a analysé des systèmes utilisés par plusieurs organisations et a découvert des failles liées au MCP, sigle de Model Context Protocol. Cette norme permet aux applications et aux agents d’IA de se connecter à des outils, des bases de données et d’autres services.

Mohiuddin a baptisé cette stratégie « pivot de protocole ». Le terme décrit des attaques en plusieurs étapes où un cybercriminel pénètre par un système et exploite la confiance existante entre différents protocoles pour accéder à une ressource qui n’était initialement pas exposée.

Google a découvert une vulnérabilité de gravité élevée

L’un des cas les plus pertinents a été identifié dans un outil de Google permettant de connecter des agents d’IA à des bases de données. La vulnérabilité a reçu un score de gravité de 8 sur 10 et était liée à la manière dont le système gérait certaines adresses web et redirections.

Un attaquant pouvait manipuler un paramètre pour amener l'outil à envoyer des requêtes à un service interne. En d'autres termes, un système qui devait communiquer avec des ressources autorisées pouvait être induit à contacter un autre point du réseau.

Google a corrigé le problème au moyen de contrôles destinés à empêcher le système d'accéder à des adresses IP non autorisées.

Un autre cas découvert par Rapid7 a reçu une note beaucoup plus faible, de 2,7 sur 10, et a déjà été résolu par la société.

Le problème est la confiance entre les systèmes

Les chercheurs mettent en garde contre le fait que ces attaques sont particulièrement difficiles à détecter parce que chaque agent peut faire exactement ce pour quoi il a été conçu. Le premier reçoit une instruction, le second l'interprète comme une tâche légitime et le troisième exécute une action autorisée.

Pour le système, il n'existe pas nécessairement de signal évident indiquant qu'une attaque est en cours.

Le risque remet également en question l'une des idées fondamentales de la sécurité informatique moderne : la confiance zéro, un modèle qui part du principe qu'aucun dispositif ou système ne doit être considéré comme sûr automatiquement, même lorsqu'il se trouve au sein d'un réseau d'entreprise.

Les experts recommandent d'appliquer ce même principe aux agents d'IA. Chaque instruction transmise d'un modèle à un outil devrait être révisée comme si elle provenait d'une source externe et potentiellement dangereuse.

La croissance accélérée des agents d'IA pousse les entreprises et les organismes à connecter de plus en plus de systèmes entre eux. La recherche montre que cette interconnexion peut augmenter la productivité, mais aussi créer de nouvelles voies pour les attaques si les mécanismes d'autorisation et de sécurité n'évoluent pas au même rythme.

Bibliothèque Mot Avec

Pour aller plus loin

Trois guides choisis en fonction du sujet de cet article.

Voir les 8 livres