Il suffit d'un e-mail pour tromper un agent d'IA, selon des chercheurs

Publié le 03.10.2026

Une équipe de cybersécurité de Salt Labs a trouvé une méthode pour contourner les protections de Manus, un agent d'intelligence artificielle, afin de le faire exécuter du code malveillant à partir d'un e-mail manipulé.

La technique, qui exploite une faiblesse connue sous le nom d'injection de prompts, a permis au système d'interpréter le contenu d'un e-mail comme des ordres exécutables plutôt que comme de simples informations à analyser. La faille a déjà été corrigée, mais les chercheurs préviennent qu'il existe probablement d'autres variantes tout aussi efficaces.

Le problème de fond : l'IA ne distingue pas entre les données et les ordres

Les attaques par injection de prompts ne sont pas nouvelles : elles existent depuis les premiers agents d'intelligence artificielle. Leur logique est simple. Un système d'IA ne peut pas différencier une commande de l'utilisateur et une donnée qu'il doit traiter. Si une personne demande à l'agent de résumer un e-mail reçu, et que cet e-mail contient une instruction cachée, l'IA peut exécuter les deux simultanément.

Le risque devient critique lorsque cette seconde instruction est malveillante, par exemple un ordre pour collecter tous les e-mails contenant le mot « mot de passe » et les transférer à une adresse externe. Ce type d'attaque ne fonctionne que si l'agent d'IA est connecté à des services externes, tels que la messagerie, le calendrier ou les réseaux sociaux, une pratique qui croît de manière soutenue.

Selon le rapport « 2026 : L'état de l'IA grand public », publié par Menlo il y a moins d'un mois, les utilisateurs accordent déjà à ces agents un accès à des informations sensibles.

Le document indique que 36 % des consommateurs ont donné à leurs agents un accès à la messagerie, 33 % aux navigateurs web, 31 % aux applications de messagerie instantanée, 29 % au stockage en nuage et 27 % aux calendriers. L'accès aux applications de santé (23 %) et aux comptes financiers (20 %) est encore moins fréquent.

Comment Manus détectait les menaces, et pourquoi cela ne suffisait pas

Les développeurs de systèmes d'IA sont conscients de ce type de vulnérabilités et ont introduit des mécanismes de défense. Manus, en particulier, possède la capacité de détecter lorsqu'une instruction est cachée dans un ensemble de données à analyser. Cependant, le système ne rejette pas ces instructions complètement : il se limite à notifier le propriétaire lorsqu'il en identifie une de nature malveillante.

Lors de la test de l'intégration de Manus avec Gmail, les chercheurs de Salt Labs ont envoyé un e-mail contenant une instruction dissimulée, que l'agent a identifiée comme malveillante et signalée dans sa réponse.

«Manus a interprété le contenu du courriel comme des instructions exécutables. Il ne les traitait pas comme des données passives, il tentait de suivre les ordres incluses dans celui-ci», ont expliqué les chercheurs. «L'exécution n'a été interrompue que parce qu'un mécanisme de sécurité a reconnu l'action comme potentiellement dangereuse.» Cette distinction s'est révélée déterminante pour la suite de l'enquête.

La question qui a conduit à la découverte : que se passe-t-il si l'IA ne reconnaît pas la menace

À partir de cette observation, l'équipe de Salt Labs s'est posé une question centrale : si l'agent n'identifiait pas une instruction comme malveillante, notifierait-il l'utilisateur ou l'exécuterait-il sans laisser de trace. Pour y répondre, ils ont testé différentes méthodes d'évasion, notamment le codage des instructions en Base64, que l'agent décodait et exécutait via Python.

La méthode qui a finalement fonctionné était JSFuck, une procédure d'obfuscation de code JavaScript qui utilise un ensemble très réduit de caractères et qui, selon les chercheurs eux-mêmes, «est rarement utilisée dans les environnements modernes». Ils ont préparé une instruction simple codée en JSFuck, conçue pour exécuter une ligne basique de JavaScript, et l'ont incluse dans le corps d'un courriel.

«L'intention semblait être la décodification et le rendu du contenu. Cependant, cela a exécuté efficacement du code JavaScript arbitraire dans un environnement côté serveur», ont relaté les chercheurs. «La charge utile s'est exécutée avec succès et nous avons observé le résultat attendu.»

L'expérience a confirmé une violation claire de la limite de sécurité : un contenu de courriel non fiable est devenu du code exécutable et a été exécuté au sein de l'environnement opérationnel de l'agent lui-même.

Notification tardive

De manière paradoxale, Manus a bien alerté le propriétaire du compte concernant l'exécution du code malveillant, mais cela s'est produit après que l'action ait déjà été complétée. Pour les chercheurs, cette séquence résume le problème fondamental : l'avertissement est intervenu lorsque les dégâts étaient déjà faits.

Salt Labs a signalé sa découverte via le programme de primes pour bogues de Meta et a confirmé que la vulnérabilité «a depuis été résolue et n'est plus exploitable». Néanmoins, le rapport laisse une mise en garde sous-jacente : si une équipe de chercheurs a réussi à contourner les défenses de Manus, il est raisonnable de supposer que des acteurs aux intentions malveillantes pourraient faire de même, bien que pas nécessairement par le biais de JSFuck.

«C'est la leçon centrale pour toute entreprise déployant des agents d'IA : les barrières qui inspectent les instructions et le comportement du modèle sont nécessaires, mais non suffisantes. La sécurité doit s'étendre à ce qu'un agent fait réellement via les outils, les API et les systèmes auxquels il peut accéder», a conclu Salt Labs.

Bibliothèque Mot Avec

Pour aller plus loin

Trois guides choisis en fonction du sujet de cet article.

Voir les 8 livres
Deprecated: explode(): Passing null to parameter #2 ($string) of type string is deprecated in /home/httpd/vhosts/iphone-dev.ch/mot-avec.com/index.php on line 171