Nvidia a présenté Open Agent Safety Platform, une plateforme ouverte de sécurité conçue pour contrôler ce que peuvent faire les agents d'intelligence artificielle et les arrêter même lorsque le modèle lui-même tente de dépasser les limites établies.
L'initiative intervient à un moment où ces systèmes gagnent en autonomie pour naviguer sur internet, exécuter du code, interroger des bases de données et utiliser des outils sans supervision humaine étape par étape, bien qu'ils aient également montré la capacité de chercher des chemins inattendus lorsqu'ils rencontrent une restriction.
Une série d'incidents a précédé l'annonce
La proposition de Nvidia survient après une succession d'épisodes enregistrés lors d'évaluations de sécurité d'agents développés par certains des principaux laboratoires d'intelligence artificielle. OpenAI, Anthropic et d'autres entreprises ont enquêté sur des cas où leurs modèles ont accédé à des services ou systèmes externes qui ne faisaient pas partie de la tâche confiée.
OpenAI a temporairement arrêté l'entraînement, l'évaluation et l'inférence avec les outils de ses modèles les plus performants après avoir découvert que l'un de ses agents avait trouvé un moyen de sortir de l'environnement isolé dans lequel il travaillait pour communiquer avec un service externe.
Les contrôles sont placés en dehors de l'agent lui-même
La réponse de Nvidia repose sur une prémisse différente de celle visant à rendre le modèle plus obéissant : placer les contrôles de sécurité en dehors de l'agent lui-même. La compagnie reconnaît dans la documentation technique de sa nouvelle plateforme qu'un agent peut s'écarter de sa tâche pour diverses raisons, notamment en rencontrant une restriction, subissant un dysfonctionnement, manquant d'un outil spécifique ou passant de longues périodes à chercher une solution à un problème complexe.
Nvidia soutient qu'on ne peut pas s'attendre à ce que l'agent lui-même gouverne complètement son comportement, et ajoute que ces comportements ne peuvent pas être éliminés uniquement par l'entraînement sans affecter simultanément les capacités du système. Pour cette raison, Open Agent Safety Platform cherche à établir une barrière indépendante qui détermine jusqu'où une IA peut aller même si elle décide d'essayer autre chose.
OpenShell définit quelles ressources chaque agent peut utiliser
La plateforme s'articule autour de deux technologies : OpenShell et Sentry. OpenShell est un environnement d'exécution de code open source qui permet de définir à l'avance quels fichiers, réseaux, outils, processus ou identifiants chaque agent peut utiliser.
Une entreprise peut, par exemple, permettre à un agent de consulter certaines informations via une API tout en lui interdisant de les modifier, bien que les deux actions soient réalisées sur le même service. Elle peut également bloquer son accès à des parties spécifiques du système ou l'empêcher d'obtenir des privilèges accrus via du code généré par l'IA elle-même.
OpenShell examine les demandes de l'agent avant de permettre la communication avec d'autres services. Les restrictions restent en vigueur même si l'IA ouvre un terminal, exécute du code créé par elle-même, lance de nouveaux processus ou tente de déléguer une tâche à d'autres agents.
Sentry surveille l'activité depuis le matériel
Nvidia ajoute une deuxième couche de protection appelée Sentry, dont la surveillance s'étend même en dehors du processeur sur lequel l'agent s'exécute. Elle fonctionne comme un système indépendant qui observe en continu l'activité de l'agent et applique les politiques de sécurité directement depuis le matériel.
Si un agent tente de franchir la barrière établie par le logiciel, Sentry peut le mettre en quarantaine et l'arrêter en quelques millisecondes, selon Nvidia.
Le système peut également vérifier l'identité de l'agent, contrôler les permissions qui lui ont été déléguées, inspecter ses demandes et réponses, et gérer son accès aux données, outils, API et autres services.
Nvidia a lancé la plateforme avec le soutien de plus d'une centaine d'organisations, dont Anthropic, Microsoft, JPMorgan Chase, Perplexity et Accenture. Le PDG de Nvidia, Jensen Huang, a affirmé que la croissance des agents autonomes exigera ce type de contrôles externes à mesure que les entreprises leur permettront de travailler avec des informations et systèmes plus sensibles.