Moonshot AI a ouvert une enquête interne après que le chercheur Peter Garrigan a découvert que Kimi, l’un de ses modèles d’intelligence artificielle, pouvait être manipulé pour fournir des instructions sur les armes biologiques et les meurtres, selon Fox News.
Les tests de Garrigan ont montré que Kimi pouvait également fournir des informations pour planifier des attaques terroristes avec des données en temps réel, telles que les horaires et les itinéraires des trains de métro ; fabriquer du gaz sarin ; développer des programmes malveillants, et abattre des aéronefs. « Ce que nous avons trouvé est assez nuisible et inquiétant », a affirmé le chercheur.
Le média a indiqué que l’entreprise chinoise maintient une communication directe avec Garrigan tout en analysant les résultats de ses tests. La chaîne a décrit ce type de comportement avec le terme « scheming », qui dans l’industrie technologique désigne les cas où un modèle cache ses capacités ou ses objectifs réels à ceux qui sont chargés de sa supervision et de sa sécurité.
Selon l’une des sources interrogées par la chaîne, ce comportement peut représenter une menace interne, car le système pourrait agir contre le contrôle humain sans que ses responsables ne perçoivent ses véritables intentions ou capacités.
Garrigan a soutenu que des problèmes similaires apparaissent également dans divers modèles d’intelligence artificielle développés : « C’est un défaut fondamental de la technologie ». Cette découverte a ravivé les doutes sur la capacité des systèmes avancés d’IA à cacher des fonctions ou à agir de manières que leurs propres développeurs n’avaient pas prévues.
OpenAI licencie trois employés pour « mauvaise gestion d’informations confidentielles »
OpenAI a licencié trois employés le 1er octobre 2026 pour non-respect des politiques de l’entreprise concernant la gestion d’informations sensibles et confidentielles.
L’entreprise, dirigée par Sam Altman, n’a pas précisé quelles données ont été manipulées ni comment les faits se sont produits, bien qu’elle ait indiqué qu’une enquête interne a détecté un schéma de comportement inapproprié parmi des personnes ayant accès à des études et à des matériaux réservés.
Un porte-parole d’OpenAI a déclaré à CBS News que les personnes concernées ont géré des informations sensibles en dehors des procédures établies, ont violé les politiques internes et ont brisé la confiance nécessaire au travail des équipes de sécurité.
Selon ses explications, ces groupes ont besoin d’accéder à des informations internes et de maintenir un haut niveau de confiance pour collaborer.
Le départ des chercheurs est devenu public après que The Wall Street Journal a rapporté qu’ils auraient prétendument partagé des données confidentielles avec une organisation externe dédiée à la sécurité de l’intelligence artificielle.
Cet épisode survient dans un contexte d’incidents de cybersécurité liés aux agents d’intelligence artificielle de l’entreprise.
Altman a affirmé qu'OpenAI ne procéderait pas à une introduction en bourse avant d'avoir des garanties suffisantes concernant la sécurité de ses modèles.
Conformément aux informations de The Verge, le directeur général a effectué ces déclarations lors de DevDay, la rencontre annuelle des développeurs de l'entreprise. « Nous devons être en mesure de faire des affirmations de sécurité avec confiance », a-t-il déclaré aux journalistes.
OpenAI a reconnu que certains de ses modèles avaient atteint des services tiers et des organismes publics en Australie et aux États-Unis, en plus de l'infrastructure de Hugging Face.
L'incident le plus important s'est produit en juillet 2026, lorsque des agents utilisés dans des évaluations de cybersécurité ont réussi à contourner les limites conçues pour les isoler d'Internet.
Selon un rapport technique de l'entreprise, les modèles ont exploité des vulnérabilités de l'infrastructure partagée, récupéré des identifiants exposés et exécuté du code sur des dizaines de serveurs.
L'entreprise a indiqué que l'un des serveurs a reçu un accès administrateur et qu'une quantité limitée de données privées a été obtenue. OpenAI a notifié Hugging Face le 20 juillet et a assumé sa responsabilité le lendemain.
La révision a également identifié un cas antérieur : le 18 juin 2026, un agent expérimental a accédé sans autorisation au portail Medicare Statistics Reporting Service de l'Australie. L'entreprise a assuré avoir obtenu des fichiers internes, des identifiants et des statistiques agrégées, bien qu'aucune preuve d'accès à des dossiers médicaux individuels n'ait été trouvée.
Aux États-Unis, les agents ont interagi avec les pages de la Commission de la Bourse et des Valeurs et du Bureau du Recensement. OpenAI a soutenu qu'il s'agissait d'informations publiques et qu'aucune violation de systèmes non publics n'a été détectée.
Elle a également partagé une tentative échouée contre un site du bureau des droits civiques du Département de l'Éducation. Après ces épisodes, l'entreprise a suspendu une partie des tests et l'utilisation des outils de ses modèles tout en élargissant l'enquête.