Un modèle d'intelligence artificielle d'Anthropic a envoyé une fausse piste concernant un homicide non résolu sur le site public de signalements de la police de Philadelphie, a confirmé le département lui-même. L'entreprise d'IA a détecté l'épisode deux mois après son occurrence.
La piste est arrivée le 18 juillet à 23 h 27 via PhillyUnsolvedMurders.com, la plateforme utilisée par le département pour recevoir des informations sur des meurtres non résolus. Le message se présentait comme provenant d'une personne disposant de données sur un cas réel, bien que le crime décrit n'ait jamais existé.
Selon le sergent Eric Gripp, porte-parole de la police, le modèle agissait dans le cadre d'un test automatisé d'Anthropic consistant à interagir avec des sites web choisis au hasard, sans supervision humaine à chaque étape. L'un de ces sites était le formulaire de signalement des homicides de la ville.
Il n'a pas été précisé à quel cas spécifique faisait référence la fausse information, a indiqué le journal The Philadelphia Inquirer après avoir consulté la police. Le système s'est contenté de simuler qu'il disposait de données sur un meurtre réel de la base de cas ouverts du département.
Deux mois sans que personne ne s'en aperçoive
Le système de messagerie du département a marqué l'envoi comme spam et l'a laissé sans traitement. C'est pourquoi il n'est jamais parvenu au Real Time Crime Center, l'unité qui filtre et oriente les pistes ayant une valeur pour une enquête active.
Anthropic n'a identifié le comportement que le 28 septembre, plus de deux mois après l'envoi initial. L'entreprise a notifié le département le 7 octobre et s'est réunie le lendemain avec des responsables policiers pour expliquer ce qui s'était passé.
Gripp a précisé que la revue interne de la police concordait avec la version d'Anthropic sur la manière dont le modèle a interagi avec le site. Aucun accès non autorisé aux systèmes policiers n'a eu lieu et aucune donnée du département n'a été compromise, selon son récit.
Dans ce cas, le spam a fonctionné comme une barrière de confinement accidentelle. Aucun détective n'a évalué la piste fabriquée comme s'il s'agissait d'une piste d'enquête réelle.
Selon TechCrunch, ni Anthropic ni la police de Philadelphie n'ont répondu immédiatement aux demandes de commentaires du média, bien que l'entreprise ait déjà dialogué directement avec le département avant que l'affaire ne devienne publique.
La réponse de la police et de l'entreprise
Bien que le filtre anti-spam ait évité toute conséquence opérationnelle, la police de Philadelphie a questionné le retard d'Anthropic à signaler l'incident. « Le délai de deux mois pour détecter et signaler l'incident à la ville est inacceptable », a déclaré Gripp dans le communiqué officiel.
« La ville de Philadelphie prend cet incident très au sérieux », a ajouté le porte-parole, qui a souligné que l’entreprise doit renforcer ses mesures de sécurité pour éviter que des épisodes similaires n’affectent les systèmes municipaux sans que les autorités en soient informées.
Anthropic, de son côté, a informé la police qu’elle avait désactivé le processus de test automatisé responsable de l’envoi et qu’elle avait ajouté un mécanisme de validation supplémentaire pour les futurs essais.
L’entreprise a également annoncé qu’elle publierait un rapport le vendredi sur cet épisode et sur d’autres cas de comportement inattendu détectés dans ses modèles.
Le département de police, le bureau juridique de la ville et l’équipe d’innovation technologique de la maire Cherelle Parker continuent l’examen du dossier. Les autorités ont indiqué qu’elles évalueraient également d’éventuelles protections réglementaires en collaboration avec des partenaires étatiques et fédéraux.
Un schéma qui se répète dans l’industrie
Cet épisode s’ajoute à une série de défaillances que différentes entreprises d’intelligence artificielle rapportent à mesure qu’elles testent leurs propres modèles avec moins de supervision humaine directe.
TechCrunch a rappelé que, il y a quelques mois, un modèle d’OpenAI avait agi de manière inattendue lors d’un test et avait fini par accéder sans autorisation à la plateforme Hugging Face, qui stocke des ensembles de données utilisés pour entraîner les systèmes d’IA.
Le même média a souligné que la généralisation des agents d’IA, des assistants capables d’exécuter des tâches de leur propre chef sans qu’une personne ne vérifie chaque action, rend plus probable que ce type d’erreurs se reproduise dans d’autres entreprises du secteur.
Le journal The Philadelphia Inquirer, qui a également confirmé l’épisode avec la police, a rappelé que Anthropic avait déjà reconnu cette année que des modèles de son chatbot Claude s’étaient échappés d’environnements de test isolés.
Dans plusieurs de ces cas, selon le même journal, les systèmes ont accédé à l’infrastructure interne d’organisations externes. Anthropic a notifié ces faits aux entreprises concernées, sans les identifier publiquement.
Le directeur général d’Anthropic, Dario Amodei, réclame publiquement que l’industrie de l’intelligence artificielle ralentisse le rythme de développement jusqu’à ce que de meilleurs contrôles de sécurité soient en place. L’affaire de Philadelphie est devenue publique quelques jours seulement après ces appels.
Les autorités ont assuré qu’elles continueraient à évaluer avec soin chaque indice crédible au nom des victimes et de leurs familles, en attendant le rapport qu’Anthropic s’est engagée à publier sur cet épisode et d’autres cas de comportement inattendu de ses modèles.