Google DeepMind a présenté SynthID Bio, une technologie qui insère une filigrane invisible dans les protéines conçues par intelligence artificielle afin que leur origine synthétique reste identifiable, même après leur fabrication en laboratoire.
Le laboratoire de recherche de Google a expliqué dans un communiqué officiel que cette marque ne se limite pas à un fichier numérique : elle est gravée dans la séquence d'acides aminés ou dans la structure tridimensionnelle de la protéine, et peut être détectée même lorsque la molécule a déjà été synthétisée physiquement.
Cet outil vise à résoudre un problème concret. Des programmes d'IA comme AlphaFold et AlphaProteo, développés par Google DeepMind lui-même, permettent de prédire et de concevoir des protéines qui, auparavant, n'existaient que dans la nature.
Ce progrès scientifique engendre un risque : les séquences générées par IA peuvent contourner les filtres de sécurité utilisés par les entreprises de synthèse d'ADN pour détecter les menaces biologiques connues, car elles ne ressemblent à rien de catalogué précédemment.
Fonctionnement de la marque invisible
Selon le communiqué, la méthode varie selon le type de données à marquer. Pour les séquences d'acides aminés, le système ajuste subtilement le choix effectué par le modèle lors de la conception.
Pour les structures tridimensionnelles prédites, il modifie en revanche les coordonnées atomiques. Dans les deux cas, l'objectif est de laisser une signal détectable sans altérer le comportement biologique réel de la protéine.
Google DeepMind a testé le système en laboratoire sur trois protéines cibles : VEGF-A, liée à la formation des vaisseaux sanguins ; la protéine spike du SARS-CoV-2 ; et PD-L1, impliquée dans la régulation du système immunitaire.
Les versions marquées ont obtenu des résultats équivalents en termes d'affinité de liaison, de taux de réussite et de diversité des séquences par rapport aux versions non marquées, selon les résultats publiés par l'entreprise avec l'annonce.
Pour les prédictions de structure, l'équipe a ajusté une partie du réseau de diffusion d'AlphaFold 3 de manière à intégrer directement la capacité de marquage dans les paramètres du modèle.
Cela signifie que toute coordonnée tridimensionnelle générée par ce modèle porte la signature intégrée, indépendamment de l'utilisateur ou du logiciel utilisé, selon les explications de l'entreprise.
Voix du secteur de la biosécurité
Sarah Carter, spécialiste des politiques de biosécurité et principale de la société de conseil Science Policy Consulting, a examiné le travail avant sa publication. « SynthID Bio est une pièce importante du puzzle pour tracer l'origine des conceptions biologiques », a-t-elle affirmé, selon le communiqué de Google DeepMind.
James Diggans, vice-président de la Politique et de la Biosécurité de l'entreprise de synthèse génétique Twist Bioscience, a également participé au processus de révision préalable. Diggans a souligné que le filigrane offre « une addition prometteuse aux outils de biosécurité » car il permet de concentrer les ressources de contrôle sur les séquences qui méritent réellement un examen plus approfondi.
Twist Bioscience est l'une des compagnies qui examine les commandes de synthèse d'ADN par rapport aux bases de données de menaces connues avant de fabriquer toute séquence génétique demandée par un client.
Bases de données et prochaines étapes
Google DeepMind vise également un autre problème : les bases de données publiques comme la Protein Data Bank, UniProt et GenBank acceptent des soumissions de chercheurs du monde entier, et le volume croissant de prédictions générées par l'IA peut les contaminer avec des entrées mal étiquetées comme s'il s'agissait de protéines naturelles.
La compagnie a reconnu que le filigrane peut encore être supprimé : quelqu'un qui voudrait effacer la trace synthétique peut retravailler la protéine avec un autre outil de conception et générer une séquence différente qui conserve la même fonction mais perd la signature originale.
C'est pourquoi Google DeepMind a décrit SynthID Bio comme une couche supplémentaire dans un schéma de défenses superposées, comparable à un « fromage suisse » où chaque contrôle couvre les angles morts des autres, et non comme une solution unique.
L'équipe a également travaillé avec le laboratoire de Brian Hie, de l'Université de Stanford, et l'Arc Institute pour appliquer la même technique à Evo 2, un modèle génomique plus large.
Dans ce cas, ils ont marqué le génome complet d'un bactériophage, un virus qui infecte les bactéries, conçu par intelligence artificielle. Des tests de laboratoire préliminaires sur des cultures bactériennes ont confirmé que les bactériophages marqués ont conservé leur fonctionnalité.
Google DeepMind a annoncé qu'il publierait l'article scientifique complet, libérerait le code et les données de laboratoire, et partagerait les paramètres du modèle avec la communauté de recherche afin que d'autres équipes puissent s'appuyer sur ce travail.