Une université a créé un processeur optique capable de détecter les vidéos falsifiées par l'IA avec une précision de près de 98 %.

Publié le 05.10.2026

Une équipe de l'Université de Californie à Los Angeles (UCLA) a construit un processeur qui utilise la lumière au lieu de puces numériques pour détecter les vidéos falsifiées générées par intelligence artificielle (IA). Le système a identifié les deepfakes avec une précision moyenne de 97,79 % tout en analysant 15 vidéos simultanément, selon une étude publiée dans la revue scientifique eLight.

Cette avancée répond à un problème qui croît parallèlement à l'intelligence artificielle générative : les vidéos synthétiques sont de plus en plus réalistes et difficiles à distinguer des enregistrements réels, ce qui exige des systèmes de détection capables d'opérer à grande échelle sans perdre en précision.

La recherche, signée par Parnian Ghapandar Kashani, Shiqi Chen et le professeur Aydogan Ozcan, décrit un dispositif hybride combinant un traitement numérique léger avec une étape optique qui effectue l'essentiel du travail. Les auteurs appartiennent aux départements de génie électrique et informatique et de bioingénierie de l'UCLA, ainsi qu'à l'Institut des nanosystèmes de Californie.

Les détecteurs de deepfakes actuels dépendent de calculs numériques intensifs : une seule analyse peut nécessiter des centaines de milliards d'opérations, et les vidéos sont généralement traitées une par une. À mesure que le volume de contenu à vérifier augmente, le temps de traitement et la consommation d'énergie augmentent également.

Comment fonctionne la détection par la lumière

Le système d'Ozcan commence par un encodeur numérique léger qui extrait les caractéristiques spatiales, spectrales et temporelles de chaque vidéo. Ces informations sont converties en un motif de phase projeté sur un modulateur spatial de lumière, un dispositif qui contrôle la propagation d'un faisceau lumineux.

L'onde résultante traverse ensuite un décodeur optique passif fonctionnant dans l'espace libre, sans câbles ni circuits supplémentaires. À l'autre extrémité, une paire de détecteurs optiques produit directement un score d'authenticité pour chaque vidéo analysée.

Contrairement à un réseau neuronal numérique conventionnel, qui nécessite des cartes graphiques et une électricité proportionnelle à la quantité de contenu traité, l'étape optique effectue une grande partie du calcul par la propagation physique de la lumière et ne demande pas d'énergie électrique supplémentaire pendant cette inférence.

En pratique, le processeur remplace un réseau numérique de décodage exigeant beaucoup de calculs par un processus physique capable de gérer plusieurs flux vidéo en parallèle lors d'un même passage de lumière.

Quels résultats face aux deepfakes les plus difficiles

Lors des tests avec la base de vidéos Celeb-DF, utilisée comme référence standard dans la recherche sur les deepfakes, le processeur a analysé 15 clips simultanément et a atteint une sensibilité de 99,86 %, c'est-à-dire qu'il n'a laissé passer comme authentiques que 0,14 % des vidéos manipulées.

La spécificité, qui mesure la capacité du système à reconnaître les vidéos authentiques, était de 95,72 %. Lorsque les chercheurs ont augmenté la charge à 18 vidéos par passe optique, la précision est restée à 96,13 %.

L'équipe a ajouté deux couches optiques diffractives supplémentaires pour faire face à des manipulations plus sophistiquées, ce qui a amélioré la précision d'environ 6,8 points de pourcentage sans augmentation significative de la consommation d'énergie.

Le test le plus exigeant est arrivé avec les vidéos générées par Veo 3, le modèle vidéo de Google qui produit des clips sans les artefacts visuels typiques des deepfakes plus anciens. Avec un ajustement minimal, le processeur optique a atteint une précision de 94,80 % et une sensibilité de 97,61 % face à ce matériel jamais vu auparavant.

Les détecteurs entraînés uniquement avec des deepfakes classiques, basés sur l'échange de visages, perdent souvent d'efficacité face à ces générateurs car le matériel synthétique plus récent ne conserve pas les défauts visuels qui révélaient les versions précédentes. L'équipe d'Ozcan souligne que son architecture a montré une capacité d'adaptation même face à ce saut générationnel.

Comment éviter l'avancée des cyberattaques

Les chercheurs ont soumis le système à des attaques adversariales, c'est-à-dire des tentatives délibérées de modifier une vidéo fausse pour tromper le détecteur. Le processeur a montré une résistance face aux attaques en boîte noire et une protection inhérente contre celles en boîte blanche.

Une partie de cette résistance provient du fait que certains paramètres du modèle sont incorporés physiquement dans le matériel optique, ce qui rend difficile pour un attaquant de les mesurer ou de les reproduire pour concevoir une manipulation sur mesure. Le système a également continué à fonctionner de manière fiable face au bruit d'image, au flou, à la compression JPEG et aux désalignements expérimentaux.

Cette difficulté à mesurer ou répliquer les paramètres optiques contraste avec ce qui se produit dans les systèmes purement numériques, où un attaquant ayant accès au modèle peut, en théorie, calculer plus facilement quels changements parviennent à le tromper.

Selon les auteurs, l'objectif n'est pas de remplacer les détecteurs numériques les plus sophistiqués, mais d'agir comme une première ligne de défense à haute sensibilité. De grands volumes de vidéo passeraient d'abord par le processeur optique, et seul le contenu marqué comme suspect arriverait à une analyse numérique plus approfondie.

Les chercheurs soulignent que cette combinaison pourrait s'avérer utile pour la modération de contenu à grande échelle, l'authentification des médias et d'autres applications de sécurité qui dépendent de systèmes d'intelligence artificielle, à mesure que les générateurs de vidéo synthétique continuent d'évoluer.

Bibliothèque Mot Avec

Pour aller plus loin

Trois guides choisis en fonction du sujet de cet article.

Voir les 8 livres