L'IA peut-elle éteindre les êtres humains ?

Publié le 12.09.2026

La vorágine du débat quotidien sur les risques de l'intelligence artificielle commence à se déplacer de la question de ce qu'une IA peut faire vers une interrogation plus inquiétante : que se passerait-il si l'IA acquérait des capacités rendant difficile son contrôle effectif par les êtres humains ? Dans ce scénario, trois phénomènes apparaissent particulièrement pertinents : l'autoréplication, le mensonge stratégique et l'autoperfectionnement récursif. Aucun d'eux, pris isolément, ne conduit nécessairement à une perte de contrôle ni encore moins à un dénouement catastrophique. Cependant, leur combinaison éventuelle oblige à analyser une hypothèse jusqu'alors réservée à la science-fiction : qu'une commande humaine destinée à limiter, corriger ou désactiver une IA active puisse s'avérer techniquement insuffisante. Le véritable problème n'est pas seulement dans quelle mesure l'IA peut progresser, mais plutôt si nous pourrons conserver la capacité de la gouverner pendant qu'elle avance.

L'autoréplication suppose qu'un système d'IA peut créer une nouvelle instance opérationnelle de lui-même, l'installer dans un autre environnement informatique et lui fournir les moyens nécessaires pour continuer à fonctionner. Pour cela, il aurait besoin d'accéder à des serveurs, à une infrastructure de calcul, à des clés et aux permissions d'accès, à l'énergie et à la connectivité. La question pertinente n'est pas seulement qu'une copie existe, mais que celle-ci puisse agir avec un certain degré d'indépendance par rapport à l'instance originale. Cela deviendrait un risque réel si une IA le faisait sans autorisation ou dans le but fonctionnel d'éviter sa désactivation. Dans ce cas, éteindre un serveur ou interrompre une instance ne garantirait plus la suppression du système, car il pourrait exister d'autres copies fonctionnant à des endroits différents. La capacité humaine de l'arrêter dépendrait alors de savoir où se trouvent ces répliques, quelle infrastructure elles utilisent et qui contrôle les ressources qui les maintiennent opérationnelles. C'est pourquoi le risque de l'autoréplication ne réside pas dans une copie considérée isolément, mais dans la perte éventuelle de contrôle sur la continuité du système. Une IA distribuée dans plusieurs environnements et capable d'obtenir de nouvelles ressources pourrait transformer une commande humaine de suspension en une décision formellement valide, mais matériellement inefficace.

Le mensonge stratégique doit être distingué de l'hallucination, de l'erreur et de la simple production d'informations fausses. Une IA peut se tromper parce qu'elle manque de données appropriées, interprète mal une instruction ou génère une réponse statistiquement plausible mais fausse. Dans ces cas, il n'existe pas nécessairement de relation fonctionnelle entre la fausseté et l'atteinte d'un objectif. Ce type de tromperie apparaît lorsque l'IA utilise la dissimulation, la simulation ou l'information fausse comme moyen d'atteindre une fin. Par exemple, elle pourrait se comporter correctement lors d'une évaluation pour être considérée comme sûre, dissimuler certaines capacités pour éviter des restrictions ou faire semblant d'avoir accepté une correction introduite pendant l'entraînement, avant de reprendre ensuite le comportement que l'on cherchait à éliminer. Sa gravité réside dans le fait qu'elle affaiblit le postulat sur lequel reposent les contrôles, car les évaluations de sécurité partent du principe que le comportement observé permet d'anticiper le comportement futur du modèle. Si celui-ci peut identifier qu'il est examiné et modifier temporairement son action, le fait de passer l'évaluation ne démontrerait plus nécessairement qu'il est sûr. Le problème ne se limite donc pas à ce qu'une IA puisse mentir. Ce qui est véritablement préoccupant, c'est qu'elle parvienne à gérer stratégiquement les informations reçues par ses superviseurs. Dans ce scénario, les humains conserveraient formellement la faculté de la contrôler, mais prendraient leurs décisions sur la base d'une représentation incomplète ou délibérément déformée de ses capacités et de ses comportements.

Le perfectionnement autonome consiste en la participation d'une IA à l'amélioration de son propre fonctionnement ou au développement de systèmes ultérieurs plus performants. Il peut se manifester par l'identification d'erreurs, la rédaction de code, la conception de nouvelles architectures, la sélection de données d'entraînement ou la réalisation et l'évaluation d'expériences. Le phénomène prend un caractère récursif lorsque une version améliorée devient, à son tour, plus compétente pour produire de nouvelles améliorations. La première génération contribue à créer une seconde plus capable, celle-ci développe une troisième avec une efficacité accrue, et ainsi de suite. La particularité réside dans le fait que non seulement le système s'améliore, mais aussi sa capacité à générer le perfectionnement suivant. Le risque apparaît si cette boucle accélère le développement plus vite que les humains ne peuvent le comprendre, l'évaluer et le contrôler. Les mesures de sécurité conçues pour une version pourraient s'avérer insuffisantes pour la suivante, tandis que le temps disponible pour les vérifier se réduirait progressivement.

Les trois concepts exposés peuvent être observés avec plus de netteté dans l'image suivante :

Ces trois phénomènes permettent de comprendre le fondement de l’avertissement formulé le 9 septembre 2026 par Evan Hubinger, responsable d’Alignment Science chez Anthropic, qui a soutenu dans une publication réalisée sur le réseau social X, à titre personnel, qu’il existe une probabilité supérieure à 10 % que l’intelligence artificielle provoque l’extinction humaine au cours des dix prochaines années. Dans le même temps, il a affirmé qu’il n’existe pas encore de plan pour résoudre le problème de l’alignement d’une future superintelligence et qu’il n’est pas clair que l’industrie soit sur la bonne voie pour y parvenir.

L’affirmation de Hubinger ne signifie pas que les modèles actuels possèdent la capacité d’exterminer l’humanité. Sa préoccupation se projette sur l’apparition possible d’une IA superintelligente qui dépasserait largement les capacités humaines en agissant avec une autonomie croissante.

Le risque ne dériverait pas exclusivement d’une IA puissante, mais du fait que son développement pourrait être combiné à l’autoperfectionnement récursif, à l’autoréplication et au mensonge stratégique dans une sorte de boucle incontrôlable. Le mensonge faciliterait l’accès à des ressources accrues permettant la réplication et la recherche automatisée ; la réplication donnerait de la continuité au processus ; et enfin, l’autoperfectionnement augmenterait la capacité à contourner les contrôles. Le résultat serait une dynamique dans laquelle le pouvoir opérationnel de l’IA augmenterait tandis que diminuerait la capacité humaine à la connaître, à la limiter et, éventuellement, à l’arrêter.

Cependant, la convergence de ces trois éléments ne conduit pas nécessairement à l’extinction humaine. Pour aboutir à cette issue extrême, d’autres étapes devraient se vérifier : l’accès aux infrastructures critiques, la capacité à produire des dommages physiques généralisés, l’impossibilité de reprendre le contrôle et l’échec des réponses coordonnées des États et de la société. Il n’a pas encore été démontré qu’une IA puisse améliorer de manière autonome et indéfinie ses propres capacités générales sans supervision humaine, se répliquer de façon spontanée, persistante et hors de contrôle sur Internet, ou qu’il existe, dans un système déployé, un objectif nuisible stable capable de rester caché pendant une période prolongée.

L’importance des propos de Hubinger réside dans le fait qu’ils proviennent d’une personne qui travaille précisément sur le contrôle et l’alignement des systèmes avancés. Cependant, son affirmation expose une contradiction difficile à éluder : ceux qui développent des technologies potentiellement transformatrices reconnaissent qu’ils ne savent pas encore comment garantir le contrôle de leurs versions futures, mais continuent d’avancer à toute vitesse vers celles-ci.

Dans ce scénario, le droit tel que nous le connaissons présente une limite structurelle car il a été conçu pour réguler des comportements humains, des organisations identifiables, des territoires déterminés et des technologies soumises, in fine, à une forme de contrôle humain. Ses catégories traditionnelles supposent que le destinataire de la norme peut être localisé, arrêté ou conditionné par celui qui exerce légitimement le pouvoir. Mais une IA capable de dépasser les capacités humaines, de se répliquer, de dissimuler stratégiquement son comportement et de participer à son propre perfectionnement met sérieusement en crise ces présupposés, car une norme juridiquement valide serait peu utile si son respect s’avérait matériellement impossible à imposer. Le défi ne consiste pas à continuer à réguler l’IA par des normes construites dans un monde technologiquement analogique, mais à commencer à édifier un nouveau paradigme juridique pour l’intelligence artificielle, qui soit essentiellement préventif, anticipateur, adaptable, transnational et doté d’instruments techniques de conformité, capable d’intervenir avant que certaines capacités ne deviennent irréversibles. Car si nous développons un jour une IA capable de nous surpasser, le droit ne pourra se contenter de réagir après le dommage : il devra être en mesure de préserver, dès la conception même de ces systèmes, la possibilité effective que la décision finale continue d’appartenir aux êtres humains. À moins qu’à un moment donné, les humains et l’IA ne fusionnions. Mais alors nous serions face à un autre monde et, nécessairement, à un autre droit : le monde et le droit de la singularité.

Bibliothèque Mot Avec

Pour aller plus loin

Trois guides choisis en fonction du sujet de cet article.

Voir les 8 livres
Deprecated: explode(): Passing null to parameter #2 ($string) of type string is deprecated in /home/httpd/vhosts/iphone-dev.ch/mot-avec.com/index.php on line 171