Une IA a battu le meilleur joueur de l'histoire du Stratego avec un entraînement coûtant seulement 8 000 dollars américains.

Publié le 01.10.2026

Des chercheurs du Massachusetts Institute of Technology (MIT), de Carnegie Mellon, de Stanford et de l'Université de New York ont développé un système d'intelligence artificielle qui a vaincu pour la première fois le meilleur joueur humain de Stratego, un jeu de guerre de plateau avec des pièces cachées qui avait résisté à toutes les tentatives précédentes d'automatisation.

Le système, appelé Ataraxos, a battu le Néerlandais Pim Niemeijer, décrit dans l'étude comme le joueur le plus titré de l'histoire du jeu, avec 15 victoires, une défaite et quatre nuls sur une série de 20 parties. Le résultat a été publié dans la revue Nature.

Le coût qui change l'équation

Ce qui distingue Ataraxos des tentatives précédentes n'est pas seulement le résultat, mais le prix. Selon l'étude, l'entraînement du système a coûté moins de 8 000 USD : une semaine avec 16 processeurs graphiques Nvidia H100, plus quatre jours supplémentaires avec quatre autres pour entraîner un réseau qui calcule les coups probables de l'adversaire.

La comparaison directe est avec DeepNash, le système présenté par Google DeepMind en 2022 et entraîné pendant deux à trois mois sur 1 024 nœuds TPU, les processeurs spécialisés que l'entreprise utilise pour entraîner des modèles d'IA. Les auteurs de la nouvelle étude estiment que cet entraînement coûterait entre 3 000 000 et 4 500 000 USD aux prix actuels.

DeepNash avait réussi à se classer parmi les trois meilleurs joueurs de la plateforme Gravon en 2022, mais n'avait jamais réussi à surpasser de manière soutenue les humains d'élite. Ataraxos, en revanche, a accumulé un bilan de 39 victoires et 2 défaites face à des joueurs de premier plan au championnat du monde de Stratego, en plus du résultat contre Niemeijer.

Pourquoi Stratego résistait plus que les échecs

Contrairement aux échecs ou au Go, où les deux joueurs voient l'échiquier complet, dans Stratego chaque camp connaît la position des 40 pièces adverses mais pas leur identité. Cette information cachée multiplie les combinaisons possibles et avait freiné pendant des années les tentatives d'atteindre une performance surhumaine.

« Avec Stratego, il y a une explosion d'univers possibles auxquels il faut faire face. Les techniques d'IA développées pour des jeux comme le poker ne pouvaient pas s'adapter à cet environnement », a expliqué Gabriele Farina, professeur assistant au MIT et l'un des auteurs du travail, à MIT News.

Pour résoudre ce problème, l'équipe a combiné l'apprentissage par renforcement (une technique où le système apprend en jouant contre lui-même des millions de fois) avec un réseau de croyances qui estime, à chaque tour, quelle est la configuration la plus probable de l'échiquier adverse. « Au lieu de deviner à l'aveugle, nous utilisons la planification au moment de décider pour trouver l'état le plus plausible de l'échiquier », a ajouté Farina.

Un bluff qui ne tient pas éternellement

Le propre design du système visait à éviter qu'il ne devienne prévisible. Pendant l'entraînement, les chercheurs ont poussé le modèle à varier ses configurations et ses mouvements plutôt que de fixer une stratégie précoce, ce qui est décisif dans Stratego car les joueurs prévisibles finissent exploités par leur adversaire.

Farina a également souligné la manière dont le système gère le risque face à un humain. « Ataraxos calcule le risque d'une manière que les humains ne font pas. Une personne peut s'alarmer si sa pièce la plus précieuse est exposée, mais le système peut rester étonnamment serein : il ne surcompense ni ne dévoile ses secrets », a indiqué le chercheur.

La série contre Niemeijer s'est étendue sur trois semaines, ce qui a donné au joueur néerlandais le temps d'étudier son adversaire entre les parties et de chercher des faiblesses.

Les mêmes auteurs ont appliqué la technique à d'autres jeux à information cachée : ils ont obtenu le premier résultat documenté supérieur à celui des humains dans Barrage Stratego, une variante plus rapide avec moins de pièces, battant trois champions du monde de cette modalité. Ils ont également établi de nouveaux records dans le jeu coopératif Hanabi et surpassé les systèmes de référence existants dans dou dizhu, un jeu de cartes chinois.

Les chercheurs ont suggéré que la méthode pourrait être étendue à des problèmes du monde réel où l'information est répartie de manière inégale entre les parties, comme les négociations commerciales, les simulations de cybersécurité ou la planification militaire, tant qu'un simulateur rapide et précis du scénario peut être construit.

L'équipe a indiqué que sa prochaine étape consiste à intégrer des mécanismes d'interprétabilité au système, afin qu'Ataraxos puisse expliquer ses décisions dans un langage compréhensible pour les personnes qui doivent superviser ou valider ses recommandations.

Bibliothèque Mot Avec

Pour aller plus loin

Trois guides choisis en fonction du sujet de cet article.

Voir les 8 livres
Deprecated: explode(): Passing null to parameter #2 ($string) of type string is deprecated in /home/httpd/vhosts/iphone-dev.ch/mot-avec.com/index.php on line 171