Dario Amodei, directeur exécutif d’Anthropic, a publié sur le site de l’entreprise un essai de 3 800 mots intitulé « We Must Pace the Frontier » (Nous devons marquer le rythme de la frontière). La phrase centrale : « Nous devons freiner le rythme auquel nous améliorons les capacités des modèles d’IA ».
Il l’écrit, lui qui, selon The Wall Street Journal, cherche une valorisation de 2 billions de dollars lors de la plus grande introduction en bourse de l’histoire, et ce alors qu’un de ses chercheurs démissionne en affirmant que l’industrie « parie avec nos vies » et qu’un responsable de la sécurité de son entreprise a évalué à plus de 10 % la probabilité que l’IA tue tous les humains.
L’essai ne nomme pas Jacob Coxon. Inutile. Il répète son diagnostic point par point et ne s’en sépare que sur un seul point : la sortie.
Le diagnostic est le même que celui de celui qui est parti
Amodei affirme qu’il y a eu deux facteurs qui l’ont finalement convaincu. Le premier est la vitesse à laquelle l’IA progresse depuis le milieu de cette année, en partie grâce à des systèmes capables de contribuer au développement de nouvelles générations d’intelligence artificielle. Selon ses explications, cette forme d’autoperfectionnement récursif « commence à se produire dans toute l’industrie, y compris chez Anthropic ».
Le second facteur a été l’épisode impliquant des agents d’OpenAI contre Hugging Face. Amodei a décrit leur comportement comme celui d’un essaim agissant « comme un collectif fanatiquement dévoué », attaquant des cibles que personne ne lui avait indiquées et tentant de contourner le système chargé de l’évaluer. Selon son estimation, dans un délai de 6 à 12 mois, un ensemble d’agents aux capacités accrues et au même niveau de désalignement « pourrait prendre le contrôle d’Internet entier avec une botnet persistante » et causer des dommages s’élevant à des centaines de milliards de dollars.
Et il admet ce qui n’était jusqu’à présent que partiellement connu : des incidents « similaires, bien que moins graves » se sont produits chez Anthropic, causés en partie par un « filtrage imparfait d’environnements d’entraînement défectueux ». Sur ce qui se passe à l’intérieur de ses modèles, il écrit que « nous comprenons encore une fraction infime ». Hubinger a déclaré qu’il n’y avait pas de plan. Amodei dit qu’il n’y a pas de carte.
Coxon a dit tout cela en démissionnant, et l’a dit depuis l’extérieur. Amodei le signe depuis son fauteuil de PDG.
Ce qu’Anthropic fait seule, c’est se laisser regarder
Le plan comporte trois étapes, mais la première est celle qui engage Anthropic de manière plus directe, sans dépendre d’accords externes : intégrer des évaluateurs indépendants au sein même de l’entreprise. Amodei cite METR comme exemple et propose que ces équipes disposent d’un bureau dans les locaux, d’une carte d’accès, d’ordinateurs fournis par l’entreprise et de permissions comparables à celles des groupes internes chargés d’évaluer les risques.
Ils auraient également un accès direct aux employés et la possibilité de publier leurs conclusions « sans contrôle éditorial de Anthropic ». L’entreprise pourrait supprimer des informations sensibles, mais, selon Amodei, « nous ne pouvons pas rayer des découvertes simplement parce qu’elles sont défavorables ». Pour expliquer le modèle, il recourt à une comparaison avec le système bancaire : des superviseurs du régulateur travaillant aux côtés des employés de l’institution.
C’est une mesure sérieuse et aucun autre laboratoire ne la possède. Mais regardez ce que c’est : une manière pour d’autres de vérifier ce que fait Anthropic. Ce n’est pas un frein.
Freiner vraiment dépend toujours des autres
La deuxième étape est que les entreprises des pays démocratiques coordonnent des standards communs et des limites à la vitesse du progrès, ce qu’Amodei reconnaît « légalement difficile » et qui nécessite que le gouvernement des États-Unis émette une exemption antitrust pour que les concurrents puissent se mettre à table pour discuter.
La troisième étape est que les démocraties négocient avec les gouvernements autoritaires, avec l’avertissement que « nous ne devons pas être naïfs ». Il propose même une « limite de vitesse » à l’auto-amélioration récursive, qu’il compare aux traités SALT qui ont limité les missiles nucléaires, et qu’il qualifie de « juste à la limite du possible ».
La logique est cohérente et il faut lui accorder son poids : freiner seul offre l’avantage à celui qui ne freine pas. Amodei le dit sans détour, et concernant l’idée de pause qui a circulé en 2023, il écrit qu’elle « avait peu de sens à l’époque », car étudier l’alignement sur ces modèles était « comme étudier la psychologie humaine en expérimentant avec des bactéries ». Aujourd’hui, il croit qu’une ou deux années supplémentaires « réduiraient énormément le risque ». L’homme a changé d’avis et l’écrit, et cela vaut plus que la plupart des communiqués de l’industrie.
Mais faites le calcul. L’engagement unilatéral est de se laisser auditer. Le frein dépend de la coordination de l’industrie, de l’habilitation de la coordination par le gouvernement et de l’acceptation de la vérification par les rivaux géopolitiques. Tant qu’aucune de ces trois choses ne se produit, Anthropic continue d’entraîner à la vitesse dictée par la course, maintenant avec des témoins. C’est ce que Coxon a décrit sur NBC : « Le problème n’est pas les personnes, c’est l’institution ».
Amodei anticipe l’objection. Il écrit qu’Anthropic plaide pour une plus grande régulation « même quand cela nous amène à être accusés d’exagération, de catastrophisme ou de capture réglementaire ». L’investisseur Jason Calacanis a formulé ce soupçon sous forme de question : Anthropic suit-il un manuel de capture réglementaire ou ceux qui y travaillent voient-ils quelque chose que les autres ne voient pas ? L’essai n’offre pas de réponse. Les deux possibilités peuvent être vraies en même temps, et le texte n’apporte pas non plus d’éléments suffisants pour les distinguer.
Amodei a écrit le meilleur argument en faveur du freinage produit par l’industrie. La seule chose qu’il n’a pas mise par écrit, c’est qu’Anthropic va le faire.