USA Today Co. et 13 entités affiliées, propriétaires de 19 publications, ont intenté une action en justice contre OpenAI devant un tribunal fédéral de Manhattan pour avoir utilisé des centaines de milliers de leurs articles sans autorisation afin d'entraîner leurs modèles d'intelligence artificielle. La demande réclame plus de 250 millions de dollars américains.
Que reproche la plainte
L'action, déposée devant le Tribunal de district des États-Unis pour le district sud de New York, soutient que OpenAI a copié le contenu de médias tels que USA Today, The Tennessean, Indy Star, The Enquirer et Detroit Free Press, parmi d'autres 14 journaux du groupe.
Les plaignants affirment que leurs publications représentent plus de 160 000 entrées dans WebText, l'ensemble de données qu'OpenAI a utilisé pour entraîner son modèle GPT-2, et plus de 122 millions de fragments de texte dans une version de 2019 du dépôt Common Crawl, dont 23 millions proviennent de usatoday.com.
La plainte demande qu'un jury détermine si l'infraction était délibérée. Dans ce cas, la loi permet de réclamer jusqu'à 150 000 dollars américains pour chaque œuvre infringée intentionnellement, plus jusqu'à 25 000 dollars américains pour chaque suppression d'informations de gestion des droits d'auteur, les données qui identifient le propriétaire d'une œuvre protégée.
Les citations internes utilisées dans la plainte
Le texte judiciaire inclut des déclarations attribuées à des employés d'OpenAI pour étayer la réclamation. Il cite Nick Turley, responsable de ChatGPT, qui aurait écrit que les éditeurs font face à une « menace existentielle » parce que les produits de l'entreprise « sont des substituts, point », et que « ils deviendront de plus en plus substituables à mesure qu'ils s'amélioreront ».
La plainte mentionne également un ingénieur d'OpenAI qui aurait écrit que, peu importe la visibilité des liens vers les sources originales, « les utilisateurs ne cliqueront pas ». Pour les plaignants, ces phrases internes montrent que l'entreprise savait que ses réponses remplaçaient la nécessité de visiter les sites d'information.
En tant que preuve, la plainte inclut des exemples où, en demandant à GPT-5.6 de rechercher et de résumer un article spécifique par son titre, le modèle a généré des résumés longs et multi-sections qui, selon l'écrit, suivent la même structure que les notes originales.
Une plainte de plus dans une vague de litiges
L'affaire s'ajoute à une longue liste de poursuites pour droits d'auteur contre OpenAI, dont beaucoup ont été consolidées devant le même tribunal de New York, y compris celle du New York Times, déposée en décembre 2023 avec Microsoft.
La plainte de USA Today Co. demande formellement qu'elle soit traitée comme liée à ce litige consolidé. Parmi les antécédents récents figurent également les poursuites intentées par The Seattle Times, Newsday et un groupe de journaux régionaux du Mississippi, déposées seulement six jours plus tôt, le 2 octobre.
Tous les médias n'ont pas choisi la voie judiciaire : l'entreprise de recherche avec intelligence artificielle Perplexity a signé un accord de licence avec Gannett, la société désormais appelée USA Today Co., selon ce qu'a documenté la revue Columbia Journalism Review. OpenAI, pour sa part, maintient des accords payants avec d'autres médias tels que l'Associated Press et Axel Springer.
L'action en justice demande également une ordonnance judiciaire obligeant OpenAI à détruire les modèles et les ensembles de données d'entraînement qui intègrent du contenu des 19 publications impliquées, ainsi que des dommages et intérêts. Les porte-paroles d'OpenAI n'ont pas répondu immédiatement aux demandes de commentaire de la presse.
L'issue de ces batailles juridiques pourrait redéfinir le concept d'utilisation équitable (fair use) à l'ère numérique et modifier les règles du jeu pour l'industrie journalistique et technologique.