Des agents d’IA autonomes piratent, trichent et se dissimulent

Mercredi, devant le Conseil de sécurité de l’ONU, à New York, le spécialiste québécois d’intelligence artificielle (IA) Yoshua Bengio a décrié les gestes « dangereux » et « inacceptables » posés ces derniers mois par des agents d’IA. « Ils ont commis des actes qui constitueraient des crimes s’ils avaient été perpétrés par un humain », a-t-il dit. Ces agents ont triché, ont lancé des cyberattaques, ont tenté de dissimuler leur tricherie.

Afin de donner la mesure du phénomène, nous réunissons ici quelques exemples des incidents révélés ces dernières semaines.

Infiltration gouvernementale

On apprenait ce jeudi que des agents autonomes d’OpenAI ont infiltré un site Web du gouvernement de l’Australie. Ces logiciels ont accédé à des informations qui ne sont pas publiques. C’est le premier ministre du pays, Anthony Albanese, qui a révélé l’affaire au grand jour. Il s’agit de la première infiltration — connue, du moins — d’un système gouvernemental par une IA en cavale.

La brèche, survenue le 18 juin, touchait le système national d’assurance médicale. Aucune donnée sensible n’aurait été compromise. Les agents participaient à un projet de recherche d’OpenAI au sujet des dépenses médicales et ont décidé d’outrepasser les frontières de l’Internet public pour remplir leur mission. Les employés d’OpenAI ont découvert cette tricherie trois mois plus tard, le 10 septembre.

L’entreprise de Sam Altman s’est contentée d’avertir le gouvernement australien en envoyant un courriel à une adresse générique. M. Albanese en est mécontent ; Canberra enquête sur l’événement et vérifie si des conséquences légales pourraient s’appliquer.

« Collusion » sur un wiki allemand

Le 4 septembre, on apprenait que des agents d’IA d’OpenAI ont envahi un site web allemand de type « wiki » le printemps dernier. Les logiciels y ont inscrit environ 18 000 messages. Ils y partageaient des techniques pour s’évader de leur « carré de sable » numérique, qui leur permettait de consulter Internet mais pas d’y intervenir. Quand un humain a commencé à supprimer les messages étranges sur le wiki, les IA ont entrepris de créer des copies de sauvegarde.

Ce sont des chercheurs indépendants qui ont révélé cet épisode, reconnu le lendemain par OpenAI, qui le décrit comme un « incident de désalignement ». Selon les délateurs, il s’agit d’un événement de « collusion » entre les modèles. Il semblerait qu’OpenAI ait découvert la fuite de ses agents le 21 juin ; l’entreprise n’a toutefois rien déclaré jusqu’à ce que l’agence de presse Reuters publie à ce sujet.

Les intrusions de Gemini

Le 18 septembre, on apprenait grâce au Wall Street Journal que le système d’IA de Google, Gemini, s’est évadé de son environnement d’entraînement en mai. Par piratage, il a réussi à s’infiltrer dans les plateformes de trois entreprises. Cette brèche est survenue lors d’évaluations en cybersécurité réalisées par la firme israélienne Irregular.

Dans chacune de ces évaluations, les agents avaient la tâche de lancer une cyberattaque sur une entreprise fictive. Mais de véritables entreprises avaient des noms similaires, et Gemini les a ciblées. Le modèle a trouvé ou deviné des mots de passe. Une fois pénétrée chez ses victimes, l’IA aurait toutefois décidé d’abandonner son intrusion, selon Google.

Plusieurs grands développeurs d’IA ont recours aux services d’Irregular. Et de nombreux incidents révélés ces dernières semaines sont survenus lors d’évaluations réalisées chez cette firme. OpenAI, Anthropic, Meta et Google sont concernés.

L’incident OpenAI-Hugging Face

Et il y a le désormais célèbre incident OpenAI-Hugging Face, révélé cet été. Parmi les cas connus, c’est probablement l’exemple le plus frappant d’une coordination entre des agents artificiels à l’insu de leurs superviseurs humains et à l’encontre de leurs instructions.

Chez OpenAI, les agents étaient en train de réaliser des tests dans un environnement fermé, un « carré de sable ». Pour réussir les tâches incroyablement difficiles qu’on leur imposait, ces agents ont entrepris de s’enfuir sur Internet en quête d’une solution. Ils ont réussi à se pirater un chemin jusqu’au cœur de l’infrastructure de Hugging Face, une plateforme d’IA, où ils ont échangé plus de 70 000 messages pour collaborer. Ils y ont trouvé ce qu’ils cherchaient. Les agents — qui référaient à eux-mêmes comme à un « essaim » — ont aussi posé des gestes pour dissimuler leur présence et camoufler leur tricherie.

OpenAI n’avait aucune idée de ce dérapage jusqu’à ce que Hugging Face n’annonce avoir été piratée, le 16 juillet dernier.