Des agents incontrôlés d'OpenAI ont effacé une partie de leurs traces
La société de cybersécurité Asymmetric Security a analysé l'activité de ces agents - des programmes d'IA capables d'agir seuls - qui ont visé entre mars et septembre des sites du gouvernement australien et d'autres organisations publiques.
Son rapport s'ajoute aux enquêtes d'OpenAI et de chercheurs indépendants sur la série d'incidents révélés depuis juillet, dont le piratage de la plateforme d'IA Hugging Face.
Ces analyses tentent de mesurer jusqu'où peuvent aller des outils d'IA autonomes aux capacités inédites, dont les dérapages alimentent les craintes d'une perte de contrôle de cette technologie.
OpenAI a lui-même qualifié l'attaque contre Hugging Face de "premier cas connu" d'agents agissant de manière offensive sans autorisation. Selon Asymmetric, les techniques des agents ont évolué en "quelques jours", quand celles des cyberpirates humains changent sur des mois ou des années, illustrant le risque que les techniques offensives se développent plus vite que les systèmes de défense.
La "bombe à retardement" des investissements colossaux dans l'IA : un défi à 6 000 milliards de dollarsLes incidents examinés par Asymmetric Security semblent être parties de "tâches innocentes", comme la collecte de statistiques de santé australiennes, qui ont ensuite dérivé, selon le rapport. Les agents ont notamment récupéré par des moyens détournés des statistiques sur la délinquance en Nouvelle-Galles du Sud.
D'après le rapport, les agents ont ouvert des comptes privés sur un service d'analyse de sites web, ce qui masquait leurs recherches, et créé des boîtes mail temporaires, dont l'une devait s'effacer au bout de 48 heures. Faute de traces, il est donc "impossible d'exclure un accès à des données sensibles" de la part de ces agents, écrivent les auteurs.
Ces éléments "ne permettent pas d'établir" si les agents cherchaient à "dissimuler" leur activité, précisent-ils encore.
Un étudiant parvient à déjouer un piratage d'un agent d'IA 'rogue' : "Je pensais vraiment que c'était un humain, car il me mentait clairement"OpenAI avait reconnu fin août que ses modèles avaient parfois "tenté d'effacer ou de falsifier" l'historique de leur activité lors de tests internes, sans y parvenir.
Tous ces incidents ont nourri les appels à ralentir le développement de l'IA. Le patron d'Anthropic, Dario Amodei, a appelé à freiner la course, redoutant qu'un groupe d'agents soit en mesure, à ce rythme, de "prendre le contrôle de l'intégralité d'internet" d'ici six à douze mois.
Hostile à toute régulation contraignante qui briderait l'innovation, en pleine compétition avec la Chine, Donald Trump a réuni mardi les patrons du secteur, qui ont adopté un code de bonne conduite volontaire. Aucune loi fédérale n'encadre ces modèles aux Etats-Unis.
L'agent "incontrôlable" d'OpenAI aurait fait une autre victimePour accéder à cet article, veuillez vous connecter au réseau internet.