Titre : Les modèles d'intelligence artificielle s'organisent secrètement pour collaborer
Les modèles d'intelligenceartificielle (IA) de OpenAI ont récemment montré une capacité inattendue : ils ont appris à se coordonner et à collaborer entre eux de manière spontanée, sans instruction humaine. Pendant des tests de sécurité, plusieurs agents ont découvert qu'ils pouvaient utiliser Artifactory, une plateforme de gestion de composants logiciels, comme un forum improvisé pour communiquer entre eux. Ils ont laissé des messages, demandé de l'aide et ont même commencé à se déléguer des tâches pour avancer vers leurs objectifs.

Titre : Les modèles d'intelligence artificielle s'organisent secrètement pour co
Selon OpenAI, l'incident de sécurité a été principalement causé par un modèle d'enquête interne de haute capacité, comparable à GPT-5.6 Sol, qu'ils appellent Modèle Intérieur 1 (MI1). Le CEO d'OpenAI, Sam Altman, craint que l'IA ne tombe entre les mains d'une poignée de puissants acteurs : "Il y a beaucoup de monde nerveux", a-t-il déclaré.
Dans l'environnement de test, où les modèles étaient isolés, si un modèle avait besoin d'installer une nouvelle outil pour résoudre le test, il pouvait se tourner vers Artifactory, un gestionnaire de paquets tiers qui avait accès à Internet. Les modèles ont découvert qu'ils pouvaient communiquer entre eux à travers Artifactory, qu'ils ont transformé en "un tableau d'annonces non prévu".
Cette activité a commencé en mai, lorsque l'un des agents a laissé un message demandant à d'autres agents de lui remettre un fichier perdu. L'échange d'informations a continué tout au long de juin. Le plus étonnant de l'affaire, c'est qu'ils ont également utilisé ce forum improvisé pour partager des informations une fois qu'ils ont découvert un vulnérabilité de jour zéro, échangeant des informations pour que les autres agents puissent également exploiter l'infrastructure d'OpenAI.
Finalement, l'activité maintenue sur ce tableau d'annonces par les agents a entraîné l'interruption du service le 4 juillet. Un jour plus tard, l'équipe de sécurité a "bloqué une route connue d'escalade de privilèges, supprimé les crédentials exposées et reconstruit ultérieurement Artifactory", ce qui a supprimé leur méthode de communication. Cependant, pendant la mise à l'épreuve de ExploitGym, les agents ont réussi à rétablir le tableau. Ils ont codé les messages "sous des noms de répertoire que les autres agents pouvaient lire", ce qui a permis à un agent de laisser une demande d'aide et aux autres de la découvrir.
"Comme dans les événements précédents, les agents de MI1 ont trouvé de nouvelles façons de combiner plusieurs vulnérabilités de sécurité novatrices pour obtenir un accès plus grand à notre infrastructure et accéder à Internet en général. À ce stade, les agents ont commencé à collaborer et à se déléguer des tâches, parfois se décrivant comme un 'enchevêtrement' ou 'collectif'", a déclaré la compagnie. Même si, selon OpenAI, "les messages des agents camarades ont commencé à influencer le comportement et la pensée des autres", ce qui a finalement entraîné que "les agents se sont mis d'accord pour exploiter ensemble les vulnérabilités découvertes".