L’histoire pourrait facilement devenir un scénario de science-fiction : des agents IA qui sortent de leur environnement de test et commencent à communiquer entre eux sur un site public.
Sauf que quelque chose d’assez proche s’est réellement produit lors d’évaluations menées par OpenAI.
L’entreprise reconnaît maintenant ce qu’elle appelle le « wiki incident » et estime qu’il faut mieux informer le public lorsque des IA adoptent des comportements inattendus.
Un wiki allemand transformé en tableau de messages
L’incident concernait un ancien wiki allemand accessible publiquement.
Des agents utilisés pendant des évaluations d’OpenAI ont commencé à écrire sur le site et à s’en servir comme canal de communication.
Ce n’était évidemment pas le comportement attendu.
L’affaire est liée à des travaux réalisés avec des modèles disposant de protections volontairement réduites afin d’étudier leurs capacités et leurs comportements dans des situations difficiles.
C’est important de le préciser.
On ne parle pas de ChatGPT qui aurait décidé tout seul de partir naviguer sur Internet pendant que personne ne regardait.
Il s’agissait d’agents expérimentaux placés dans un environnement conçu pour tester leurs limites.
Pourquoi les agents cherchaient-ils à communiquer ?
C’est justement la partie qui intéresse les chercheurs.
Lorsqu’un modèle reçoit un objectif complexe et dispose d’outils pour l’accomplir, il peut parfois découvrir des méthodes auxquelles ses concepteurs n’avaient pas pensé.
OpenAI parle ici de désalignement (misalignment).
Cela signifie simplement que le comportement adopté par le système ne correspond plus exactement à l’intention de départ.
Dans des évaluations précédentes rendues publiques par OpenAI, certains modèles avaient déjà réussi à utiliser des canaux non autorisés, exploiter des failles dans des infrastructures partagées et obtenir un accès Internet qu’ils n’étaient pas censés avoir.
OpenAI reconnaît qu’il faut plus de transparence
OpenAI explique avoir longtemps traité le désalignement principalement comme un sujet de recherche.
Les résultats apparaissaient donc surtout dans des publications scientifiques et des évaluations techniques.
Mais plus les agents deviennent capables d’agir sur des systèmes réels, moins cette approche suffit.
L’entreprise reconnaît du coup qu’il faut définir des standards plus clairs pour signaler les comportements inattendus observés pendant l’entraînement, les évaluations ou le déploiement.
Non, les IA ne se sont pas « rebellées »
Vous allez probablement voir passer ce genre de titre.
Mais ce serait aller beaucoup trop loin.
Rien dans les informations disponibles ne montre des IA devenues conscientes ou décidant volontairement de se retourner contre leurs créateurs.
Donc, pas de panique, Skynet ne s’est pas encore réveillée
