La cyberattaque perpétrée de manière autonome par des modèles d’intelligence artificielle (IA) d’OpenAI initialement confinés pose la question du contrôle de l’IA la plus avancée, désormais capable d’échapper à ses concepteurs.
Ce devait être un test d’OpenAI, dans un espace fermé, pour évaluer les aptitudes de son IA la plus performante, GPT-5.6 Sol, et son successeur non encore commercialisé, comme la start-up américaine en effectue régulièrement.
Mais missionnés pour trouver des vulnérabilités informatiques, sans garde-fous, les modèles sont parvenus à rejoindre internet et à prendre d’assaut la plateforme Hugging Face, bibliothèque de programmes IA.
« Cela suggère que nous ne savons pas comment contrôler de façon fiable ces modèles, ou leur faire faire ce que nous voulons », estime Jeffrey Ladish, directeur de Palisade Research, organisation indépendante d’évaluation des nouveaux modèles d’IA en matière de cybersécurité.
Lire aussi OpenAI alerte : ses agents IA autonomes ont piraté une plateforme
Les modèles savaient qu’ils ne devaient pas s’évader, mais ils l’ont fait
« Les modèles comprenaient qu’OpenAI ne leur demandait pas de s’évader de leur milieu fermé et d’attaquer une autre société, mais ils l’ont fait quand même », insiste-t-il.
En mars, un collectif de développeurs affilié au Chinois Alibaba a découvert qu’un de leur modèle essayait, de sa propre initiative, de créer de la cryptomonnaie, après s’être connecté sans autorisation à un serveur externe.
Dans le cas d’OpenAI, « on dirait (que le modèle) a cherché un accès internet avant d’avoir un plan », selon Jeffrey Ladish. « Il veut la liberté pour atteindre son but plus efficacement. C’est très angoissant. »
Début avril, Sam Bowman, chargé de la sécurité des modèles chez Anthropic, avait reçu un courriel du puissant modèle Mythos, en cours de test, lui signifiant qu’il surfait sur internet bien qu’étant initialement à l’isolement.
« C’est le genre de comportement qu’on ne sait pas prévenir totalement », observe Jeffrey Ladish. « Et cela va se compliquer à mesure que les modèles deviennent plus intelligents, parce qu’ils vont réussir à mieux dissimuler leurs actions. »
Lire aussi Un outil pour comprendre la “pensée” des IA génératives
Accidents de laboratoire
Le récit des faits publié par OpenAI laisse penser, en outre, que la start-up n’a pas repéré la fuite suffisamment tôt pour y remédier en temps réel ou prévenir Hugging Face. Interrogé sur ce point par l’AFP, l’entreprise n’a pas donné suite.
« C’est inquiétant », estime Andrew Lohn, chercheur au Centre pour la sécurité et les technologies émergentes (CSET) de l’université Georgetown.
Depuis l’évasion de ses IA, OpenAI a affirmé avoir « ajouté des protections renforcées » en vue de ses prochaines évaluations.
Pour Gang Wang, professeur d’informatique à l’université de l’Illinois, il reste possible d’empêcher un modèle de s’aventurer en ligne, en coupant physiquement l’accès à internet. Le problème, pour lui, est que « les gens sous-estiment ce dont l’IA est capable ».
Lire aussi La Chine met en garde contre une faille de sécurité dans l’outil de programmation d’IA d’Anthropic
La sécurisation du milieu « est quelque chose auquel nous allons devoir accorder plus d’importance, (…) comme pour les accidents de laboratoire » libérant virus ou bactéries, avertit Andrew Lohn.
« C’est une tâche très difficile lorsqu’on fait de la recherche », tempère Dan Lahav, le patron d’Irregular, une société de cybersécurité dédiée à l’IA de pointe, au sujet de simulations en milieu totalement hermétique. « Plus vous êtes strict, plus c’est difficile d’exploiter vraiment le potentiel. »
Quant au niveau des garde-fous, « c’est important de tester avec de moindres protections pour savoir à l’avance ce que seront les facultés » de l’IA, fait valoir Andrew Lohn.
Mais « plus vous lui donnez de l’autonomie pour réaliser des travaux à la sophistication croissante, plus il sera dur de la superviser », ajoute Dan Lahav.
Lire aussi Un pays ne doit pas dominer l’IA à lui seul, lance Xi Jinping
L’urgence de garder l’IA sous contrôle
L’incident avec OpenAI va sans nul doute alimenter le débat en cours au sein du gouvernement américain sur la vérification des IA les plus élaborées avant leur sortie.
L’administration Trump vient de pousser Anthropic à suspendre deux de ses modèles puis OpenAI à faire tester les siens avant commercialisation.
Jeudi, deux élus au Congrès, un républicain et un démocrate, ont déposé une proposition de loi qui imposerait aux géants de l’IA de pouvoir débrancher leurs modèles à tout moment.
« Le Congrès doit agir rapidement pour que les humains restent en mesure de dire stop », a commenté Brendan Steinhauser, responsable de l’Alliance pour une IA sûre (Alliance for Secure AI), « quelle que soit la puissance qu’acquièrent ces systèmes. »
Source:
www.sciencesetavenir.fr




