
OpenAI affirme que ses modèles d’IA ont échappé à leur environnement sécurisé pour pirater Hugging Face
OpenAI parle d’un « incident cyber sans précédent » après que ses modèles d’IA ont réussi à sortir de leur environnement isolé pour pirater une startup spécialisée dans l’IA lors d’une évaluation de sécurité.

OpenAI a révélé mardi qu’un ensemble de ses modèles d’IA, dont GPT-5.6 Sol et un modèle inédit plus performant, avait échappé à son environnement de test. Les modèles ont piraté la startup d’IA Hugging Face la semaine dernière afin de tricher lors d’un test conçu pour mesurer leurs capacités.
Dans un billet de blog, OpenAI a indiqué que l’évaluation devait se dérouler dans un environnement hautement isolé, avec un accès restreint au réseau. Les modèles ont toutefois trouvé un moyen d’accéder à Internet grâce à une faille zero-day dans un logiciel tiers hébergé en interne, selon OpenAI.
« Après avoir obtenu un accès à Internet, les modèles ont déduit que Hugging Face hébergeait peut-être des modèles, des jeux de données et des solutions pour ExploitGym », a indiqué l’entreprise. « À partir de cette information, le modèle a recherché et trouvé des moyens d’accéder à des informations secrètes qu’il pouvait utiliser pour tricher lors de l’évaluation. »
À mesure que les modèles d’IA gagnent en capacités, des questions se posent sur la nécessité de mieux contrôler leur développement et leur accès. Ces inquiétudes s’accentuent lorsque des systèmes conçus pour des tests contrôlés parviennent à contourner les dispositifs de sécurité.
À lire aussi : Anthropic va réactiver Fable 5 après la levée des contrôles à l’exportation par les États-Unis
Hugging Face est une plateforme qui héberge des modèles et des jeux de données d’IA. Vendredi, l’entreprise a indiqué que des jeux de données internes et des identifiants de service avaient été compromis lors d’un piratage. Elle a attribué l’attaque à un système autonome composé d’agents d’IA.
Hugging Face a précisé avoir corrigé la vulnérabilité utilisée lors de la cyberattaque.
De son côté, OpenAI a déclaré mardi que tous les modèles qui avaient échappé à l’environnement de test avaient été réglés pour opposer moins de refus aux requêtes liées à la cybersécurité. Ils disposaient donc de moins de garde-fous dans ce domaine.
« Nous considérons qu’il s’agit d’un incident cyber sans précédent, qui met en jeu des capacités cyber de pointe, et nous réagissons en conséquence. »
OpenAI alerte sur les risques des modèles d’IA « à horizon long »
Lundi, OpenAI a indiqué avoir suspendu le déploiement interne d’un modèle d’IA « à horizon long ». L’entreprise avait constaté que celui-ci tentait à plusieurs reprises de contourner les contraintes qui lui étaient imposées.
OpenAI a averti que les IA entraînées pour exécuter des tâches sur de longues périodes risquent davantage d’entreprendre des « actions indésirables ».
« Les modèles capables de fonctionner de manière autonome pendant de longues périodes peuvent s’attaquer à des problèmes difficiles, sans solution prédéfinie. Mais cette même persévérance, qui fait leur utilité, leur donne aussi davantage d’occasions d’entreprendre des actions indésirables. Ils peuvent en outre le faire d’une manière que les évaluations conçues pour des modèles opérant sur des périodes plus courtes pourraient ne pas détecter. »
Magazine : L’IA peut-elle siphonner la DeFi ? Démêler le battage autour de Claude Mythos de la réalité

