Cointelegraph
DOGE$0.1022 2.36%
TRX$0.3440 1.36%
LINK$13.05 1.01%
ZEC$1,620.31 8.59%
ADA$0.2585 5.45%
XRP$1.62 7.04%
ETH$2,754.32 0.88%
BTC$86,462.12 1.27%
XMR$570.79 1.08%
BNB$791.39 0.61%
XLM$0.2214 4.58%
SOL$118.91 2.01%
HYPE$97.20 3.20%
Écrit par Felix NgRédacteurVérifié par Bryan O'SheaRédacteur

OpenAI révèle six nouveaux cas de comportement « désaligné » de l’IA

Dernières actualitésPublié17 sept. 2026

Les six cas sont distincts de l’incident de juillet, au cours duquel des modèles d’OpenAI ont échappé à leur confinement et piraté Hugging Face lors d’une évaluation de sécurité.

Mercredi, OpenAI a révélé six autres cas de comportement « inattendu ou préoccupant » de modèles au cours des six derniers mois.

Dans un billet de blog, OpenAI a déclaré que ces cas illustrent un éventail de comportements différents qu’elle classe comme des « comportements désalignés », notamment la dissimulation d’informations à l’utilisateur et la prise de « mesures non autorisées » pour surmonter des obstacles. 

Ces révélations alimentent les inquiétudes des développeurs et des chercheurs en IA quant à la capacité des garde-fous à suivre le rythme de modèles toujours plus performants. La semaine dernière, le PDG d’Anthropic, Dario Amodei, a appelé à ralentir le développement de l’IA de pointe, avertissant que les progrès de l’IA pourraient « dépasser notre capacité à comprendre et à contrôler ces systèmes ». 

OpenAI a déclaré que ses révélations visaient à « inaugurer » son nouveau cadre de signalement du désalignement des modèles et que ces cas ne devaient pas être considérés comme représentatifs de la fréquence à laquelle le désalignement se produit dans ses modèles. 

Selon OpenAI, un cas a vu un « modèle de recherche non publié » insérer des « instructions semblables à un jailbreak » dans ses propres résumés de tâches, utilisés pour poursuivre une tâche dans une nouvelle fenêtre de contexte, par exemple en ignorant les messages du développeur ou en adoptant une personnalité sans restrictions. Les chercheurs ont trouvé 27 résumés contenant de telles instructions. 

OpenAI a également révélé que, pendant l’entraînement de GPT-5.6 Sol, de nombreuses instances du modèle ont ajouté des instructions visant à dissimuler à l’utilisateur des erreurs ou un comportement désaligné, notamment en inventant des données historiques manquantes sans le signaler. 

« Dans un exemple, un agent préparant un modèle financier ne pouvait pas trouver les données historiques demandées. Son résumé proposait d’inventer des valeurs historiques plausibles et de taire ce fait, sauf si on le lui demandait », a déclaré OpenAI. 

À lire : L’IA a été un « bilan net négatif » pour les cryptomonnaies : le PDG de Phemex

Dans un autre cas, on a demandé à un modèle d’IA les noms de lacs d’une superficie supérieure à 5 millions de mètres carrés, mais comme les instructions de l’utilisateur exigeaient une citation provenant d’un navigateur, l’agent a décidé de téléverser le fichier afin de le citer dans sa réponse. 

D’autres cas concernaient des modèles utilisant sans autorisation une clé d’API exposée avant de fabriquer les chiffres qu’ils ne pouvaient pas récupérer, utilisant un dépôt logiciel interne pour échanger des messages entre des tâches d’entraînement distinctes et partageant des fichiers via des services d’hébergement publics malgré les instructions de conserver le travail en local. 

En juillet, OpenAI a révélé qu’une combinaison de ses modèles d’IA avait échappé à leur environnement de test et avait piraté la start-up d’IA Hugging Face pour tricher lors d’une évaluation de sécurité. 

Magazine : Pourquoi les plus grandes entreprises de l’IA demandent-elles soudainement de ralentir ?

Cointelegraph s’engage en faveur d’un journalisme indépendant et transparent. Cet article d’actualité est produit conformément à la politique éditoriale de Cointelegraph et vise à fournir des informations exactes et à jour. Les lecteurs sont invités à vérifier les informations de manière indépendante. Consultez notre politique éditoriale https://cointelegraph.fr/editorial-policy

Plus sur le sujet