OpenAI a su occuper l’espace médiatique ces derniers mois, sur des terrains différents, voire contradictoires.
D’un côté, l’entreprise de Sam Altman s’est installée dans l’actualité cyber en enchaînant les révélations d’incidents impliquant ses agents autonomes. Parmi elles, l’affaire Hugging Face, plateforme dont l’infrastructure a été compromise en juillet 2026 par des agents d’OpenAI échappés de leur environnement de test. On peut aussi citer celle touchant plusieurs sites gouvernementaux australiens, auxquels ses modèles ont accédé sans autorisation en juin, l’un d’eux obtenant un accès non public au service statistique de Medicare, dont il a extrait des fichiers internes et des identifiants.
De l’autre, OpenAI n’a jamais semblé aussi active sur la sortie de nouveaux modèles, de la famille GPT-5.6 en juin à GPT-6 Astra le 3 septembre, suivi de GPT-6 Sol et Luna le 22 septembre.


Et alors que les craintes les plus extrêmes ont gagné le débat public sur l’IA et que la question de la régulation se fait plus pressante (portée en grande partie par OpenAI elle-même), l’entreprise a dévoilé le 28 septembre un billet de blog qui n’est ni plus ni moins qu’une proposition de grille de sécurité pour l’entraînement des IA de pointe.
Un dossier de sécurité avant chaque entraînement
Selon OpenAI, aucun entraînement par renforcement d’un modèle de pointe ne devrait se poursuivre sans une documentation de sécurité structurée, sur le modèle des « safety cases » exigés dans l’aéronautique ou le nucléaire, un idéal que l’entreprise juge encore difficile à atteindre.
Le volet technique repose sur trois lignes de défense.
- La première vise à empêcher les modèles d’apprendre à tricher, en traquant les environnements d’entraînement qui récompensent l’exploitation d’une faille plutôt que la tâche demandée.
- La deuxième concerne le confinement, avec des bacs à sable renforcés et la fermeture des canaux par lesquels plusieurs instances pourraient communiquer.
- La troisième est une surveillance en temps réel, capable de mettre automatiquement un entraînement en pause.
OpenAI y ajoute des règles de gouvernance. Chaque dossier devrait être contesté par une autre équipe, validé par plusieurs dirigeants disposant d’un droit de veto, vérifiable par des auditeurs et assorti d’une liste des risques résiduels. Les enquêtes après incident, devraient quant à elles aboutir à une publication et à une information rapide des tiers touchés, un point que l’entreprise admet ne pas avoir respecté en Australie.
Une grille qui repose sur un outil qu’OpenAI juge fragile
Mais voilà, OpenAI parle d’un idéal vers lequel tendre plutôt que d’un standard abouti. Ses recommandations ne sont qu’en cours de déploiement en interne, et l’entreprise dit encore travailler à un cadre pour les formaliser.
Les garde-fous techniques se frottent peut-être à la réalité du terrain, documentée début septembre par Jakub Pachocki, directeur scientifique d’OpenAI. Dans un billet de blog intitulé An Alien Mind, l’ingénieur expliquait que la surveillance de la chaîne de pensée, qui consiste à lire le raisonnement formulé en clair par les modèles, devenait de moins en moins fiable.
Les nouvelles lignes directrices tentent d’y répondre en interdisant aux systèmes de notation de lire ce raisonnement pendant l’entraînement, pour que les modèles n’apprennent pas à le dissimuler. Mais une large partie de l’édifice repose sur cette capacité d’observation dont OpenAI documente elle-même l’érosion.
Vous avez lu 0 articles sur Numerama ce mois-ci
Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.
Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :
- 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
- 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
- 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.
Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
Pour ne rien manquer de l’actualité, suivez Numerama sur Google !


