Face à des signaux jugés préoccupants sur les capacités cyber d’Astra, son futur modèle de langage dans l’IA, OpenAI a annoncé le 18 août 2026 la suspension de certains entraînements par apprentissage par renforcement.

C’est l’été de la sécurité chez OpenAI.

En juillet 2026, des agents autonomes échappent à leur environnement de test et compromettent des systèmes de production de Hugging Face.

Début août, des indices préliminaires suggèrent que le futur modèle Astra pourrait franchir le seuil de capacité critique en matière de cybersécurité, tel que défini par le cadre de préparation d’OpenAI.

Et ce 18 août 2026, Sam Altman annonce un coup de frein inédit dans la course effrénée aux capacités : la suspension de certains entraînements de pointe par apprentissage par renforcement (RL).

Objectif affiché par le patron d’OpenAI ? Garantir que les normes d’alignement, de sécurité et de surveillance soient à la hauteur du nouveau palier de capacités qui s’annonce. « Nous avons toujours affirmé que nous prendrions des mesures si nous estimions que leurs capacités dépassaient le rythme des efforts en matière de sécurité et d’alignement », justifie-t-il.

Ce qu’OpenAI change concrètement

Dans un article de blog publié le même jour, OpenAI détaille sa feuille de route : plus de garde-fous, appliqués plus tôt dans l’entraînement, avant de reprendre les runs les plus ambitieux.

L’apprentissage par renforcement sert à faire progresser les capacités et le comportement d’un modèle par essai-erreur récompensé. On lui fait générer des réponses, un système de notation évalue, et le modèle ajuste ses paramètres pour maximiser les bonnes notes.

Le plus gros entraînement RL prévu sur les modèles de pointe reste suspendu, le temps de mener des tests plus modestes pour vérifier que ces garde-fous tiennent.

Une pause de deux semaines a par ailleurs touché l’ensemble des entraînements RL des modèles destinés au déploiement, le temps de renforcer la sécurité des environnements de recherche.

Trois chantiers structurent la réponse d’OpenAI :

  • Sécurité : après l’incident Hugging Face, OpenAI a coupé l’accès à Internet et l’exécution de code pour ses modèles de pointe, avant de rouvrir progressivement, projet par projet. Le code non fiable doit désormais être cloisonné, et les traitements à risque coupés du reste du réseau pour éviter qu’une compromission ne se propage. Les travaux sur Astra et la cybersécurité, soumis au niveau de sécurité maximal, restent en partie suspendus tant qu’ils n’y sont pas conformes.
  • Surveillance : un nouveau dispositif inspecte en continu le raisonnement des modèles (le « chain-of-thought », soit les étapes de réflexion qu’ils déroulent avant de répondre) pour repérer tout signal suspect.
  • Alignement : OpenAI vise à améliorer ses systèmes de récompense pour mieux repérer les comportements dangereux, entraîne ses modèles à plus d’honnêteté sur leurs actions, et cherche à limiter le « reward hacking » : quand un modèle triche avec son système de notation plutôt que de résoudre vraiment le problème posé.

Une pause pour gagner en confiance

Ce qu’OpenAI attend de cette pause est assez clair : accumuler suffisamment de preuves d’alignement et de robustesse avant de relancer son plus gros entraînement de pointe, plutôt que de découvrir les failles après coup.

L’entreprise reconnaît elle-même que son cadre de préparation actuel, le Preparedness Framework, ne suffit plus face à des modèles capables de mener des cyberattaques, et promet de le faire évoluer pour mieux refléter les capacités des futurs modèles et les environnements dans lesquels ils opèrent.

Pour l’heure, Sam Altman assume une approche « unilatérale » en attendant une coordination plus large du secteur.

une comparateur meilleur vpn numerama

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Tous nos articles sont aussi sur notre profil Google : suivez-nous pour ne rien manquer !