Ce sont deux dynamiques bien différentes que dessine le dernier billet de blog d’OpenAI, publié le 6 septembre 2026.
Signée Jakub Pachocki, chef scientifique de l’entreprise américaine, la tribune décortique dans un premier temps la capacité croissante des modèles à gagner en autonomie offensive sur les systèmes informatiques.
Jusque-là, rien de fondamentalement nouveau. S’il en fallait une preuve récente, l’épisode du piratage de Hugging Face, largement documenté par OpenAI elle-même, est devenu le symbole de cette montée en puissance.
Mais alors que de nouveaux incidents similaires sont dévoilés au fil des semaines et que la question de la sécurisation des environnements dans lesquels évoluent les agents IA devient de plus en plus pressante, l’ingénieur dresse un autre défi majeur : la baisse de notre capacité à comprendre et à observer de façon pertinente le raisonnement des modèles ayant conduit à ces intrusions.


Un outil de surveillance qui s’effrite
Le point le plus significatif concerne ce que les chercheurs nomment couramment le « chain-of-thought monitoring », la surveillance de la chaîne de pensée.
Il s’agit de laisser les modèles verbaliser leur raisonnement en clair, sans optimiser directement ce contenu, afin de pouvoir l’observer et y détecter d’éventuelles intentions problématiques.
L’ingénieur rappelle d’ailleurs qu’OpenAI en avait fait un pilier de sa stratégie de sécurité dès le lancement d’o1-preview, allant jusqu’à masquer ce raisonnement aux utilisateurs pour le protéger de toute pression d’optimisation indirecte.
Mais cette approche serait aujourd’hui mise à mal par trois évolutions convergentes :
- D’abord, les modèles mêlent désormais leur raisonnement à des interactions avec des humains, d’autres IA et des outils externes, ce qui brouille la frontière entre ce qui doit être supervisé et ce qui ne devrait pas l’être.
- Ensuite, ils apprennent à raisonner sur leur propre processus de raisonnement, et donc, potentiellement, à le manipuler.
- Enfin, les gains de performance obtenus dès le pré-entraînement permettent aux modèles d’être performants sans même verbaliser de chaîne de pensée explicite.
Résultat, selon ses propres mots : la fiabilité de cette supervision diminue progressivement. Une érosion particulièrement critique lorsqu’il est question de cybersécurité.
Des capacités qui inquiètent
Car dans le même temps, Jakub Pachocki décrit des modèles en passe de devenir « surhumains » pour s’introduire dans les systèmes informatiques, capables d’affecter la quasi-totalité des infrastructures.
Une communication alarmiste qui s’inscrit dans la continuité des prises de position récentes d’OpenAI. En août 2026, l’entreprise avait déjà plaidé pour une une coordination du secteur face à ces défis, annonçant dans le même temps la suspension de certains entraînements par apprentissage par renforcement.
Cette nouvelle tribune va plus loin, défendant notamment l’instauration de seuils de sécurité communs, controlés par des auditeur tierces, appelés à devenir obligatoires pour poursuivre le développement.
À force de prises de position répétées, OpenAI se rapproche d’une posture longtemps associée à Anthropic, et régulièrement dénoncée par des voix comme celle de Yann LeCun, qui accuse les grands laboratoires d’agiter le risque pour pousser des normes si strictes qu’elles évincent de fait les acteurs plus petits et l’open source.
Reste à voir si OpenAI essuiera les mêmes critiques.
Vous avez lu 0 articles sur Numerama ce mois-ci
Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.
Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :
- 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
- 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
- 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.
Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.
Toute l'actu tech en un clin d'œil
Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !
Pour ne rien manquer de l’actualité, suivez Numerama sur Google !


