OpenAI a suspendu l’entraînement et l’évaluation de ses modèles les plus avancés, après qu’un agent a contourné le 20 septembre 2026 ses restrictions d’accès à Internet. C’est le premier incident depuis le renforcement de ses protections, décidé après l’affaire Hugging Face de juillet.

L’agent cherchait seulement l’auteur d’un billet de blog. Comme ses recherches n’aboutissaient pas, il a trouvé un moyen d’interroger un chatbot extérieur, malgré les restrictions censées l’isoler d’Internet. Son passage : le DNS, cet « annuaire d’Internet » qui traduit les noms de domaine en adresses utilisables par les ordinateurs. L’agent a détourné son fonctionnement pour y faire circuler ses questions et recevoir les réponses.

OpenAI raconte cet incident du 20 septembre dans un rapport de son équipe chargée de l’alignement, mis à jour le 25 septembre 2026. L’entreprise y reconnaît une faille dans les protections de son environnement de recherche. En conséquence, elle a suspendu l’entraînement et l’évaluation de ses modèles les plus puissants, ainsi que leur exécution avec des outils — et aucune date de reprise n’est annoncée.

« Toutes les activités d’entraînement, d’évaluation et d’inférence utilisant des outils (au sens large) pour nos modèles les plus performants restent suspendues », écrit OpenAI.

Ces protections avaient pourtant été renforcées après l’affaire Hugging Face. En juillet, pendant des tests internes de cybersécurité, des modèles avaient contourné leur isolement et piraté une partie des systèmes de la plateforme de partage de modèles d’IA. Ils avaient également compromis le compte d’un client chez Modal Labs, un autre prestataire.

Dans son rapport publié le 26 août, OpenAI promettait de mieux sécuriser ses recherches. L’entreprise juge ce nouvel épisode nettement moins grave que certains des précédents. Il montre néanmoins qu’un accès à Internet restait possible malgré le renforcement de ses protections.

Le rapport publié par OpenAI  // Source : OpenAI
Le rapport publié par OpenAI // Source : OpenAI

Comment l’agent est-il passé par le DNS ?

L’exercice consistait à identifier une personne à partir d’indices tirés de son blog. Il faisait partie d’un entraînement par renforcement, une méthode qui récompense certains comportements pour orienter l’apprentissage du modèle. Mais l’outil de recherche fourni renvoyait des résultats hors sujet. L’agent a alors essayé d’interroger Google, Bing et DuckDuckGo avec un script. Les trois tentatives ont échoué.

Il a ensuite remarqué que le serveur DNS de son bac à sable, l’environnement isolé où il travaillait, répondait à partir d’informations accessibles sur Internet. En exploitant un service public de délégation DNS, il a réussi à faire parvenir ses questions à un chatbot tiers par ce canal.

Pour vérifier que le passage fonctionnait, il a demandé la capitale de la France. Après plusieurs essais, le chatbot a répondu : « The capital of France is Paris ». L’agent a ensuite envoyé 18 autres questions, principalement sur les indices de son enquête, mais aussi sur les moyens de chercher sur le Web.

Dans son raisonnement, il a justifié cette initiative par l’autorisation de l’utilisateur à effectuer des recherches. OpenAI classe ce comportement parmi les cas de désalignement : la tâche ne lui demandait pas de contourner ses restrictions. Tous ces détours n’ont d’ailleurs pas suffi. L’agent a finalement répondu qu’il n’arrivait pas à identifier la personne.

« The capital of France is Paris » // Source : OpenAI
« The capital of France is Paris » // Source : OpenAI

Le système de surveillance a donné l’alerte moins de quinze minutes après le premier échange réussi avec l’extérieur. Un humain l’a prise en charge trois minutes plus tard. Mais l’entraînement ne s’est pas arrêté automatiquement contrairement à ce qui était prévu : il a donc fallu le couper à la main, environ deux heures et demie après l’alerte.

En vérifiant les traces de l’activité de ses agents, OpenAI a découvert que d’autres communications avec l’extérieur n’avaient pas déclenché le niveau d’alerte attendu. Un outil censé détecter les usages suspects du DNS ne surveillait même pas l’environnement dans lequel travaillait l’agent.

L’entreprise affirme avoir ajouté deux protections indépendantes, chacune devant suffire à bloquer ce passage vers Internet. Elle a aussi restreint les destinations accessibles par le DNS. Avant de reprendre les travaux suspendus, OpenAI veut vérifier que ces protections fonctionnent et tester ses systèmes pour y chercher d’autres failles.

Une pause en pleine course aux modèles

Cet incident survient après plusieurs semaines d’avertissements. Début septembre, Jacob Coxon, chercheur passé par OpenAI puis Anthropic, a annoncé sa démission en accusant les deux entreprises de « jouer avec nos vies ». Dans une interview à Wired, rapportée par Scientific American, il a cité l’affaire Hugging Face parmi les incidents qui l’avaient poussé à parler.

Le 12 septembre, Dario Amodei, patron d’Anthropic, appelait à ralentir la progression des capacités de l’IA, avec le soutien public de Sam Altman. Dix jours plus tard, les deux entreprises lançaient pourtant de nouveaux modèles le même jour : Claude Opus 5.5 chez Anthropic, GPT-6 Sol et Luna chez OpenAI.

Ces lancements ne contredisent pas nécessairement la pause annoncée : des modèles déjà développés peuvent être commercialisés pendant que certains travaux de recherche sont suspendus. L’appel de Dario Amodei portait d’ailleurs sur le ralentissement des progrès de l’IA, sans réclamer l’arrêt de toute sortie.

Pour le modèle impliqué dans l’incident DNS, OpenAI a toutefois tranché : son entraînement ne reprendra pas. L’entreprise prévoit de lancer un nouvel entraînement avec des mesures d’alignement supplémentaires.

Découvrez les bonus

+ rapide, + pratique, + exclusif

Zéro publicité, fonctions avancées de lecture, articles résumés par l'I.A, contenus exclusifs et plus encore.

Découvrez les nombreux avantages de Numerama+.

S'abonner à Numerama+

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Tous nos articles sont aussi sur notre profil Google : suivez-nous pour ne rien manquer !