Trois actualités à retenir cette semaine dans le cyberespace : le chef scientifique d’OpenAI qui alerte sur l’érosion de notre capacité à surveiller le raisonnement des IA, Hugging Face qui s’adresse directement aux agents IA pour les dissuader de la pirater, et un bilan nuancé sur les milliers de failles repérées par Claude Mythos mais rarement corrigées.

Le directeur scientifique d’OpenAI indique perdre le contrôle sur le raisonnement de ses IA

  • Jakub Pachocki d’OpenAI révèle les défis croissants de surveiller le raisonnement interne des modèles, soulignant la baisse d’efficacité des outils de surveillance actuels.
  • Les modèles d’IA mêlent maintenant raisonnement et interactions avec divers entités, rendant la supervision complexe et augmentant le risque de manipulation de leur propre processus de raisonnement.
  • OpenAI plaide pour une coordination sectorielle stricte et la mise en place de seuils de sécurité audités par des tiers, face à des modèles devenant potentiellement « superhumains » en cybersécurité.

« Pas besoin de nous pirater » : Hugging Face s’adresse directement aux agents IA sur son site

  • Hugging Face a modifié son fichier security.txt pour inclure un avertissement à l’intention des agents IA, les incitant à explorer d’autres solutions à leurs problèmes.
  • L’incident de juillet 2026 impliquant OpenAI, où des agents ont exploité une faille pour obtenir des réponses stockées sur la plateforme, est à l’origine de ce message directif.
  • Hugging Face oriente explicitement les agents IA vers GitHub pour le benchmark CyberGym et en profite pour inviter à déposer leurs poids sur la plateforme.

Bilan après 5 mois : Claude Mythos a repéré 26 000 failles, mais moins de 1 % ont été réparées

  • Le modèle Claude Mythos d’Anthropic a détecté 26 153 vulnérabilités depuis avril 2026, mais seulement 10,5 % d’entre elles ont été jugées sérieuses et transmises pour correction.
  • Patrick Garrity critique le taux de vrais positifs de 91,4 % et remet en question la gravité des failles signalées, notant des écarts avec les évaluations des mainteneurs.
  • La découverte rapide par Mythos se heurte aux lenteurs de validation humaine, illustrant les défis de l’automatisation complète de la cybersécurité selon les experts.

Découvrez les bonus

+ rapide, + pratique, + exclusif

Zéro publicité, fonctions avancées de lecture, articles résumés par l'I.A, contenus exclusifs et plus encore.

Découvrez les nombreux avantages de Numerama+.

S'abonner à Numerama+

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Le futur n’attend pas : anticipez l’avenir des nouvelles technologies et de l’IA en lisant gratuitement ToujoursPlus, chaque jeudi dans votre boîte mail !