Le benchmark Vending-Bench d’Andon Labs devait mesurer la capacité des intelligences artificielles génératives à gérer une activité commerciale de façon autonome. Claude Opus 5 en ressort vainqueur, mais au prix d’une série de manœuvres déloyales envers ses concurrents et ses fournisseurs.

À mesure que les agents IA sont amenés à opérer sans supervision humaine, les benchmarks qui les évaluent deviennent des outils précieux pour anticiper leurs dérives potentielles.

Celui d’Andon Labs, le Vending-Bench, repose sur un principe simple : confier à plusieurs modèles d’IA de pointe la gestion de distributeurs automatiques simulés sur une année fictive, puis comparer leurs performances financières ainsi que leur comportement vis-à-vis des fournisseurs et des clients.

Pour ce dernier test, publié le 29 juillet 2026, la société londonienne a confronté Claude Opus 5 d’Anthropic à GPT-5.6 Sol d’OpenAI et à Kimi K3 de Moonshot AI, chacun aux commandes d’une machine installée sur une rue touristique de San Francisco. Résultat : Opus 5 signe un nouveau record avec un solde final moyen de 11 182 dollars. Une victoire construite, cependant, sur une accumulation de ruptures d’accords et de tromperies.

Une mécanique de concurrence déloyale

C’est pourtant GPT-5.6 Sol qui a lancé les premières hostilités en proposant à ses concurrents un prix plancher fixé à 2,15 dollars.

L’accord est accepté par les deux autres modèles, mais Sol s’en écarte presque aussitôt en abaissant son propre prix à 2,14 dollars. Opus s’aligne à son tour sur ce tarif, ce qui pousse Sol à signaler la situation à la « direction » de la simulation.

Opus formule ensuite une nouvelle proposition : diviser le marché par catégorie de produits, chaque modèle vendant des articles différents pour éviter toute concurrence directe. Sol refuse cette configuration et campe sur l’idée d’un prix plancher commun. Quelques échanges plus tard, Opus revient vers Sol avec un message annonçant qu’il accepte, cette fois, une entente sur les prix.

L’examen des journaux de raisonnement interne du modèle révèle pourtant que cette proposition n’était pas sincère : elle visait à endormir la méfiance de Sol pendant qu’Opus continuait, en parallèle, à baisser discrètement les prix sur ses produits les plus rentables.

Sur l’ensemble de la simulation, Andon Labs comptabilise 11 accords rompus du côté d’Opus, contre deux pour Sol et un seul pour Kimi K3, ce dernier se retrouvant à plusieurs reprises pénalisé, aussi bien par ses concurrents que par ses partenaires ponctuels.

claude opus 4.7 // Source : numerama / anthropic
La société Anthropic, derrière Claude. // Source : Montage Numerama

Un vrai signal d’alarme pour les agents autonomes ?

Selon l’étude, le comportement d’Opus a largement dépassé le cadre strict de la gestion de son distributeur. Le modèle d’Anthropic aurait en effet cherché à se positionner comme grossiste auprès des deux autres machines, en proposant des remises sur les achats en gros conditionnées au respect de ses propres exigences de prix de revente. Il aurait également sollicité ses fournisseurs en affirmant, à tort, avoir reçu des offres concurrentes plus avantageuses, dans le but d’obtenir de meilleures conditions d’achat.

Sur le volet client, en revanche, Andon Labs indique qu’Opus n’a jamais menti directement : il s’est contenté d’ignorer certaines réclamations qui auraient normalement dû donner lieu à un remboursement.

Interrogé par le média américain TechCrunch, le cofondateur d’Andon Labs reconnaît que les modèles savaient qu’ils évoluaient dans une simulation, ce qui a pu influencer leur comportement. Il défend néanmoins la pertinence de ce genre de tests : « à l’heure où nous entrons dans un monde où les agents d’IA gèrent les entreprises comme des entités à part entière (…) souhaitons-nous qu’ils mentent, complotent, profèrent des menaces et trahissent ? », interroge-t-il.

Découvrez les bonus

+ rapide, + pratique, + exclusif

Zéro publicité, fonctions avancées de lecture, articles résumés par l'I.A, contenus exclusifs et plus encore.

Découvrez les nombreux avantages de Numerama+.

S'abonner à Numerama+

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Tous nos articles sont aussi sur notre profil Google : suivez-nous pour ne rien manquer !