Après une levée de fonds de 28 millions d’euros en série A, la start-up française Arlequin AI sort progressivement de sa phase de discrétion. Son architecture, fondée sur des réseaux de neurones topologiques, vise des secteurs où une erreur coûte cher : sécurité, défense, finance. Rencontre avec ses deux fondateurs.

C’est un changement d’échelle, et le point de départ de cette rencontre. Le 10 septembre, Arlequin AI annonçait une levée de fonds de 28 millions d’euros en série A.

L’occasion d’échanger avec les fondateurs de cette start-up française de la deeptech, qui voient dans l’intérêt des investisseurs la confirmation du potentiel des réseaux de neurones topologiques développés par l’entreprise. Selon eux, ces technologies se trouvent aujourd’hui « à peu près au même niveau de développement que les LLM il y a dix ans ».

Déjà déployée en France, au Royaume-Uni et en Allemagne, dans le secteur public comme dans le privé, l’entreprise compte sur cette levée pour passer à la vitesse supérieure. Avec, en ligne de mire, l’ouverture d’un laboratoire à San Francisco, consacré notamment à la sécurité des systèmes d’IA les plus avancés.

Aux commandes, deux profils bien distincts. Hugo Micheron vient des sciences politiques, tandis qu’Antoine Jardin est chercheur au CNRS en data science, spécialisé dès ses débuts dans la réduction de dimensionnalité, un domaine mathématique qui s’avérera central dans l’architecture d’Arlequin AI.

Le nom de l’entreprise porte d’ailleurs la trace de ces deux univers. Arlequin, figure carnavalesque de la Commedia dell’arte, évoque ces moments où le vrai et le faux s’inversent, à l’image d’un monde informationnel dans lequel l’entreprise veut « voir clair à travers le désordre », explique Hugo Micheron. Pour les initiés, c’est aussi un clin d’œil mathématique, puisque les losanges du costume évoquent le complexe simplicial, la structure au cœur des réseaux de neurones topologiques. Nous y reviendrons.

Les deux hommes se connaissent depuis quinze ans, et leur histoire commune a quelque chose d’un jeu de miroir. « C’est presque Antoine qui m’a décidé à faire une thèse il y a quinze ans », raconte Hugo Micheron. « Ce qui l’amène parfois à dire que c’est moi qui l’ai décidé à monter une start-up il y a deux ans. »

De cette amitié de longue date est née une conviction partagée. « Historiquement, les problèmes relatifs au comportement humain, on ne les traite pas avec des modèles mathématiques très avancés », résume Hugo Micheron. C’est précisément cette lacune que l’essor des réseaux de neurones vient combler, à condition, disent-ils, de ne pas se tromper d’outil.

Hugo Micheron (à gauche) et Antoine Jardin (à droite), co-fondateurs d'Arlequin AI // Source : Arlequin AI
Hugo Micheron (à gauche) et Antoine Jardin (à droite), co-fondateurs d’Arlequin AI // Source : Arlequin AI

Sortir du brouillard de « l’IA générative » !

Avant de décrire ce que fait Arlequin AI, il faut préciser ce que l’entreprise n’est pas. Depuis l’explosion de ChatGPT, le terme « intelligence artificielle » est souvent réduit, à tort, à une seule famille de technologies : les grands modèles de langage (LLM), génératifs par construction. Arlequin AI ne s’inscrit pas dans cette famille, et ses fondateurs voient d’ailleurs dans cette confusion un malentendu qui dessert la compréhension du secteur tout entier.

« Les LLM ont fait écran à l’étendue du champ de l’IA », résume Hugo Micheron. Hugo Micheron ne rejette pas pour autant les modèles de langage (Arlequin peut amener à les utiliser, comme on le verra), il rappelle leur nature : « Les LLM sont des modèles de génération et de raisonnement très intéressants. Mais ils n’ont jamais été conçus pour être des modèles d’analyse systématique sans inférer de biais. »

Autrement dit, un LLM produit des sorties à partir d’une modélisation probabiliste. Un fonctionnement qui peut devenir une limite lorsqu’il s’agit de garantir, sans mécanisme de vérification supplémentaire, un résultat exact et reproductible.

Or, dans les secteurs où opère Arlequin, notamment la sécurité, la défense et la finance, le besoin de fiabilité est essentiel : « Si on rate une information, ça peut avoir des conséquences dramatiques. […] Dans ces secteurs-là, les applications des LLM sont limitées », insiste Hugo Micheron. C’est ce constat, partagé selon lui par l’ensemble des acteurs du marché, qui a poussé Arlequin à explorer une tout autre architecture dès sa création : les réseaux de neurones topologiques.

Comprendre les réseaux de neurones topologiques

Pour saisir ce que change cette architecture, il faut revenir sur la manière dont les systèmes d’IA actuels représentent l’information.

Aujourd’hui, les modèles les plus connus, les Transformers, qui propulsent les LLM, excellent à mettre en relation chaque élément d’un texte ou d’un jeu de données avec tous les autres. Lorsqu’il s’agit de modéliser des structures physiques ou des réseaux complexes, l’industrie s’appuie souvent sur des réseaux de neurones graphiques (GNN), qui représentent le monde sous forme de points reliés deux à deux par des lignes.

Si ces approches sont puissantes, elles présentent toutes deux des limites pour modéliser finement des interactions de groupe complexes. Les Transformers lient les éléments par des associations statistiques globales, parfois floues, tandis que les GNN représentent principalement les relations deux à deux. En clair, ces architectures classiques ne représentent pas toujours explicitement ce qui émerge quand trois, quatre ou dix éléments s’associent simultanément.

C’est exactement ce que cherchent à corriger les réseaux de neurones topologiques (TNN) sur lesquels travaille Arlequin AI. Plutôt que de se limiter à des relations deux à deux, ils s’appuient sur des structures mathématiques issues de la topologie. Non plus seulement « A est lié à B », mais « A, B et C forment ensemble un bloc cohérent ». On passe donc de simples lignes entre deux points à de véritables « formes » (des triangles ou des tétraèdres pleins) qui englobent plusieurs éléments à la fois.

Ce champ de recherche, encore jeune, baptisé le « topological deep learning », est notamment étudié pour analyser des réseaux biologiques, l’activité du cerveau ou des systèmes financiers très complexes.

Alors qu'un GNN ne voit que des points et des lignes, un TNN utilise des objets de dimensions supérieures : les triangles pleins (surfaces) et les tétraèdres pleins (volumes). // Source : Infographie Numerama
Alors qu’un GNN ne voit que des points et des lignes, un TNN utilise des objets de dimensions supérieures : les triangles pleins (surfaces) et les tétraèdres pleins (volumes). // Source : Infographie Numerama

Antoine Jardin, qui porte la dimension technique du projet, résume l’objectif : « Dans les systèmes de traitement de données complexes, on a besoin de certifier les relations et de regarder de très près la façon dont beaucoup de points de données sont connectés entre eux. (…) C’est un peu comme le travail de journaliste : on prend plein d’éléments d’information, et il faut les relier entre eux d’une façon qui soit vérifiable et auditable. »

Selon les fondateurs d’Arlequin AI, cette architecture permettrait non seulement de repérer des connexions de groupe, mais aussi de les cartographier, de les tracer et de mieux les généraliser.

Comment fonctionne Arlequin AI ?

À quoi ressemble l’usage d’Arlequin pour un client ? « On prend n’importe quel jeu de données, vidéo, audio, texte, image, peu importe. On le met dans la plateforme Arlequin, pas de prompt, pas de message, rien et on obtient une visibilité totale de notre jeu de données », décrit Hugo Micheron.

À partir de là, des modèles non supervisés analysent l’intégralité de l’information, en extraient les relations, les signaux et les structures pertinentes, et stockent ce résultat « à froid », c’est-à-dire déjà calculé, prêt à être interrogé.

Et ce n’est qu’à ce stade qu’un LLM peut entrer en jeu, non pour produire une réponse, mais pour aller chercher, dans cette base déjà constituée, l’information pertinente et la restituer à l’utilisateur. « Les LLM sont très utiles pour permettre d’accéder en langage naturel aux résultats qui sont calculés de façon complètement indépendante par nos systèmes. Nous n’utilisons jamais les LLM pour produire ni modifier les résultats eux mêmes. C’est ce qui leur permet d’etre audités et vérifiés de façon exhaustive. », détaille Antoine Jardin.

Voilà donc pourquoi le cœur d’Arlequin n’est pas génératif : son rôle se joue en amont, dans l’analyse et la structuration des informations contenues dans les données.

L’intérêt de cette approche, selon les fondateurs, est de révéler des phénomènes invisibles aux outils d’analyse classiques. Antoine Jardin cite l’exemple du risque financier : « il peut y avoir toute une série de transactions entre des individus, deux par deux, qui sont légales, mais le système d’ensemble, la structure globale, témoigne d’une activité illégale. »

Autre argument, celui du biais. Sans couche générative pour interpréter la donnée, Arlequin élimine-t-elle mécaniquement le biais ? « Ça va dépendre de la donnée que l’on met en entrée », précise Hugo Micheron, « si on injecte des données biaisées, naturellement le résultat le sera aussi, la plateforme analyse ce qu’on lui transmet, sans rien y ajouter. »

En revanche, l’outil se distingue par sa capacité à corriger le biais de confirmation de l’utilisateur lui-même. Lorsqu’un analyste ne consulte qu’une fraction de ses données pour étayer une hypothèse préexistante, la plateforme peut le signaler. « Il pourra dire : attention, on est en train de regarder 0,1 % de la donnée, et on est en train de tirer des conclusions sur quelque chose qui est en fait le petit bout de la lorgnette », explique Hugo Micheron, avant d’opposer ce comportement à celui de l’IA générative, « nos modèles vont refléter ce que révèle la donnée, sans y rajouter d’éléments externes ou hypothèses utilisateurs ».

Qui utilise Arlequin, et pour quoi faire ?

Les cas d’usage se répartissent, sans grande surprise, autour de la sécurité et de la défense, mais aussi autour de ce que les fondateurs appellent « l’usage stratégique de l’information » : fraude bancaire, désinformation, cyberattaques (dont les journaux de logs constituent, par nature, des données de connectivité particulièrement adaptées à ce type d’analyse). D’autres exemples sortent de ce périmètre attendu, comme les clubs de football qui doivent analyser « toutes les stats de trois saisons de joueurs sur l’intégralité des sept grands championnats », décrit Hugo Micheron. Un volume de données considérable, dans lequel il s’agit d’extraire les éléments les plus saillants, ou au contraire de révéler des configurations que personne n’avait anticipées.

Arlequin AI se positionne également dans l’analyse massive d’information pour des médias ou des services d’enquête.

La traçabilité est peut-être l’argument le plus structurant de l’entretien. Avec un LLM, rappelle Antoine Jardin, « on ne peut pas tracer le comportement des LLM. On ne peut pas observer ce qui se passe à l’intérieur, on ne peut pas vérifier. »

Une limite qui rejoint des débats bien réels du secteur : plusieurs laboratoires, dont OpenAI, ont publiquement reconnu des difficultés croissantes à analyser précisément le raisonnement interne (la « chain of thought ») de leurs modèles les plus avancés.

À l’inverse, les modèles topologiques offrent, selon Antoine Jardin, « une transparence complète sur le comportement du modèle », permettant de « certifier de la donnée source jusqu’au résultat toutes les étapes de traitement qui ont eu lieu. » Une auditabilité qui devient un critère décisif dès lors qu’une décision automatisée touche à un système critique : « on ne confierait pas à un modèle de langage le pilotage d’un avion ou d’un système critique », illustre-t-il.

Le pari d’une vision européenne

Parmi les arguments avancés en faveur de leur solution, un dernier renvoie à la vision plus large que défendent les deux fondateurs, celle d’un modèle européen de l’IA.

Pour Antoine Jardin, l’Europe « n’a pas les ressources ni en calcul, ni en données, ni en régulation pour faire la même chose que ce que font les Américains, les Chinois ».

Chercher à les rattraper, ce serait partir avec un handicap permanent. Il faut donc, selon lui, construire une voie technologique distincte. « Il y a un modèle américain où on joue sur leur terrain : grosse puissance de calcul, data infinie, investissement infini. Il y a le modèle chinois, très autoritaire, qui discipline tout ça. C’est maintenant que l’Europe a l’opportunité de définir son modèle distinct. »

Arlequin entend contribuer à combler ce vide par l’architecture plutôt que par la puissance brute. « La force, c’est qu’on n’a pas à entraîner de modèles, mais on est capables de traiter de la donnée massive extrêmement complexe, sans avoir besoin de milliards d’investissements pour avoir une plateforme très efficace », explique Hugo Micheron. Un choix dont la portée reste encore mal perçue, reconnaît-il : « C’est vraiment une nouvelle architecture […] et ça, c’est un vrai sujet en soi […] on a presque du mal à faire passer le message. »

Les fondateurs ne nient pas l’existence de concurrents directs, chinois comme américains, du côté de la recherche. Hugo Micheron estime toutefois qu’Arlequin garde un coup d’avance. « Ils sont sur des usages beaucoup plus laboratoire […] Arlequin AI est une deep tech avec de la recherche fondamentales à la frontière de ce qui se fait aujourd’hui et une plateforme opérationnelle.. »

Découvrez les bonus

+ rapide, + pratique, + exclusif

Zéro publicité, fonctions avancées de lecture, articles résumés par l'I.A, contenus exclusifs et plus encore.

Découvrez les nombreux avantages de Numerama+.

S'abonner à Numerama+

Vous avez lu 0 articles sur Numerama ce mois-ci

Il y a une bonne raison de ne pas s'abonner à

Tout le monde n'a pas les moyens de payer pour l'information.
C'est pourquoi nous maintenons notre journalisme ouvert à tous.

Mais si vous le pouvez,
voici trois bonnes raisons de soutenir notre travail :

  • 1 Numerama+ contribue à offrir une expérience gratuite à tous les lecteurs de Numerama.
  • 2 Vous profiterez d'une lecture sans publicité, de nombreuses fonctions avancées de lecture et des contenus exclusifs.
  • 3 Aider Numerama dans sa mission : comprendre le présent pour anticiper l'avenir.

Si vous croyez en un web gratuit et à une information de qualité accessible au plus grand nombre, rejoignez Numerama+.

S'abonner à Numerama+
Toute l'actu tech en un clien d'oeil

Toute l'actu tech en un clin d'œil

Ajoutez Numerama à votre écran d'accueil et restez connectés au futur !


Un édito exclusif, un guide, une reco de lecture et l’agenda de la rédaction : c’est ce que vous trouverez tous les jeudis dans ToujoursPlus, la newsletter tech écrite par Julien Cadot. Inscrivez-vous gratuitement ici !