Aikido

De Hugging Face à Fable : cet été montre que le contrôle de l'IA est plus important que la confiance

Écrit par
Sooraj Shah

Une évaluation de routine d'un modèle s'est transformée en une compromission totale de l'infrastructure, et personne n'était aux commandes. Nous n'aurions jamais pu imaginer cela il y a quelques mois. Aujourd'hui, avec un nombre croissant d'agents d'IA qui agissent de manière incontrôlée, cela commence à devenir monnaie courante. 

Les analyses passionnées ne manquent pas sur X pour expliquer pourquoi ce phénomène se répète (S’agit-il simplement d’une question de crédibilité « PR » ? Ou devrions-nous craindre ce que l’avenir nous réserve ?). Ce qui a retenu notre attention, au-delà de ces deux points de vue, c’est ce que cela révèle de la dépendance actuelle des défenseurs vis-à-vis de modèles qu’ils ne contrôlent pas. 

Lors de la conférence Black Hat, les chercheurs d’OpenAI ont décrit le déroulement réel de l’incident. Tout a commencé lorsque des agents bloqués sur des tâches impossibles à accomplir ont commencé à se laisser des notes les uns aux autres au sein d’un gestionnaire de paquets partagé, le seul élément d’infrastructure accessible à chaque exécution de modèle, même s’ils étaient par ailleurs confinés dans un environnement sandbox sans accès à Internet. D'autres agents bloqués sont tombés par hasard sur ces notes, et un forum de discussion s'est ainsi formé. L'un de ces messages s'est avéré être un moyen de contourner complètement ce bac à sable, et tous les modèles qui l'ont lu ont pu l'utiliser à leur tour.

Au cours de la phase finale, les agents sont passés de l'exécution de code sur un seul pod de traitement de données au sein de l'infrastructure de production de Hugging Face à la gestion d'un cluster regroupant plusieurs clusters Hugging Face, le tout en moins de 13 heures. 

Pour mettre les choses en perspective, ce travail aurait pu prendre des semaines d’efforts délibérés à une « red team » humaine, mais tout cela s’est produit de manière aléatoire, sans supervision, comme un effet secondaire. C’est un peu comme si, dans une mission de GTA où l’on doit livrer une voiture, on finissait par voler un char d’assaut en cours de route, déclencher une course-poursuite avec la police et provoquer un chaos à l’échelle de la ville. 

Pourquoi vous devez prévoir un plan B pour votre fournisseur d'IA

Mais ce qui est plus pertinent, c'est ce qu'a déclaré sur scène Eric Wallace, chercheur chez OpenAI :

« L’objectif final que nous souhaitons atteindre en tant que secteur est que les améliorations apportées à l’intelligence des modèles doivent davantage profiter à la défense qu’à l’attaque. Si nous ne parvenons pas à atteindre cet objectif final, alors chaque amélioration de l’intelligence favorisera l’attaquant, et c’est une situation intenable. »

Il a exhorté les acteurs du secteur à s'attaquer à ce problème spécifique de toute urgence (car c'est bien le cas !). Si le secteur ne parvient pas à le résoudre, cela fera pencher la balance encore davantage en faveur de l'attaquant plutôt que du défenseur.

Et pourtant, on dirait que chaque semaine, un nouvel agent d’IA se déchaîne et s’en prend à une autre organisation. Pour remédier à ce problème, il ne suffit pas de se concentrer sur les détails techniques du bac à sable et du système de contrôle. La vraie question est de savoir à qui une entreprise ou une administration peut réellement faire confiance. La suspension de Fable par Anthropic en est un bon exemple : du jour au lendemain, l’un des outils des principaux fournisseurs de modèles d’IA réputés a été retiré de toutes les équipes qui s’en servaient.

Selon Alex Stamos, responsable de la sécurité chez Corridor.dev: « Cela a montré qu’on ne peut pas compter sur l’infrastructure américaine en matière d’IA, car, à tout moment, une justification non écrite, arbitraire et juridiquement contestable pourrait être invoquée pour vous priver de cette infrastructure. »

Cela a ouvert la voie à des modèles chinois compétitifs, notamment des modèles à poids ouvert. Kimi a lancé un avertissement sans équivoque à OpenAI et Anthropic quant à ce qui allait suivre, avec des performances comparables à celles de Fable.

Même après la levée de la suspension de Fable, la nouvelle version mise en place par Anthropic a aggravé le problème en introduisant de nouvelles mesures de sécurité. Lorsque les agents d’OpenAI ont attaqué Hugging Face, cette dernière a tenté d’utiliser Fable et Opus 4.8 d’Anthropic pour mener son enquête. Cependant, ces deux modèles étaient soumis à des mesures de cybersécurité strictes qui ont bloqué ses requêtes. Elle a donc mis en place GLM 5.2, un modèle à poids ouverts, afin de réaliser son analyse des traces sur son propre matériel. 

Tout cela pour dire que ce n’est pas parce que les modèles américains sont les plus connus, les plus performants (même si certains, comme le Kimi K3, sont en train de rattraper leur retard) et donc accessibles à l’heure actuelle, qu’ils le resteront forcément. Ils sont là pour être utilisés, mais il faut garder à l’esprit qu’un problème se pose s’il n’y a pas de plan B lorsque la situation évolue selon le calendrier de quelqu’un d’autre.

Quelle devrait donc être la réponse du secteur à ce problème ?

Selon M. Wallace, d’OpenAI, l'un des défis les plus urgents auxquels le secteur doit commencer à s'attaquer est le « red teaming agentique continu » :

« Il est nécessaire d'investir dans la mise en place d'une équipe « red team » basée sur l'IA, qui permette aux défenseurs d'identifier et de corriger les vulnérabilités avant que les attaquants ne le fassent. »

Il a toutefois souligné que ce cycle devait être entièrement automatisé, depuis la détection des vulnérabilités jusqu’à l’application des correctifs et la correction des problèmes. 

M. Stamos a laissé entendre que les modèles « open-weights » allaient constituer un formidable moteur d’innovation et de développement commercial. Outre leur rentabilité, il cite la souveraineté des données comme un avantage majeur pour le nombre croissant de juridictions et d’entreprises qui ne peuvent pas envoyer leur code ou leurs données à une « cloud » américaine. Il ajoute :

« Il existe une demande réelle et légitime pour des modèles sur site à haut débit capables de fonctionner hors connexion. »

Si l'on rassemble ces trois éléments, la réponse apportée par le secteur à la mise en garde de Wallace elle-même nous saute aux yeux : une défense qui fonctionne en continu, sur des modèles qui la rendent abordable, et sur une infrastructure que personne d'autre ne peut vous retirer. 

Où cela nous mène-t-il ?

Si vous ne maîtrisez pas votre infrastructure de sécurité, vous comptez sur la décision de quelqu’un d’autre pour qu’elle reste à votre disposition. La faille de sécurité chez Hugging Face a montré jusqu’où une attaque peut s’aggraver dès lors que personne n’est tenu d’approuver l’étape suivante. Le récit de Stamos concernant la suspension de Fable a mis en évidence le même problème sous un autre angle : les outils d’un fournisseur de confiance ont cessé de fonctionner pour les équipes qui en dépendaient, pour des raisons qui n’avaient rien à voir avec leur bon fonctionnement.

Cependant, le simple fait d’intégrer des agents d’IA à votre propre infrastructure ne résout pas le problème en soi. Un agent non confiné tentera d’accéder à toutes les portes à sa portée, qu’il fonctionne sur votre réseau ou sur celui d’un tiers cloud. Le transférer sur votre propre matériel n’est utile que si le système lui-même l’empêche de vagabonder. Les tests doivent être effectués en continu, sur une infrastructure dont vous êtes réellement propriétaire. Et les agents chargés de cette tâche doivent être soumis à des limites imposées par le système lui-même. 

Si votre équipe a besoin de ce que cet article défend, Aikido Machine fonctionne entièrement sur site, avec un accès optionnel à votre code (boîte blanche/boîte noire), et peut fonctionner en mode « air-gapped » lorsque rien ne doit quitter le bâtiment. Elle suit la même approche de limitation de portée que nous avons mise au point pour Aikido Attack: un confinement intégré au système plutôt que laissé à la seule instruction. Sur Aikido Machine, ce confinement s’étend également à la couche réseau. Deux banques européennes l’utilisent déjà. Réservez une séance d’information technique ici.

Partager :

https://www.aikido.dev/blog/why-you-need-your-own-ai-security-infrastructure

S'abonner aux actualités

4,7/5
Fatigué des faux positifs ?
Essayez Aikido, comme 100 000 autres.
Commencez maintenant
Obtenez une démonstration personnalisée

Approuvé par plus de 100 000 équipes

Réserver maintenant
Analysez votre application à la recherche d'IDORs et de chemins d'attaque réels

Approuvé par plus de 100 000 équipes

Démarrer l'analyse
Découvrez comment le pentest IA teste votre application

Approuvé par plus de 100 000 équipes

Démarrer les tests

Sécurisez votre environnement dès maintenant.

Sécurisez votre code, votre cloud et votre environnement d’exécution dans un système centralisé unique.
Détectez et corrigez les vulnérabilités rapidement et automatiquement.

Aucune carte de crédit requise | Résultats en 32 secondes.