Aikido

Comment « Aikido » détecte davantage de vulnérabilités que Mythos, pour la moitié du prix

Écrit par

En bref : Nous avons testé trois produits de sécurité du code basés sur l'IA sur une application de référence privée comportant 89 vulnérabilités connues. Voici les résultats :

  • Audit de sécurité du code Aikido : 68 vulnérabilités sur 89 (76 %) pour 75 $
  • Claude Security avec Mythos : 60 vulnérabilités sur 89 (67 %) pour 157 $
  • Codex Security : 58 vulnérabilités sur 89 (65 %) pour 125 $

Claude Mythos est sans doute le modèle de cybersécurité le plus puissant conçu par Anthropic. Cependant, nous savons que les capacités d'un modèle ne constituent qu'une partie des facteurs qui déterminent l'efficacité d'un produit de sécurité basé sur l'IA.

Pour le vérifier, nous avons opposé Claude Security d'Anthropic (propulsé par Mythos) et Aikido Code Security Audit sur la même cible exacte afin de comparer la couverture et les coûts de chaque solution. Code Security Audit fait partie de la suite analyse de code par IA d'Aikido. Nous avons également testé Codex Security. Les trois produits ont été soumis à la même application de référence privée.

Les résultats ? Aikido a détecté 8 vulnérabilités de plus que Claude Security avec Mythos, dont 1 critique et 3 de sévérité élevée, pour un coût inférieur de moitié. Aikido en a trouvé dix de plus que Codex Security. Ces résultats confirment une fois de plus que les performances et l'efficacité dépendent du système qui entoure le modèle, et que même avec le modèle le plus performant, les résultats peuvent décevoir.

L'orchestration fait toute la différence

Comme nous l'avons déjà écrit, la découverte de vulnérabilités relève fondamentalement d'un problème de recherche. Un outil doit déterminer où chercher, quelles hypothèses explorer, quel niveau d'investigation mener et à quel moment une anomalie réunit suffisamment de preuves pour être signalée.

Claude Security utilise un processus sophistiqué comprenant le cartographie de dépôts, des agents d'analyse et une vérification en plusieurs étapes. Aikido possède son propre processus sophistiqué, mais diffère dans la manière d'allouer cette charge de travail, en utilisant des modèles plus petits et moins coûteux choisis spécifiquement pour les tâches qu'ils exécutent le mieux. Ces modèles plus petits peuvent explorer un plus large éventail d'hypothèses indépendantes, tandis que le raisonnement de pointe, plus coûteux, est réservé aux étapes où il est le plus susceptible d'influencer le résultat.

Cette répartition permet d'allouer le budget à l'exhaustivité des recherches plutôt que de mobiliser systématiquement le modèle le plus coûteux, ce qui se traduit par un taux de rappel nettement supérieur.

Ce rappel accru inclut plusieurs problèmes à fort impact réel détectés par l'essaim d'agents d'Aikido, mais manqués par Mythos. L'un d'eux était une faille critique d'autorisation inter-tenant qui permettait aux utilisateurs de modifier les paramètres de leur propre compte, de changer leur affectation d'organisation pour s'ajouter à une autre et ainsi accéder aux données de celle-ci. Aikido a également identifié des anomalies plus subtiles et faciles à rater, telles qu'une incohénuité de format de horodatage entre l'application et la base de données permettant à des clés API expirées de rester valides.

‍

L'intelligence de pointe s'avère rapidement coûteuse

Mythos est facturé à partir de 10 $ par million de tokens en entrée et 50 $ par million de tokens en sortie. La facture s'alourdit très vite lorsqu'un audit génère des centaines de trajectoires d'agents sur un vaste dépôt de code. 

La difficulté réside dans le fait que les audits de code pilotés par des agents n'ont pas de charge de travail fixe. En fonction de facteurs tels que la taille du dépôt et la complexité de l'application, le nombre de pistes à suivre et le niveau de raisonnement requis varient d'un projet à l'autre. 

Claude Security vous laisse gérer cette variabilité. Les utilisateurs naviguent à l'aveugle car Claude Security ne communique pas le coût de l'analyse avant la fin de l'exécution. Ainsi, une fois la poussière retombée, vous pouvez vous retrouver avec un coût bien supérieur à vos prévisions.

Aikido fait un choix différent. Nous prenons cette incertitude à notre charge. Avant le lancement de l'analyse, nous estimons dynamiquement son coût à partir de la taille du dépôt, du code auditable et de sa complexité, puis nous affichons cette estimation à l'utilisateur.

En tant qu'utilisateur, vous pouvez augmenter ou réduire le niveau de couverture pour l'adapter à cette estimation avant de l'engager. Notre test sur le dépôt de référence vous aurait coûté 75 $ à la profondeur recommandée, tandis que Claude Security aurait coûté un montant fixe de 157,06 $.

‍

‍

Et si vous estimez que le dépôt mérite une couverture encore plus intensive que celle que nous avons estimée automatiquement, vous avez la liberté de l'augmenter.  

‍

Lors de notre test avec Claude Security, aucune estimation de coût n'a été fournie au préalable, et le montant total n'a été connu qu'après la fin de l'analyse. 

Le dépôt que nous avons utilisé pour l'analyse compte environ 15 000 lignes de code. Ne pas avoir la possibilité de consulter une estimation de coût préalable ou d'ajuster le niveau d'effort d'analyse en fonction de votre budget reste gérable sur un dépôt de cette taille. Mais cela devient un problème beaucoup plus important à mesure que les coûts de recherche de vulnérabilités augmentent avec la taille du dépôt, le type d'application et la complexité du pipeline.

Appliquez un modèle coûteux à un monorepo, ou exécutez-le sur chaque pull request, et l'absence d'estimation préalable peut engendrer des coûts nettement supérieurs à ce que vous attendiez.

Ce que cela signifie

Nous soutenons depuis un certain temps que la conception de l'infrastructure détermine la sécurité des résultats bien plus que le modèle qui se trouve en dessous. Ce benchmark nous offre un premier aperçu d'un chiffre comparatif direct, en testant Mythos 5 et Codex Security face à Code Security Audit sur les mêmes dépôts, et l'infrastructure a tout de même fait la différence.

‍
Bien entendu, un seul benchmark ne clôt pas le débat, mais il apporte la preuve que l'approche « l'infrastructure prime sur le modèle » ne repose plus seulement sur de simples affirmations.

Partager :

https://www.aikido.dev/blog/aikido-finds-more-vulnerabilities-claude-security-mythos

S'abonner aux actualités

4,7/5
Fatigué des faux positifs ?
Essayez Aikido, comme 100 000 autres.
Commencez maintenant
Obtenez une démonstration personnalisée

Approuvé par plus de 100 000 équipes

Réserver maintenant
Analysez votre application à la recherche d'IDORs et de chemins d'attaque réels

Approuvé par plus de 100 000 équipes

Démarrer l'analyse
Découvrez comment le pentest IA teste votre application

Approuvé par plus de 100 000 équipes

Démarrer les tests

Sécurisez vos systèmes dès aujourd'hui,
rapidement et gratuitement.

Sécurisez votre code, votre cloud et votre runtime au sein d'un système centralisé.
Connectez un dépôt pour découvrir ce que les agents de raisonnement trouvent dans votre base de code.

Aucune carte bancaire requise | Résultats de l'analyse en 32 secondes.
Utilisé par plus de 150 000 organisations