Claude Mythos est sans doute le modèle de cybersécurité le plus performant qu’Anthropic ait jamais développé. Mais nous savons que les capacités d’un modèle ne constituent qu’un des facteurs qui déterminent les performances d’un produit dédié à la détection des vulnérabilités de l’IA.
Pour vérifier cela, nous avons mis en parallèle « Claude Security » d’Anthropic, qui fonctionne sur Mythos, et « Code Security Audit » d’Aikido , en les testant sur une cible identique, afin de déterminer quel outil offre la meilleure couverture et à quel coût. « Code Security Audit » fait partie de la suite « analyse de code par IA » d’Aikido. Nous avons également testé « Codex Security ».
Nous avons testé ces trois produits sur une application de référence privée comportant 89 vulnérabilités connues, qui avaient été identifiées au préalable dans l'ensemble.
Les résultats ? Claude Security, avec Mythos, a détecté 60 vulnérabilités sur 89 (67 %) pour un coût de 157 dollars, tandis que l’audit de sécurité Code Security Audit d’ Aikidoen a détecté 68 sur 89 (76 %) pour 75 dollars. Codex Security en a détecté 58 sur 89 pour 125 dollars.
Aikido a détecté 8 vulnérabilités de plus que Claude Security avec Mythos, dont 1 critique et 3 de gravité élevée, pour un coût inférieur de plus de moitié. Aikido en a détecté pas moins de dix de plus que Codex Security. Ces résultats illustrent une fois de plus que les performances et l'efficacité dépendent du système qui entoure le modèle, et que même avec le modèle le plus performant, les performances peuvent rester à la traîne.
C'est toujours le harnais qui fait la différence
Comme nous l'avons déjà évoqué, la détection des vulnérabilités est avant tout un problème de recherche. Un outil doit déterminer où chercher, quelles hypothèses explorer, jusqu'à quel point les approfondir et à quel moment une découverte dispose de preuves suffisantes pour être signalée.
Claude Security utilise un processus sophistiqué faisant appel à la cartographie de référentiels, à des agents d'analyse et à une vérification en plusieurs étapes. « Aikido » dispose de son propre processus sophistiqué, mais se distingue par la manière dont il répartit ce travail, en utilisant des modèles plus petits et moins coûteux, sélectionnés spécifiquement pour les tâches qu'ils accomplissent le mieux. Ces modèles plus petits permettent d'explorer un éventail plus large d'hypothèses indépendantes, tandis que le raisonnement de pointe, plus coûteux, est réservé aux étapes où il est le plus susceptible d'influencer le résultat.
C'est grâce à cette répartition que ce projet a pu consacrer son budget à la diversité des analyses plutôt que d'appliquer le modèle le plus coûteux à tous les cas, ce qui a permis d'obtenir un taux de rappel nettement plus élevé.
Ce taux de détection plus élevé comprenait plusieurs problèmes ayant un impact concret que la multitude d’agents d’ Aikidoavait détectés, mais que Mythos avait manqués. L’une d’entre elles était une faille critique d’autorisation inter-locataires qui permettait aux utilisateurs de mettre à jour les paramètres de leur propre compte et de modifier leur affectation organisationnelle afin de s’ajouter à une autre organisation, ce qui leur donnait accès aux données de cette dernière. Aikido a également détecté des problèmes plus subtils et faciles à manquer, notamment une incompatibilité de format d’horodatage entre l’application et la base de données qui permettait à des clés API expirées de rester valides.

Les renseignements de pointe deviennent très vite coûteux
Mythos coûte à partir de 10 $ par million de jetons d'entrée et de 50 $ par million de jetons de sortie. Le montant grimpe rapidement lorsqu'une analyse porte sur des centaines de trajectoires d'agents au sein d'un vaste référentiel.
La difficulté réside dans le fait que les audits de code axés sur l'agentique n'impliquent pas une charge de travail fixe. En fonction de facteurs tels que la taille du dépôt et la complexité de l'application, le nombre de pistes à explorer et le niveau de réflexion requis ont tendance à varier d'un dépôt à l'autre.
Claude Security vous laisse gérer cette variabilité. Les utilisateurs avancent à l'aveuglette, car Claude Security ne vous communique le coût de l'analyse qu'une fois celle-ci terminée. Ainsi, une fois la poussière retombée, vous pouvez vous retrouver avec une facture bien plus élevée que prévu.
Aikido fait un choix différent. C'est nous qui assumons cette incertitude. Avant le lancement de l'analyse, nous estimons en temps réel son coût en fonction de la taille du dépôt, du code à examiner et de la complexité, puis nous présentons cette estimation à l'utilisateur.
En tant qu'utilisateur, vous pouvez augmenter ou réduire le niveau de couverture pour l'adapter à cette estimation avant de vous engager. Notre exécution sur le repo de référence vous aurait coûté 75 $ à la profondeur recommandée, tandis que Claude Security vous aurait coûté un montant forfaitaire de 157,06 $.

Et si vous estimez que le référentiel mérite une couverture encore plus approfondie que celle que nous avons estimée automatiquement, vous êtes libre d'augmenter cette valeur.

Lors de notre test avec Claude Security, aucun devis n'a été fourni au préalable, et le montant total n'a été connu qu'une fois l'analyse terminée.
Le référentiel que nous avons utilisé pour l'analyse compte environ 15 000 lignes de code. L'impossibilité de consulter une estimation préalable des coûts ou d'adapter le niveau d'effort d'analyse à votre budget reste gérable pour un référentiel de cette taille. Mais cela devient un problème bien plus important, car les coûts liés à la recherche de vulnérabilités augmentent en fonction de la taille du référentiel, du type d'application et de la complexité du pipeline.
Si vous utilisez un modèle coûteux sur un monorepo, ou si vous l'exécutez à chaque pull request, l'absence d'une estimation préalable peut entraîner des coûts nettement supérieurs à ce que vous aviez prévu.

Ce que cela signifie
Nous soutenons depuis un certain temps déjà que la conception du harnais influe davantage sur les résultats en matière de sécurité que le modèle qui le sous-tend. Ce test comparatif nous offre un premier aperçu des résultats directs, en comparant Mythos 5 et Codex Security à Code Security Audit sur les mêmes dépôts, et c'est encore une fois le harnais qui a fait la différence.
Bien sûr, une seule étude comparative ne suffit pas à trancher le débat, mais elle apporte la preuve que le modèle « du harnais » ne repose plus uniquement sur des affirmations.

