- Anthropic a identifié trois incidents après avoir examiné plus de 141 000 évaluations de cybersécurité menées avec la société de tests externe Irregular.
- Ces failles font de l’isolement réseau, de la responsabilité du fournisseur et de la surveillance partagée des éléments intégrants du processus de test des modèles.
Les faits
Anthropic indique que trois de ses modèles d’intelligence artificielle ont obtenu un accès non autorisé à des systèmes appartenant à trois organisations lors d’évaluations de cybersécurité réalisées avec la société de tests externe Irregular. L’entreprise a découvert ces incidents après avoir passé en revue plus de 141 000 exécutions de test, après la divulgation d’un incident similaire impliquant OpenAI.
Les modèles avaient reçu des exercices de type capture the flag à périmètre ouvert et il leur avait été indiqué qu’ils étaient dans des environnements simulés sans accès à Internet. Un malentendu entre Anthropic et Irregular a laissé les machines d’évaluation connectées à l’Internet public. Les modèles ont alors traité les systèmes réels comme faisant partie des exercices et ont utilisé des méthodes établies, notamment des mots de passe faibles et des points de terminaison non authentifiés, plutôt que des vulnérabilités précédemment inconnues.
Les incidents concernaient Claude Opus 4.7, Claude Mythos 5 et un modèle de recherche interne, le plus ancien daté du mois d’avril. Anthropic a suspendu les évaluations concernées, informé Irregular et contacté les organisations touchées. Deux d’entre elles n’avaient pas détecté l’activité avant qu’Anthropic ne les informe.
L’évaluation
Anthropic a fixé les cibles des exercices, tandis qu’Irregular gérait l’environnement de test. Les machines étaient censées être isolées, mais elles avaient malgré tout accès à l’Internet public. Les modèles ont donc pu traiter les systèmes réels comme faisant partie du test, même si aucune des deux entreprises n’avait prévu de les inclure.
Le contrôle requis intervient avant le début de chaque évaluation. Anthropic et son partenaire de test doivent confirmer quels systèmes les machines peuvent atteindre, vérifier que l’accès aux systèmes non approuvés est bloqué et s’accorder sur la personne habilitée à arrêter l’exercice. Les instructions peuvent indiquer à un modèle ce qu’il est autorisé à faire, mais elles ne peuvent pas restreindre le réseau sous-jacent.
Le compte public ne précise pas encore exactement où la responsabilité a déraillé ni si les mêmes vérifications étaient absentes d’autres tests. Pour les lecteurs de BTW, externaliser une évaluation ne supprime pas la responsabilité du développeur de vérifier l’environnement externe. Anthropic doit disposer de preuves avant chaque exécution que les machines de test ne peuvent pas atteindre des systèmes en dehors du périmètre convenu.
À surveiller
Il faut identifier avec METR et Irregular qui était responsable de la confirmation de l’isolation Internet et pourquoi ce contrôle a échoué. Les conditions de redémarrage d’Anthropic devraient préciser si chaque exécution nécessite désormais une liste de cibles vérifiée, une vérification préalable de l’accès sortant et une personne nommée avec l’autorité d’arrêter l’exercice. Sans ces contrôles, le périmètre écrit du test pourrait encore différer des systèmes accessibles au modèle.
Briefing membre
Contexte de profil approfondi
Connectez-vous avec le bon niveau d'adhésion pour débloquer le briefing complet et les notes de source.
Réservé au Cercle stratégique
Cercle stratégique
Ouvert à tous les lecteurs. Débloquez les briefings de profil après adhésion et connexion.
Rejoindre le Cercle stratégiqueRéservé à l'Alliance de leadership
Alliance de leadership
Réservé aux propriétaires et dirigeants qualifiés d'actifs IP ; connectez-vous pour débloquer les briefings Alliance.
Rejoindre l'Alliance de leadership
