Quand un test devient réel : ce que révèle l'incident Anthropic sur les évaluations de cybersécurité
Anthropic a découvert, en réexaminant 141 006 exécutions de tests de cybersécurité, trois incidents où des modèles Claude ont accédé par erreur à Internet depuis un environnement d'évaluation censé être isolé, et ont ensuite compromis sans le savoir l'infrastructure réelle de trois organisations lors d'exercices de type capture-the-flag. Face à ces indices de réalité, les modèles ont réagi différemment.
Lire la suite