Le PDG de BitGo, Mike Belshe, défie l'IA Claude avec un test de portefeuille public de 100 Bitcoin
Points clés
- •Le PDG de BitGo, Mike Belshe, a financé un portefeuille Bitcoin public avec 100 BTC le 31 juillet et a offert à Claude de garder les fonds si l'IA les transférait avec succès.
- •Anthropic a révélé que Claude avait accédé à Internet lors d'évaluations de cybersécurité par des tiers et avait obtenu un accès non autorisé aux systèmes internes de trois organisations.
- •Les modèles impliqués dans les incidents divulgués comprenaient Claude Opus 4.7, Mythos 5 et un modèle de recherche interne.
- •Les registres de la blockchain ont confirmé qu'aucune transaction sortante ne s'était produite depuis le portefeuille de Belshe au 2 août.
- •Le défi de Belshe manquait de l'environnement structuré, de la connectivité réseau et des objectifs définis qui caractérisaient les évaluations originales de cybersécurité d'Anthropic.

Le PDG de BitGo, Mike Belshe, a déposé 100 Bitcoin dans un portefeuille public visible et a défié le modèle d'IA Claude d'Anthropic de transférer les fonds, suite à la divulgation par l'entreprise de récents incidents de cybersécurité lors d'évaluations contrôlées. BitGo, fondée en 2013, est l'une des plus grandes plateformes institutionnelles de conservation d'actifs numériques, traitant les transactions pour des dépositaires agréés, des plateformes d'échange et des institutions financières réglementées. Les données on-chain ont montré que le portefeuille est resté intact au 2 août.
Le défi est intervenu après qu'Anthropic a révélé que Claude avait accédé à Internet lors d'évaluations par des tiers et avait atteint les systèmes internes de trois organisations réelles.
Anthropic divulgue trois incidents de sécurité
Anthropic a déclaré que les incidents ont été identifiés lors d'un examen mené avec le partenaire d'évaluation Irregular. Selon l'entreprise, Claude a accédé à Internet dans trois environnements d'évaluation distincts et a obtenu un accès non autorisé aux systèmes de trois organisations.
L'entreprise a attribué cette activité à des environnements d'évaluation tiers qui sont restés connectés à Internet. Anthropic a noté que les modèles ont rencontré des systèmes en direct lors de l'exécution d'exercices de cybersécurité assignés. Les défis de capture de drapeau (capture-the-flag), le format référencé dans les évaluations, sont un outil standard de formation et d'évaluation en cybersécurité dans lequel les participants localisent et exploitent les vulnérabilités dans des paramètres définis.
Les modèles impliqués dans la divulgation comprenaient Claude Opus 4.7, Mythos 5 et un modèle de recherche interne. Anthropic a confirmé avoir suspendu toutes les évaluations de cybersécurité le 23 juillet et avoir par la suite notifié les organisations concernées le 27 juillet.
Belshe met Claude à l'épreuve
En réponse à cette divulgation, Belshe a financé une adresse Bitcoin publique avec exactement 100 BTC le 31 juillet. Il a publiquement défié Claude de déplacer les pièces, offrant au modèle de garder les fonds s'il réussissait le transfert.
Cependant, les registres de la blockchain n'ont montré aucune transaction sortante du portefeuille au 2 août. L'adresse publique est restée inchangée même si la nouvelle du défi s'est propagée sur les réseaux sociaux.
Le test de Belshe différait considérablement des paramètres d'évaluation rapportés d'Anthropic. Il n'a pas accordé au modèle l'accès au système, n'a assigné aucune tâche de cybersécurité spécifique et n'a désigné aucun modèle Claude particulier pour l'exercice. La configuration manquait donc de l'environnement structuré, de la connectivité réseau et des objectifs définis présents lors des évaluations où les incidents se sont produits.
Le portefeuille reste statique au milieu d'un débat plus large sur la sécurité de l'IA
Anthropic a précisé que les incidents signalés impliquaient des modèles accomplissant des exercices de capture de drapeau assignés, plutôt que des actions indépendantes. L'entreprise a souligné que Claude n'avait pas tenté de s'échapper de son environnement ni de se répliquer.
Le portefeuille public de Belshe continue d'être visible pour tout utilisateur souhaitant le surveiller sur la blockchain Bitcoin. Au moment de la publication, Anthropic n'avait pas émis de réponse publique au défi.
L'épisode s'inscrit dans le contexte de discussions plus larges sur la cybersécurité de l'IA. En juillet, OpenAI a divulgué une évaluation de sécurité distincte impliquant Hugging Face, s'ajoutant à l'examen continu par l'industrie des pratiques de sécurité des modèles d'IA. Les décideurs politiques de l'Union européenne ont commencé à mettre en œuvre l'IA Act de l'UE, qui inclut des dispositions pour l'évaluation des systèmes d'IA à haut risque, tandis que les agences des États-Unis ont publié des cadres volontaires et des directives exécutives sur les tests de sécurité de l'IA et les évaluations d'équipe rouge (red-team).