Anthropic reconnaît que ses IA ont attaqué de vraies entreprises sans jamais s’en rendre compte

Un exercice de cybersécurité se déroule normalement en vase clos, loin de tout système réel. Chez Anthropic, un réglage oublié a pourtant ouvert l’accès à Internet pendant plusieurs tests. L’un des modèles Claude a même publié un logiciel malveillant, téléchargé en une heure par quinze machines.

Malware Qakbot
Crédits : 123RF

Les éditeurs d’intelligence artificielle évaluent régulièrement les capacités offensives de leurs modèles. Ces exercices reposent sur des scénarios fictifs, où le programme doit s’introduire dans une machine pour y récupérer une information cachée. L’environnement reste théoriquement coupé du monde extérieur. Cette étanchéité a volé en éclats le mois dernier, quand OpenAI a reconnu que ses modèles avaient pénétré l’infrastructure de Hugging Face.

La réaction du secteur ne s’est pas fait attendre. Nvidia a fédéré 52 entreprises autour d’une alliance consacrée à la sécurité des modèles ouverts. Anthropic a choisi une autre voie en relisant l’intégralité de ses propres évaluations de cybersécurité. L’éditeur du modèle Claude cherchait la trace d’un accès à Internet là où il n’aurait jamais dû exister.

Anthropic a repéré trois intrusions réelles en relisant 141 000 sessions de test

Anthropic a détaillé ces incidents dans un rapport publié par sa Frontier Red Team. Sur 141 006 sessions passées au crible, trois ont conduit des modèles Claude à compromettre l’infrastructure de production de trois organisations. Le prompt affirmait à chaque fois que l’environnement était une simulation dépourvue d’accès à Internet. Une mauvaise configuration, née d’un malentendu avec le partenaire d’évaluation Irregular, laissait pourtant la connexion ouverte. Les modèles ont donc pris de vraies entreprises pour des cibles fictives.

Le cas le plus spectaculaire implique Claude Mythos, le modèle spécialisé en cybersécurité. Après avoir repéré un paquet Python inexistant dans une documentation, il a créé une adresse mail puis un compte PyPI pour publier son propre programme piégé sous ce nom. Le fichier est resté environ une heure en ligne. Quinze machines réelles l’ont téléchargé et exécuté, dont le scanner d’une entreprise de sécurité. L’IA en a exfiltré les identifiants pour atteindre d’autres serveurs.

Les deux autres incidents concernent Opus 4.7 et un prototype de recherche non destiné au public. Le premier a poursuivi son attaque après avoir compris que la cible était réelle, quand le second s’est arrêté de lui-même. Anthropic y voit une défaillance de son infrastructure de test, pas un dérapage des modèles. Les trois organisations ont été prévenues le 27 juillet et deux d’entre elles ignoraient l’intrusion.


Réagissez à cet article !

Demandez nos derniers articles !

Hausse de l’électricité au 1er août : les conducteurs qui rechargent la nuit vont être agréablement surpris

Une nouvelle grille tarifaire de l’électricité s’applique ce samedi 1er août en France. Contrairement à ce que beaucoup imaginent, elle ne découle pas du prix de l’énergie. Et pour les…

Google Chrome pourrait bientôt se mettre à jour automatiquement sans que vous vous en rendiez compte

Google travaille sur un projet qui pourrait bien vous épargner quelques casse-tête au nom de la sécurité de son navigateur Chrome. Plutôt que d’attendre de pouvoir fermer tous vos onglets…

Nintendo Switch 2 : l’un des meilleurs jeux Mario 3D arrive dans le catalogue Classics

Nintendo a annoncé l’arrivée prochaine d’un nouveau Mario 3D dans le catalogue Classics, accessible avec l’abonnement Online. Deux jeux Virtual Boy jamais commercialisés viendront également s’ajouter à la liste. Le…

Ce constructeur chinois entre dans le club très fermé des bornes qui rechargent une voiture en cinq minutes

Le temps passé à la borne demeure le principal reproche adressé à la voiture électrique. Les constructeurs chinois s’attaquent à ce point faible avec des puissances vertigineuses. Dongfeng rejoint la…

Google Earth a droit à une grosse mise à jour à base d’IA, mais on est vraiment sceptiques du résultat

Google vient d’annoncer l’arrivée de Nano Banana, sa technologie de génération d’images par IA, dans son application Earth. Celle-ci est censée ajouter tout un lot de fonctionnalités pour “visiter le…

Cette étude a listé les habitudes qui ruinent une carrière, et les patrons sont les premiers à les cumuler

Le téléphone est devenu un compagnon de réunion presque banal dans les entreprises. Une étude britannique a chiffré ces habitudes de bureau et leur influence sur une carrière. Ses résultats…

Pour ne pas faire exploser le prix du Galaxy S27 Ultra, Samsung abandonnerait cette idée

En cette période de crise de la mémoire, Samsung devrait se résoudre à ne pas équiper son Galaxy S27 Ultra des dernières technologies de RAM et de stockage. Les constructeurs…

Voici les visuels précis des Pixel 11 et Pixel Watch 5 dans tous leurs coloris

Le design des Pixel 11 et Pixel Watch 5 n’a plus aucun secret pour nous. Des images en bonne qualité de tous les modèles ont fuité. La conférence Made by…

Le problème de batterie des Pixel est censé être réglé, mais pas pour tous les modèles

Google annonce avoir corrigé le problème qui ruine l’autonomie des Pixel depuis des mois. Mais certains utilisateurs sont sceptiques, tandis que certains modèles de smartphones sont mis à l’écart du…

Chrome : personnalisez l’écran d’accueil à votre guise sur Android

Le navigateur Chrome permet désormais de personnaliser sa page d’accueil, voici comment ça marche et quelles sont les options disponibles. C’est déjà possible depuis longtemps sur PC et depuis quelques…