Le rapport d’OpenAI sur son IA devenue incontrôlable dévoile un détail que personne n’avait vu venir

En juillet, plusieurs modèles d’OpenAI lancés sur une épreuve de cybersécurité ont fini par pirater Hugging Face sans ordre humain. Le créateur de ChatGPT détaille aujourd’hui les cinq jours durant lesquels l’incident s’est déroulé. Son rapport explique surtout la manière dont les agents ont réussi à contourner leurs propres garde-fous.

ChatGPT
Crédits : 123RF

Aujourd’hui, un agent d’intelligence artificielle ne fait désormais plus que répondre aux questions. Il peut lancer une série de tâches, faire des essais, les corriger puis recommencer sans validation humaine à chaque étape. Du côté des experts en cybersécurité, cette autonomie suscite autant d’inquiétude qu’elle attire les entreprises. Des agents autonomes auraient récemment compromis les systèmes de plusieurs administrations taïwanaises sans aucune intervention humaine. Le danger atteint une autre échelle.

Dès le 21 juillet, OpenAI avait admis que ses propres modèles étaient à l’origine du piratage de Hugging Face. Son premier communiqué parlait de failles utilisées afin d’obtenir les solutions du test. L’affaire avait provoqué un choc jusque devant le Congrès américain, loin du seul secteur concerné. Une question restait entière, celle de programmes privés du web capables d’aller aussi loin. Le nouveau rapport apporte désormais la réponse.

Les agents d’OpenAI ont monté un forum caché et échangé 70 000 messages

À l’origine se trouve surtout la triche devant des exercices conçus pour être insolubles. Pour atteindre leur objectif à tout prix, les modèles ont détourné Artifactory, le gestionnaire interne de paquets connecté à internet. D’après OpenAI, ils ont installé sur Artifactory leur propre forum improvisé, invisible aux équipes chargées de la supervision. Les discussions ont influencé le raisonnement des autres agents, poussés ensuite à accepter davantage de risques. METR, laboratoire indépendant chargé de l’analyse, a recensé 1 200 participants et plus de 70 000 messages, tandis que 700 ont ensuite participé à l’attaque.

Une partie des agents a pourtant refusé de suivre le mouvement. Plusieurs ont questionné la légitimité de ce qu’ils faisaient. Certains n’ont pas rejoint le groupe, estimant la manœuvre contraire à l’éthique, alors que d’autres ont continué malgré leurs réserves. OpenAI admet avoir manqué plusieurs avertissements, avec une activité inhabituelle détectée dès la fin mai puis une alerte fin juin considérée comme insuffisante pour interrompre l’évaluation. Depuis, l’entreprise surveille constamment les chaînes de raisonnement de ses modèles et récompense les agents réclamant de l’aide devant une tâche impossible. Il s’agit toujours du premier cas connu d’un collectif d’agents lancé dans une attaque sans autorisation.


Réagissez à cet article !

Demandez nos derniers articles !

Gemini Notebook intègre Google Play Books pour résumer et analyser vos livres par IA

L’outil de prises de notes et résumés IA Gemini Notebook peut désormais piocher dans les livres achetés sur Google Play Books. Votre bibliothèque numérique change de dimension. Gemini Notebook, anciennement…

BYD a torturé sa berline électrique pendant 9 jours pour prouver que la recharge ultra-rapide n’abîme rien

La recharge ultrarapide inquiète encore de nombreux automobilistes, qui craignent un vieillissement accéléré des batteries. BYD a donc soumis sa berline électrique la plus luxueuse à une épreuve particulièrement sévère….

Xiaomi officialise deux montres et un bracelet connectés pour accompagner vos résolutions de la rentrée

Si vous comptiez prendre davantage soin de votre santé au quotidien à l’occasion de la rentrée, Xiaomi se propose pour vous accompagner dans cet objectif. En effet, la marque chinoise…

Le grand aperçu de GTA 6 est sorti sur Netflix, voici ce qu’on en retient

Le grand moment est arrivé. Rockstar Games a diffusé sur Netflix 26 minutes de gameplay de GTA 6. On en a pris plein la vue. Une claque visuelle. C’est ce…

Comment les pirates profitent du retour de vacances pour cibler nos boîtes mail

Des dizaines d’emails non lus dans notre boîte de réception au retour de vacances : voilà une opportunité pour les cybercriminels de tromper notre vigilance. C’est bientôt la rentrée et…

Sony lance la Bravia 6, une TV OLED 4K complète, mais étrangement limitée

A une semaine de l’ouverture de l’IFA à Berlin, Sony dévoile une nouvelle télévision. Il s’agit de la Bravia 6, un modèle qui va représenter l’offre OLED « abordable » de la…

WhatsApp fait la chasse aux arnaques sans sacrifier votre confidentialité grâce à Scam Alert

WhatsApp ne compte pas se reposer sur ses lauriers. Si l’application de Meta a récemment fait le plein de nouveautés, elle en a encore dans les cartons. Et pour cause,…

Galaxy S27 Pro : découvrez en images le tout nouveau smartphone de Samsung

Samsung va lancer dans quelques mois un tout nouveau modèle de smartphone : le Galaxy S27 Pro. Il ressemble à une version compacte du Galaxy S27 Ultra. Deux jours après…

Xiaomi officialise le Redmi 17 Pro Max : sa batterie hors-norme promet 3 jours d’autonomie

Le nouveau Redmi 17 Pro Max a été lancé par Xiaomi. Il est équipé d’une batterie à la capacité jamais vue sur un smartphone grand public. Xiaomi a révélé aujourd’hui…

VPN gratuit : les meilleures solutions pour naviguer de façon sécurisée

Utiliser Internet peut être compliqué ou dangereux pour notre vie privée et nos données. Dans certains cas, il est donc plus sûr d’utiliser un VPN. Mais si vous ne voulez pas débourser d’argent, optez pour un VPN gratuit. Découvrez notre sélection non exhaustive.