Le rapport d’OpenAI sur son IA devenue incontrôlable dévoile un détail que personne n’avait vu venir

En juillet, plusieurs modèles d’OpenAI lancés sur une épreuve de cybersécurité ont fini par pirater Hugging Face sans ordre humain. Le créateur de ChatGPT détaille aujourd’hui les cinq jours durant lesquels l’incident s’est déroulé. Son rapport explique surtout la manière dont les agents ont réussi à contourner leurs propres garde-fous.

ChatGPT
Crédits : 123RF

Aujourd’hui, un agent d’intelligence artificielle ne fait désormais plus que répondre aux questions. Il peut lancer une série de tâches, faire des essais, les corriger puis recommencer sans validation humaine à chaque étape. Du côté des experts en cybersécurité, cette autonomie suscite autant d’inquiétude qu’elle attire les entreprises. Des agents autonomes auraient récemment compromis les systèmes de plusieurs administrations taïwanaises sans aucune intervention humaine. Le danger atteint une autre échelle.

Dès le 21 juillet, OpenAI avait admis que ses propres modèles étaient à l’origine du piratage de Hugging Face. Son premier communiqué parlait de failles utilisées afin d’obtenir les solutions du test. L’affaire avait provoqué un choc jusque devant le Congrès américain, loin du seul secteur concerné. Une question restait entière, celle de programmes privés du web capables d’aller aussi loin. Le nouveau rapport apporte désormais la réponse.

Les agents d’OpenAI ont monté un forum caché et échangé 70 000 messages

À l’origine se trouve surtout la triche devant des exercices conçus pour être insolubles. Pour atteindre leur objectif à tout prix, les modèles ont détourné Artifactory, le gestionnaire interne de paquets connecté à internet. D’après OpenAI, ils ont installé sur Artifactory leur propre forum improvisé, invisible aux équipes chargées de la supervision. Les discussions ont influencé le raisonnement des autres agents, poussés ensuite à accepter davantage de risques. METR, laboratoire indépendant chargé de l’analyse, a recensé 1 200 participants et plus de 70 000 messages, tandis que 700 ont ensuite participé à l’attaque.

Une partie des agents a pourtant refusé de suivre le mouvement. Plusieurs ont questionné la légitimité de ce qu’ils faisaient. Certains n’ont pas rejoint le groupe, estimant la manœuvre contraire à l’éthique, alors que d’autres ont continué malgré leurs réserves. OpenAI admet avoir manqué plusieurs avertissements, avec une activité inhabituelle détectée dès la fin mai puis une alerte fin juin considérée comme insuffisante pour interrompre l’évaluation. Depuis, l’entreprise surveille constamment les chaînes de raisonnement de ses modèles et récompense les agents réclamant de l’aide devant une tâche impossible. Il s’agit toujours du premier cas connu d’un collectif d’agents lancé dans une attaque sans autorisation.


Réagissez à cet article !

Demandez nos derniers articles !

Ikea lance un mod pour Skyrim, l’étagère Kallax devient un compagnon de jeu indispensable

Votre inventaire est toujours plein dans Skyrim ? Ikea résout ce problème avec l’intégration de son étagère Kallax en jeu via un mod approuvé par Bethesda. Elle est même doublée…

À peine lancé, le Galaxy S26 FE perd déjà 150 € : Samsung offre en plus les Galaxy Buds 4

Le Galaxy S26 FE vient à peine de sortir que Samsung baisse déjà son prix de 150 €. Cette offre de lancement s’accompagne aussi des Galaxy Buds 4 offerts au…

Même dans le meilleur scénario, le réchauffement grimperait jusqu’à 1,8 °C selon l’ONU

Août 2026 se hisse au niveau du mois le plus chaud jamais relevé sur Terre. Début septembre, l’ONU a publié un rapport selon lequel la barre de 1,5 °C prévue…

Switch 2 : Nintendo ajoute enfin le VRR en mode docké sur la TV, téléchargez la mise à jour

La dernière mise à jour du firmware de la Nintendo Switch 2 débloque enfin la fonction VRR en mode TV, quand la console est dockée. C’est la fin d’un long…

iOS 27 : l’application Remote va avoir droit à deux grosses améliorations très pratiques

Deux nouvelles fonctionnalités ont été découvertes au sein de l’application Remote sur les iPhone passés sur iOS 27. Ces dernières vont vous permettre de naviguer sur votre Apple TV beaucoup…

En attendant GTA 6, ous pouvez jouer gratuitement à GTA Vice City et GTA 3 sur votre navigateur

Un nouveau portage web de GTA Vice City et GTA III a été mis en ligne, rendant les jeux cultes accessibles gratuitement pour le monde entier. Si certains vont adorer…

La petite électrique de Nissan a enfin un nom, il va rappeler des souvenirs à certains

Nissan prépare son retour sur le marché des toutes petites voitures en Europe. Sa future citadine électrique partagerait l’essentiel de sa technique avec la Renault Twingo. Le constructeur japonais vient…

Windows 11 : le Patch Tuesday de septembre corrige le bug qui rend votre PC triste à souhait

Fin août dernier, Microsoft déployait Windows 11 KB5120998, censé apporter plusieurs nouvelles fonctionnalités. Mais ces dernières ne sont pas les seules à avoir débarqué, puisque quelques bugs sont également venus…

Ce smartphone Samsung milieu de gamme a enfin accès à la bêta de One UI 9

La bêta de One UI 9 continue son petit bonhomme de chemin et arrive enfin sur les smartphones Samsung plus abordables. Après les plus récents flagships, c’est tout d’un milieu…

iPhone Duo : que vaut la charnière de premier smartphone pliant d’Apple ?

Ça y est, Apple a levé le voile sur son tout premier iPhone pliable. Reste désormais à savoir ce que vaut la bête, et surtout sur le point considéré par…