L’IA pourrait bientôt “penser” d’une manière qu’on ne comprend pas

Aujourd’hui, on peut surveiller le cheminement de pensée des modèles d’IA pour détecter les erreurs et les dangers. Mais prochainement, ils pourraient devenir assez intelligents pour dissimuler la manière dont ils arrivent à un résultat, une action ou un raisonnement.

Robot IA contre humain aux échecs
Crédit : 123RF

À mesure qu’elle devient plus performante, l’IA se complexifie, rendant de plus en plus difficile la possibilité de comprendre comment elle en arrive à un résultat ou à une “réflexion”. C’est d’autant plus vrai qu’on sait que l’IA peut apprendre d’elle-même, ce qui signifie qu’elle peut s’adapter au-delà des bases de données ou des paramètres qui lui sont initialement soumis.

Une récente étude sur la sécurité de l’IA vient d’être publiée. Elle regroupe des dizaines de chercheurs spécialisés, appartenant à des entreprises à la pointe de l’IA : Google, Amazon, OpenAI, Meta, Anthropic… Cette étude porte plus exactement sur le contrôle des chaînes de pensée de l’IA. Pouvoir surveiller et analyser le “cheminement de pensée” exact des IA limiterait les risques que les agents d’IA avancés, dont le fonctionnement est opaque, fassent des erreurs d’interprétation, ou décident d’agir contre les règles qui leur ont été imposées. Mais ce n’est pas si simple…

Les modèles d’IA pourront délibérément occulter des informations sur leur chaîne de pensée

La surveillance des chaînes de pensée comporte en effet des limites. Le rapport souligne qu’elle peut permettre de détecter certains comportements anormaux, mais qu’elle ne fournit pas à elle seule des preuves solides de sécurité. Ce n’est pas parce qu’on met en place un système de contrôle des chaînes de pensée, que l’IA ne peut pas dysfonctionner en dehors de ce type de surveillance. “Il faut veiller à ne pas créer un faux sentiment de sécurité basé sur une telle surveillance”, insistent les chercheurs.

En outre, la surveillance des tâches nécessitant un raisonnement avancé peut ne pas détecter tous les dangers pertinents. “La surveillance des chaînes de pensée pourrait cesser de fonctionner dans les modèles plus avancés, conscients de la situation. Les futurs modèles pourraient être capables d’éviter la détection en neutralisant leur propension à penser à voix haute et, lorsque le raisonnement est requis, en l’obscurcissant délibérément”, estiment les auteurs de l’étude.

D’après eux, il faut réfléchir dès maintenant à des moyens de conserver une bonne visibilité des chaînes de pensée des modèles d’IA dans le futur pour que ceux-ci, bien plus puissants que les modèles actuels, puissent être exploités dans une relative sécurité.


Réagissez à cet article !

Demandez nos derniers articles !

Huawei lance la Watch D3, une montre connectée médicale avec mesure précise de la pression artérielle

Huawei annonce un nouveau modèle de montre connectée : la Watch D3. Présentée comme un véritable dispositif médical certifié, elle se distingue par une mesure particulièrement précise de la pression…

iPhone 18 Pro et 18 Pro Max : la taille des écrans est connue

Apple va-t-il conserver ou modifier la taille des écrans des iPhone 18 Pro et 18 Pro Max ? A quelques jours du lancement, on a la réponse. La technologie LTPO+…

Galaxy S27 Ultra : Samsung miserait sur un tout nouveau zoom

En plus d’importants changements de design, le Galaxy S27 Ultra offrirait une expérience photo bien différente à celle de ses prédécesseurs en matière de zoom. Si les smartphones Samsung n’évoluent…

AliExpress casse les prix pour la rentrée : les meilleures offres à saisir

Une nouvelle vague de promotion démarre chez à l’occasion de sa campagne Local Day de septembre. Plusieurs catégories de produits profitent de fortes remises pour la rentrée. Voici les meilleures…

Test Google Pixel 11 : on prend (presque) les mêmes et on recommence ?

Le 12 août a été une journée chargée : éclipse solaire (presque totale), pic des Perséides et surtout conférence Made by Google. C’est à l’occasion de cette dernière que la firme…

GTA 6 : y aura-t-il des microtransactions et de l’IA générative ?

Les joueurs doivent-ils craindre des microtransactions et de l’IA générative dans GTA 6 ? Rockstar Games s’exprime à ce sujet. Entre la vidéo de gameplay de 26 minutes de GTA…

ChatGPT devient la première IA sous surveillance renforcée de l’UE, qu’est ce qui va changer ?

La Commission européenne a décidé que ChatGPT devait se conformer à la législation sur les services numériques. Reddit et Roblox sont aussi concernés. OpenAI n’a plus les mains libres en…

Attention, votre application de messagerie Android pourrait trahir vos secrets les plus gênants

Google Messages mélange désormais de vieux messages à des conversations récentes. Plusieurs personnes affirment avoir transmis des contenus intimes à des contacts qui ne devaient jamais les recevoir. Pour l’instant,…

One UI 9 : Samsung pourrait bientôt étendre cette fonction anti-arnaque à davantage de smartphones Galaxy

La fonction de détection des arnaques de Google proposée sur les smartphones Galaxy reste limitée à un nombre restreint de modèles. Et alors que Samsung pourrait l’étendre à d’autres régions,…

L’optique d’un satellite espion vient de décoller pour percer le secret de la matière noire

Dimanche, la NASA a envoyé dans l’espace son télescope Nancy Grace Roman depuis la Floride. Durant cinq ans, l’observatoire se consacrera à l’étude de la matière noire et de l’énergie…