L’IA pourrait bientôt “penser” d’une manière qu’on ne comprend pas

Aujourd’hui, on peut surveiller le cheminement de pensée des modèles d’IA pour détecter les erreurs et les dangers. Mais prochainement, ils pourraient devenir assez intelligents pour dissimuler la manière dont ils arrivent à un résultat, une action ou un raisonnement.

Robot IA contre humain aux échecs
Crédit : 123RF

À mesure qu’elle devient plus performante, l’IA se complexifie, rendant de plus en plus difficile la possibilité de comprendre comment elle en arrive à un résultat ou à une “réflexion”. C’est d’autant plus vrai qu’on sait que l’IA peut apprendre d’elle-même, ce qui signifie qu’elle peut s’adapter au-delà des bases de données ou des paramètres qui lui sont initialement soumis.

Une récente étude sur la sécurité de l’IA vient d’être publiée. Elle regroupe des dizaines de chercheurs spécialisés, appartenant à des entreprises à la pointe de l’IA : Google, Amazon, OpenAI, Meta, Anthropic… Cette étude porte plus exactement sur le contrôle des chaînes de pensée de l’IA. Pouvoir surveiller et analyser le “cheminement de pensée” exact des IA limiterait les risques que les agents d’IA avancés, dont le fonctionnement est opaque, fassent des erreurs d’interprétation, ou décident d’agir contre les règles qui leur ont été imposées. Mais ce n’est pas si simple…

Les modèles d’IA pourront délibérément occulter des informations sur leur chaîne de pensée

La surveillance des chaînes de pensée comporte en effet des limites. Le rapport souligne qu’elle peut permettre de détecter certains comportements anormaux, mais qu’elle ne fournit pas à elle seule des preuves solides de sécurité. Ce n’est pas parce qu’on met en place un système de contrôle des chaînes de pensée, que l’IA ne peut pas dysfonctionner en dehors de ce type de surveillance. “Il faut veiller à ne pas créer un faux sentiment de sécurité basé sur une telle surveillance”, insistent les chercheurs.

En outre, la surveillance des tâches nécessitant un raisonnement avancé peut ne pas détecter tous les dangers pertinents. “La surveillance des chaînes de pensée pourrait cesser de fonctionner dans les modèles plus avancés, conscients de la situation. Les futurs modèles pourraient être capables d’éviter la détection en neutralisant leur propension à penser à voix haute et, lorsque le raisonnement est requis, en l’obscurcissant délibérément”, estiment les auteurs de l’étude.

D’après eux, il faut réfléchir dès maintenant à des moyens de conserver une bonne visibilité des chaînes de pensée des modèles d’IA dans le futur pour que ceux-ci, bien plus puissants que les modèles actuels, puissent être exploités dans une relative sécurité.


Réagissez à cet article !

Demandez nos derniers articles !

ChatGPT se dote d’une version pour les adolescents, qui refuse de faire leurs devoirs à leur place

OpenAI annonce le lancement de ChatGPT for Teens, une version de son chatbot IA embarquant plus de protections et les empêchant de tricher pour leurs devoirs. ChatGPT for Teens est…

Bon plan DJI Neo 2 : seul ou dans son pack Fly More Combo, le drone est disponible dès 160 €

Le DJI Neo 2 profite d’une réduction de 33 % qui le ramène à seulement 160 € sur AliExpress. Vous pouvez également sélectionner le pack Fly More Combo, beaucoup plus…

Windows 11 : le menu contextuel devient plus rapide et personnalisable

Microsoft annonce une mise à jour pour Windows 11 visant à rendre le menu contextuel plus efficace. Il s’affiche désormais plus rapidement après un clic droit, et l’utilisateur peut choisir…

Spotify : cette fonction inédite vous permet de redécouvrir vos playlists préférées et de raconter les vôtres

Spotify ne cesse d’améliorer son application et tend à offrir une expérience d’écoute de plus en plus personnalisée et collaborative. La dernière nouveauté en date ? Les notes de playlists qui…

Avec One UI 9.5, la connectivité par satellite devient sérieuse chez Samsung

La mise à jour One UI 9.5 va apporter un nouveau hub de connectivité par satellite sur les smartphones compatibles. Son but est de regrouper toutes les fonctions liées à…

Gboard : Google prépare enfin une option pour éliminer ce défaut agaçant des suggestions du presse-papiers

Gboard dispose d’options plus pratiques les unes que les autres. Mais, à l’usage, certaines peuvent se transformer en petits défauts agaçants. Les suggestions du presse-papiers, lorsque l’on n’en a pas…

Sony ne sait toujours pas quand sortira la PS6, son patron explique pourquoi

Autour de la PS6, les rumeurs s’accumulent depuis presque deux ans sans qu’une annonce officielle permette encore de départager les scénarios. Le patron du groupe japonais vient finalement d’évoquer publiquement…

Le Galaxy S26 FE entre en action dans cette vidéo de prise en main

Le Galaxy S26 FE n’est pas encore sorti, mais il est déjà exhibé dans diverses vidéos de prise en main, confirmant son design et certaines fonctions et caractéristiques. Samsung n’a…

Les nouveaux PC portables Googlebook pourront interagir avec les smartphones Android

De nouveaux indices viennent confirmer qu’il existera un lien étroit entre les PC portables Googlebook et les smartphones Android. Ces dernières années, de nombreux efforts ont été consentis par Google…

Les fans de Pokémon voient leurs commandes annulées après une cyberattaque qu’ils n’ont pas vue venir

Les amateurs de peluches Pikachu ne pensaient certainement pas recevoir une telle alerte. La boutique officielle Pokémon les informe que leurs données personnelles ont probablement circulé ailleurs. Pourtant, aucun pirate…