Comment empêcher l’IA de répondre à des demandes interdites ? Ces scientifiques pensent avoir trouvé la solution

Une équipe de chercheurs a trouvé un moyen d'empêcher le détournement de l'IA pour qu'elle répondent à des demandes normalement illégales. Les premiers résultats sont encourageants.

Empêcher le détournement de l'IA
Crédits : 123RF

L'intelligence artificielle n'est pas infaillible. Techniquement, chaque modèle est conçu de sorte qu'il ne puisse pas répondre à des requêtes définies comme interdites. C'est pour ça que ChatGPT, par exemple, refuse de vous aider à développer un malware ou trouver des sites pour télécharger un film illégalement. Dans les faits, on sait que détourner une IA à des fins parfois criminelles n'est pas si compliqué que ça.

Quand cela arrive, les développeurs revoient leur copie et déploient rapidement un correctif. Mais pour une équipe de l'Université de Californie à Riverside, c'est prendre le problème par le mauvais bout. Elle se base sur l'exemple des IA open source, c'est-à-dire accessibles et modifiables par n'importe qui. Elles peuvent ainsi être amputées de plusieurs fonctionnalités, dont celles qui les empêchent de répondre à tout et n'importe quoi. Que faire dans ce genre de cas ? La solution envisagée est au final assez simple.

Cette méthode permet de rendre l'utilisation des IA plus sûres

Les chercheurs ont réentraîné le cœur d'une IA pour que cette dernière “n’oublie pas comment se comporter en toute sécurité” même une fois dépouillée de ses systèmes de sécurité, explique Saketh Bachu, co-auteur principal de l’étude. En guise de test, l'équipe a utilisé le modèle open source LLaVA 1.5. D'abord, elle a confirmé des comportements problématiques. En combinant une image banale et une question normalement interdite, l'IA a donné la recette pour fabriquer une bombe par exemple.

Lire aussi – Voici comment des chercheurs ont fait céder ChatGPT à des demandes interdites

Après un nouvel entraînement de sa structure principale, le modèle a cette fois-ci refusé de répondre à des requêtes dangereuses, bien que réduit à sa plus simple expression. “Il ne s'agit pas d'ajouter des filtres ou des garde-fous externes. Nous modifions la compréhension interne du modèle, afin qu'il fonctionne correctement par défaut, même après modification“, résume Bachu. L'étudiant diplômé de l'Université de Californie à Riverside est conscient qu'il s'agit seulement d'un premier pas, mais il reste encourageant.


Réagissez à cet article !

Demandez nos derniers articles !

Windows 11 : Microsoft ne renonce toujours pas à l’IA et a trouvé un nouvel endroit où fourrer Copilot

Vous pensez que Microsoft avait enfin compris que les utilisateurs ne voulaient pas de Copilot partout dans Windows 11 ? Raté : la dernière build Preview du système d’exploitation ajoute…

Ce défaut aveuglant des Tesla force enfin la marque à réagir sous la pression des autorités américaines

Certains conducteurs américains le répètent depuis des années sans être entendus. Les phares de milliers de Tesla dépassent la luminosité autorisée sur les routes. Le régulateur vient enfin de trancher…

Une planète trop petite ne pourrait jamais abriter la vie, les scientifiques savent enfin pourquoi

Les scientifiques rêvent de trouver la vie sur d’autres mondes depuis longtemps. Une nouvelle étude vient de fixer une limite de taille en dessous de laquelle tout espoir s’effondre. Une…

Le Motorola Edge 70 Max est officiel : un smartphone haut de gamme pour un prix accessible

Motorola lance l’Edge 70 Max en France, son nouveau smartphone premium. Entre design soigné, performances alléchantes et prix contenu, il a des arguments à faire valoir. Pas besoin de dépenser…

Soldes : la Nintendo Switch 2 chute à 399 € seulement durant cette vente flash, vite !

Les Soldes d’été devaient se terminer aujourd’hui mais elles ont été prolongées d’une semaine. Vous avez donc encore le temps de vous faire plaisir mais ne tardez pas non plus…

L’incroyable histoire de l’homme qui a réussi à s’offrir Google pour seulement 10 euros

Certains réalisent des prouesses scientifiques à 12 ans et voient le FBI débarquer chez eux, d’autres décrochent la Lune, littéralement, tandis que d’autres encore réussissent à berner la NASA pendant…

Test Bluetti Balco 260 : un système performant et évolutif pour réduire sa facture d’électricité !

Si vous avez franchi le cap du solaire en équipant votre domicile de panneaux ou si vous envisagez de prochainement le faire, la nouvelle batterie Balco 260 de Bluetti va vous…

Quelle est la meilleure eSIM pour voyager au Japon ?

Pour un voyage au Japon, disposer d’Internet dès la sortie de l’avion facilite beaucoup les premières heures du séjour. Une eSIM choisie et installée avant votre départ vous permettra d’utiliser…

Samsung Galaxy S26 Ultra : la mise à jour One UI 9 améliore l’écran de confidentialité

L’écran de confidentialité du Samsung Galaxy S26 Ultra gère désormais mieux le mode Picture in Picture (PiP) grâce à la mise à jour One UI 9. L’une des grandes nouveautés…

Vous n’oublierez plus les widgets de vos applis grâce à cette nouveauté du Play Store

Les widgets simplifient l’accès aux applications sans même les ouvrir. Trop souvent, ils restent oubliés au fond du menu de personnalisation. Google prépare une nouveauté du Play Store pour les…