L’IA Claude reçoit une nouvelle fonction contre les utilisateurs pénibles (et ça pourrait tout changer)

Anthropic poursuit le développement de Claude, son intelligence artificielle. Après l’avoir dotée d’une nouvelle fonction de mémoire à la demande, l’entreprise se tourne désormais vers un autre aspect : le « bien-être des modèles », en lui permettant de mettre fin à des conversations « pénibles ».

Claude Anthropic IA
Crédits : Anthropic

Les entreprises qui développent des modèles d’intelligence artificielle équipent leurs chatbots de garde-fous et de filtres de contenu, afin d’éviter que leur chatbot ne dérape – comme ça a été le cas plusieurs fois avec Grok, l’IA d’Elon Musk. Concrètement, ces IA sont programmées pour refuser certaines demandes, telles que la création de virus informatiques, d’armes ou de drogue, mais aussi pour esquiver (voire censurer) des sujets jugés sensibles (sexualité, violence, politique…). L’objectif ? Protéger à la fois les utilisateurs et l’entreprise.

Dans certains cas plus extrêmes, les modèles disposent même d’un mécanisme de coupure leur permettant de mettre fin à une conversation. Et c’est précisément de cette nouvelle fonctionnalité qu’Anthropic vient d’équiper son IA, baptisée Claude. Mais cette fois-ci, elle sert un but bien différent.

L’IA Claude peut maintenant interrompre une conversation pour se protéger elle-même

Anthropic continue d’enrichir Claude de nouvelles options, comme une mémoire à la demande, qui permet à l’utilisateur d’instaurer une relation plus maîtrisée avec l’IA. L’entreprise vient en effet d’annoncer une nouvelle fonctionnalité : la capacité pour ses modèles les plus récents, Claude Opus 4 et 4.1, d’interrompre une conversation avec un utilisateur dans « de rares cas extrêmes d’interactions persistantes, nuisibles ou abusives ».

D’après Anthropic, cette fonctionnalité n’interviendra qu’en dernier recours, dans « des cas extrêmes et marginaux », après plusieurs tentatives de redirection vaines ou si l’utilisateur en fait lui-même la demande. Claude ne pourra pas non plus utiliser cette fonction en cas de risque de blessure imminent, qu’il soit pour l’utilisateur lui-même ou pour les autres. Concrètement, l’utilisateur ne pourra plus envoyer de messages dans une conversation si le chatbot a estimé qu’elle était dangereuse (contenu sexuel impliquant des mineurs, actes de violence à grande échelle…). Mais d’après nos confrères d’Engadget, cela n’aura aucune conséquence sur les autres échanges : l’utilisateur pourra créer une autre discussion immédiatement, ou encore retourner dans l’historique de la conversation problématique pour créer de nouvelles branches en modifiant ses réponses.

Mais cette nouveauté n’a pas été créée pour protéger les utilisateurs – ou du moins pas directement –, mais l’IA elle-même. En effet, elle s’inscrit dans le nouveau programme de recherche d’Anthropic, mis en place pour étudier « le bien-être des modèles ». Il s’agit pour le moment d’une expérimentation, et les utilisateurs sont invités à donner leur avis si jamais ils sont confrontés à l’interruption d’une de leurs conversations par Claude.

Réagissez à cet article !

Demandez nos derniers articles !

Nintendo Switch 2 : la console passe à prix cassé durant cette vente flash, vite !

La Nintendo Switch 2 vous fait de l’oeil, mais vous attendez une belle chute de prix pour sauter le pas ? Ce moment est venu, mais il va falloir faire…

Huawei lance la Watch D3, une montre connectée médicale avec mesure précise de la pression artérielle

Huawei annonce un nouveau modèle de montre connectée : la Watch D3. Présentée comme un véritable dispositif médical certifié, elle se distingue par une mesure particulièrement précise de la pression…

iPhone 18 Pro et 18 Pro Max : la taille des écrans est connue

Apple va-t-il conserver ou modifier la taille des écrans des iPhone 18 Pro et 18 Pro Max ? A quelques jours du lancement, on a la réponse. La technologie LTPO+…

Galaxy S27 Ultra : Samsung miserait sur un tout nouveau zoom

En plus d’importants changements de design, le Galaxy S27 Ultra offrirait une expérience photo bien différente à celle de ses prédécesseurs en matière de zoom. Si les smartphones Samsung n’évoluent…

AliExpress casse les prix pour la rentrée : les meilleures offres à saisir

Une nouvelle vague de promotion démarre chez à l’occasion de sa campagne Local Day de septembre. Plusieurs catégories de produits profitent de fortes remises pour la rentrée. Voici les meilleures…

Test Google Pixel 11 : on prend (presque) les mêmes et on recommence ?

Le 12 août a été une journée chargée : éclipse solaire (presque totale), pic des Perséides et surtout conférence Made by Google. C’est à l’occasion de cette dernière que la firme…

GTA 6 : y aura-t-il des microtransactions et de l’IA générative ?

Les joueurs doivent-ils craindre des microtransactions et de l’IA générative dans GTA 6 ? Rockstar Games s’exprime à ce sujet. Entre la vidéo de gameplay de 26 minutes de GTA…

ChatGPT devient la première IA sous surveillance renforcée de l’UE, qu’est ce qui va changer ?

La Commission européenne a décidé que ChatGPT devait se conformer à la législation sur les services numériques. Reddit et Roblox sont aussi concernés. OpenAI n’a plus les mains libres en…

Attention, votre application de messagerie Android pourrait trahir vos secrets les plus gênants

Google Messages mélange désormais de vieux messages à des conversations récentes. Plusieurs personnes affirment avoir transmis des contenus intimes à des contacts qui ne devaient jamais les recevoir. Pour l’instant,…

One UI 9 : Samsung pourrait bientôt étendre cette fonction anti-arnaque à davantage de smartphones Galaxy

La fonction de détection des arnaques de Google proposée sur les smartphones Galaxy reste limitée à un nombre restreint de modèles. Et alors que Samsung pourrait l’étendre à d’autres régions,…