Meta a possiblement entraîné son IA avec des livres piratés

Dans un procès qui l’oppose à plusieurs ayants droit, Meta admet avoir entraîné son IA avec des parties d’une base de données contenant des livres piratés. L’entreprise nie avoir violé les droits des auteurs concernés.

Livres
Crédits : 123RF

Nous vous parlons assez souvent d’intelligence artificielle. La technologie a fait un immense bond en avant et l’arrivée de ChatGPT notamment l’a rendu accessible au plus grand nombre. Si vous utilisez ce chatbot ou un autre de temps en temps, vous savez que les réponses fournies sont le fruit d’un entraînement. Des milliards de données ont été transmises aux l’IA afin qu’elles apprennent quoi dire selon ce qu’on leur demande. Le principe est le même quel que soit le but recherché : détecter une maladie, lire dans les pensées, générer des images…

Et c’est justement ce procédé qui pose de plus en plus de problèmes aujourd’hui. Dans l’immense majorité des cas, les données permettant de développer les intelligences artificielles sont récupérées à la source la plus fournie qui soit : Internet. Sauf que sur le Web, on trouve des textes et des œuvres libres de droits certes, mais aussi beaucoup d’autres protégées par des droits d’auteur. À mesure que le temps passe, les personnes concernés multiplient les attaques en justice. C’est ainsi qu’OpenAI, à l’origine de ChatGPT, se retrouve empêtré dans des procès sans fin. La maison-mère de Facebook, Meta, est également sous le coup de plusieurs actions judiciaires.

Meta est accusé d’avoir entraîné son IA avec du matériel protégé par droits d’auteur

Pour comprendre pourquoi Meta est visé ici, il faut remonter en 2020. Cette année-là, Shawn Presser, chercheur en intelligence artificielle crée Book3. Il s’agit d’une base de données reprenant le contenu du site Bibliotik, alors hébergé publiquement par le collectif The Eye. À l’intérieur, 195 000 livres regroupés dans 37 Go de données à des fins d’archivage. Avec Book3, l’objectif de Presser est d’offrir des donnés à tous ceux qui veulent développer un modèle d’IA. Le problème, c’est que dans le tas, il y a des livres protégés, donc piratés.

Lire aussi – ChatGPT : l’IA générative est menacée par un procès historique

Book3 reste accessible pendant des années avant de disparaître progressivement des sites Web sur lesquels l’archive est hébergée. À la demande d’ayants droit bien sûr. Avant cela, les grands noms de la Tech comme Meta ont eu largement le temps de s’en servir, et c’est bien ça que les plaignants reprochent à la firme. Le procès est actuellement en cours, mais des documents montrent comment le groupe de Mark Zuckerberg compte se défendre. Dans un premier temps, Meta admet avoir utilisé Book3 pour entraîner son IA.

L’IA de Meta a peut-être reçu des livres piratés en guise d’entraînement, l’entreprise nie

On peut ainsi lire : “Meta admet avoir utilisé des parties de l’ensemble de données Books3, parmi de nombreux autres matériaux, pour entraîner Llama 1 et Llama 2”. Il s’agit de ses modèles de langage, dont la 2e itération est disponible depuis l’été 2023. La question est maintenant de savoir si cela constitue une infraction aux droits d’auteur. Par exemple, les plaignants disent que Mera aurait dû demander la permission d’utiliser leurs œuvres.  Mais “Meta nie que son utilisation d’œuvres protégées par le droit d’auteur pour entraîner Llama ait nécessité un consentement, un crédit ou une compensation”. Et pas la peine de parler de piratage puisque “Meta nie avoir violé les droits d’auteur présumés des plaignants”.

Lire aussi – Google face à une amende record de 7 milliards, le procès s’annonce historique

Pour justifier son utilisation de Book3, Meta se cache derrière la notion de “fair use”, ou usage raisonnable, en indiquant que “les copies non autorisées des œuvres protégées par le droit d’auteur […],  constituent une utilisation équitable […]”. La tactique est connue et largement répandue dans ce genre d’affaires liées à l’intelligence artificielle. Elle s’applique d’ailleurs aussi bien aux œuvres supposément piratées que celles publiées sur des canaux accessibles publiquement mais utilisées sans permission.

Ce procès et les autres n’en sont qu’à leur début et beaucoup de choses peuvent se passer d’ici le rendu d’une décision. En dernier recours, c’est la Cour Suprême américaine qui pourrait être amenée à trancher. Quel que soit le verdict final, il aura un impact significatif sur le développement futur des intelligences artificielles.

Source : TorrentFreak


Réagissez à cet article !

Demandez nos derniers articles !

GTA 6 sur smartphone ? Un ancien développeur de Rockstar lâche une information surprenante

Le prochain volet de la saga Grand Theft Auto pourrait un jour être en mesure de tourner sur votre smartphone. C’est en tout cas ce que laisse entendre un ancien…

Instagram, TikTok, Facebook : et si vous pouviez enfin choisir ce que vous voyez dans votre fil d’actualité ?

Vous ouvrez Instagram ou Facebook pour voir les publications des personnes que vous suivez, mais tombez souvent sur des contenus de comptes que vous ne connaissez pas ? Même s’il…

Galaxy Z Fold 8 Ultra : ce bug YouTube gâche complètement le visionnage des vidéos

Certains utilisateurs de smartphones Android signalent des problèmes avec la lecture de vidéos YouTube. Le problème toucherait tout particulièrement le Galaxy Z Fold 8 Ultra de Samsung. YouTube est incontestablement…

Avengers Endgame : Marvel ajoute des scènes inédites et sème le chaos avant Doomsday

Le cultissime Avengers : Endgame est de retour en salle. Et, bonne nouvelle pour les fans, celui-ci inclut des scènes post-génériques totalement inédites. Ces dernières préparent l’arrivée d’Avengers : Doomsday….

The Legend of Zelda Ocarina of Time : tout savoir sur le remake tant attendu d’un des plus grands jeux vidéo de tous les temps

The Legend of Zelda: Ocarina of Time est ce que l’on peut raisonnablement appeler un véritable mythe. À l’occasion des quarante ans de la licence The Legend of Zelda, Nintendo…

Un abonnement ChatGPT Pro Max à 500 $ par mois arrive bientôt, pour quelles nouveautés ?

OpenAI préparerait le lancement d’un nouvel abonnement ChatGPT Pro Max à 500 $ par mois. Il ciblerait les professionnels et les développeurs. Nous avions déjà l’iPhone Pro Max, nos auront…

Apple TV 4K, HomePod Mini, iPad Mini, Apple va lancer trois nouveaux produits dans quelques jours

Après ses iPhone 18 Pro et l’iPhone Duo, Apple s’apprête à renouveler trois autres gammes de produits avec l’Apple TV 4K, le HomePod Mini et l’iPad Mini. L’automne s’annonce chargé…

Le ventilateur à haute vitesse Shark TurboBlade est bradé pour la fin de l’été, et à ce prix-là, il faut en profiter !

L’été 2026 a particulièrement été chaud en France. Alors que de belles journées sont encore annoncées ces prochaines semaines, Shark vous donne la possibilité de vous équiper à prix cassé….

Specs de Snap : nos premières impressions en vidéo sur les lunettes de réalité augmentée de Snapchat

Avec ses nouvelles Specs, Snap veut installer un ordinateur dans une paire de lunettes à verres transparents. Nous avons pu les essayer à Hawaï, lors du Qualcomm Snapdragon Summit. À…

Android : les smartphones vont gagner en autonomie, les batteries de 10 000 mAh arrivent en force

En combinant la technologie silicum-carbone à une coque rigide en acier, les constructeurs Android vont pouvoir intégrer des batteries à la capacité massive dans leurs smartphones premium. Depuis quelque temps,…