Les géants de l'ia tournent en cercle avec leur propre déchet numérique : l'ia slop

Les titans de l'intelligence artificielle comme OpenAI, Google et Anthropic se trouvent face à un problème imprévu : les nouveaux données nécessaires pour entraîner leurs modèles d'IA naissent de plus en plus de l'IA slop, c'est-à-dire de la propre bavure générée par l'IA. Le résultat est que les nouveaux modèles d'IA sont pires que les anciens, car ils ont été entraînés avec plus de données erronées et de hallucinations.

La solution? acheter des livres anciens édités avant l

La solution? acheter des livres anciens édités avant l'émergence de l'ia

n

Une enquête du média indépendant 404 Media a révélé que des libraires de livres anciens, rares et peu édités aux États-Unis reçoivent des demandes de centaines et de milliers d'exemplaires par le biais de marchés de seconde main, qui cherchent des livres spécifiques grâce à leur ISBN.

n

Tout indique que les entreprises d'IA sont derrière ces mystérieux achats.

n

C'est une polémique double. D'un côté, beaucoup de ces livres sont protégés par le droit d'auteur. De l'autre, dans de nombreux cas, il faut détruire les livres pour les digitaliser, ce qui soulève des questions éthiques et culturelles sur ce qui arrive à ces livres.

n

Il y a une troisième peste : il y a un an, un juge a statué que Anthropic pouvait utiliser des livres protégés par le droit d'auteur pour entraîner son IA, sous condition qu'elle ne partage pas les fichiers numériques et qu'elle détruit les livres en papier.

n

L'obscur marché des livres pour entraîner l'IA

n

L'ISBN ou N° International Standard Book Number est une sorte de carte d'identité internationale pour les livres, qui respecte l'internationally. Chaque livre a un numéro d'ISBN unique, pour faciliter sa catalogation ou sa commande à une librairie.

n

ISBNDB est une entreprise qui a créé une base de données d'ISBN contenant plus de 110 millions de livres. Sur son site, elle propose aux entreprises d'IA de localiser des livres concrets par le biais de leur ISBN, en soulignant qu'elle peut localiser des livres en papier datant de avant 2022, année où a commencé l'IA.

n

C'est parce que ces livres sont libres de l'IA slop, c'est-à-dire de fausses données, d'alucinations ou de contenu créé par de l'IA de qualité médiocre. Il semblerait que la personne utilisant ce contenu généré par intelligence artificielle n'ait pas de problème, mais elles le rechquent pour trop mauvais.

n

Voici les nouveaux modèles d'IA Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash Cyber : le prêt, l'efficace et le hacker.

n

Le fonctionnement est le suivant : ISBNDB reçoit la liste de livres que les entreprises d'IA veulent, grâce à leur ISBN. Cette entreprise les cherche dans des marchés de livres tels que Better World Books, Biblio ou Alibris. Dans ces plates-formes, il y a des acheteurs qui se mettent en contact avec des libraires de livres anciens ou de seconde main, pour les localiser. Ils les achètent à elles et les vendent à ISBNDB, qui les vend ensuite aux entreprises d'IA, en lots allant de 1.000 à un million d'exemplaires.

n

Évidemment, rien de contraire à la loi ici, mais il y a des questions éthiques et culturelles sur ce qui arrive à ces livres.

n

Existent des méthodes pour digitaliser les livres qui ne les détruisent pas, et d'autres qui les détruisent. Le problème est que les méthodes qui ne les détruisent pas sont plus chères et plus lentes, et les entreprises d'IA ont beaucoup de pression pour entraîner leur IA avant que la concurrence ne le fasse.

n

Alors certaines achètent et détruisent les livres.

n

De plus, une décision d'un juge dit que, pour que cela soit légal, les livres en papier doivent être détruits.

n

Ils ont maintenant l'excuse qu'ils cherchaient.

n

Les livres en danger de disparition

n

Même si c'est légal, ces achats se font de manière anonyme, par le biais d'intermédiaires. La raison est simple : aucune entreprise d'IA ne veut voir des titres tels que :