La clôture, non le bûcher

6 septembre 2026·
Clément Godbarge
Clément Godbarge
· 12 min. de lecture
Fahrenheit 451 (François Truffaut, 1966), photo d’exploitation Universal International – Collection Cinémathèque québécoise, via cinematheque.qc.ca
post Notes

Dans un entrepôt de North Las Vegas, Amazon fait tourner une machine qui tranche le dos des livres d’occasion. Les feuillets passent au scanner, puis le papier part au pilon. Détruire des livres pour nourrir l’IA : l’affaire avait tout pour devenir un scandale culturel. Le Daily Mail y a vu un autodafé des temps modernes, et n’a reculé devant aucun poncif : Savonarole, des photos de banque d’images montrant des livres d’allure rare et, comme il se doit, le bûcher de Berlin. Les grands quotidiens, on s’en doute, ont gardé la tête plus froide, mais ont laissé flotter la même comparaison. Pourtant, pour indignés qu’ils soient, ces articles ménagent singulièrement l’industrie de l’IA. Le sort du papier occupe tout le devant de la scène ; la propriété des bibliothèques numériques ainsi constituées reste dans l’ombre. À qui reviendra le savoir ainsi numérisé ? Cette question attendra que nous en ayons fini avec les fariboles de l’autodafé.

Un scanner n’est pas un bûcher

L’analogie avec les bûchers de Savonarole ou les autodafés nazis est saugrenue : détruire un exemplaire n’est pas supprimer un texte. Ces bûchers étaient des actes publics de répudiation. Ce pauvre moine de Savonarole, dont on cite le nom dans toutes les querelles d’autodafé, appelait les fidèles à sacrifier une partie de leurs biens en signe public de pénitence ; les bûchers nazis mettaient en scène une répudiation d’un autre ordre, en proclamant que les auteurs des livres brûlés n’avaient plus leur place dans la vie culturelle allemande. Dans les deux cas, si déplaisant que ce fût, la destruction était un spectacle. La numérisation destructive, procédé courant dans les campagnes de numérisation, vise tout autre chose : on massicote l’exemplaire pour en garder le contenu. Le livre est détruit, le texte dématérialisé. Ceux qui brandissent Fahrenheit 451 se souviendront peut-être de sa leçon centrale : un texte n’est pas le papier sur lequel il est imprimé.

Plus provocateur que le Daily Mail, mais non moins maladroit, 404 Media a ajouté à l’émoi en titrant sur des « livres rares ». Or un libraire cité par l’enquête elle-même précisait que ces commandes en gros écartaient les livres sans ISBN, ce qui désigne pour l’essentiel des éditions parues depuis l’apparition de ce numéro, vers 1970. C’est le fonds des vide-greniers et des boutiques d’Emmaüs, ces livres qu’un prochain rangement de cave enverra à la déchetterie. Avant de proclamer la catastrophe culturelle, on pourrait consulter le catalogue de la bibliothèque : ce sont précisément les publications que les bibliothèques de dépôt légal ont pour mission de conserver. Un ISBN ne garantit pas, il est vrai, qu’un exemplaire de dépôt ait survécu ; mais la rareté sur le marché de l’occasion ne prouve pas davantage la disparition d’un texte.

Les livres ont, bien sûr, une histoire matérielle. Les exemplaires dont les annotations, les envois ou la provenance font l’intérêt historique méritent d’être repérés et conservés. Les libraires d’occasion ont ici leur rôle à jouer : reconnaître un tel exemplaire devrait suffire à le retirer d’un lot promis au pilon. On peut aussi s’inquiéter de voir fondre le nombre d’exemplaires des titres épuisés ; mais il faut alors se demander pourquoi leurs ayants droit ne les réimpriment pas et n’ouvrent pas l’accès aux fac-similés numériques qui existent déjà. Les chercheurs connaissent la scène : Google Books trouve le passage qu’il vous faut, puis vous en tend un extrait de trois lignes, tiré d’un livre qu’on ne peut ni acheter neuf ni lire en ligne. Il y a donc là des pertes dont on peut débattre, mais elles ne changent pas un scanner en bûcher nazi.

Le commerce du livre, du reste, pilonne ses invendus depuis toujours, et par routine. Rien qu’en France, on estime que 25 000 tonnes de livres ont été pilonnées en 2023, soit environ 60 % du tonnage retourné aux distributeurs. Cela s’appelle gérer un stock. Exemplaires en surnombre et titres d’occasion devenus rares posent des questions d’accès différentes ; mais détruire du papier n’est pas en soi de la censure, ni de la tyrannie.

Plus de livres, meilleure IA ?

Que des entreprises d’IA achètent et numérisent des livres est, à vrai dire, une bonne nouvelle. Une technologie à qui l’on reproche sans cesse sa compréhension superficielle de la culture humaine s’en imprègne davantage ; on aurait pu attendre des universitaires qu’ils s’en félicitent.

Le web est un pauvre succédané de la mémoire écrite d’une langue. Une bonne part de ce qui s’est écrit dans une langue, des romans et des mémoires aux chansons populaires et aux conversations transcrites, n’est jamais passée de l’imprimé au web ; bien des livres ont survécu à leur éditeur. Les verser dans les données d’entraînement compte surtout là où il n’y a guère autre chose : quelques livres de plus en anglais n’apportent qu’un gain marginal ; en revanche, dans une langue mal représentée, ces mêmes livres peuvent faire la différence entre un système utilisable et un système inutile. Que ces outils aient leur place dans nos services publics ou dans notre vie de tous les jours, c’est affaire de débat public ; mais partout où nous décidons de nous en servir, nous devrions pouvoir le faire dans notre langue.

Les commandes signalées en Espagne et aux Pays-Bas donnent à l’enjeu linguistique un tour concret. En mai, elDiario.es décrivait un libraire de Badalona qui recevait commande sur commande, surtout d’ouvrages documentaires en catalan : livres d’histoire, manuels techniques, vieux actes de colloques. En août, la presse néerlandaise rapportait une demande adressée à De Slegte pour 800 000 livres en néerlandais. La langue de ces livres mérite au moins autant d’attention que le sort de leurs reliures. C’est peut-être trop demander au Daily Mail ; mais les journaux plus sobres eux-mêmes n’ont presque rien dit des langues en cause.

Les accords de licence avec les grands éditeurs peuvent aussi fournir une matière précieuse, mais leurs catalogues numériques ne couvrent qu’une fraction de ce qui a paru sous forme imprimée : les livres jamais numérisés, ou dont l’éditeur n’a plus les droits, restent hors de l’offre. Même généreux, un accord de licence ne saurait tenir lieu d’histoire de l’édition, et encore moins d’histoire d’une culture. Acheter des exemplaires d’occasion, c’est aller chercher ce qui se trouve au-delà de ces frontières commerciales.

Crier au vol n’est pas un argument

Parler de « vol » n’avance pas davantage. En juin 2025, deux tribunaux fédéraux américains ont jugé que, dans les affaires dont ils étaient saisis, l’entraînement de modèles de langue sur des livres relevait du fair use. Dans Bartz v. Anthropic, le tribunal a insisté sur le caractère transformatif de l’entraînement : les livres servaient à bâtir un système capable de produire une expression nouvelle. Un modèle peut retenir des passages par cœur, mais entraîner un modèle sur un livre ne rend pas le texte entier disponible sur commande. L’absence de reproduction littérale ne lève pas non plus toutes les objections : dans Kadrey v. Meta, le juge a averti que les œuvres produites par l’IA pourraient inonder le marché, et que la preuve d’un tel préjudice pourrait faire échec au fair use ; mais ces plaignants-là n’avaient rien produit de sérieux quant au préjudice subi par leurs propres œuvres. Aucune des deux décisions ne donne carte blanche aux entreprises d’IA ni ne tranche le débat moral. Elles nous obligent à distinguer trois choses : comment les livres sont acquis, comment les copies sont conservées, et ce que l’entraînement en fait. Qualifier le tout de « vol », c’est laisser ces questions sans réponse.

Soit dit en passant, la décision Anthropic fournit au massicot sa raison d’être. Le tribunal a validé la numérisation d’exemplaires achetés, et condamné l’accumulation de livres piratés dans une bibliothèque permanente, pour laquelle l’entreprise a ensuite consenti à un règlement de 1,5 milliard de dollars. Si la numérisation a passé, c’est en partie parce que chaque exemplaire imprimé était détruit dans l’opération : la copie numérique le remplaçait, et ne sortait pas de l’entreprise. La destruction qui bouleverse tant de monde a donc aidé Anthropic à faire reconnaître son programme de numérisation comme un usage loyal. Acheter, numériser, jeter : voilà, dans ce cas, la voie licite. Le massicot est ici un instrument de mise en conformité.

On a de bonnes raisons de vouloir que l’IA puise dans plus de langues, plus de travaux savants, plus de ce monde qui existait avant internet. Ces raisons ne s’évanouissent pas parce qu’une entreprise qui nous déplaît y a trouvé un filon.

Une indignation d’emprunt

Revenons donc au Daily Mail. Son article s’inscrit dans Make It Fair, campagne menée par des patrons de presse et des éditeurs pour obtenir un marché de licences à part entière pour l’IA. Deux substitutions commodes font tout le travail : les géants du numérique tiennent lieu d’IA, et les ayants droit tiennent lieu de « créativité britannique ». On invite le lecteur à défendre la culture pendant que les éditeurs en négocient le prix de vente. Les universitaires qui font circuler l’article pourraient se demander quelle cause sert leur indignation.

Les géants du numérique et les Big Five se disputent sur le montant du loyer, mais ni les uns ni les autres ne s’en prennent à la clôture. La fable de l’auteur solitaire dépouillé par un géant de la tech cache ce que de coûteux accords de licence offrent aux deux camps : les éditeurs sont payés, et les géants obtiennent un marché où leurs rivaux plus modestes n’ont pas les moyens d’entrer. Peter Thiel a dit sans détour la préférence de la Silicon Valley : « la concurrence, c’est pour les perdants ».

Les licences ne mènent pas fatalement là. Un accès abordable et non exclusif pourrait servir les petits développeurs. Mais un système qui oblige chaque nouvel entrant à négocier des accords coûteux avec les grands ayants droit fait de la surface financière une condition d’entrée ; et un paiement présenté comme une concession aux industries culturelles finit par acheter une protection contre les rivaux de demain.

L’IA n’appartient pas aux géants du numérique

Il y a plus grave. Trop de critiques de l’IA prennent ses plus gros fournisseurs pour le domaine tout entier. Les produits occupent les gros titres ; la recherche et le développement qui se font hors de ces entreprises disparaissent du champ. Les géants ne sauraient rêver malentendu plus commode : leur ambition de posséder le domaine devient le postulat même de la critique qu’on leur adresse. Le monopole n’est pas encore acquis ; le tenir pour tel, c’est leur rendre un immense service. C’est aussi détourner le regard de l’open source : de ses besoins, de ses chances d’exister, de ses intérêts, de sa légitimité comme alternative.

L’IA libre permet de bâtir et d’adapter des systèmes qui reflètent une plus grande diversité de langues, de cultures et de formes d’expression. Pour les pays d’Europe, d’Afrique, d’Amérique latine et d’Asie, c’est une assise concrète de souveraineté technologique et culturelle : le pouvoir de décider comment les systèmes fonctionnent, quelles langues ils servent et où on les emploie. Recourir ou non à l’IA, et à quelles fins, doit rester un choix public, et non une décision dictée par la dépendance envers un oligopole étranger.

Mais la liberté de modifier un système ne vaut pas grand-chose sans les moyens de le faire. Le travail indépendant exige des compétences, une infrastructure de calcul et l’accès à une matière d’entraînement. Ce qui nous ramène aux livres. Si chaque équipe de recherche ou chaque institution publique doit négocier ses propres accords avec les éditeurs, ou se constituer sa propre bibliothèque privée, l’indépendance deviendra inabordable, même pour certains pays riches.

Les livres sont déjà là

Bibliothèques et archives ont passé des générations à rassembler la matière dont ces systèmes ont besoin. Leurs collections existent parce que l’accès au savoir doit survivre à l’intérêt commercial qu’il y a à le vendre. Beaucoup est déjà numérisé : HathiTrust conserve quelque dix-neuf millions de volumes numérisés issus de bibliothèques de recherche, dont un grand nombre encore sous droits. Une bibliothèque numérise un livre et le garde ; personne n’y a besoin de massicot. HathiTrust ferme son Research Center à la fin de 2026, mais a aussi annoncé Transparent Books, un projet d’accès aux corpus pour la recherche et le développement non commerciaux en IA. À ces conditions, certains développeurs indépendants resteraient encore à la porte.

Posséder les livres, toutefois, ne donne pas à une bibliothèque le droit d’en distribuer le contenu protégé sous forme de corpus d’entraînement. Le droit de l’Union européenne autorise les organismes de recherche et les bibliothèques à fouiller les œuvres licitement accessibles à des fins de recherche scientifique, et permet une fouille plus large là où les ayants droit n’ont pas réservé leurs droits. Le Royaume-Uni trace une frontière plus étroite : son exception de fouille couvre la recherche non commerciale et limite le transfert des copies. Ni l’un ni l’autre de ces cadres ne donne aux bibliothèques un droit général de partager leurs fonds sous droits pour que d’autres bâtissent dessus.

On pourrait aussi revoir la durée pendant laquelle les ayants droit contrôlent les usages computationnels des livres. Le brevet pharmaceutique repose sur un pacte : une exclusivité temporaire récompense l’innovation, puis l’invention devient disponible pour d’autres. Sa durée ordinaire, vingt ans, est bien plus courte que celle du droit d’auteur, qui court toute la vie de l’auteur et soixante-dix ans au-delà. Pourquoi ne pas appliquer un principe analogue aux usages computationnels des livres ? Au bout de vingt ans, disons, à compter de la première publication, un livre s’ouvrirait à la fouille de textes et de données sans redevance, tandis que les droits de réédition et de vente resteraient protégés. Les auteurs continueraient de tirer un revenu de leurs livres sans que des générations de chercheurs aient à négocier l’autorisation de les analyser.

Je soutenais il y a deux ans dans The Hindu que les données patrimoniales devraient être traitées comme un bien public. Les États devraient financer les bibliothèques et les archives pour qu’elles numérisent, transcrivent et documentent leurs collections, et leur donner l’autorité légale de mettre les corpus ainsi constitués à la disposition de tous ceux qui voudront bâtir dessus. Les géants du numérique pourraient être mis à contribution par une taxe dédiée.

L’argent public devrait s’accompagner de politiques de collection et de règles d’accès rendues publiques, valant pour la recherche comme pour le commerce, sans accord exclusif ni accès privilégié pour les donateurs. Ouvrir l’accès à l’entraînement n’oblige pas à laisser redistribuer sans restriction les livres sous droits. Les auteurs devraient prendre part à la conception du dispositif public, y compris sur le consentement, la rémunération et la concurrence faite à leurs œuvres ; et la gratuité pour les utilisateurs n’exclut pas une rémunération des auteurs sur fonds publics : le droit de prêt public, qui les rémunère à chaque emprunt de leurs livres, en donne le précédent. Le bûcher n’a jamais été le sujet. La clôture, si.

Clément Godbarge
Auteurs
Maître de conférences en humanités numériques
Clément Godbarge est maître de conférences en humanités numériques à l’université de St Andrews. Ses recherches portent sur les rapports entre science et art de gouverner dans l’Europe de la première modernité. Dans son livre à paraître, il examine comment des médecins attachés aux cours de France et d’Italie au XVIe siècle se sont imposés comme des experts politiques d’un genre nouveau. Ses travaux ont été soutenus par la Fondation Andrew W. Mellon, la Commission Fulbright, la Renaissance Society of America et l’université Harvard.