A cerca, não a fogueira

6 de setembro de 2026·
Clément Godbarge
Clément Godbarge
· 12 minutos de leitura
Fahrenheit 451 (François Truffaut, 1966), lobby card da Universal International – Coleção Cinémathèque québécoise, via cinematheque.qc.ca
post Notas

Num armazém de North Las Vegas, a Amazon mantém uma máquina que corta a lombada aos livros em segunda mão. As folhas soltas passam por um scanner, e o papel segue depois para a pasta. Destruir livros para alimentar a IA: à história não faltava nada para se tornar um escândalo cultural. O Daily Mail comparou a operação a uma queima de livros dos tempos modernos, sem poupar num único cliché: alusões a Savonarola, fotografias de banco de imagens com livros de ar raro e, como não podia deixar de ser, a fogueira de Berlim. Como seria de esperar, os jornais de referência mantiveram mais sangue-frio, mas deixaram a mesma comparação no ar. E, no entanto, por muito indignados que estejam, estes artigos tratam a indústria da IA com uma brandura notável. O destino do papel ocupa todo o primeiro plano; a propriedade das bibliotecas digitais daí resultantes quase não entra em cena. Quem vai controlar o saber que está a ser digitalizado? Essa pergunta terá de esperar enquanto despachamos o disparate da queima de livros.

Um scanner não é uma fogueira

A analogia com as fogueiras de Savonarola ou com as queimas de livros nazis é disparatada: destruir um exemplar não é o mesmo que suprimir um texto. As fogueiras eram atos públicos de repúdio. O pobre frade Savonarola, cujo nome aparece em todas as polémicas sobre queimas de livros, exortava as pessoas a sacrificar parte dos seus bens em ato público de penitência. As fogueiras nazis encenavam um repúdio de outra ordem: queimar os livros em público declarava que os seus autores não tinham lugar na vida cultural alemã. Em ambos os casos, por mais desagradáveis que fossem, a destruição era um espetáculo. A digitalização destrutiva, método corrente nas campanhas de digitalização, serve outro fim: guilhotina-se o exemplar para conservar o conteúdo. O livro é destruído; o texto, desmaterializado. Quem invoca Fahrenheit 451 faria bem em lembrar-se da sua lição central: um texto não é o papel em que está impresso.

Mais atrevida do que o Daily Mail, mas não menos desajeitada, a 404 Media agravou o alarme ao pôr «livros raros» no título. Ora, um livreiro citado na sua própria investigação disse que estas encomendas em massa excluíam os livros sem ISBN, o que aponta sobretudo para edições publicadas desde a introdução do ISBN, por volta de 1970. É o fundo das feiras de velharias e das lojas solidárias, livros a que só falta uma arrumação da cave para irem parar ao ecoponto. Antes de anunciar uma catástrofe cultural, convinha consultar o catálogo da biblioteca. São precisamente estas as publicações que as bibliotecas de depósito legal existem para preservar. É certo que um ISBN não garante que sobreviva um exemplar de depósito; mas a escassez no mercado em segunda mão também não prova o desaparecimento de um texto.

Os livros têm, claro, uma história material. Os exemplares cujas anotações, dedicatórias ou proveniência lhes dão significado histórico merecem ser identificados e preservados. Os alfarrabistas têm aqui um papel a desempenhar: reconhecer um exemplar assim devia ser razão para o retirar de uma remessa destinada à pasta. Podemos ainda inquietar-nos com a rarefação dos exemplares físicos de títulos esgotados. Mas então devemos também perguntar por que razão os detentores dos direitos nem os reimprimem nem autorizam o acesso aos fac-símiles digitais existentes. Os investigadores conhecem a frustração: o Google Books encontra a passagem de que precisamos, e depois oferece-nos três linhas de um livro que não se pode comprar novo nem ler em linha. Há aqui, portanto, perdas que vale a pena discutir, mas não transformam um scanner numa fogueira nazi.

O comércio livreiro, entretanto, há muito que destrói por rotina os livros que não vende. Só em França, estima-se que 25 000 toneladas de livros foram para a pasta em 2023, cerca de 60 % da tonelagem devolvida por vender aos distribuidores. A isto chama-se gerir stock. Os exemplares excedentários e os títulos raros em segunda mão levantam questões de acesso diferentes, mas destruir papel não equivale, em si, a censura ou a tirania.

Mais livros, melhor IA?

Que as empresas de IA estejam a comprar e a digitalizar livros é, na verdade, uma boa notícia. Uma tecnologia rotineiramente criticada pela sua compreensão superficial da cultura humana está a adquirir mais dela, e seria de esperar que os académicos aplaudissem o esforço.

A web é um pobre sucedâneo do registo acumulado de uma língua. Grande parte da vida escrita de uma língua, dos romances e memórias às canções populares e às conversas transcritas, nunca passou do papel para a web. Muitos destes livros sobreviveram aos seus editores. Levá-los para os dados de treino importa sobretudo onde pouco mais existe. Uns livros a mais em inglês trarão melhorias marginais. Numa língua mal representada, porém, esses mesmos livros podem fazer a diferença entre um sistema utilizável e um sistema inútil. Se estas ferramentas têm lugar nos nossos serviços públicos ou no nosso quotidiano é matéria de debate público. Mas, onde quer que decidamos usá-las, devíamos poder fazê-lo na nossa própria língua.

As encomendas noticiadas em Espanha e nos Países Baixos tornam concreto o que está em jogo do ponto de vista linguístico. Em maio, o elDiario.es descrevia um livreiro de Badalona que recebia encomendas sucessivas, sobretudo de não-ficção em catalão: livros de história, manuais técnicos e velhas atas de congressos. Em agosto, a imprensa neerlandesa noticiava um pedido dirigido à De Slegte de 800 000 livros em língua neerlandesa. A língua dos livros merece pelo menos tanta atenção como o destino das suas encadernações. Talvez seja pedir demasiado ao Daily Mail. Mas até os jornais mais sóbrios pouco tiveram a dizer sobre as línguas em causa.

Os acordos de licenciamento com as grandes editoras também podem fornecer material valioso, mas os seus catálogos digitais cobrem apenas uma fração do que foi impresso. Os livros nunca digitalizados, ou cujos direitos a editora já não detém, ficam fora da oferta. Nem o mais generoso acordo de licenciamento pode substituir a história da edição, e menos ainda a história de uma cultura. Comprar exemplares em segunda mão é uma maneira de ir buscar o que fica para lá dessas fronteiras comerciais.

«Roubo» não é argumento

Chamar-lhe «roubo» também não ajuda. Em junho de 2025, dois tribunais distritais dos Estados Unidos decidiram que, nos casos que lhes foram submetidos, usar livros para treinar modelos de linguagem constituía uso legítimo (fair use). Em Bartz v. Anthropic, o tribunal sublinhou o caráter transformativo do treino: os livros serviram para construir um sistema capaz de produzir expressão nova. Os modelos podem memorizar passagens, mas usar um livro para treino não torna o texto inteiro recuperável a pedido. Nem a ausência de reprodução literal liquida todas as objeções. Em Kadrey v. Meta, o juiz avisou que as obras geradas por IA podiam inundar o mercado e que a prova de tal dano poderia derrotar uma defesa de fair use. Estes queixosos, porém, não tinham apresentado prova relevante desse dano às suas próprias obras. Nenhuma das decisões dá às empresas de IA licença ilimitada nem encerra a disputa ética. Obrigam-nos a distinguir como os livros são adquiridos, como as cópias são conservadas e o que o treino faz com elas. Chamar «roubo» a tudo isto deixa essas perguntas sem resposta.

Diga-se de passagem que a decisão Anthropic dá à guilhotina a sua razão de ser. O tribunal validou a digitalização de exemplares comprados e rejeitou a acumulação de livros pirateados numa biblioteca permanente, pela qual a empresa viria a aceitar um acordo de 1,5 mil milhões de dólares. A digitalização passou em parte porque cada exemplar impresso era destruído na conversão: a cópia digital substituía-o e não era partilhada fora da empresa. A destruição que tanto perturba algumas pessoas ajudou a Anthropic a fazer reconhecer o seu programa de digitalização como uso legítimo. Comprar, digitalizar e deitar fora ofereceu, nesse caso, uma via lícita. A guilhotina, aqui, é um instrumento de conformidade.

Há boas razões para querer que a IA beba de mais línguas, de mais erudição e de mais desse mundo que existia antes da internet. Essas razões não desaparecem porque uma empresa de que não gostamos encontrou nisso uma oportunidade comercial.

Indignação de empréstimo

Voltemos, pois, ao Daily Mail. O seu artigo insere-se na Make It Fair, uma campanha de proprietários de jornais e editores que reclamam um mercado de licenciamento em plena escala para a IA. Duas substituições convenientes fazem todo o trabalho: as grandes tecnológicas passam por IA, e os detentores de direitos passam por «criatividade britânica». Convida-se o leitor a defender a cultura enquanto os editores negoceiam os termos da sua venda. Os académicos que partilham a notícia fariam bem em perguntar-se ao serviço de que causa está a sua indignação.

As grandes tecnológicas e as Big Five discutem o valor da renda, mas nenhuma delas se opõe à cerca. A história do autor solitário roubado por um gigante tecnológico esconde o que os acordos de licenciamento caros oferecem aos dois campos empresariais: as editoras recebem, e as grandes tecnológicas ganham um mercado em que os rivais mais pequenos não têm meios para competir. Peter Thiel resumiu com mais crueza a preferência de Silicon Valley: «a concorrência é para os perdedores».

O licenciamento não tem de produzir esse resultado. Um acesso a preço comportável e não exclusivo poderia ajudar os pequenos programadores. Mas um sistema que obriga cada recém-chegado a negociar acordos dispendiosos com os grandes detentores de direitos transforma o poder de compra em condição de entrada. Um pagamento apresentado como concessão às indústrias culturais acaba por comprar proteção contra os rivais de amanhã.

A IA não pertence às grandes tecnológicas

Há uma questão mais funda. Demasiadas críticas da IA tomam os seus maiores fornecedores comerciais pelo campo inteiro. Os produtos dominam as manchetes; a investigação e o desenvolvimento para lá dessas empresas desaparecem de vista. As grandes tecnológicas dificilmente poderiam desejar mal-entendido mais útil. A sua ambição de possuir o campo torna-se a premissa da crítica que lhes é dirigida. O monopólio ainda não está garantido. Tratá-lo como coisa feita presta a essas empresas um favor enorme. É também desviar o olhar do código aberto: das suas necessidades, das suas hipóteses de existir, dos seus interesses, da sua legitimidade como alternativa.

A IA de código aberto permite construir e adaptar sistemas que refletem uma maior diversidade de línguas, culturas e formas de expressão. Para países de toda a Europa, África, América Latina e Ásia, é uma base concreta de soberania tecnológica e cultural: a capacidade de decidir como funcionam os sistemas, que línguas servem e onde são usados. Usar ou não a IA, e para que fins, deve continuar a ser uma escolha pública, e não uma decisão ditada pela dependência de um oligopólio estrangeiro.

Mas a liberdade de modificar um sistema pouco vale sem os meios para o fazer. O trabalho independente exige competências, infraestrutura de cálculo e acesso a material de treino. O que nos traz de volta aos livros. Se cada equipa de investigação ou cada instituição pública tiver de negociar os seus próprios acordos com as editoras ou de montar a sua própria biblioteca privada, a independência tornar-se-á incomportável até para alguns países ricos.

Os livros já cá estão

As bibliotecas e os arquivos passaram gerações a reunir o material de que estes sistemas precisam. As suas coleções existem porque o acesso ao saber deve sobreviver ao interesse comercial em vendê-lo. Muito já está digitalizado: a HathiTrust guarda cerca de dezanove milhões de volumes digitalizados provenientes de bibliotecas de investigação, muitos ainda protegidos por direitos de autor. Uma biblioteca digitaliza um livro e fica com ele. Ali ninguém precisa de guilhotina. A HathiTrust vai encerrar o seu Research Center no fim de 2026, mas anunciou também o Transparent Books, um projeto de acesso a corpora para investigação e desenvolvimento não comerciais em IA. Um acesso nesses termos deixaria ainda de fora alguns programadores independentes.

Possuir os livros, contudo, não dá a uma biblioteca o direito de distribuir o seu conteúdo protegido como corpus de treino. O direito da UE permite às instituições de investigação e às bibliotecas prospetar obras licitamente acessíveis para fins de investigação científica, e autoriza uma prospeção mais ampla quando os detentores de direitos não os reservaram. O Reino Unido traça uma fronteira mais apertada: a sua exceção de prospeção cobre a investigação não comercial e restringe a transferência de cópias. Nenhum dos dois quadros dá às bibliotecas um direito geral de partilhar os seus fundos protegidos para que outros construam sobre eles.

Podíamos também reconsiderar durante quanto tempo os detentores de direitos devem controlar os usos computacionais dos livros. As patentes farmacêuticas encerram um pacto: a exclusividade temporária recompensa a inovação e, depois, a invenção fica disponível para que outros a usem. O seu prazo normal de vinte anos é muito mais curto do que a proteção dos direitos de autor, que dura a vida do autor e setenta anos depois. Porque não aplicar um princípio semelhante aos usos computacionais dos livros? Ao fim de, digamos, vinte anos após a primeira publicação, um livro podia ficar disponível para prospeção de textos e dados sem taxas de licenciamento, mantendo-se protegidos os direitos de reedição e de venda. Os autores continuariam a ganhar com os seus livros sem que gerações de investigadores tivessem de negociar autorização para os analisar.

Defendi há dois anos, no The Hindu, que os dados patrimoniais deviam ser tratados como bem público. Os governos deviam financiar as bibliotecas e os arquivos para digitalizarem, transcreverem e documentarem as suas coleções, e dar-lhes autoridade legal para disponibilizar os corpora resultantes a quem queira construir sobre eles. As grandes tecnológicas poderiam ajudar a pagar a conta através de uma taxa específica.

O financiamento público deveria vir acompanhado de políticas de coleção e regras de acesso publicadas, abrangendo o trabalho académico e o comercial, sem acordos exclusivos nem acesso privilegiado para doadores. Acesso para treino não tem de significar redistribuição irrestrita de livros protegidos. Os autores deviam participar na conceção do regime público, incluindo na forma como este trata o consentimento, a remuneração e a concorrência às suas obras. O acesso gratuito para os utilizadores não exclui uma remuneração dos autores financiada por fundos públicos. O direito de empréstimo público, que paga aos autores a partir de fundos públicos quando os seus livros são emprestados, oferece um precedente. A fogueira nunca foi a questão. A cerca, sim.

Clément Godbarge
Authors
Professor de Humanidades Digitais
Clément Godbarge é professor de Humanidades Digitais na Universidade de St Andrews. A sua investigação incide sobre a ciência e a arte de governar na Europa do início da Idade Moderna. No livro que tem no prelo, examina o modo como médicos ligados às cortes de França e de Itália no século XVI se afirmaram como peritos políticos de um novo género. A sua investigação tem contado com o apoio da Andrew W. Mellon Foundation, da Comissão Fulbright, da Renaissance Society of America e da Universidade de Harvard.