<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>图书馆 |</title><link>https://clementgodbarge.com/zh/tag/%E5%9B%BE%E4%B9%A6%E9%A6%86/</link><atom:link href="https://clementgodbarge.com/zh/tag/%E5%9B%BE%E4%B9%A6%E9%A6%86/index.xml" rel="self" type="application/rss+xml"/><description>图书馆</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>zh-cn</language><lastBuildDate>Sun, 06 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://clementgodbarge.com/media/icon_hu_64a6c3bec25b3d7b.png</url><title>图书馆</title><link>https://clementgodbarge.com/zh/tag/%E5%9B%BE%E4%B9%A6%E9%A6%86/</link></image><item><title>篱笆，不是火堆</title><link>https://clementgodbarge.com/zh/post/fence-not-fire/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://clementgodbarge.com/zh/post/fence-not-fire/</guid><description>&lt;p&gt;在北拉斯维加斯的一座仓库里，亚马逊开着一台机器，专门切掉二手书的书脊。散页过一遍扫描仪，纸张便送去打浆。
把这桩事比作当代焚书，套话一个不落：影射萨伏那洛拉，配上几张看似珍本的图库照片，当然还少不了柏林的焚书堆。不出所料，大报们口气冷静些，却把同一个类比悬在半空，没有收回。这些文章义愤填膺，可字里行间，人工智能产业竟被轻轻放过，放得出奇。谁来掌控正在被扫描的知识？这个问题得先等一等——我们先把焚书这套胡话清扫干净。&lt;/p&gt;
&lt;h2 id="扫描仪不是火刑堆"&gt;扫描仪不是火刑堆&lt;/h2&gt;
&lt;p&gt;销毁一个实体本，并不能凭这一点就让破坏性扫描成为萨伏那洛拉的篝火或纳粹焚书的当代翻版。那些行为的意义，来自被谴责的对象和谴责的缘由。可怜的修士萨伏那洛拉，一有焚书争议就被拖出来示众；他号召人们焚烧自己的一部分财物，作为公开的忏悔。纳粹的火堆上演的是另一种否弃：当众焚书，宣告这些作者在德国文化生活中没有立足之地。两者的销毁都是表演。破坏性扫描则是数字化中常用的手段，用意截然不同：牺牲书本，是为了保住内容。书毁了，文本却脱离了纸张。谁要是想搬出《华氏451度》，不妨想想：布拉德伯里笔下的消防员，可没打算把文本留到以后用。&lt;/p&gt;
&lt;p&gt;
把“珍本”写进标题，火上浇油，其他媒体也照抄不误。然而，它自己的调查里引述的一位书商就说，这些大宗订单
——也就是说，主要是1970年前后ISBN问世以来出版的版本。这是后备箱旧货摊和慈善商店里的货色，往往一次大扫除就进了垃圾场。在宣告文化浩劫之前，不妨先查查图书馆目录：法定送存图书馆的存在，正是为了保存这类出版物。诚然，有ISBN不等于必有送存本存世；可二手市场上难寻，也不能证明一个文本就此消失。&lt;/p&gt;
&lt;p&gt;打浆毁掉的是实体本，连同上面的题赠和页边批注。批注或流传经历具有历史价值的本子，理应先行识别、妥为保存，最好赶在流入二手市场之前。绝版书的实体本日渐稀少，我们也大可为此担忧。但既然担忧，就该同时问一句：权利人为何既不重印，又不授权读者查阅现有的数字复制件？学者们对这种憋屈再熟悉不过：Google图书替你找到了要的那段话，然后只给你看一小片，而这本书既买不到新的，也无法在线阅读。这里有值得争论的损失。但它们并不能把扫描仪变成纳粹的火堆。&lt;/p&gt;
&lt;p&gt;再说，图书业早就把化浆当作日常。单在法国，
，约占退还经销商的滞销书吨数的60%。这叫库存管理。滞销的多余本子和稀缺的二手书，各自引出的是不同的获取问题；但销毁纸张本身，算不上审查，也算不上暴政。&lt;/p&gt;
&lt;h2 id="书越多人工智能越好"&gt;书越多，人工智能越好？&lt;/h2&gt;
&lt;p&gt;人工智能公司买书、扫书，其实是好消息。一种常因对人类文化理解肤浅而挨批的技术，正在多吸收一些文化——照理说，学者本该乐见其成。&lt;/p&gt;
&lt;p&gt;一种语言积累下来的记录，网络远远替代不了。一种语言有据可查的生命——从小说、回忆录到流行歌曲、对话记录——很大一部分从未从纸面走上网络。这些书中，不少已经比出版它们的出版社活得更长。把它们纳入训练数据，在别无他物可用的地方最为紧要。英语多几本书，也许只带来些微改善；而在一种资料稀少的语言里，这些书可能决定一个系统是可用还是废物。这些工具该不该进入我们的公共服务和日常生活，是一个留给公共讨论的问题。但无论我们决定在哪里用它们，都应当能用自己的语言来用。&lt;/p&gt;
&lt;p&gt;西班牙和荷兰报道的订单，让语言上的利害有了具体的样子。五月，
报道，巴达洛纳的一位书商反复接到订单，要的主要是加泰罗尼亚语的非虚构书：史书、技术手册、旧会议论文集。到了八月，荷兰媒体报道，有人向De Slegte书店求购
。这些书的语言，至少值得与它们书脊的命运同等的关注。对《每日邮报》，这或许要求过高；可就连较为持重的报纸，对所涉语言也几乎无话可说。&lt;/p&gt;
&lt;p&gt;与大出版商签许可协议，同样能提供有价值的材料，但它们的数字书目只覆盖印刷品中的一小部分。从未数字化的书，或出版商已不再持有版权的书，都不在供给之列。再慷慨的许可协议，也顶替不了出版史，更顶替不了一种文化的历史。收购二手书，正是绕过这些商业边界的一条路。&lt;/p&gt;
&lt;h2 id="盗窃不是论证"&gt;“盗窃”不是论证&lt;/h2&gt;
&lt;p&gt;把这叫作“盗窃”，同样无济于事。2025年6月，美国两家地区法院在各自审理的案件中裁定，用图书训练语言模型属于合理使用。在
中，法院强调训练的转换性：这些书被用来构建一个能产生新表达的系统。模型固然会记住段落，但用一本书训练，并不等于整本书随时可以按需调取。反过来，没有逐字复制，也不足以打消一切异议。在
中，法官警告说，人工智能生成的作品可能淹没市场，此类损害若有证据，或可击破合理使用的抗辩；只是这些原告没能拿出有分量的证据，证明自己的作品受到了这种损害。两项裁决都没有给人工智能公司开出无限制的许可，也没有了结伦理之争。它们要求我们分清三件事：书是怎么获取的，复制件是怎么保存的，训练又拿它们做了什么。一句“盗窃”，把这些问题全搁下了。&lt;/p&gt;
&lt;p&gt;顺带一提，Anthropic案的裁决恰恰为裁切机提供了理由。法院认可对购得本子的数字化，却否决了在永久馆藏中囤积盗版书的做法——为此，该公司后来
。数字化之所以过关，一部分原因正是每一本纸质书都在转换中销毁：数字副本取而代之，且不曾外传。让某些人如此不安的销毁，反倒帮Anthropic坐实了其数字化项目属于合理使用。在那个案子里，买、扫、弃，提供了一条合法路径。裁切机在这里是合规的工具。买书能解决获取问题，却不能凭此授予任何人分享所得语料库的权利。&lt;/p&gt;
&lt;p&gt;希望人工智能汲取更多语言、更多学术、更多互联网之前的世界，有充分的理由。这些理由不会因为一家我们不喜欢的公司从中看到了商机就烟消云散。&lt;/p&gt;
&lt;h2 id="借来的义愤"&gt;借来的义愤&lt;/h2&gt;
&lt;p&gt;那么，回到《每日邮报》。它这篇文章隶属于
运动——报业老板与出版商联手发起，目的是为人工智能建立
。两个顺手的偷换在起作用：大科技公司顶替了人工智能，权利人顶替了英国的创造力。读者受邀捍卫文化，而出版商正在谈判出售文化的价码。转发这则报道的学者不妨自问：自己的义愤在替谁效劳？&lt;/p&gt;
&lt;p&gt;大科技公司与
争的是租金，却没有谁反对篱笆。“孤身作者被科技巨头掠夺”的故事，遮住了昂贵许可协议给两大企业阵营各自带来的好处：出版商拿到钱，大科技公司得到一个小对手付不起入场费的市场。彼得·蒂尔把硅谷的偏好说得更露骨：
。&lt;/p&gt;
&lt;p&gt;许可制度未必非得走到这一步。价格可承受、非排他的访问，本可以帮到小开发者。但一个逼着每个新进入者都去和大权利人谈昂贵协议的制度，把购买力变成了入场条件。一笔被包装成对文化产业让步的付款，最终买到的是对未来对手的防护。&lt;/p&gt;
&lt;h2 id="人工智能不属于大科技公司"&gt;人工智能不属于大科技公司&lt;/h2&gt;
&lt;p&gt;还有一层更深的问题。太多对人工智能的批评，把最大的几家商业供应商当成了整个领域。产品霸占头条，这些公司之外的研究与开发便从视野里消失。对大科技公司来说，再没有比这更称心的误解了：它们独占这一领域的野心，成了批评它们的前提。垄断尚未坐实；把它当作既成事实，等于帮了这些公司一个大忙。&lt;/p&gt;
&lt;p&gt;开源人工智能让人们能够构建和改造系统，使之容纳更多样的语言、文化和表达方式。对欧洲、非洲、拉丁美洲各国，以及韩国、日本和印度而言，这是技术与文化主权的现实根基：自己决定系统如何运作、服务哪些语言、用在何处。用不用人工智能、用来做什么，应当始终是公共的选择，而不是被对外国供应商的依赖所左右。&lt;/p&gt;
&lt;p&gt;但若没有修改系统的手段，修改的自由便无从谈起。独立的工作需要专业知识、算力基础设施，以及训练材料的获取渠道。这就又回到了书。如果每个研究团队、每家公共机构都得自己去谈出版协议，或者自建私人书库，那么独立仍旧只是付得起钱的人的特权。&lt;/p&gt;
&lt;h2 id="书早就在那里"&gt;书早就在那里&lt;/h2&gt;
&lt;p&gt;图书馆和档案馆几代人下来，一直在收集这些系统所需的材料。它们的馆藏之所以存在，是因为知识的获取理应比销售知识的商业利益更长久。许多书早已扫描完毕：
收藏了来自研究图书馆的约一千九百万册数字化图书，其中不少仍在版权期内。图书馆扫一本书，书还留着——那里没人需要裁切机。HathiTrust将于
，但也宣布了
项目，为非商业性的人工智能研发提供语料库访问。以这样的条件开放，仍会把一些独立开发者挡在门外。&lt;/p&gt;
&lt;p&gt;然而，拥有这些书，并不赋予图书馆把受版权保护的内容当作训练语料库分发的权利。
允许研究机构和图书馆为科学研究挖掘可合法访问的作品，在权利人未保留权利的情况下，还允许更广泛的挖掘。
：其挖掘例外仅限非商业研究，并限制复制件的转移。两个框架都没有赋予图书馆一项一般性的权利，让它们把受版权保护的馆藏分享出去供他人再利用。&lt;/p&gt;
&lt;p&gt;我们也不妨重新考虑，权利人对图书的计算性使用应当掌控多久。药品专利提供了一个参照：通常二十年的期限，远短于版权对作者终身加身后七十年的保护。书籍能否在首次出版（比方说）二十年后，无需许可费即可用于文本与数据挖掘，而再版与销售的权利依旧受到保护？保护作者卖书的权利，不必等于世世代代管住其内容的每一种用途。&lt;/p&gt;
&lt;p&gt;两年前我在
上主张，文化遗产数据应视为公共品。政府应资助图书馆和档案馆对馆藏进行数字化、转录和著录，并赋予它们法律权限，让由此产生的语料库可供他人再利用。大科技公司可以通过一项专项征费分担开销。&lt;/p&gt;
&lt;p&gt;公共资助应当附带公开的馆藏政策和访问规则，涵盖学术和商业用途，不设排他协议，也不给捐资者特权。开放训练访问，不必意味着不受限制地再分发受版权保护的书。作者应当参与设计这套公共方案，包括它如何处理同意、报酬，以及与作者作品的竞争。用户免费访问，并不排斥由公共资金向作者支付报酬。
——读者借阅时由公共资金向作者付费——就是一个先例。火从来不是重点。篱笆才是。&lt;/p&gt;</description></item></channel></rss>