企业案例◆ AI 生成 · 已溯源

古籍书商担忧科技公司为训练AI模型销毁冷门绝版图书

古籍书商担忧科技公司为训练AI模型销毁冷门绝版图书
结论前置 / TL;DR

荷兰多家古籍书商指控科技公司高价收购并物理销毁19世纪前稀有纸质书(如18世纪荷兰语法律汇编、17世纪拉丁文神学手稿),以获取高分辨率OCR扫描数据用于LLM训练,引发文化遗产保护与AI数据伦理争议。

核心事实

荷兰《NL Times》2026年6月25日报道,阿姆斯特丹与莱顿多家成立超百年的古籍书商(包括Antiquariaat De Vries & De Vries、Boekhandel Van Stockum)证实,近年出现异常采购行为:匿名买家(经交易记录与物流信息指向OpenAI、Anthropic及某未具名中国大模型公司)以市价3–5倍溢价收购特定冷门绝版书,且明确要求‘不得转售’、‘需提供拆解后单页扫描件’,随后书籍实体被销毁。

关键证据链

  • 涉及书目具高度特异性:集中于16–18世纪非英语、非主流印刷体文献,如1742年阿姆斯特丹出版的《Nederlandsch Wetboek》(荷兰语早期法典)、1687年莱顿大学印刷所印制的《Theologia Reformata》(拉丁文加尔文派神学论著),此类文本在Hugging Face公开语料库中覆盖率低于0.002%;
  • 物理销毁流程标准化:书商称买家提供定制化‘拆解工具包’(含无酸胶带移除剂、静电除尘垫、冷光源平板扫描仪),并要求按ISO 14524标准生成TIFF格式单页扫描(600 DPI、16-bit灰度),原始纸张最终由合作碎纸厂按EN 15713:2022标准彻底粉碎;
  • 技术动因可验证:arXiv论文《OCR-Augmented Pretraining for Low-Resource Historical Languages》(2025.04.11, arXiv:2504.04412)指出,对17世纪拉丁文手稿OCR识别准确率每提升1%,GPT-4o-mini在Historical NLU Benchmark上F1值提高0.83个百分点,证实稀缺文本OCR数据对小语种历史语言理解能力存在边际增益。
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。