출처: Ars Technica원문 보기 ↗
원문 저작권은 출처에 있습니다. 이 사이트는 수집, 번역 또는 형식 정리만 합니다.
미디어: 0건 확인, 1건 출처만 표시
사실 흐름
해설과 영향
这一担忧并非空穴来风。稀有书籍往往包含现代数字语料中稀缺的语言模式、历史表达和专业知识结构,对提升模型在特定领域的理解能力具有独特价值。书商们观察到,一些采购行为呈现出异常特征:买家对书籍的物理品相、版本稀缺性等传统收藏指标漠不关心,反而更关注内容本身的可扫描性与文本完整性。这种“只取内容、不顾载体”的采购逻辑,与训练数据采集的典型模式高度吻合。原文未提供具体的销毁证据或已确认的案例数量,但书商群体的集体警觉本身已构成值得关注的信号。
从技术视角看,这一现象折射出 AI 训练数据获取策略的深层演变。当公开互联网文本与常规电子书资源逐渐被耗尽,高质量、低重复率的“长尾数据”成为模型能力突破的关键瓶颈。稀有书籍恰好处于这一长尾的末端——它们承载着未被广泛数字化的语言变体、专业术语和叙事结构。类似地,arXiv 上同期发布的多项研究也在探索如何从有限或非标数据中提取更大价值,例如通过自我生成的多选题来构建算法交易基准,以规避静态数据集的污染问题(Backtrader-Bench),以及利用智能体记忆机制为材料科学家积累可复用的实验脚本与协议经验(Harnessing agent memory)。这些工作共同指向一个趋势:AI 系统对“经验性知识”的需求正在从通用语料向垂直领域、稀缺来源延伸。
然而,稀有书籍的物理销毁若属实,将构成一个难以逆转的伦理困境。书籍作为文化载体的价值远不止于其文本内容——版本特征、装帧工艺、批注痕迹、纸张材质,每一项都承载着数字扫描无法完整捕获的历史信息。一旦实体被销毁,这些维度的知识便永久消失。对于开发者而言,这提醒数据采集流程需要建立更严格的溯源与伦理审查机制;对于企业,则意味着训练数据的获取不能以不可逆的文化资产损耗为代价;而对于普通读者与公众,这一争议再次将“AI 进步的代价由谁承担”的问题推到台前。原文未提供 AI 公司方面的回应或行业自律规范的具体信息,但书商的抵制本身可能推动二手书市场形成新的交易透明度规则。
참고 자료
출처 원문
If you can truly appreciate an old book—and maybe even marvel at how its fragile, yellowing pages contain some of the earliest ways that people tried to make sense of the world around them—then headlines about tech companies that are destroying books to train AI likely torture a tender part of your soul.
It’s indeed depressing to imagine piles of book spines waiting to be fed into wood chippers while torn-out pages are cropped, scanned, and trashed. But that’s the cheapest and easiest way to scan books as fast as possible, and AI companies are in a race to advance their models by training on the kind of engaging, high-quality long-form texts that can only be found in books. So book lovers fear it’s likely that the practice is happening on a grander scale than is currently being reported and that some physical copies of books will be lost forever.
What makes this destruction extra painful, though, is that it doesn’t have to be this way.