核心看点
AI发展遇到了一个尴尬的问题:互联网上的内容已经被AI生成内容严重污染。为了获取高质量、”纯净”的训练数据,多家AI公司正通过中间商大规模收购二手图书。
为什么盯上旧书?
调查媒体404 Media最新报道揭示了这一趋势:
- AI垃圾内容泛滥:大量由AI生成的低质量内容充斥互联网,污染了数据环境
- 旧书更”干净”:2022年之前出版的纸质书籍更有可能是人类原创作品
- 规避舆论风险:通过中间商收购比直接抓取网络内容更低调
Anthropic的先例
作为卷入版权诉讼的主要AI公司之一,Anthropic曾投入数百万美元购买大量纸质图书,用于提取内容训练Claude AI模型,随后再将这些图书销毁。
法院认定将正版图书用于AI训练属于版权法中的”合理使用”,但公众对AI公司”吃干抹净”的做法仍有争议。
数据焦虑背后的真相
这一现象反映了AI行业的深层焦虑:
- 高质量人类创作数据正在枯竭
- AI生成内容的”递归污染”问题日益严重
- 模型性能提升越来越依赖数据质量而非数量
总结
AI公司收购旧书的背后,是整个行业对”纯净数据”的渴求。当AI开始吃AI的”剩饭”,模型质量必然下降。这场”旧书争夺战”或许只是开始——未来,高质量人类创作内容可能越来越稀缺,也越来越值钱。
本文地址:https://www.163264.com/14360


微信扫一扫,鼓励一下~