Paper: The Pile: An 800GB Dataset of Diverse Text


一句话概括

The Pile是一个800GB的多样化英文文本数据集,由22个经过精心策展的高质量子数据集混合而成,成为开源LLM预训练的重要数据基准。

核心思想

The Pile的设计哲学是”多样性胜过纯粹规模”。与简单大规模爬取网页不同,Pile精心收集了22个不同来源的专业数据子集,包括学术论文(ArXiv)、法律文档(FreeLaw)、专利文本、GitHub代码、Stack Exchange问答、维基百科、书籍等。每个子集都经过专门的清洗和去重处理。通过科学混合这些高质量的领域数据,模型可以获得更广泛的知识覆盖和更好的下游任务泛化性能。

关键创新

1) 系统化地策展多源异构数据,建立了预训练数据构建的标准化流程;2) 引入了基于困惑度的分析方法来评估数据质量和多样性;3) 实验有力证明了数据多样性对下游任务性能有显著正向影响。

深远影响

The Pile是第一个被广泛使用的开源大规模预训练数据集,GPT-Neo、GPT-J、Pythia等重要模型都在其上训练。它开创了开源预训练数据的先河,推动了后续RedPajama、FineWeb等更大规模数据集的涌现。

启发与思考

The Pile证明了数据策展是一门需要专业知识和审慎判断的工作。不是数据越多越好,而是数据的多样性、质量和合理配比共同决定了模型能力的上限。”垃圾进,垃圾出”的铁律在大模型时代依然牢固成立。