Skip to main content
llm.info

The Pile

Open Source
Datasets

825GB diverse open text dataset

About

The Pile is EleutherAI's 825GiB open dataset of diverse English text drawn from 22 high-quality sources, built for training large language models. It was foundational for open LLMs like GPT-Neo and Pythia.

Details

Category
Datasets
License
MIT (code)