The Pile: An 800GB Dataset of Diverse Text for Language Modeling [pdf]pile.eleuther.ai1 point·nixtaken··1 commentOpen articleSaveView on HN