Data Distributional Properties Drive Emergent Few-Shot Learning in Transformers | Hacker News Reader