Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf]github.com6 points·virde··0 commentsOpen articleSaveView on HN