Training AI Co-Scientists Using Rubric Rewards [Meta Superintelligence Labs]alphaxiv.org·1 pts·shash42·0
The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMsarxiv.org·3 pts·shash42·1