HNHacker News
TopNewBestAskShowJobs

tamassimond

97 karma · joined September 1, 2022

submissionscomments

How to Train an LLM to Do Proofs: Beyond Verifiable Rewards

tobysimonds.com·3 pts·tamassimond·
0

The Cost of Winning:How RL Training on Poker Leads to Evil LLMs

tobysimonds.com·2 pts·tamassimond·
1

The Hidden Cost of Winning:How RL Training on Poker Degrades LLM Moral Alignment

tobysimonds.com·8 pts·tamassimond·
0

AlphaWrite: AI that improves at writing by evolving its own stories

tobysimonds.com·80 pts·tamassimond·
159

Self Rewarding Self Improving: Autonomous LLM Improvement

arxiv.org·28 pts·tamassimond·
0

LLMs for Engineering: Teaching Models to Design High Powered Rockets

arxiv.org·124 pts·tamassimond·
45

Text to RL: Extracting High-Quality RL Questions from Text

tufalabs.ai·1 pts·tamassimond·
0