Token-in-token-out RL training with any agent harness, via a proxy gatewaycastform.com·4 pts·kumama·0
Prompt caching but for RL – 7.5x speedup on long-prompt/short-response workloadscastform.com·4 pts·kumama·0
Show HN: Benchmax, a new open-source RL environment framework for LLM finetuninggithub.com·1 pts·kumama·0