HNHacker News
TopNewBestAskShowJobs

kumama

17 karma · joined February 19, 2017

submissionscomments

Token-in-token-out RL training with any agent harness, via a proxy gateway

castform.com·4 pts·kumama·
0

Castform now supports supervised finetuning

castform.com·2 pts·kumama·
0

how we monitor our rl training runs

castform.com·1 pts·kumama·
0

Designing dev onboarding for an agent-first world

castform.com·2 pts·kumama·
0

I post-trained a model to reliably roll a die

castform.com·2 pts·kumama·
0

Open-Weight Models Don't Need to Win

twitter.com·5 pts·kumama·
8

Prompt caching but for RL – 7.5x speedup on long-prompt/short-response workloads

castform.com·4 pts·kumama·
0

Pokegents: Making multi-agent coding feel like a team

castform.com·8 pts·kumama·
1

Grpo explained: group relative policy optimization for LLM finetuning

cgft.io·1 pts·kumama·
0

Do RL on a model with your vector db

cgft.io·1 pts·kumama·
0

What is reinforcement learning finetuning

youtube.com·3 pts·kumama·
0

RAG to riches: synthetic data for training RAG agents

cgft.io·2 pts·kumama·
0

rag not lag: rl for fast agentic retrieval

cgft.io·3 pts·kumama·
0

Show HN: Benchmax, a new open-source RL environment framework for LLM finetuning

github.com·1 pts·kumama·
0

Beating o3/o4-mini with Codebase-specific Reinforcement Learning

cgft.io·3 pts·kumama·
0

We might be overestimating coding agent performance on SWE-Bench

cgft.io·1 pts·kumama·
1

How to Improve Code Completion LLMs with Repo-Specific Finetuning

cgft.io·3 pts·kumama·
1

Show HN: Free AI Code Completion for Xcode with model choice/codebase context

cgft.io·2 pts·kumama·
0