Tpo-Torch – Target Policy Optimization for Stable RLHF Alignment in PyTorchgithub.com·1 pts·Griffith-7·1
Show HN: Fast NF4 dequantization Triton kernel (1.41x faster than bitsandbytes)github.com·5 pts·Griffith-7·1