Moe inference optimizations: 15% lower expert load by request reorderingblog.doubleword.ai·3 pts·mezark·0
ZeroDP: Just-in-Time Weight Offloading over NVLink for Data Parallelismmainlymatmul.com·1 pts·mezark·0