Low-Latency Inference with Speculative Decoding on D-Matrix Corsair and GPUgimletlabs.ai·1 pts·nserrino·0
Speeding up PyTorch inference on Apple devices with AI-generated Metal kernelsgimletlabs.ai·187 pts·nserrino·30