LLM inference FHE homomorphic encryption: 1s/token interactive, 6min/token fullforums.developer.nvidia.com·1 pts·vkaufmann·0
Nemotron 3.5 Lightning-Omni: I gave NVIDIA's agent model eyes and earshuggingface.co·1 pts·vkaufmann·0
Custom FP4 CUDA Kernel – 129 Tflops on DGX Spark with Pre-Quantized Weight Cacheforums.developer.nvidia.com·2 pts·vkaufmann·1
GPT-OSS-20B-Vision: First Community VLM for GPT-OSS, Trained on a DGX Sparkhuggingface.co·4 pts·vkaufmann·1