HNHacker News
TopNewBestAskShowJobs

mezark

126 karma · joined February 27, 2023

submissionscomments

What happens when you run a CUDA kernel?

fergusfinn.com·294 pts·mezark·
32

A running list of reasons to move to open source

whyopensource.ai·6 pts·mezark·
0

Moe inference optimizations: 15% lower expert load by request reordering

blog.doubleword.ai·3 pts·mezark·
0

Tensor Network Attention

mainlymatmul.com·2 pts·mezark·
0

Redundant Information in LLM Weights

fergusfinn.com·5 pts·mezark·
0

Tans: Precomputing RANS

fergusfinn.com·3 pts·mezark·
0

Also-RANS: Asymmetric Numeral Systems for Entropy Coding

fergusfinn.com·25 pts·mezark·
0

70x faster cold(ish) starts for SGLang

fergusfinn.com·4 pts·mezark·
0

QueueSpec – drafting speculation tokens while a request queues

blog.doubleword.ai·1 pts·mezark·
0

ZeroDP: Just-in-Time Weight Offloading over NVLink for Data Parallelism

mainlymatmul.com·1 pts·mezark·
0

Parallel Primitives for Multi-Agent Workflows

fergusfinn.com·1 pts·mezark·
0

New fastest AI Model Gateway – 450x less overhead than LiteLLM

github.com·2 pts·mezark·
0

Should GPUs Make Free Trade Agreements?

doubleword.ai·3 pts·mezark·
1

Controlled generation of OS LLMs – without impacting latency

youtube.com·7 pts·mezark·
1

Takeoff Inference Server Is Now Open Source

github.com·3 pts·mezark·
1

Falcon 7B running real time on CPU

youtube.com·11 pts·mezark·
3