Cartridges: Storing long contexts in tiny caches with self-studyhazyresearch.stanford.edu·10 pts·rsehrlich·0
Tokasaurus: An LLM inference engine for high-throughput workloadsscalingintelligence.stanford.edu·218 pts·rsehrlich·24
Large Language Monkeys: Scaling Inference Compute with Repeated Samplingscalyresearch.stanford.edu·4 pts·rsehrlich·0