Theoretical Bottlenecks for Scaling LLM Inference to Get Higher Token per Second | Hacker News Reader