Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engine | Hacker News Reader