ParentFull threadeigenspace·LLMs dont do gradient descent to generate tokens.They are trained by gradient descent, but inference doesnt involve it.View on HN