OpenAI has a mysterious reference to caching in their guide to latency.
> Maximize shared prompt prefix, by putting dynamic portions (e.g. RAG results, history, etc) later in the prompt. This makes your request more KV cache-friendly (which most LLM providers use) and means fewer input tokens are processed on each request.
source: https://platform.openai.com/docs/guides/latency-optimization