Zum Inhalt springen

Was ist Prefix-Caching / Cache-Reuse?

Ohne Caching wird derselbe Prompt-Präfix jedes Mal neu verarbeitet, selbst wenn er in aufeinanderfolgenden Anfragen identisch ist. Das kostet Zeit und Tokens.

Mit KV Cache Prefix Caching hält der Betreiber bereits berechnete Key-Value-Zustände für wiederkehrende Prompt-Präfixe im GPU VRAM/RAM vor. Bei Treffern muss der Präfix nicht erneut berechnet werden.

  • Schneller: geringere Latenz, da der Präfix nicht neu verarbeitet wird
  • Günstiger: Cached Input Tokens werden zu einem reduzierten Satz abgerechnet
  • Feste System-Prompts, die in jeder Anfrage identisch sind
  • RAG-Pipelines mit gleichem Kontext
  • Multi-Turn-Gespräche mit gemeinsamem Gesprächsverlauf