Token-Typen und Abrechnung
Ein Token ist ein Text-Baustein, ungefähr ein Wortbestandteil. Als Faustregel gelten etwa 1.000 Tokens ≈ 750 Wörter.
Vier Token-Typen
Abschnitt betitelt „Vier Token-Typen“| Token-Typ | Beschreibung | Abrechnung |
|---|---|---|
| Input Token | Text, den Kunde an API sendet (Prompts, System-Anweisungen, RAG-Kontext) | Voll abrechenbar |
| Cached Input Token | Input-Tokens mit vorhandenem KV-Cache (Prefix Caching) | Reduziert abrechenbar |
| Reasoning Token | Token für Denkprozess (Chain-of-Thought), wird an Kunden ausgeliefert | Voll abrechenbar (selber Satz wie Output) |
| Output Token | Vom Modell generierte Antwort | Voll abrechenbar (höherer Satz) |
KV Cache Prefix Caching
Abschnitt betitelt „KV Cache Prefix Caching“Der KV Cache liegt flüchtig im VRAM/RAM. Es handelt sich um keinen persistenten Cache, die Zustände werden sofort freigegeben, sobald die Verarbeitung abgeschlossen ist. Details siehe Prefix-Caching.
AI-Punkte
Abschnitt betitelt „AI-Punkte“Die Abrechnung erfolgt nutzungsbasiert (Pay-as-you-grow) in AI-Punkten. Ein Precommit ist möglich und wirtschaftlich attraktiv.
Die konkreten AI-Punkte je Modell und einen interaktiven Verbrauchsrechner finden Sie im AI-Punkte-Rechner.
Embedding- und Reranker-Modelle (Harrier, BGE) werden ausschließlich über Input-Tokens abgerechnet; Cached-Input und Output entfallen. Details zu den Modellen finden Sie in der Modell-Übersicht.
