Zum Inhalt springen

Token-Typen und Abrechnung

Ein Token ist ein Text-Baustein, ungefähr ein Wortbestandteil. Als Faustregel gelten etwa 1.000 Tokens ≈ 750 Wörter.

Token-TypBeschreibungAbrechnung
Input TokenText, den Kunde an API sendet (Prompts, System-Anweisungen, RAG-Kontext)Voll abrechenbar
Cached Input TokenInput-Tokens mit vorhandenem KV-Cache (Prefix Caching)Reduziert abrechenbar
Reasoning TokenToken für Denkprozess (Chain-of-Thought), wird an Kunden ausgeliefertVoll abrechenbar (selber Satz wie Output)
Output TokenVom Modell generierte AntwortVoll abrechenbar (höherer Satz)

Der KV Cache liegt flüchtig im VRAM/RAM. Es handelt sich um keinen persistenten Cache, die Zustände werden sofort freigegeben, sobald die Verarbeitung abgeschlossen ist. Details siehe Prefix-Caching.

Die Abrechnung erfolgt nutzungsbasiert (Pay-as-you-grow) in AI-Punkten. Ein Precommit ist möglich und wirtschaftlich attraktiv.

Die konkreten AI-Punkte je Modell und einen interaktiven Verbrauchsrechner finden Sie im AI-Punkte-Rechner.

Embedding- und Reranker-Modelle (Harrier, BGE) werden ausschließlich über Input-Tokens abgerechnet; Cached-Input und Output entfallen. Details zu den Modellen finden Sie in der Modell-Übersicht.