LLM-Token-Kosten messen
Zuletzt aktualisiert: 2026-07-17Lesezeit ca. 3 Min.
Eine niedrigere Token-Zahl ist eine Messung, kein Einspar- oder Qualitätsergebnis. Trennt nicht gecachten Input, gecachten Input, Output, Modell-Requests, Tool-Aktivität, Latenz, Anbietergebühren, Review und Nacharbeit. Wendet aktuelle Account-Tarife an und bewertet die Aufgabenabnahme unabhängig.
Kurz: Zählt Input, Output, Cache und Tool-Aufrufe getrennt. Nutzt den Preis aus eurem Konto und messt die ganze Aufgabe. Weniger Token können Kosten senken. Sie sagen für sich aber nichts über Güte, Zeit oder Erfolg. Der ganze Lauf zählt.
Schreibt stets alle Annahmen klar neben jede Zahl; dazu gehören Modell, Tarif, Cache, Zahl der Läufe und Art der Tools; messt dann den ganzen echten Job bis zu seiner Abnahme. Ein kurzer Prompt kann mehr Rückfragen oder mehr Fixes auslösen.
Ein langer Prompt kann unnötig sein. Nur der ganze Lauf zeigt, was Zeit und Geld kostete. Vergleicht gleiche Aufgaben und nennt den Stand des Preises.
Fair.
Inhalt
Bei Roh-Usage und Rechnungsgrenze beginnen
Anbieter-Schemata liefern keine universelle Zahl namens “Token-Kosten”. Die OpenAI Usage API trennt Input, gecachten Input, Output und Request-Zahlen und ordnet den Finanzabgleich Kosten- oder Rechnungsdaten zu. Anthropics Dokumentation trennt Basis-Input, Cache-Erstellung, Cache-Lesen, Output und toolbezogene Nutzung.
Geprüft am 17. Juli 2026. Feldsemantik, Tarife, Modelle, Tiers, Verträge und Tools wechseln; behaltet daher Roh-Usage und verwendete Tarifquelle.
Ein illustratives Journal mit austauschbaren Annahmen
Nur ein Beispiel-kein Benchmark, keine Rechnung, Prognose oder Reality-Graph-Messung. Angenommen, eine abgenommene Änderung nutzt 8 Modell-Requests, 60.000 nicht gecachte Input-Tokens, 40.000 bestätigte gecachte Input-Tokens, 8.000 Output-Tokens und 12 Tool-Aufrufe. Pᵤ, P𝚌 und Pₒ stehen für die aktuellen Account-Tarife pro Million dieser exklusiven Token-Kategorien. Die illustrative Modellgebühr lautet (60.000 × Pᵤ + 40.000 × P𝚌 + 8.000 × Pₒ) / 1.000.000.
Erzeugt eine Kontextänderung unter sonst gleichen Annahmen 48.000 nicht gecachte Input-Tokens, ist das Rechendelta 12.000 × Pᵤ / 1.000.000. Das ist keine gemessene Einsparung. Tool-Nutzung, Latenz, Cache-Verhalten, Output, Review, Fehler und Nacharbeit können sich ebenfalls ändern. Ersetzt jede Zahl und jedes Symbol durch beobachtete Usage und Rechnungsbedingungen; verwerft den Vergleich, wenn Aufgabenscope oder Abnahmekriterien wechselten.
Kostendimensionen nicht zusammenwerfen
| Beobachtete Einheit | Kostenbehandlung | Was sie nicht zeigt | |
|---|---|---|---|
| Nicht gecachte Input-Tokens | Anbieter-Usage nach Abzug überlappender Cache-KategorienMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Aktuellen Tarif für nicht gecachten Input anwendenBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Ausgabequalität, Latenz oder GesamtkostenAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
| Gecachte Input-Tokens | Bestätigte Cache Reads/Hits gemäß Anbieter-SchemaMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Anwendbare Cache-Regel nur auf bestätigte Cache-Nutzung anwendenBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Dass der Cache frisch, nützlich oder insgesamt günstiger warAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
| Output-Tokens | Anbieterseitig gemeldete generierte oder Reasoning-Kategorien wie abgerechnetMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Passenden Output-Kategorietarif anwendenBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Korrektheit, Vollständigkeit oder Review-AufwandAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
| Tool-Aufrufe | Aufrufe, Schemata, Argumente, Ausgaben, Fehler und Server-Tool-NutzungMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Token-Effekte und toolspezifische Gebühr oder Laufzeit addierenBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Dass ein Aufruf nötig oder erfolgreich warAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
| Latenz | Wall Time und, soweit vorhanden, Modell-/Tool-SpansMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Als getrennte Betriebskennzahl behandelnBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Ausgaben oder AusgabequalitätAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
| Gesamte Workflow-Kosten | Modell, Tools, Infrastruktur, menschliches Review, Nacharbeit und FehlversucheMesseinheit · 2026-07-17Rohfelder des Anbieters vor Normalisierung mappen. | Vergleichbare beobachtete Kosten des deklarierten Fensters summierenBuchungsregelAktuelle Account- und Rechnungsbedingungen, nicht diese Seite, liefern Tarife. | Künftige Einsparung oder Kausalität ohne kontrollierten VergleichAussagegrenze · 2026-07-17Kein automatischer Schluss über Kennzahlen hinweg. |
Nur gegen eine unabhängige Abnahmegrenze optimieren
Kontextauswahl, Cache-Layout, Modellrouting, Session-Grenzen und Batching sind zu testende Hypothesen-keine universellen Hebel mit fixem Effekt. Ein kleinerer Kontext kann Rauschen oder eine nötige Schnittstelle entfernen. Ein anderes Modell kann Gebühr, Latenz und Fehlerrate in verschiedene Richtungen bewegen. Haltet Scope und Abnahme stabil und vergleicht dann das gesamte Journal mit Tests, Review-Befunden, Defekten und Nacharbeit. Eine schriftliche maschinenprüfbare Aufgabengrenze macht den Vergleich wiederholbar; sie sagt das Ergebnis nicht voraus.
Wo Reality Graph ansetzt
Reality Graph kann die Aufgabengrenze eines Runs, gewählte Checks, bereitgestellte Usage-Artefakte, beobachtete Ergebnisse, geänderte Dateien und Operatorentscheidung halten. Was ein Agent an Material bekommt, wird als begrenztes Paket zusammengestellt, aus dem Secrets vor dem Prompt entfernt werden, sodass ein Run eine dokumentierte Auswahl trägt und nicht das, was im Editor gerade offen war. Es misst nicht automatisch jeden Anbieter und jedes Tool, setzt keine aktuellen Preise und beweist nicht, dass ein kleinerer Prompt Gesamtkosten senkte oder Qualität verbesserte.
Eine begrenzte Messung kann erfassen
- Roh-Usage, Cache-Kategorien, Modell-Requests, Tool-Aufrufe und Laufzeit
- Accountspezifische Tarifquelle und Rechnungsdatum der Rechnung
- Beobachtete Tests, Review-Befunde, Fehler, Nacharbeit und Aufgabenabnahme
Sie kann allein nicht feststellen
- Wiederkehrende oder künftige Einsparung aus einem illustrativen Token-Delta
- Geringere Latenz oder Gesamtkosten nur weil eine Token-Kategorie fiel
- Bessere Ausgabequalität nur weil weniger Tokens verarbeitet wurden
FAQ
- Was sollte eine Kostenmessung für KI-Coding trennen?
- Mindestens: nicht gecachten Input, gecachten Input, Output, Modell-Requests, Tool-Aufrufe, toolspezifische Gebühren, Latenz, Infrastruktur, menschliches Review und Nacharbeit. Anbieter-Schemata unterscheiden sich; behaltet Rohwerte und Rechnungsfelder vor der Normalisierung.
- Senken weniger Input-Tokens die gesamten Workflow-Kosten?
- Sie können eine Gebührenposition senken, wenn anwendbarer Tarif und Abrechnungskategorie gleich bleiben. Das belegt nicht automatisch geringere Latenz, weniger Tool-Aufrufe, weniger Review, weniger Nacharbeit oder geringere Gesamtkosten. Vergleicht den vollständigen Workflow in einem expliziten Messfenster.
- Wie sollte Prompt Caching gezählt werden?
- Nutzt die realen Usage-Felder und Rechnungsregeln des Anbieters. Manche Schemata melden Cache-Tokens als Teilmenge des Inputs, andere trennen Cache-Erstellung und Cache-Lesen. Überlappende Felder nicht doppelt addieren und keinen Cache-Tarif ohne bestätigten Hit anwenden.
- Verbessern weniger Tokens die Ausgabequalität?
- Daraus folgt kein automatischer Zusammenhang. Irrelevanten Kontext zu entfernen kann einer konkreten Aufgabe helfen; nötigen Kontext zu entfernen kann schaden. Qualität braucht eine unabhängige Abnahme wie Tests, Review-Befunde, Defekte oder Nacharbeit-nicht Token-Zahl als Proxy.
- Kann das Beispiel auf dieser Seite Einsparungen vorhersagen?
- Nein. Es ist als Illustration markiert und nutzt Symbole für aktuelle Preise. Ersetzt jede Zahl und jeden Tarif durch beobachtete Usage- und Rechnungsdaten und vergleicht dann Qualität und gesamte Workflow-Kosten. Die Rechnung zeigt Buchhaltung, keine Prognose.
Weiterlesen
Quellen
- OpenAI API - Usage-Felder für Input, gecachten Input, Output und Modell-Requests; Grenze zu Kosten/Abrechnung (geprüft 2026-07-17, englisch)
- OpenAI - aktuelle API-Preiskategorien; Werte bewusst nicht übernommen (geprüft 2026-07-17, englisch)
- Anthropic - aktuelle Struktur für Modell-, Cache- und Tool-Nutzung; Werte bewusst nicht übernommen (geprüft 2026-07-17, englisch)