Zum Inhalt springen

Kosten kalkulieren

iStand: September 2026

Token-Preise und Modellnamen entsprechen dem Stand vom September 2026. Bedenke: Seit Opus 4.7 verwendet die Opus-Reihe einen neuen Tokenizer, der pro Anfrage rund 30 % mehr Tokens als ältere Modelle produziert — kalkuliere bei Migration einen Aufschlag ein.

Wissen

Dein Agent funktioniert -- er denkt, handelt und liefert Ergebnisse. Aber was kostet das Ganze? Agents verbrauchen durch ihren Loop deutlich mehr Tokens als ein einzelner Chat-Aufruf. In diesem Abschnitt lernst du, die Kosten realistisch einzuschätzen und zu optimieren.

Warum Agents teurer sind als Chatbots

Ein einfacher Chatbot-Aufruf: 1 Request, ~500 Input-Tokens, ~500 Output-Tokens. Ein Agent für dieselbe Aufgabe: 3-8 Requests (Think-Act-Observe pro Iteration), jeweils mit wachsendem Context (die gesamte bisherige Konversation wird jedes Mal mitgeschickt).

Beispielrechnung für einen Code-Review-Agent:

IterationInput-TokensOutput-TokensKosten (Claude Sonnet)
1: Think + Act800200$0.005
2: Observe + Think + Act1.500300$0.009
3: Observe + Think + Act2.400250$0.011
4: Observe + Finale Antwort3.200500$0.017
Gesamt7.9001.250$0.042

Ein einzelner Agent-Lauf kostet also rund 4 Cent. Klingt wenig -- aber rechne hoch: 100 Code-Reviews pro Tag sind $4,20/Tag oder ~$126/Monat.

Token-Verbrauch analysieren

Die größten Kostentreiber bei Agents:

  1. Context-Wachstum: Jede Iteration schickt die gesamte bisherige Konversation mit. Iteration 5 hat den fünffachen Input von Iteration 1.
  2. Unnötige Tool-Aufrufe: Ein schlecht konfigurierter Agent ruft Tools auf, die er nicht braucht.
  3. Große Tool-Ergebnisse: Ein read_file auf eine 1000-Zeilen-Datei schickt den kompletten Inhalt als Tokens.
  4. Fehlende Abbruchbedingung: Agent läuft weiter, obwohl die Aufgabe längst erledigt ist.

Verstehen

Plan-and-Execute für Kostenoptimierung

Du kennst Plan-and-Execute aus Modul 04. Es ist auch die beste Strategie zur Kostenoptimierung:

Ohne Plan-and-Execute (ReAct pur):

  • Agent probiert, beobachtet, überlegt, probiert nochmal -- viele Iterationen
  • Context wächst mit jeder Iteration
  • Typisch: 5-10 Iterationen pro Aufgabe

Mit Plan-and-Execute:

  • Ein großes Modell erstellt den Plan (1 Aufruf)
  • Ein kleines, günstiges Modell führt jeden Schritt aus (mehrere günstige Aufrufe)
  • Typisch: 1 teurer + 3-5 günstige Aufrufe

Kosteneinsparung: Oft 50-70% gegenüber reinem ReAct mit großem Modell.

Weitere Optimierungsstrategien

  • Kontext trimmen: Alte Tool-Ergebnisse zusammenfassen statt komplett mitzuschicken
  • Tool-Ergebnisse begrenzen: Nur die ersten 100 Zeilen einer Datei lesen, nicht alle 1000
  • Caching: Wiederholte Anfragen an dasselbe Tool zwischenspeichern
  • Modell-Routing: Einfache Schritte an ein günstiges Modell, komplexe an ein teures

Probiere es aus: Der Kosten-Rechner

Mit dem folgenden Dashboard kannst du die Kosten für deinen Agent durchrechnen. Wähle ein Modell, gib die erwartete Nutzung ein und sieh, was am Ende des Monats auf der Rechnung steht.

Kosten-Dashboard

103 Anfragen/Tag
Moderat

Token-Verteilung

Input (67%)Output (33%)

Kosten-Aufteilung / Tag

InputOutput
$0.41$1.03

Hochrechnung

Pro Tag

$1.44

Pro Woche

$7.21

Pro Monat

$31.72

Anwenden

Dein Agent verbraucht 50.000 Tokens pro Aufgabe und wird 200 Mal pro Tag aufgerufen. Was ist die effektivste Maßnahme zur Kostenreduktion?

Reflektieren

Kostenmanagement ist kein Nachgedanke -- es ist ein zentraler Teil der Agent-Architektur. Die Entscheidung zwischen ReAct und Plan-and-Execute, die Modellwahl und das Context-Management bestimmen, ob dein Agent $50 oder $500 pro Monat kostet. Ein guter Agent ist nicht nur der, der die besten Ergebnisse liefert -- sondern der, der die besten Ergebnisse im Budget liefert.