Kosten kalkulieren
iStand: September 2026
Token-Preise und Modellnamen entsprechen dem Stand vom September 2026. Bedenke: Seit Opus 4.7 verwendet die Opus-Reihe einen neuen Tokenizer, der pro Anfrage rund 30 % mehr Tokens als ältere Modelle produziert — kalkuliere bei Migration einen Aufschlag ein.
Wissen
Dein Agent funktioniert -- er denkt, handelt und liefert Ergebnisse. Aber was kostet das Ganze? Agents verbrauchen durch ihren Loop deutlich mehr Tokens als ein einzelner Chat-Aufruf. In diesem Abschnitt lernst du, die Kosten realistisch einzuschätzen und zu optimieren.
Warum Agents teurer sind als Chatbots
Ein einfacher Chatbot-Aufruf: 1 Request, ~500 Input-Tokens, ~500 Output-Tokens. Ein Agent für dieselbe Aufgabe: 3-8 Requests (Think-Act-Observe pro Iteration), jeweils mit wachsendem Context (die gesamte bisherige Konversation wird jedes Mal mitgeschickt).
Beispielrechnung für einen Code-Review-Agent:
| Iteration | Input-Tokens | Output-Tokens | Kosten (Claude Sonnet) |
|---|---|---|---|
| 1: Think + Act | 800 | 200 | $0.005 |
| 2: Observe + Think + Act | 1.500 | 300 | $0.009 |
| 3: Observe + Think + Act | 2.400 | 250 | $0.011 |
| 4: Observe + Finale Antwort | 3.200 | 500 | $0.017 |
| Gesamt | 7.900 | 1.250 | $0.042 |
Ein einzelner Agent-Lauf kostet also rund 4 Cent. Klingt wenig -- aber rechne hoch: 100 Code-Reviews pro Tag sind $4,20/Tag oder ~$126/Monat.
Token-Verbrauch analysieren
Die größten Kostentreiber bei Agents:
- Context-Wachstum: Jede Iteration schickt die gesamte bisherige Konversation mit. Iteration 5 hat den fünffachen Input von Iteration 1.
- Unnötige Tool-Aufrufe: Ein schlecht konfigurierter Agent ruft Tools auf, die er nicht braucht.
- Große Tool-Ergebnisse: Ein
read_fileauf eine 1000-Zeilen-Datei schickt den kompletten Inhalt als Tokens. - Fehlende Abbruchbedingung: Agent läuft weiter, obwohl die Aufgabe längst erledigt ist.
Verstehen
Plan-and-Execute für Kostenoptimierung
Du kennst Plan-and-Execute aus Modul 04. Es ist auch die beste Strategie zur Kostenoptimierung:
Ohne Plan-and-Execute (ReAct pur):
- Agent probiert, beobachtet, überlegt, probiert nochmal -- viele Iterationen
- Context wächst mit jeder Iteration
- Typisch: 5-10 Iterationen pro Aufgabe
Mit Plan-and-Execute:
- Ein großes Modell erstellt den Plan (1 Aufruf)
- Ein kleines, günstiges Modell führt jeden Schritt aus (mehrere günstige Aufrufe)
- Typisch: 1 teurer + 3-5 günstige Aufrufe
Kosteneinsparung: Oft 50-70% gegenüber reinem ReAct mit großem Modell.
Weitere Optimierungsstrategien
- Kontext trimmen: Alte Tool-Ergebnisse zusammenfassen statt komplett mitzuschicken
- Tool-Ergebnisse begrenzen: Nur die ersten 100 Zeilen einer Datei lesen, nicht alle 1000
- Caching: Wiederholte Anfragen an dasselbe Tool zwischenspeichern
- Modell-Routing: Einfache Schritte an ein günstiges Modell, komplexe an ein teures
Probiere es aus: Der Kosten-Rechner
Mit dem folgenden Dashboard kannst du die Kosten für deinen Agent durchrechnen. Wähle ein Modell, gib die erwartete Nutzung ein und sieh, was am Ende des Monats auf der Rechnung steht.
Kosten-Dashboard
Token-Verteilung
Kosten-Aufteilung / Tag
Hochrechnung
Pro Tag
$1.44
Pro Woche
$7.21
Pro Monat
$31.72
Anwenden
Dein Agent verbraucht 50.000 Tokens pro Aufgabe und wird 200 Mal pro Tag aufgerufen. Was ist die effektivste Maßnahme zur Kostenreduktion?
Reflektieren
Kostenmanagement ist kein Nachgedanke -- es ist ein zentraler Teil der Agent-Architektur. Die Entscheidung zwischen ReAct und Plan-and-Execute, die Modellwahl und das Context-Management bestimmen, ob dein Agent $50 oder $500 pro Monat kostet. Ein guter Agent ist nicht nur der, der die besten Ergebnisse liefert -- sondern der, der die besten Ergebnisse im Budget liefert.