Guardrails & Realitätscheck
Wissen
Hier kommt die unbequeme Wahrheit: AI Agents machen Fehler. Sie sind keine deterministischen Programme, die immer dasselbe tun. Sie basieren auf LLMs, und LLMs sind probabilistisch -- sie generieren wahrscheinliche, nicht garantiert korrekte Ausgaben.
Das bedeutet: Ein Agent, der gestern perfekt funktioniert hat, kann morgen bei der gleichen Aufgabe scheitern. Nicht weil etwas kaputt ist, sondern weil das LLM eine andere Token-Sequenz gewählt hat.
!Kernprinzip
Behandle jeden Agent-Output als "wahrscheinlich korrekt, aber nicht garantiert". Baue dein System so, als könnte jeder Schritt fehlschlagen -- denn das kann er.
Was kann schiefgehen?
1. Halluzination in der Reasoning-Kette
Der Agent "denkt" sich falsche Fakten aus und baut darauf auf. Besonders gefährlich, weil der Rest der Kette logisch konsistent aussieht, aber auf einer falschen Basis steht.
Beispiel: Ein Support-Agent behauptet, es gäbe eine "30-Tage-Premium-Rückgabegarantie", die es in Wirklichkeit nicht gibt -- und leitet dann korrekt eine Rückgabe ein, die nie hätte stattfinden dürfen.
2. Tool-Missbrauch
Der Agent ruft das falsche Tool auf oder übergibt falsche Parameter. Besonders kritisch bei schreibenden Operationen.
Beispiel: Ein Agent soll Kundendaten lesen (get_customer), ruft aber versehentlich delete_customer auf, weil die Tool-Namen ähnlich klingen.
3. Endlosschleifen
Der Agent kommt in einen Loop: Er erkennt nicht, dass er dieselbe Aktion wiederholt, weil jede Iteration leicht anders formuliert ist.
Beispiel: Der Agent sucht nach einer Information, findet sie nicht, formuliert die Suche um, findet sie wieder nicht -- 50 Mal in Folge.
4. Scope Creep
Der Agent interpretiert die Aufgabe breiter als gedacht und führt Aktionen aus, die nicht beabsichtigt waren.
Beispiel: "Optimiere die Webseite" führt dazu, dass der Agent eigenständig den Datenbankzugang ändert, weil er "Optimierungspotenzial" sieht.
Verstehen
Guardrails-Strategien
Fehlerbehandlung und Retry-Logik
def safe_tool_call(tool, params, max_retries=3):
for attempt in range(max_retries):
try:
result = tool.execute(params)
if validate_result(result):
return result
# Ergebnis ungueltig -- retry mit Feedback
params = adjust_params(params, result)
except ToolError as e:
if attempt == max_retries - 1:
return fallback_response(e)
# Warte kurz, dann erneut versuchen
time.sleep(2 ** attempt)
Wichtig: Nicht einfach blind wiederholen! Gib dem Agent Feedback, warum der Versuch fehlgeschlagen ist, damit er seine Strategie anpassen kann.
Output-Validation
Prüfe jede Agent-Antwort gegen definierte Regeln, bevor sie an den Nutzer geht:
- Schema-Validation -- Entspricht die Ausgabe dem erwarteten Format?
- Faktencheck -- Stimmen genannte Zahlen, Daten, Policies?
- Sicherheitscheck -- Enthält die Antwort sensible Daten, die nicht raus sollten?
- Relevanzcheck -- Beantwortet die Antwort tatsächlich die gestellte Frage?
Human-in-the-Loop
Für kritische Aktionen: Menschliche Freigabe einbauen.
Hover oder klickeTippe auf eine Ebene, um Details zu sehen
| Risikostufe | Beispiel | Strategie |
|---|---|---|
| Niedrig | Information lesen | Automatisch ausführen |
| Mittel | E-Mail senden | Agent formuliert, Mensch gibt frei |
| Hoch | Daten löschen, Geld überweisen | Menschliche Freigabe + Vier-Augen-Prinzip |
*Praxisregel
Alles, was nicht rückgängig gemacht werden kann, braucht menschliche Freigabe. Lesende Operationen: automatisch. Schreibende Operationen: mit Vorsicht. Löschende Operationen: immer mit Freigabe.
Max-Steps-Limit
Setze immer eine Obergrenze für die Anzahl der Schritte, die ein Agent ausführen darf. 10-20 Schritte sind für die meisten Aufgaben ausreichend. Ohne Limit kann ein fehlerhafter Agent endlos laufen und Kosten verursachen.
Tool-Berechtigungen
Nicht jeder Agent braucht Zugriff auf jedes Tool. Vergib Berechtigungen nach dem Least-Privilege-Prinzip:
- Ein Recherche-Agent braucht nur Leserechte
- Ein Support-Agent braucht Lese- und begrenzte Schreibrechte
- Nur ein Admin-Agent bekommt volle Rechte -- und auch der nur mit Human-in-the-Loop
Anwenden
Der Realitätscheck: Was du wissen musst
- Agents sind nicht zuverlässig genug für autonome, kritische Entscheidungen -- Stand 2026 brauchen sie menschliche Aufsicht bei allem, was echte Konsequenzen hat.
- Die Fehlerrate sinkt, aber sie wird nie null -- Probabilistische Systeme haben immer eine Restfehlerrate.
- Kosten können explodieren -- Ein Agent ohne Max-Steps-Limit oder mit zu vielen Retries kann in Minuten hunderte Dollar an API-Kosten verursachen.
- Logging ist Pflicht -- Du musst jeden Denkschritt, jeden Tool-Call und jedes Ergebnis loggen. Ohne Logs kannst du Fehler nicht debuggen.
Dein Agent soll automatisch Kundenbestellungen stornieren, wenn ein Kunde darum bittet. Welche Guardrail-Strategie ist am wichtigsten?
Reflektieren
Guardrails sind kein Luxus, sondern Pflicht. Input-Validation, Output-Checks und Human-in-the-Loop schützen dein System vor den typischen Fehlern probabilistischer Agenten. Die Faustregel lautet: Je schwerer eine Aktion rückgängig zu machen ist, desto mehr Kontrolle brauchst du.