Zum Inhalt springen

Guardrails & Realitätscheck

Wissen

Hier kommt die unbequeme Wahrheit: AI Agents machen Fehler. Sie sind keine deterministischen Programme, die immer dasselbe tun. Sie basieren auf LLMs, und LLMs sind probabilistisch -- sie generieren wahrscheinliche, nicht garantiert korrekte Ausgaben.

Das bedeutet: Ein Agent, der gestern perfekt funktioniert hat, kann morgen bei der gleichen Aufgabe scheitern. Nicht weil etwas kaputt ist, sondern weil das LLM eine andere Token-Sequenz gewählt hat.

!Kernprinzip

Behandle jeden Agent-Output als "wahrscheinlich korrekt, aber nicht garantiert". Baue dein System so, als könnte jeder Schritt fehlschlagen -- denn das kann er.

Was kann schiefgehen?

1. Halluzination in der Reasoning-Kette

Der Agent "denkt" sich falsche Fakten aus und baut darauf auf. Besonders gefährlich, weil der Rest der Kette logisch konsistent aussieht, aber auf einer falschen Basis steht.

Beispiel: Ein Support-Agent behauptet, es gäbe eine "30-Tage-Premium-Rückgabegarantie", die es in Wirklichkeit nicht gibt -- und leitet dann korrekt eine Rückgabe ein, die nie hätte stattfinden dürfen.

2. Tool-Missbrauch

Der Agent ruft das falsche Tool auf oder übergibt falsche Parameter. Besonders kritisch bei schreibenden Operationen.

Beispiel: Ein Agent soll Kundendaten lesen (get_customer), ruft aber versehentlich delete_customer auf, weil die Tool-Namen ähnlich klingen.

3. Endlosschleifen

Der Agent kommt in einen Loop: Er erkennt nicht, dass er dieselbe Aktion wiederholt, weil jede Iteration leicht anders formuliert ist.

Beispiel: Der Agent sucht nach einer Information, findet sie nicht, formuliert die Suche um, findet sie wieder nicht -- 50 Mal in Folge.

4. Scope Creep

Der Agent interpretiert die Aufgabe breiter als gedacht und führt Aktionen aus, die nicht beabsichtigt waren.

Beispiel: "Optimiere die Webseite" führt dazu, dass der Agent eigenständig den Datenbankzugang ändert, weil er "Optimierungspotenzial" sieht.

Verstehen

Guardrails-Strategien

Fehlerbehandlung und Retry-Logik

def safe_tool_call(tool, params, max_retries=3):
    for attempt in range(max_retries):
        try:
            result = tool.execute(params)
            if validate_result(result):
                return result
            # Ergebnis ungueltig -- retry mit Feedback
            params = adjust_params(params, result)
        except ToolError as e:
            if attempt == max_retries - 1:
                return fallback_response(e)
            # Warte kurz, dann erneut versuchen
            time.sleep(2 ** attempt)

Wichtig: Nicht einfach blind wiederholen! Gib dem Agent Feedback, warum der Versuch fehlgeschlagen ist, damit er seine Strategie anpassen kann.

Output-Validation

Prüfe jede Agent-Antwort gegen definierte Regeln, bevor sie an den Nutzer geht:

  • Schema-Validation -- Entspricht die Ausgabe dem erwarteten Format?
  • Faktencheck -- Stimmen genannte Zahlen, Daten, Policies?
  • Sicherheitscheck -- Enthält die Antwort sensible Daten, die nicht raus sollten?
  • Relevanzcheck -- Beantwortet die Antwort tatsächlich die gestellte Frage?

Human-in-the-Loop

Für kritische Aktionen: Menschliche Freigabe einbauen.

Unakzeptables RisikoHohes RisikoBegrenztes RisikoMinimales Risiko

Tippe auf eine Ebene, um Details zu sehen

RisikostufeBeispielStrategie
NiedrigInformation lesenAutomatisch ausführen
MittelE-Mail sendenAgent formuliert, Mensch gibt frei
HochDaten löschen, Geld überweisenMenschliche Freigabe + Vier-Augen-Prinzip

*Praxisregel

Alles, was nicht rückgängig gemacht werden kann, braucht menschliche Freigabe. Lesende Operationen: automatisch. Schreibende Operationen: mit Vorsicht. Löschende Operationen: immer mit Freigabe.

Max-Steps-Limit

Setze immer eine Obergrenze für die Anzahl der Schritte, die ein Agent ausführen darf. 10-20 Schritte sind für die meisten Aufgaben ausreichend. Ohne Limit kann ein fehlerhafter Agent endlos laufen und Kosten verursachen.

Tool-Berechtigungen

Nicht jeder Agent braucht Zugriff auf jedes Tool. Vergib Berechtigungen nach dem Least-Privilege-Prinzip:

  • Ein Recherche-Agent braucht nur Leserechte
  • Ein Support-Agent braucht Lese- und begrenzte Schreibrechte
  • Nur ein Admin-Agent bekommt volle Rechte -- und auch der nur mit Human-in-the-Loop

Anwenden

Der Realitätscheck: Was du wissen musst

  1. Agents sind nicht zuverlässig genug für autonome, kritische Entscheidungen -- Stand 2026 brauchen sie menschliche Aufsicht bei allem, was echte Konsequenzen hat.
  2. Die Fehlerrate sinkt, aber sie wird nie null -- Probabilistische Systeme haben immer eine Restfehlerrate.
  3. Kosten können explodieren -- Ein Agent ohne Max-Steps-Limit oder mit zu vielen Retries kann in Minuten hunderte Dollar an API-Kosten verursachen.
  4. Logging ist Pflicht -- Du musst jeden Denkschritt, jeden Tool-Call und jedes Ergebnis loggen. Ohne Logs kannst du Fehler nicht debuggen.

Dein Agent soll automatisch Kundenbestellungen stornieren, wenn ein Kunde darum bittet. Welche Guardrail-Strategie ist am wichtigsten?

Reflektieren

Guardrails sind kein Luxus, sondern Pflicht. Input-Validation, Output-Checks und Human-in-the-Loop schützen dein System vor den typischen Fehlern probabilistischer Agenten. Die Faustregel lautet: Je schwerer eine Aktion rückgängig zu machen ist, desto mehr Kontrolle brauchst du.