← Alle Beiträge

Schutzmechanismen für ein LLM, das echten Menschen E-Mails schreibt

Ein Assistent, der E-Mails automatisch beantwortet, kann echten Schaden anrichten. Die langweilige Sicherheitsebene ist das, was ihn auslieferbar macht.

  • LLM
  • E-Mail
  • Guardrails

Das Modell, das die Antwort schreibt, sind die einfachen 20 %. Die anderen 80 % — der Teil, den niemand in eine Demo packt — sind das, was dich das Ding tatsächlich einschalten lässt, ohne zusammenzuzucken. Einen E-Mail-Autoresponder mit LLM (Imgestor) zu bauen war vor allem das Bauen der Bremsen.

Antworte niemals einem Roboter

Eine Autoantwort, die mit einer Autoantwort spricht, ist eine Endlosschleife mit der Reputation deiner Domain als Pfand. Erkenne Auto-Submitted-Header, Precedence: bulk/list, Abmelde-Header, No-Reply-Absender und deine eigenen vorherigen Nachrichten — und schweige. Die wichtigste Fähigkeit des Bots ist das Schweigen.

Deckle alles, pro Absender

Eine einzige verärgerte Person sollte nicht in der Lage sein, in einer Stunde zwanzig KI-Antworten herauszuholen. Ratenbegrenzungen pro Absender und global, plus eine harte Tagesobergrenze, verwandeln eine außer Kontrolle geratene Schleife in eine harmlose „rate-limited“-Logzeile.

Erst Entwurf, dann mit Vertrauen senden

Neuer Absender oder Klassifikation mit geringer Zuversicht → schreibe einen Entwurf zur menschlichen Prüfung mit einem Klick. Bekannt, sicher und mit hoher Zuversicht → sende automatisch. Wo du diese Grenze ziehst, ist eine Produktentscheidung, kein Modellparameter, und du solltest sie verschieben können, ohne etwas neu zu trainieren.

Verankere jede Antwort

Eine aus dem Nichts erfundene Antwort ist eine Haftung mit deinem Namen darauf. Verankere Antworten in einer Wissensdatenbank und verweigere — oder eskaliere an einen Menschen — wenn der Abruf leer zurückkommt. „Ich weiß es nicht, jemand kümmert sich darum“ ist eine Funktion, kein Fehler.

Das Modell ist eine Komponente. Die Schutzmechanismen sind das Produkt.