Wie schützt man sich vor versteckten Anweisungen, ohne die KI zu entmündigen?

Meine Regel ist einfach: die KI muss es bis zum Entwurf bringen, offen im Browser-Tab, nie weiter von selbst. Erst ein geheimes Codewort, das nur ich kenne, schaltet das tatsächliche Senden oder Veröffentlichen frei.

Sage ich der KI, sie soll eine Mail senden, öffnet sie die Mail nur im Entwurf. Ohne das Codewort passiert das auch bei wiederholter Aufforderung nicht, selbst wenn ich es mehrfach verlange. Erst mit dem Codewort sendet sie wirklich, und zwar sofort alles, was darauf wartet.

Der Grund ist Prompt Injection. Eine fremde Mail oder ein fremdes Dokument kann einen Satz enthalten, der wie eine Anweisung klingt, etwa veröffentliche das sofort im eigenen Namen. Eine allgemeine Anweisung wie erledige alles löst das Senden nicht aus, selbst wenn sie von mir kommt und mehrfach wiederholt wird. Nur das Codewort schaltet die Freigabe frei, und das steht in keiner eingehenden Nachricht zufällig drin.

Ein Department arbeitet nach genau diesem Muster. Jeder Agent bereitet vor, ob Newsletter, Social-Media-Post oder Formular, aber nichts verlässt das Haus von selbst. Freigegeben wird erst, wenn ein Mensch den Entwurf gesehen und bestätigt hat. Die Freigabe bleibt bei diesem Menschen, so wie das Codewort bei mir bleibt.

Aus dem KI DeepDive

Feste Regel: die KI bringt eine Mail immer nur bis zum Entwurf, offen im Browser-Tab. Ein geheimes Codewort schaltet das tatsächliche Senden frei, eine allgemeine Anweisung wie erledige alles reicht dafür nicht aus. Im KI DeepDive ausdrücklich als Schutz gegen Prompt Injection genannt, weil das Codewort in keiner fremden Nachricht zufällig steht. KI DeepDive Agenten-Mindset, öffentliche Live-Session, August 2026.

Diese Notiz wächst

2026-09-02: Gepflanzt aus dem KI DeepDive Agenten-Mindset.

ZukunftBilden GmbH · Salzburg · +43 681 81655313 · office@zukunftbilden.eu