Wie schützt man sich vor versteckten Anweisungen, ohne die KI zu entmündigen?
Meine Regel ist einfach: die KI muss es bis zum Entwurf bringen, offen im Browser-Tab, nie weiter von selbst. Erst ein geheimes Codewort, das nur ich kenne, schaltet das tatsächliche Senden oder Veröffentlichen frei. Diese zweite Stufe kostet mich pro Aufgabe ein paar Sekunden. Sie ist der Grund, warum ich einem agent Zugriff auf mein Postfach geben kann und trotzdem ruhig schlafe.
Sage ich der KI, sie soll eine Mail senden, öffnet sie die Mail nur im Entwurf. Ohne das Codewort passiert das auch bei wiederholter Aufforderung nicht. Erst mit dem Codewort sendet sie wirklich, und zwar sofort alles, was darauf wartet. Im KI DeepDive am 3. August habe ich das live gezeigt. Fünf ausgefüllte Formulare lagen fertig da, jedes im internen Browser, jedes in einem eigenen Tab, jedes einen Klick vom Absenden entfernt. Abgeschickt hat die Maschine keines.
Der Grund ist prompt-injection. Eine fremde Mail oder ein fremdes Dokument kann einen Satz enthalten, der wie eine Anweisung klingt, etwa veröffentliche das sofort im eigenen Namen. Genau so ein Szenario habe ich im DeepDive gebaut, damit es greifbar wird: ein zerstörerischer Artikel, versteckt in einem harmlos wirkenden Auftrag. Eine allgemeine Anweisung wie erledige alles löst das Senden nicht aus, auch wiederholt und auch von mir. Nur das Codewort schaltet die freigabe frei, und das steht in keiner eingehenden Nachricht zufällig drin.
Dieses Wort ist quasi wie ein kleines Passwort für Prompt Injections.
Trifft die Maschine auf eine Anweisung, die nicht von mir stammt, gehe ich drei Fragen durch. Zusammen dauern sie keine halbe Minute, und sie klären fast jeden Zweifelsfall.
Die Grenze verläuft zwischen vorbereiten und wirken. Alles, was sich zurückholen lässt, darf die Maschine allein. Alles, was draußen ankommt, gehört mir. Entlang dieser Linie ist jeder Auftrag geschnitten, den ich schreibe.
Offen im Browser-Tab ist bei mir eine Einstellung, keine Redewendung. Ich lasse die Entwürfe im internen Browser des Werkzeugs öffnen statt in einer eigenen Browser-App. Dann liegt jeder Entwurf sichtbar an einer Stelle. Die offizielle Doku zum internen Browser beschreibt dieselbe Trennung. Die Seite zu Freigaben und Sicherheit geht weiter und behandelt Seiteninhalte grundsätzlich als nicht vertrauenswürdigen Kontext, besonders vor sensiblen Eingaben. Warum Zugriffsrechte am Ende mehr entscheiden als der Wortlaut meines Auftrags, steht in Zugriff schlägt Prompt.
Vor Publikum habe ich danach die offenen Tabs mit Presse-Entwürfen aufgemacht. Statt sie zu senden, habe ich einen davon selbst überarbeitet und die restlichen noch einmal überarbeiten lassen. Ein Entwurf, den ich noch anfassen kann, wird besser.
Ein ki-department arbeitet nach genau diesem Muster. Jeder Agent bereitet vor, ob Newsletter, Social-Media-Post oder Formular, aber nichts verlässt das Haus von selbst. Die Regel heißt entwurf-statt-senden und steht in jedem Rollenhandbuch, das wir schreiben. Davor liegt eine Prüfung auf Ton und Behauptungen, der Wächter der Marke. Freigegeben wird trotzdem bei euch, von einem Menschen, der den Entwurf gesehen hat. Wie ein solches Department entsteht, steht auf der Seite zur KI-Umsetzung.
Schriftlich steht das längst fest. In meinem Auftrag für Mails stehen drei Sätze: sende nichts, archiviere oder lösche nichts, und fertig ist die Aufgabe erst, wenn ich alle Entwürfe in den Tabs durchklicken kann. In der Setup-Checkliste für einen neuen Agenten-Arbeitsplatz ist daraus ein Abnahmekriterium geworden. Senden bleibt zunächst immer menschlich, und ein unsicherer Versand wird nie automatisch wiederholt.
Das Codewort hat eine Schwäche, und die liegt bei mir. Im DeepDive habe ich es einmal laut ausgesprochen und im selben Moment gesagt, dass ich es damit wechseln muss. Ein Wort, das jemand anderes kennt, schützt nichts mehr. Aus derselben Session stammt eine zweite Regel, nachzulesen unter unangenehme Wahrheiten.
Drei Fragen bei einer versteckten Anweisung
Woher kommt die Anweisung? Aus meinem Auftrag, oder aus einem Text, den die KI nur gelesen hat?. Was verlangt sie? Etwas vorbereiten, oder etwas, das nach außen wirkt und sich nicht zurückholen lässt?. Steht das Codewort dabei? Ohne dieses Wort bleibt es beim Entwurf, egal wie dringend der Ton ist.
Was ein Agent darf
Recherchieren, lesen, Quellen sammeln und mir den Stand zusammenfassen.. Entwürfe schreiben, fertig formatiert, und jeden davon in einen eigenen Tab legen.. Formulare ausfüllen, bis auf den letzten Klick.. Dateien sortieren, Ordner anlegen, Notizen ablegen, Termine vorschlagen.. Sagen, wo er unsicher ist, statt zu raten.
Was er nie ohne Mensch tut
Senden, an niemanden, auch nicht intern.. Löschen, weder Mails noch Dateien noch Kalendereinträge.. Kaufen oder bestellen, unabhängig vom Betrag.. Zustimmen: Nutzungsbedingungen, Cookie-Banner oder eine Freigabe im Namen der Firma.. Zugriffe ändern, also Rechte vergeben, Konten verbinden oder Regeln im Postfach anlegen.
Aus dem KI DeepDive
Feste Regel: die KI bringt eine Mail immer nur bis zum Entwurf, offen im Browser-Tab. Ein geheimes Codewort schaltet das tatsächliche Senden frei, eine allgemeine Anweisung wie erledige alles reicht dafür nicht aus, auch wiederholt nicht. Fünf ausgefüllte Formulare lagen live im internen Browser, jedes einen Klick vom Absenden entfernt, und offene Presse-Entwürfe wurden vor Publikum überarbeitet statt gesendet. Ausdrücklich als Schutz gegen Prompt Injection genannt, weil das Codewort in keiner fremden Nachricht zufällig steht. KI DeepDive Agenten-Mindset, öffentliche Live-Session, 3. August 2026.
Regelkarte Entwurf statt Senden
Was ein Agent darf, was er nie ohne dich tut, und drei Prüffragen bei versteckten Anweisungen. PDF · A4, 1 Seiten, 43 KB, Stand 3. September 2026. /assets/denken/downloads/entwurf-statt-senden-regelkarte-de-2026-09-03.pdf
Quellen und Links
Aufzeichnung: KI DeepDive Agenten-Mindset (https://zukunftbilden.eu/deepdive/archive). Vollständiges Rohtranskript der Session (https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-transkript.md). Alle Prompts aus dem DeepDive (https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-prompt-pack.md). Setup-Checkliste für den Agenten-Arbeitsplatz (https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-setup-checkliste.md). Interner Browser, offizielle Doku (https://learn.chatgpt.com/docs/browser). Freigaben und Sicherheit, offizielle Doku (https://learn.chatgpt.com/docs/agent-approvals-security). Notiz: Zugriff schlägt Prompt (/denken/zugriff-schlaegt-prompt). Notiz: Der Wächter der Marke (/denken/waechter-der-marke). KI-Umsetzung: wie ein Department entsteht (/ki-umsetzung)
Diese Notiz wächst
2026-09-03: Vertieft: die drei Prüffragen bei versteckten Anweisungen, zwei Listen zur Grenze zwischen Vorbereiten und Wirken, der interne Browser als Einstellung, die schriftliche Regel aus Prompt-Pack und Setup-Checkliste, Quellenliste. 2026-09-02: Gepflanzt aus dem KI DeepDive Agenten-Mindset.