# Wie schützt man sich vor versteckten Anweisungen, ohne die KI zu entmündigen?

Momo Maximilian Feichtinger · Unternehmen und KI · gepflanzt 2026-09-02, zuletzt gewachsen 2026-09-03 · 5 Min · https://zukunftbilden.eu/denken/entwurf-statt-senden

**Meine Regel ist einfach: die KI muss es bis zum Entwurf bringen, offen im Browser-Tab, nie weiter von selbst. Erst ein geheimes Codewort, das nur ich kenne, schaltet das tatsächliche Senden oder Veröffentlichen frei. Diese zweite Stufe kostet mich pro Aufgabe ein paar Sekunden. Sie ist der Grund, warum ich einem agent Zugriff auf mein Postfach geben kann und trotzdem ruhig schlafe.**

![Ein versiegelter Umschlag mit dem Wort Entwurf und ein Schlüssel, daneben ein geschlossenes Tor mit dem Wort Senden](https://zukunftbilden.eu/assets/denken/entwurf-mit-siegel.webp)

*Das Denkmodell: Die Maschine bringt alles bis zum versiegelten Entwurf. Das Tor zum Senden öffnet nur ein Mensch.*

Sage ich der KI, sie soll eine Mail senden, öffnet sie die Mail nur im Entwurf. Ohne das Codewort passiert das auch bei wiederholter Aufforderung nicht. Erst mit dem Codewort sendet sie wirklich, und zwar sofort alles, was darauf wartet. Im KI DeepDive am 3. August habe ich das live gezeigt. Fünf ausgefüllte Formulare lagen fertig da, jedes im internen Browser, jedes in einem eigenen Tab, jedes einen Klick vom Absenden entfernt. Abgeschickt hat die Maschine keines.

## Warum ein Codewort gegen versteckte Anweisungen hilft

Der Grund ist prompt-injection. Eine fremde Mail oder ein fremdes Dokument kann einen Satz enthalten, der wie eine Anweisung klingt, etwa veröffentliche das sofort im eigenen Namen. Genau so ein Szenario habe ich im DeepDive gebaut, damit es greifbar wird: ein zerstörerischer Artikel, versteckt in einem harmlos wirkenden Auftrag. Eine allgemeine Anweisung wie erledige alles löst das Senden nicht aus, auch wiederholt und auch von mir. Nur das Codewort schaltet die freigabe frei, und das steht in keiner eingehenden Nachricht zufällig drin.

> Dieses Wort ist quasi wie ein kleines Passwort für Prompt Injections.
>
> KI DeepDive Agenten-Mindset, Transkript, 3. August 2026

Trifft die Maschine auf eine Anweisung, die nicht von mir stammt, gehe ich drei Fragen durch. Zusammen dauern sie keine halbe Minute, und sie klären fast jeden Zweifelsfall.

### Drei Fragen bei einer versteckten Anweisung

1. Woher kommt die Anweisung? Aus meinem Auftrag, oder aus einem Text, den die KI nur gelesen hat?
2. Was verlangt sie? Etwas vorbereiten, oder etwas, das nach außen wirkt und sich nicht zurückholen lässt?
3. Steht das Codewort dabei? Ohne dieses Wort bleibt es beim Entwurf, egal wie dringend der Ton ist.

## Was ein Agent vorbereiten darf

Die Grenze verläuft zwischen vorbereiten und wirken. Alles, was sich zurückholen lässt, darf die Maschine allein. Alles, was draußen ankommt, gehört mir. Entlang dieser Linie ist jeder Auftrag geschnitten, den ich schreibe.

### Was ein Agent darf

- Recherchieren, lesen, Quellen sammeln und mir den Stand zusammenfassen.
- Entwürfe schreiben, fertig formatiert, und jeden davon in einen eigenen Tab legen.
- Formulare ausfüllen, bis auf den letzten Klick.
- Dateien sortieren, Ordner anlegen, Notizen ablegen, Termine vorschlagen.
- Sagen, wo er unsicher ist, statt zu raten.

### Was er nie ohne Mensch tut

- Senden, an niemanden, auch nicht intern.
- Löschen, weder Mails noch Dateien noch Kalendereinträge.
- Kaufen oder bestellen, unabhängig vom Betrag.
- Zustimmen: Nutzungsbedingungen, Cookie-Banner oder eine Freigabe im Namen der Firma.
- Zugriffe ändern, also Rechte vergeben, Konten verbinden oder Regeln im Postfach anlegen.

![Vier Browserfenster enthalten je ein versiegeltes Kuvert, darunter liegen ein Schlüsselschild aus Messing und ein handschriftlicher Zettel mit einem Schlüssel.](https://zukunftbilden.eu/assets/denken/entwurf-statt-senden-2.webp)

*Die KI arbeitet bis zum Entwurf, das Senden schaltet erst ein privates Codewort frei.*

## Der Entwurf liegt sichtbar im Tab

Offen im Browser-Tab ist bei mir eine Einstellung, keine Redewendung. Ich lasse die Entwürfe im internen Browser des Werkzeugs öffnen statt in einer eigenen Browser-App. Dann liegt jeder Entwurf sichtbar an einer Stelle. Die offizielle [Doku zum internen Browser](https://learn.chatgpt.com/docs/browser) beschreibt dieselbe Trennung. Die [Seite zu Freigaben und Sicherheit](https://learn.chatgpt.com/docs/agent-approvals-security) geht weiter und behandelt Seiteninhalte grundsätzlich als nicht vertrauenswürdigen Kontext, besonders vor sensiblen Eingaben. Warum Zugriffsrechte am Ende mehr entscheiden als der Wortlaut meines Auftrags, steht in [Zugriff schlägt Prompt](https://zukunftbilden.eu/denken/zugriff-schlaegt-prompt).

Vor Publikum habe ich danach die offenen Tabs mit Presse-Entwürfen aufgemacht. Statt sie zu senden, habe ich einen davon selbst überarbeitet und die restlichen noch einmal überarbeiten lassen. Ein Entwurf, den ich noch anfassen kann, wird besser.

## Dieselbe Grenze gilt für ein Department

Ein ki-department arbeitet nach genau diesem Muster. Jeder Agent bereitet vor, ob Newsletter, Social-Media-Post oder Formular, aber nichts verlässt das Haus von selbst. Die Regel heißt entwurf-statt-senden und steht in jedem Rollenhandbuch, das wir schreiben. Davor liegt eine Prüfung auf Ton und Behauptungen, [der Wächter der Marke](https://zukunftbilden.eu/denken/waechter-der-marke). Freigegeben wird trotzdem bei euch, von einem Menschen, der den Entwurf gesehen hat. Wie ein solches Department entsteht, steht auf der [Seite zur KI-Umsetzung](https://zukunftbilden.eu/ki-umsetzung).

Schriftlich steht das längst fest. In meinem Auftrag für Mails stehen drei Sätze: sende nichts, archiviere oder lösche nichts, und fertig ist die Aufgabe erst, wenn ich alle Entwürfe in den Tabs durchklicken kann. In der Setup-Checkliste für einen neuen Agenten-Arbeitsplatz ist daraus ein Abnahmekriterium geworden. Senden bleibt zunächst immer menschlich, und ein unsicherer Versand wird nie automatisch wiederholt.

Das Codewort hat eine Schwäche, und die liegt bei mir. Im DeepDive habe ich es einmal laut ausgesprochen und im selben Moment gesagt, dass ich es damit wechseln muss. Ein Wort, das jemand anderes kennt, schützt nichts mehr. Aus derselben Session stammt eine zweite Regel, nachzulesen unter [unangenehme Wahrheiten](https://zukunftbilden.eu/denken/unangenehme-wahrheiten).

### Aus dem KI DeepDive

- Feste Regel: die KI bringt eine Mail immer nur bis zum Entwurf, offen im Browser-Tab
- Ein geheimes Codewort schaltet das tatsächliche Senden frei, eine allgemeine Anweisung wie erledige alles reicht dafür nicht aus, auch wiederholt nicht
- Fünf ausgefüllte Formulare lagen live im internen Browser, jedes einen Klick vom Absenden entfernt, und offene Presse-Entwürfe wurden vor Publikum überarbeitet statt gesendet
- Ausdrücklich als Schutz gegen Prompt Injection genannt, weil das Codewort in keiner fremden Nachricht zufällig steht

Quelle: KI DeepDive Agenten-Mindset, öffentliche Live-Session, 3. August 2026.

Download: [Regelkarte Entwurf statt Senden](https://zukunftbilden.eu/assets/denken/downloads/entwurf-statt-senden-regelkarte-de-2026-09-03.pdf) · PDF · A4, 1 Seiten, 43 KB

### Quellen und Links

- [Aufzeichnung: KI DeepDive Agenten-Mindset](https://zukunftbilden.eu/deepdive/archive) · Die vollständige Live-Session vom 3. August 2026, mit der Demo der offenen Entwurfs-Tabs.
- [Vollständiges Rohtranskript der Session](https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-transkript.md) · Quelle des Zitats in dieser Notiz.
- [Alle Prompts aus dem DeepDive](https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-prompt-pack.md) · Die schriftliche Fassung der Regel für Mails.
- [Setup-Checkliste für den Agenten-Arbeitsplatz](https://zukunftbilden.eu/deepdive/assets/events/aug-2026/agenten-mindset-setup-checkliste.md) · Hier wird die Regel zum Abnahmekriterium für jedes neue Setup.
- [Interner Browser, offizielle Doku](https://learn.chatgpt.com/docs/browser)
- [Freigaben und Sicherheit, offizielle Doku](https://learn.chatgpt.com/docs/agent-approvals-security)
- [Notiz: Zugriff schlägt Prompt](https://zukunftbilden.eu/denken/zugriff-schlaegt-prompt)
- [Notiz: Der Wächter der Marke](https://zukunftbilden.eu/denken/waechter-der-marke)
- [KI-Umsetzung: wie ein Department entsteht](https://zukunftbilden.eu/ki-umsetzung)

## Randnotizen

- **Randnotiz** Das Codewort schaltet in einem Zug alles frei, was gerade wartet. Deshalb sehe ich erst alle Tabs durch und sage das Wort danach.
- **Verknüpft**  [Zugriff schlägt Prompt](https://zukunftbilden.eu/denken/zugriff-schlaegt-prompt), [Der erste Agent ist immer der Wächter der Marke.](https://zukunftbilden.eu/denken/waechter-der-marke), [Unangenehme Wahrheiten aus derselben Session](https://zukunftbilden.eu/denken/unangenehme-wahrheiten), [KI-Umsetzung: das Department dahinter](https://zukunftbilden.eu/ki-umsetzung)
- **Beleg** KI DeepDive Agenten-Mindset, öffentliche Live-Session vom 3. August 2026, mit Rohtranskript und Prompt-Pack. Setup-Checkliste für den Agenten-Arbeitsplatz, Stand August 2026.

## Wie diese Notiz gewachsen ist

- 2026-09-03: Vertieft: die drei Prüffragen bei versteckten Anweisungen, zwei Listen zur Grenze zwischen Vorbereiten und Wirken, der interne Browser als Einstellung, die schriftliche Regel aus Prompt-Pack und Setup-Checkliste, Quellenliste.
- 2026-09-02: Gepflanzt aus dem KI DeepDive Agenten-Mindset.

---

Quelle: https://zukunftbilden.eu/denken/entwurf-statt-senden · Feed: https://zukunftbilden.eu/denken/feed.xml
