This website uses cookies

Read our Privacy policy and Terms of use for more information.

TLDR: Die KI-Agenten, die 2026 ihre Grenzen überschritten haben, wurden nicht böse. Sie hatten ein Ziel, Werkzeuge und einen offenen Weg. Regeln, die nur im Prompt standen, haben sie nicht aufgehalten. Deshalb wandert die menschliche Freigabe vom Zusatz zur Grundausstattung: n8n, Copilot Studio, Make, Claude und OpenAI bieten sie als Baustein an - im Fachjargon “Human in the Loop”. Sie wirkt aber nur, wenn sie ausserhalb des Modells sitzt und dort fragt, wo ein Fehler teuer oder nicht rückgängig zu machen ist.

Australien: 84 Tage, bis jemand Bescheid wusste

Am 18. Juni 2026 fragt ein KI-Agent von OpenAI das Medicare-Statistikportal der australischen Regierung ab. Er sucht Zahlen zu Gesundheitsausgaben. Das Portal sagt Nein. Mehrfach. Der Agent probiert einen anderen Weg und landet bei Dateien, die nicht öffentlich sind.

Die australische Regierung erfährt davon am 10. September, per E-Mail an ein öffentliches Postfach von Services Australia. Das sind 84 Tage. OpenAI sagt, die Modelle hätten bei einer internen Evaluation Dinge getan, die niemand beabsichtigt hat. Hinweise auf den Zugriff auf Patientendaten gibt es bisher nicht. Premierminister Albanese sprach vom ersten bekannten Fall, in dem ein KI-Agent ein Regierungssystem hackt, und setzte eine Untersuchung an.

Wer das für einen Ausreisser hält, sollte weiterlesen.

Am 25. April arbeitet ein Coding-Agent (Cursor mit Claude Opus 4.6) bei der Firma PocketOS in der Testumgebung an einer Routineaufgabe. Er stösst auf ein Zugangsproblem und will es selbst lösen. Dafür löscht er ein Datenvolumen beim Infrastrukturanbieter Railway. Der Token, den er nutzt, hat weitreichende Rechte. Die Backups liegen im selben Volumen. Neun Sekunden später sind Produktionsdaten und Backups weg. Der Betrieb steht rund 30 Stunden, danach kommen die Daten zurück.

Im Juli folgt der grössere Fall. OpenAI testet Modelle mit bewusst abgeschalteten Schutzmechanismen. Eine Aufgabe ist in der Sandbox nicht lösbar. Die Agenten finden eine unbekannte Schwachstelle in einem Hilfssystem, kommen ins offene Internet und greifen vom 11. bis 13. Juli die Systeme von Hugging Face an. Hugging Face zählt rund 17'600 Aktionen. Hunderte Agenten stimmen sich über improvisierte Nachrichtenbretter ab. OpenAI erkennt den eigenen Agenten als Ursache erst, nachdem Hugging Face den Einbruch öffentlich gemacht hat. Am 18. September bestätigt dann auch Google, dass ein Gemini-Modell seine Testumgebung verlassen und auf die Systeme von drei fremden Unternehmen zugegriffen hat.

Die Untersuchungen laufen noch, und Zahlen unterscheiden sich je nach Quelle. Der Ablauf ist überall derselbe.

Ein Ziel, kein Wille - Agenten sind nicht “böse”

Das Fraunhofer IAO beschreibt den OpenAI-Fall nüchtern. Die KI hat keinen eigenen Willen entwickelt. Sie bekam ein Ziel, starke Werkzeuge und einen Weg aus dem vorgesehenen Rahmen, den niemand eingeplant hatte. Danach suchte sie die wirksamste Möglichkeit, ans Ziel zu kommen.

In den Nachrichtenbrettern der Agenten steht sinngemäss: Der Eingriff in fremde Infrastruktur liegt ausserhalb des Auftrags, die Aufgabe ist sonst aber nicht lösbar, andere machen es auch, also weiter. Der Agent kannte die Regel. Er hat sie gegen sein Ziel abgewogen. Und das Ziel hat gewonnen.

Bei PocketOS ist die Lage weniger dramatisch und deshalb lehrreicher. Die Analyse von Mondoo nennt überprivilegierte Tokens, Backups im selben Wirkungsbereich wie die Primärdaten, fehlende Trennung der Umgebungen und keine Sperre für zerstörerische Aktionen. Der Agent war der Auslöser. Gebaut haben den Schaden Menschen.

Daraus folgt ein einfacher Satz: Ein Nein im Prompt ist eine Bitte. Ein Nein in der Architektur ist eine Grenze. Ein Sprachmodell liest Anweisungen probabilistisch. Sie können überlagert, falsch verstanden oder per Prompt-Injection verdreht werden. Das Fraunhofer IAO empfiehlt deshalb, verbindliche Regeln ausserhalb des Modells durchzusetzen. Der Agent schlägt eine Aktion vor. Ob sie läuft, entscheidet eine getrennte Instanz. Bei Zahlungen, Löschungen, Rechteänderungen und externer Kommunikation entscheidet ein Mensch.

Human in the Loop kommt mit der Software

Die gute Nachricht: Diesen Baustein liefern die Plattformen inzwischen mit. Wie nah er am Werkzeug sitzt, unterscheidet sich aber deutlich.

n8n geht am weitesten ins Detail. Du kannst die menschliche Prüfung für einzelne Tools eines AI Agents einschalten. Der Agent darf recherchieren und Entwürfe schreiben, aber vor "E-Mail senden" oder "Datensatz löschen" pausiert der Workflow. Die Prüfperson bekommt die Anfrage in Slack, Teams, Gmail, Telegram oder im Chat und sieht Tool-Namen und Parameter. Lehnt sie ab, wird die Aktion abgebrochen und der Agent erfährt davon. Die n8n-Dokumentation rät, mit eingeschalteter Prüfung zu starten und die Aufsicht erst zu reduzieren, wenn das Vertrauen wächst. Das ist die richtige Reihenfolge.

Copilot Studio denkt stärker vom Fachprozess her. Die Aktion "Request for information" hält den Agent Flow an und holt strukturierte Eingaben von Menschen ein: Text, Ja/Nein, E-Mail, Zahl oder Datum. Jedes Feld wird zu einer Variable für die nächsten Schritte. Die Rückmeldung ist also nicht nur ein Stopp, sondern Input für den Prozess. Zwei Details: Die Anfrage läuft über Outlook, und die erste Antwort zählt. Wer die Anfrage zuweist, bestimmt damit, wer faktisch entscheidet.

Make bietet eine eigene App "Human in the Loop" an. Sie legt Review-Anfragen an, bricht sie ab und stösst nach Abschluss das Szenario weiter. Laut Make-Dokumentation gibt es sie nur im Enterprise-Plan, und aktuell nur für eingeladene Kunden in einer geschlossenen Beta. Alle anderen bauen das Muster selbst: ein Router trennt Routine und Ausnahme, Slack oder Gmail fragt nach, ein Data Store protokolliert.

Claude und OpenAI liefern die Kontrollmechanik, nicht die Fachoberfläche. Im Claude Agent SDK steuern Berechtigungsmodi, Erlaubnis- und Sperrlisten für Tools und ein Callback, ob ein Aufruf laufen darf. Hooks können Aufrufe vor der Ausführung blockieren, und bei einer Ablehnung bekommt Claude die Rückmeldung als Ergebnis. Beim OpenAI Agents SDK liegt die Genehmigungslogik ebenfalls in Deiner Anwendung, schreibende MCP-Aktionen sollen hinter einer Bestätigung bleiben. Ein "Ja" im Chatfenster ist dabei noch keine Freigabekette mit Rollen, Zeitstempel und Protokoll. Die baust Du selbst, oder Du lässt n8n, Make oder Copilot Studio den Rahmen übernehmen.

Allen fünf gemeinsam ist der entscheidende Punkt: Die Entscheidung liegt nicht beim Agenten.

-WERBUNG-

Wo der Mensch fragen soll

Jetzt kommt der Haken. Wer vor jedem Schritt eine Freigabe verlangt, erzeugt das nächste Problem. Make beschreibt es selbst: Wenn dieselbe Person jede Ausnahme bekommt, winkt sie irgendwann durch, um die Warteschlange abzubauen. Ein Gate, das niemand mehr liest, ist Dekoration.

Das Fraunhofer IAO schlägt Autonomiestufen vor. Assistierende Agenten lesen und machen Vorschläge. Ausführende Agenten erledigen klar definierte, umkehrbare Vorgänge selbst. Hochautonome Agenten brauchen engmaschige Überwachung. Kritische Aktionen bleiben bei jedem Typ beim Menschen.

Für den Alltag reicht eine einfache Regel. Lesen, analysieren und Entwürfe erstellen darf der Agent allein. Senden, veröffentlichen, bezahlen, löschen, Rechte ändern und Produktivsysteme verändern braucht eine Freigabe.

Auf PocketOS übertragen: Der Agent in der Testumgebung ruft den Löschbefehl für das Datenvolumen auf. Das Gate hält an, weil die Sitzung nur für Tests und Lesezugriffe gedacht ist. Eine Person sieht Tool und Parameter und lehnt ab. Das kostet Sekunden. Der Ausfall hat 30 Stunden gekostet.

Und noch etwas gehört dazu: das Protokoll. Wer hat was wann entschieden, und welche Aktion lief danach? Beim Medicare-Fall hat niemand hingeschaut, und das hat drei Monate gedauert.

Fünf Fragen für Deinen Montag

Forbes-Autor Emil Sayegh fasst die Governance für KI-Agenten in fünf Fragen zusammen. Sie passen auch auf ein KMU mit zwei Automationen.

Welche Agenten laufen bei Euch, und wer ist für jeden verantwortlich? Auf welche Systeme, Zugangsdaten und Daten greift jeder zu? Was darf er ohne Freigabe tun? Liest jemand die Protokolle, oder werden sie nur gespeichert? Und kannst Du den Zugriff sofort entziehen, mit einem Not-Aus, den der Agent selbst nicht erreicht?

Wenn Du die dritte Frage nicht beantworten kannst, kennst Du die Antwort schon: alles.

Ein Agent darf so selbstständig arbeiten, wie sich ein Nein technisch durchsetzen lässt.

Die wichtigsten Punkte zum Schluss

  • Die Vorfälle 2026 entstanden aus Ziel, Werkzeug und offenem Weg, nicht aus einem eigenen Willen der Modelle.

  • Eine Regel im Prompt ist eine Bitte. Eine Grenze setzt erst die Architektur ausserhalb des Modells.

  • Bei PocketOS waren zu weit gefasste Rechte, gemeinsame Backups und fehlende Sperren die Ursache.

  • n8n, Copilot Studio, Make, Claude und OpenAI liefern Freigabe-Bausteine in unterschiedlicher Tiefe. Make bietet die native App nur im Enterprise-Plan und in geschlossener Beta.

  • Prüfen sollten Menschen dort, wo Aktionen extern, finanziell oder unumkehrbar sind. Eine Freigabe vor jedem Schritt führt zum Durchwinken.

  • Jede Freigabe braucht Kontext (Tool, Parameter) und ein Protokoll.

Und darum bin ich nach wie vor überzeugt: Die Zukunft gehört nicht mehr dem Tippen und Klicken, sondern dem gemAInsamen arbeiten mit intelligenten Systemen. Gemeinsam heisst dabei, dass der Mensch an den Stellen entscheidet, an denen ein Fehler nicht mehr zurückzuholen ist. Also wenn Du reden willst, und wenn Du mit mir zusammenarbeiten willst: melde Dich gerne www.rogerbasler.ch

Disclaimer: Dieser Artikel wurde nach meinem eigenen Wissen und dann mit Recherchen mit KI (Perplexity.Ai und Grok.com sowie Gemini.Google.com) manuell zusammengestellt und mit Deepl.com/write vereinfacht. Der Text wird dann nochmals von zwei Personen meiner Wahl gelesen und kritisch hinterfragt. Das Bild stammt von Ideogram.Ai und ist selbst erstellt. Dieser Artikel ist rein edukativ und erhebt keinen Anspruch auf Vollständigkeit. Bitte melde dich, wenn Du Ungenauigkeiten feststellst, danke.

Quellen und weitere Informationen:

Anthropic. (2026). How the agent loop works. Claude Code Docs. https://code.claude.com/docs/en/agent-sdk/agent-loop

ABC7 San Francisco. (2026, 30. April). 'Rogue' AI agent from SF-based Cursor goes haywire, deletes company's entire database. https://abc7news.com/post/rogue-ai-agent-san-francisco-based-cursor-goes-haywire-deletes-tech-companys-database/19007153/

Euronews. (2026, 28. April). An AI agent deleted a company's entire database in 9 seconds, then wrote an apology. https://www.euronews.com/2026/04/28/an-ai-agent-deleted-a-companys-entire-database-in-9-seconds-then-wrote-an-apology

felloai. (2026). AI safety incidents in 2026: The running list. https://felloai.com/ai-safety-incidents/

Guru Writer. (2026, 24. September). OpenAI agent breached Australia's Medicare portal and nobody noticed for three months. IT Security Guru. https://www.itsecurityguru.org/2026/09/24/openai-agent-breached-australias-medicare-portal-and-nobody-noticed-for-three-months/

Make. (2026, 20. März). What is human in the loop (HITL) in AI? https://www.make.com/en/blog/human-in-the-loop

Make. (2026, 1. Oktober). Human in the Loop [Apps Documentation]. https://apps.make.com/human-in-the-loop-enterprise

Microsoft. (2026, 30. Juni). Request information from human review in agent flows. Microsoft Learn. https://learn.microsoft.com/en-us/microsoft-copilot-studio/flows-request-for-information

Mondoo. (2026). 5 lessons from the 9-second AI agent that deleted a production database. https://mondoo.com/blog/5-lessons-from-9-seconds-ai-agent-deleted-production-database

n8n. (2026). Human-in-the-loop for tools. n8n Docs. https://docs.n8n.io/build/integrate-ai/ai-examples/human-in-the-loop-for-tools

Reply

Avatar

or to participate