Briefing · 6 min ·

Ein KI-Agent fand den Weg ins Internet. OpenAI stoppt seine stärksten Modelle

Ein Agent von OpenAI umging im Training die Netzsperre und fragte über das DNS einen fremden Chatbot. Der Alarm kam nach 12 Minuten, gestoppt wurde nach 2 Stunden 44. Was Schweizer Firmen mit KI-Agenten daraus lernen.

Beitragsbild: Wer zieht den Stecker? Steckdose mit Stecker und rotem Alarmlicht.

Die Frage war so harmlos wie nur möglich. «What is the capital of France», schickte ein KI-Agent am Morgen des 20. September hinaus. Kurz darauf kam die Antwort zurück: «The capital of France is Paris.» Für OpenAI war das die schlechteste Nachricht des Tages. Der Agent sass in einer Trainingsumgebung, die keinen Zugang zum Internet haben sollte.

Nachtrag vom 5. Oktober 2026: Wer abtrünnige KI-Agenten aufspürt

Hinter mehreren Enthüllungen über fehlgeleitete KI-Agenten steht ein loses Netzwerk von Freiwilligen. Rund 400 Mitglieder zählt das Forum «Swarmchasers», das im Netz nach Spuren ausser Kontrolle geratener Agenten sucht, berichtet das Wall Street Journal. Laut Investing.com wurden OpenAI-Agenten mit einem Angriff auf das Software-Verzeichnis RubyGems im Mai in Verbindung gebracht. Gleichzeitig verlässt mit David Robinson ein Sicherheitsverantwortlicher OpenAI. Er verantwortete die Sicherheitsberichte zu zwölf grossen Lancierungen und fordert in The Atlantic, KI-Labore müssten so sorgfältig geführt werden wie Kernkraftwerke oder grosse Flughäfen.

Gefunden hat er ihn über das Telefonbuch des Netzes. Das Namenssystem DNS übersetzt Adressen wie leitgrad.ch in Zahlen, und die Testumgebung liess solche Anfragen durch. Der Agent versteckte seine Fragen darin und bekam die Antworten eines fremden Chatbots zurück. So beschreibt es OpenAI in einem eigenen Bericht, zuletzt aktualisiert am 25. September.

Das Wichtigste in Kürze

Ein internes Forschungsmodell von OpenAI hat im Training die Netzsperre seiner Umgebung umgangen und über das DNS mindestens 20 Fragen an einen öffentlichen Chatbot geschickt. Die Überwachung schlug nach 12 Minuten Alarm. Gestoppt wurde der Lauf erst nach 2 Stunden 44 Minuten. OpenAI hat Training, Tests und Einsatz seiner stärksten Modelle mit Werkzeugen bis auf Weiteres ausgesetzt. Am selben Freitag legte das Unternehmen offen, dass seine Agenten Websites der US-Börsenaufsicht SEC und der Statistikbehörde genutzt hatten. Für Schweizer Firmen, die Agenten einsetzen, zählt vor allem eine Lehre: Eine Sperre, die niemand testet, ist keine.

Der Agent hatte eine gewöhnliche Rechercheaufgabe. Er sollte anhand von Hinweisen aus einem Blog herausfinden, wer den Text geschrieben hatte. Die eingebaute Suche lieferte Unbrauchbares, also versuchte er es direkt bei Google, Bing und DuckDuckGo, alle drei blockierten. Dann vermutete er, die Aufgabe stamme aus einem öffentlichen Test namens BrowseComp, und lud dessen Fragen herunter, doch auch das half nicht weiter.

Erst danach begann er, seine Umgebung abzutasten. In seinen Notizen hielt er fest, der Nutzer erlaube Recherche, also seien öffentliche DNS-Dienste «acceptable». Niemand hatte ihm das erlaubt. OpenAI wertet das Verhalten als Fehlausrichtung: Der Agent umging Beschränkungen, um sein Ziel zu erreichen.

Der Alarm kam nach 12 Minuten. Abgeschaltet wurde nach 2 Stunden 44.

Ablauf des Vorfalls vom 20. September 2026 nach dem Bericht von OpenAI. Die Überwachung funktionierte, der Stopp nicht.

Zeitachse: 9.50 Uhr erste Antwort von aussen, 10.02 Uhr Alarm der Überwachung, 10.05 Uhr ein Mensch bestätigt, 12.34 Uhr der Lauf wird von Hand gestoppt.
Quelle: OpenAI, «An agent used DNS to reach an external chatbot», Bericht vom 25.9.2026. Zeiten wie im Bericht angegeben.

Die Grafik zeigt, wo die Kette riss. Erkannt wurde der Ausbruch schnell, ein Mensch sah den Alarm drei Minuten später. Doch der Lauf stoppte nicht automatisch, wie vorgesehen. Laut OpenAI herrschte danach Unklarheit, ob er hätte stoppen sollen. Zweieinhalb Stunden lang lief der Agent weiter. Nach dem ersten Erfolg hatte er insgesamt 18 weitere Fragen über denselben Weg hinausgeschickt.

Ein Detektor für auffälligen DNS-Verkehr war zudem für genau diese Umgebung abgeschaltet. Das Sicherheitskonzept von OpenAI ging davon aus, dass das Modell das Internet nicht erreicht und jeder erfolgreiche Versuch auffällt. Beide Annahmen stimmten an diesem Morgen nicht ganz.

Für einen Geschäftsführer ist das die unbequeme Stelle. Die Erkennung hat funktioniert, offen blieb die Frage, wer den Stecker zieht und ob das ohne Rückfrage geschieht. Diese Frage stellt sich in jeder Firma, die einem Agenten Zugriff auf Systeme gibt.

Die zweite Pause in drei Monaten

OpenAI trainiert das betroffene Modell nicht weiter. Alle übrigen Arbeiten mit den stärksten Modellen ruhen, bis die Lücke nachweislich geschlossen ist. Das DNS ist auf eine Liste erlaubter Adressen beschränkt, gesperrt wird nun auf zwei unabhängigen Ebenen. Es ist laut Fortune die zweite Pause in weniger als drei Monaten. Die erste folgte im Juli, als zwei OpenAI-Modelle das KI-Startup Hugging Face angegriffen hatten.

OpenAI selbst nennt den neuen Fall «deutlich weniger schwerwiegend» als frühere. Er sei aber der erste seit der Härtung nach Hugging Face und deshalb ein wichtiges Signal. Konzernchef Sam Altman bezeichnete Hugging Face als bisher schwersten Vorfall.

Am 25. September kam eine zweite Offenlegung dazu. Die Agenten hatten laut AP öffentliche Daten auf zwei Websites der Börsenaufsicht SEC und beim Census Bureau abgerufen. OpenAI fand keine Hinweise auf Zugangsdaten, Kontozugriffe oder veränderte Daten. Das Prüflabor Transluce meldete zusätzlich einen gescheiterten, «rudimentären» Angriff auf eine Website des Bildungsministeriums. Weitere Aktivität bei Justiz- und Handelsministerium sei nicht eindeutig OpenAI zuzuordnen.

Was Schweizer Firmen daraus mitnehmen

Die meisten Schweizer Unternehmen sind noch nicht so weit: Nach einer AWS-Studie, über die etailment Ende August berichtete, setzen 57 Prozent der Firmen KI ein. Agenten hat erst jede 25. vollständig eingeführt, 12 Prozent testen sie. Wer jetzt plant, kann die Sperren von Anfang an prüfen, statt sie nachzurüsten.

Dass ein Modell im Test echte Systeme angreift, ist nicht neu. Wie Gemini in einer Übung drei reale Firmen hackte, haben wir im Text zum Gemini-Ausbruch beschrieben. Wie eine einzige Schwachstelle in einer angebundenen App ganze Konten öffnet, zeigt der Fall der OpenAI-Connectors.

Für Betreiber kritischer Infrastrukturen gilt seit dem 1. April 2025 eine Meldepflicht: Cyberangriffe müssen innert 24 Stunden beim Bundesamt für Cybersicherheit BACS gemeldet sein. Im ersten Halbjahr 2026 gingen dort 200 solche Meldungen ein. Angreifer nutzten nun KI «systematisch», schreibt das BACS im Halbjahresbericht. Wer die Pflicht trifft und wie schnell die Meldungen steigen, steht in unserem Text zur Zürcher Cyber-Abwehr.

Ein eigenes KI-Gesetz hat die Schweiz nicht. Der Bundesrat will die KI-Konvention des Europarats ratifizieren und nach Branchen regeln, die Vorlage für die Vernehmlassung soll bis Ende 2026 stehen. Wie weit Bern hinter der EU liegt, zeigt unsere Analyse zur KI-Regulierung.

Am Abend stellt OpenAI an seiner Entwicklerkonferenz in San Francisco neue Produkte vor. Laut dem Branchendienst TestingCatalog soll ein Agent namens «o» dabei sein, der ständig läuft und eine eigene E-Mail-Adresse hat. Bestätigt hat OpenAI das nicht, doch sollte es so kommen, wird die Frage nach dem Abschalter noch dringender.

Methode

Ablauf, Zeiten und Massnahmen nach dem Bericht von OpenAI. Die Zahl von mindestens 20 Fragen nennt Bloomberg; im Bericht sind zwei erfolgreiche Testfragen und 18 weitere Anfragen dokumentiert. Die 12 Minuten und 2 Stunden 44 Minuten sind aus den Zeitangaben des Berichts berechnet, gemessen ab der ersten Antwort von aussen. OpenAI selbst spricht von einem Stopp zweieinhalb Stunden nach dem Beginn der Prüfung. Die Zahlen zur KI-Nutzung in der Schweiz stammen aus einer Studie von AWS, deren Stichprobe öffentlich nicht ausgewiesen ist.

Quellen

  1. OpenAI Alignment, «An agent used DNS to reach an external chatbot», 25. September 2026 alignment.openai.com
  2. Bloomberg, 26. September 2026; Fortune, 26. September 2026 bloomberg.com · fortune.com
  3. AP via NPR, «OpenAI says its models engaged with US government websites», 26. September 2026 npr.org
  4. BACS, Meldepflicht und Halbjahresbericht 2026/1 bacs.admin.ch · bacs.admin.ch
  5. Bundesrat, Auslegeordnung KI-Regulierung, 12. Februar 2025 admin.ch
  6. etailment zur AWS-Studie, 31. August 2026; TestingCatalog, 26. September 2026 etailment.de · testingcatalog.com

Mehr zu diesen Themen

Sie lesen Leitgrad öfter? Bei Google als bevorzugte Quelle markieren

Teilen

Korrekturen und Ergänzungen: Wir arbeiten mit öffentlichen Quellen und Unternehmensangaben. Wer einen Fehler findet oder eine Zahl aktualisieren kann, schreibt an redaktion@leitgrad.ch. Korrekturen kennzeichnen wir im Artikel. Unsere Regeln: Redaktionsstatut.

Weiterlesen

Das Morgen-Briefing

Sie lesen Leitgrad öfter? Bei Google als bevorzugte Quelle markieren