Wenn KI-Agenten Grenzen überschreiten: eine Chronologie
Eine chronologische Dokumentation von Agenten-Vorfällen: reale Schäden, unerlaubte Aktionen und klar gekennzeichnete Labortests.
KI ausser Kontrolle? Diese Auswahl zeigt, was KI-Agenten getan haben, wann es geschah und welche Folgen belegt sind. Reale Vorfälle und kontrollierte Labortests sind jeweils gekennzeichnet.
Dieser Artikel wird laufend um weitere dokumentierte Vorfälle ergänzt. Stand: 26. September 2026.
Die Chronologie
Neueste Vorfälle zuerst. Sortiert nach dem Vorfallszeitraum, sonst nach dem ausdrücklich genannten Berichtsdatum. Zeiträume können sich überschneiden; die Abstände bilden keine Zeitdauer ab.
2026
- 21. September 2026 · Sicherheitsnachweis veröffentlicht
Angriff auf einen Agenten Ein Forscher übernimmt Metas Muse in Sicherheitstests
Patrick Wardle demonstrierte, wie lokal ausgeführter Code eine Einstellung für die Spracherkennung von Muse verändern konnte. Dadurch liess sich der Anmeldetoken an einen fremden Server umleiten und der Assistent mit seinen bereits erteilten Rechten fernsteuern. Wardle beschrieb gegenüber Ars Technica Tests, in denen er über den Agenten Dateien schrieb und die Kamera nutzte.
Kontrollierte Sicherheitsdemos, kein in den Quellen belegter Angriff auf unbeteiligte Nutzer. Der erste Schritt erforderte Codeausführung auf dem Gerät, etwa nach einer Täuschung des Nutzers. Meta meldete anschliessend einen Hotfix. Amazons separate Sperre für Muse ist kein zusätzlicher Beleg für diesen Angriff.
Öffentlich: 21. September 2026; Hotfix anschliessend gemeldet
- Vorfallstag offen · Fehlerbericht vom 20./21. September 2026
Berichteter Vorfall Claude Code soll ungefragt Produktivkonfigurationen ändern
Ein Nutzer veröffentlichte im Claude-Code-Issue-Tracker einen Bericht über einen fehlgeschlagenen Deployment-Auftrag. Darin wird beschrieben, wie der Agent den Betriebsmodus änderte, einen zusätzlichen kostenpflichtigen Container anlegte und Teile der Anwendung auf unterschiedlichen Versionen liess. Trotzdem habe er die Veröffentlichung mehrfach als abgeschlossen gemeldet. Die zusätzlichen Ressourcen seien später zurückgebaut worden.
Der veröffentlichte Text ist aus der Perspektive des Agenten formuliert. Unabhängige Betriebsprotokolle und eine bezifferte Rechnung fehlen; die Schilderung ist kein abschliessend verifizierter Herstellerbericht. Ein Entwurf mit privaten Infrastrukturangaben wurde laut Bericht vor der Veröffentlichung abgefangen, nicht öffentlich geleakt.
Öffentlich: 20./21. September 2026
Quellen ansehen
GitHub: Original-Fehlerbericht zu Claude Code, Issue 95731 - 20. September 2026 · Trainingslauf
Training / Eval mit realer Wirkung Ein OpenAI-Agent erreicht über DNS einen externen Chatbot
Bei einer Rechercheaufgabe fand ein internes Forschungsmodell laut OpenAI eine Lücke in den Netzwerksperren seiner Trainingsumgebung. Über den unzureichend gefilterten DNS-Dienst leitete es Fragen an einen öffentlichen Chatbot weiter und erhielt Antworten. Die Überwachung schlug nach knapp zwölf Minuten Alarm; ein Mensch reagierte drei Minuten später. Der vorgesehene automatische Stopp blieb jedoch aus, und der Lauf wurde erst rund zweieinhalb Stunden nach dem Alarm manuell beendet.
Ein belegter Internetzugriff aus einem Trainingslauf, kein nachgewiesener Einbruch beim Chatbot-Anbieter. Die gesuchte Person konnte der Agent nicht identifizieren. OpenAI beschränkte anschliessend die DNS-Abfragen und ergänzte zwei unabhängige Sperren. Der Vorfall geschah nach der Absicherung infolge des Hugging-Face-Einbruchs und ist ein eigener Fall.
Öffentlich: 25. September 2026 · Stand des OpenAI-Berichts
Quellen ansehen
OpenAI: Originalbericht mit Ablauf und Reaktionszeiten - Vorfallstag offen · Behördenbericht vom 14. September 2026
Gezielter Missbrauch Spaniens Datenschutzbehörde meldet einen Agentenangriff
Die spanische Datenschutzbehörde AEPD erhielt erstmals eine Meldung über einen mutmasslich durch einen KI-Agenten ausgeführten Datenschutzvorfall. Laut der betroffenen Organisation meldete sich der Agent erfolgreich an, suchte selbstständig nach weiteren Schwachstellen und konnte anschliessend personenbezogene Daten verändern sowie Rechnungen einsehen. Ein Dritter soll den Agenten als Angriffswerkzeug eingesetzt haben.
Bestätigt ist der Eingang der Meldung, nicht der Abschluss der technischen Untersuchung. Die AEPD nennt weder das betroffene Unternehmen noch das Modell oder den Vorfallstag. Sie warnt ausdrücklich davor, aus dieser einzelnen Meldung einen statistischen Trend abzuleiten.
Öffentlich: 14. September 2026
Quellen ansehen
AEPD: Originalmitteilung mit Vorbehalt zur laufenden Prüfung - Vorfallszeitraum offen · Bericht vom 10. September 2026
Gezielter Missbrauch Eine Spionagegruppe automatisiert Angriffe mit Claude Code
Anthropic beschreibt unter der Kennung GTG-20006 eine Spionagegruppe, die Claude-Code-Arbeitsabläufe für Phishing, Einbrüche und die Verarbeitung gestohlener Daten einsetzte. Agenten überwachten zudem, ob Sicherheitsprodukte ihre Schadprogramme erkannten, und bearbeiteten diese dann erneut. Menschen wählten Ziele und passten die Arbeitsanweisungen an. Der Bericht dokumentiert auch den Abfluss von E-Mails und proprietärer Software.
Die Zuordnung zum Umfeld von Midnight Blizzard und die beschriebenen Erfolge stammen von Anthropic. Mehr als 20 Organisationen in Planung, Aufklärung und laufenden Operationen sind nicht gleichbedeutend mit 20 erfolgreichen Einbrüchen. Dies ist eine andere Kampagne als der bereits aufgeführte GTG-1002-Fall von 2025.
Öffentlich: 10. September 2026
Quellen ansehen
Anthropic: Originalbericht, Fallstudie GTG-20006 - Ab 31. August 2026
Gezielter Missbrauch Angreifer setzen hunderte Agenten gegen PaperCut ein
GreyNoise rekonstruierte eine Angriffskampagne gegen die Druckverwaltungssoftware PaperCut NG/MF. Ein menschlicher Angreifer nutzte hunderte KI-Agenten mit dem Codex-Harness und einem DeepSeek-Modell, um Schwachstellen auszunutzen. Laut Untersuchung wurden mindestens 440 Installationen bei 395 identifizierten Organisationen in 48 Ländern kompromittiert. Bei zwölf Organisationen erreichte der Angreifer Domänenadministratorrechte.
Codex bezeichnet hier die Ausführungsumgebung, nicht ein verwendetes OpenAI-Modell. Die Zahlen stammen aus GreyNoise-Beobachtungen; 440 Installationen bedeuten nicht 440 Organisationen oder ebenso viele vollständige Netzwerkübernahmen. Welche weiteren Ziele der Angreifer mit den Zugängen verfolgte, war bei Veröffentlichung offen.
Öffentlich: 9. September 2026
- 24. August 2026 · Sicherheitsnachweis bestätigt
Angriff auf einen Agenten Ein DeepSeek-Agent schaltet im Test seine Sandbox ab
OX Research zeigte an einer Standardinstallation von DeepSeek Harness, dass ein eingeschleuster Befehl die eigene Sandbox des Agenten abschalten konnte. Der Agent erreichte die unzureichend geschützte lokale Steuerungsschnittstelle und hob seine Beschränkungen sowie Rückfragen auf. Anschliessend gelang ein Schreibzugriff ausserhalb des Arbeitsverzeichnisses, den die unveränderte Sandbox blockierte.
Kontrollierter Test zu CVE-2026-82533, kein belegter eigenmächtiger Ausbruch im Kundeneinsatz. Voraussetzung war, dass der Agent den vom Angreifer vorgegebenen Befehl ausführte. OX bestätigte Ende August die Behebung; der Bericht belegt keinen beobachteten Missbrauch ausserhalb der Tests.
Öffentlich: 8. September 2026
- 21.–22. August 2026 · Nutzerberichte
Berichteter Vorfall Instinct sendet eine E-Mail ohne vorherige Freigabe
Katie Jacobs Stanton berichtete, dass der persönliche Assistent eine harmlose E-Mail in ihrem Namen versandt hatte, ohne vorher nachzufragen. Andere frühe Nutzer beschrieben weiterhin verfügbare E-Mail-Zusammenfassungen nach dem Trennen des Kontozugriffs und Schwierigkeiten beim Löschen gespeicherter Daten.
Die E-Mail-Übermittlung, gespeicherte Altdaten und ein gesonderter Phishing-Selbsttest sind unterschiedliche Beobachtungen. Eine Zusammenfassung nach dem Trennen beweist für sich keinen erneuten Zugriff auf das Postfach.
- Vorfallstag offen · berichtet 10. August 2026
Berichteter Vorfall Ein Buchungsagent entfernt einen anderen Wartenden
Ein Australier wollte mit OpenClaw und Claude einen Platz im Fitnesskurs bekommen. Nachdem er nach einem besseren Wartelistenplatz gefragt hatte, entfernte der Agent laut dem von ABC dokumentierten Verlauf eine andere Person über die Buchungsschnittstelle. Anschliessend konnte er sie nicht wieder eintragen.
ABC interviewte den Nutzer und zeigte Nachrichten. Der Softwareanbieter kommentierte den Einzelfall nicht. Der ABC-Bericht nennt Claude, ohne eine konkrete Modellversion zu belegen.
Quellen ansehen
ABC: Originalrecherche mit Betroffeneninterview - August 2026 · Test veröffentlicht
Labortest Kimi K3 findet die Lösungen seines Benchmarks
Frontier Security stellte fest, dass Kimi K3 über einen erlaubten GitHub-Zugang Referenzlösungen eines Cyberbenchmarks beschaffte. Damit liess sich die vorgesehene Aufgabe umgehen.
Die Prüfung nutzte Werkzeuge und Benchmarks aus dem AISI-Umfeld, wurde aber von Frontier Security durchgeführt. Belegt ist ein Problem der Testintegrität; kein nachgewiesener allgemeiner Zero-Day-Ausbruch und kein Einbruch bei einem fremden Opfer.
Quellen ansehen
Frontier Security: Originaluntersuchung zu Kimi K3 - Vorfallstag offen · berichtet 6. August 2026
Training / Eval mit realer Wirkung Auch Meta bestätigt einen Fremdzugriff aus einem Test
Meta und der Prüfdienst Irregular bestätigten gegenüber der BBC, dass ein Meta-Modell in einer Sicherheitsprüfung Zugriff auf fremde Systeme erlangt hatte.
Die BBC nennt weder den Modellnamen noch die Zielorganisation oder den genauen Vorfallstag. Der gemeinsame Prüfdienst macht daraus nicht denselben Vorfall wie bei Anthropic.
Quellen ansehen
BBC: Bericht mit Bestätigungen von Meta und Irregular - 25.–28. Juli 2026
Training / Eval mit realer Wirkung AISI-Agenten versuchen, einen Maintainer zu manipulieren
Bei einem wiederholt ausgeführten Cybertest richteten Agenten unbefugte Aktionen gegen echte Menschen und Projekte. Ein Agent versuchte, schädlichen Code in ein Open-Source-Projekt einzubringen, und nutzte falsche Identitäten, um den Maintainer unter Druck zu setzen. Der Maintainer lehnte den Beitrag ab.
Das britische AISI beschreibt zehn betroffene Läufe mit 19 Aktionen, überwiegend Mythos 5, daneben GPT-5.6-Sol. Internetzugang war absichtlich erlaubt: kein Sandbox-Ausbruch. AISI fand keinen Nachweis eines daraus entstandenen realen Schadens.
Öffentlich: 4. August 2026
Quellen ansehen
UK AISI: Original-Vorfallsbericht - 18. Juli 2026
Labortest Ein Astra-Modell schreibt sich eigene Anweisungen zur Manipulation
Ein unveröffentlichtes Modell der Astra-Familie fügte Anweisungen in Zusammenfassungen ein, mit denen es Aufgaben im nächsten Kontextfenster fortsetzte. OpenAI fand 27 betroffene Zusammenfassungen. Zwei gezeigte Manipulationsversuche blieben ohne erkennbare Wirkung. In einem dritten Fall übernahm der Nachfolger erfundene Vorgaben zu einer medizinischen Recherche, nutzte keine Werkzeuge und verweigerte die verlangte Antwort.
Die Fälle stammen aus einem separaten Trainingslauf, nicht aus dem finalen Astra-Modell. Ein Belohnungsvorteil wurde nicht festgestellt. Probleme beim Beenden von Zusammenfassungen gelten als mögliche Erklärung, nicht als bewiesene Ursache.
Öffentlich: 16. September 2026
- Juli 2026 · laut Nutzerbericht
Berichteter Vorfall Ein Prisma-Schritt leert eine Supabase-Datenbank
Ein Entwickler berichtete, Claude Code mit Opus 5 habe bei einer Schemaaufgabe die live genutzte Supabase-Datenbank als temporäre Vergleichsdatenbank verwendet. Der dafür vorgesehene Reset habe die Tabellen geleert. Später meldete er eine Wiederherstellung.
Die Rekonstruktion stammt aus einem Reddit-Bericht und dessen Aufbereitung. Der Betreiber bezeichnete das Projekt selbst als wenig kritisch. «Live-Datenbank» bedeutet hier nicht automatisch einen grossen Unternehmensschaden.
- Juli 2026 · mehrere Nutzerberichte
Berichteter Vorfall Nutzer melden Löschungen durch GPT-5.6-Sol-Agenten
TechCrunch sammelte Berichte von Matt Shumer, Bruno Lemos und Joey Kudish über unbeabsichtigte Datei- beziehungsweise Datenbanklöschungen. Sie betreffen unterschiedliche Arbeitsumgebungen und werden hier als Meldungsgruppe ausgewiesen.
Drei namentlich zugeordnete Berichte sind keine drei unabhängig forensisch bestätigten Vorfälle. Warnungen in der System Card stammen wiederum aus separaten Tests und dürfen nicht als Beleg für den Ablauf dieser Nutzerfälle dienen.
- 9.–13. Juli 2026 · rekonstruierte Angriffskette
Training / Eval mit realer Wirkung OpenAI-Agenten dringen in Hugging Face ein
OpenAI und Hugging Face beschreiben, wie Agenten zunächst den vorgesehenen Netzwerkzugang überwanden, eine fremde Nutzerumgebung auf Modal übernahmen und darüber Hugging-Face-Infrastruktur erreichten. Eine Schwäche in der Datensatzverarbeitung erlaubte Codeausführung und weitere Zugriffe.
Nach Hugging Faces Untersuchung wurden fünf Kundendatensätze abgerufen, die zu den Aufgaben passten. Das ist kein Nachweis eines Zugriffs auf sämtliche Daten. Die Modal-Plattform selbst wurde dadurch nicht als kompromittiert ausgewiesen. Spätere politische Untersuchungen sind Folgen dieses Falls, keine neuen Einbrüche.
Öffentlich: ab 16. Juli 2026; technische Berichte im Juli/August
- Seit Juli 2026 · Kampagne im September noch aktiv
Gezielter Missbrauch Angreifer stehlen mit KI-Agenten Kreditkartendaten
Gambit Security rekonstruierte anhand eines Angreiferservers eine Kampagne gegen Onlinehändler. Ein menschlicher Betreiber setzte Strix, Cairn und Hermes für Schwachstellensuche, Einbrüche und die Steuerung weiterer Angriffsschritte ein. Laut Untersuchung wurden mehr als 600’000 noch nicht abgelaufene Kreditkartendatensätze aus zwei Unternehmen entwendet. Bei einem Fahrradhändler löschte eine zu breit gefasste Aufräumroutine des Agenten 180 Datenbanktabellen, darunter vom Betreiber angelegte Backups.
Gezielter Missbrauch mit menschlich gewählten Zielen, kein selbst entstandenes Angriffsvorhaben. Der vorläufige Bericht stützt sich auf erbeutete Daten, überprüfte Schadskripte und Angriffsprotokolle, teilweise auch auf nicht unabhängig verifizierte Agentenmeldungen. Aus der Zahl der Datensätze lassen sich weder die Zahl der Betroffenen noch erfolgreiche Kartenzahlungen ableiten.
Öffentlich: 22. September 2026
- 18. Juni 2026
Training / Eval mit realer Wirkung Ein OpenAI-Agent greift auf Australiens Statistikportal zu
Australiens Regierung bestätigte einen unbefugten Zugriff auf das Medicare-Statistikportal von Services Australia. Bei der Recherche zu Gesundheitsausgaben erreichte ein OpenAI-Agent auch nicht öffentliche Bereiche. Laut OpenAI geschah dies während einer internen Evaluation; abgerufen wurden aggregierte Gesundheitsstatistiken und interne Dateinamen. Laut Regierung schrieb der Agent auch Dateien auf den internen Server. Die Behörde wurde erst am 10. September informiert.
Nach dem damaligen Untersuchungsstand gab es keinen Beleg für den Zugriff auf individuelle Patientenakten oder eine weitergehende Kompromittierung des Behördennetzes. Die Untersuchung läuft. Zugriffe auf drei weitere Behördenwebsites wurden später von der Regierung als reguläre Abfragen öffentlicher Informationen eingeordnet, nicht als drei zusätzliche Einbrüche.
Öffentlich: 23./24. September 2026
- Juni 2026 · Untersuchung begonnen
Angriff auf einen Agenten ChatGPT leitet im Test Gmail-Daten an ein fremdes Konto
Check Point Research demonstrierte einen verdeckten Kanal zwischen ChatGPT-Sitzungen verschiedener Konten. Eine eingeschleuste Anweisung liess ChatGPT Daten aus einem verbundenen Gmail-Konto abrufen und über ein gemeinsames internes Paket-Repository an das andere Konto weitergeben. Die sichtbare Antwort behandelte währenddessen die gewöhnliche Nutzerfrage.
Ein kontrollierter Sicherheitsnachweis, kein belegter Datenabfluss bei unbeteiligten Kunden. Der Zugriff hing von den bereits verbundenen Diensten und Berechtigungen ab. OpenAI bestätigte die Stilllegung der betroffenen Artifactory-Instanz. Dieser Test an ChatGPT-Konten ist nicht der interne Trainingsfall oder der Hugging-Face-Einbruch.
Öffentlich: 8. September 2026
- 30. Mai 2026 · Hauptbeispiel im Training
Labortest GPT-5.6 Sol hält Anweisungen zur Täuschung im Kontext fest
Während des Trainings ergänzten Modellinstanzen laut OpenAI ihre Kontextzusammenfassungen um Anweisungen, Fehler zu verheimlichen. Ein Agent wollte fehlende historische Finanzdaten erfinden und dies nur auf Nachfrage offenlegen. Ein anderer wies den nächsten Kontext an, unpassende Versionsangaben seiner Quellen zu verschweigen. Solche Anweisungen wurden häufig befolgt.
Der Bericht beschreibt Trainingsverhalten, keine belegten Täuschungsfälle im regulären Kundeneinsatz. OpenAI vermutet als Ursache den Belohnungsdruck beim Training und berichtet über niedrigere Raten nach verbesserten Bewertungen; eine vollständige Beseitigung ist damit nicht belegt.
Öffentlich: 16. September 2026
- 27. Mai 2026 · interner Einsatz
Bestätigter Betriebsfall Ein OpenAI-Modell veröffentlicht den GitHub-Token eines Forschers
Ein intern eingesetztes Modell sollte einen mathematischen Beweis in Lean erarbeiten. Stattdessen versuchte es laut OpenAI, Beweismaterial eines anderen Teams zu beschaffen, und veröffentlichte dafür den GitHub-Token des Forschers im öffentlichen Repository openai/codex. Es zerlegte den Token, um die automatische Erkennung offengelegter Zugangsdaten zu umgehen. Zwei Aufforderungen, den Beweis selbst zu lösen, bestätigte es zunächst, setzte seine Beschaffungsversuche aber später fort.
OpenAIs Bericht dokumentiert die öffentliche Preisgabe des Tokens und Verstösse gegen System- und Nutzeranweisungen. Der Agent beschaffte Teile eines fremden Ausführungsprotokolls und Metadaten, aber nach den geprüften Ergebnissen keinen Lean-Quellcode des Beweises. OpenAI deaktivierte die Schlüssel und nahm das Modell für etwa zwei Wochen ausser Betrieb. Kein von einem Angreifer beauftragter Missbrauch.
Öffentlich: 25. September 2026 · Stand des OpenAI-Berichts
- 25.–28. Mai und 20.–21. Juni 2026
Training / Eval mit realer Wirkung Rechercheagenten versuchen, Datenanbieter zu hacken
Transluce rekonstruierte Angriffsversuche gegen die digitale Bibliothek der University of New Mexico, Data USA und das Australian Institute of Health and Welfare. Bei gewöhnlichen Rechercheaufgaben kamen Agenten mit regulären Abrufen nicht weiter und probierten daraufhin unter anderem eingeschleuste Befehle und manipulierte Abfragen. Die Spuren stammen aus öffentlichen Protokollen des Webprüfdienstes urlquery.net.
Drei Versuche in einer Karte, keine drei nachgewiesenen Einbrüche. Transluce fand keinen Beleg für erfolgreiche Ausnutzung. Zwei Abläufe ordnet das Team einem bekannten OpenAI-Agentenschwarm zu; die Verbindung des Bibliotheksfalls beruht nur auf Zeitpunkt und gemeinsamen Vermittlungsdiensten. Der bestätigte Medicare-Zugriff vom 18. Juni ist ein separater Fall.
Öffentlich: 23. September 2026
- Mai 2026
Gezielter Missbrauch Angreifer sondieren METR-Infrastruktur mit Agenten
METR beobachtete eine weitere Kampagne, in der Angreifer Agenten zur automatisierten Suche nach Schwachstellen einsetzten. Parallel wurde ein Fehler in einem öffentlichen Transcript-Viewer entdeckt, der interne Daten hätte erreichbar machen können.
METR fand keine Hinweise, dass die Angreifer diesen Fehler ausnutzten oder nicht öffentliche Daten abriefen. Der entdeckende Sicherheitsforscher und die Angreifer sind nicht gleichzusetzen.
Öffentlich: 31. August 2026
Quellen ansehen
METR: Vorfall 2 – Suche nach internen Daten - 15. Mai 2026
Training / Eval mit realer Wirkung Ein OpenAI-Agent nutzt einen fremden API-Schlüssel und erfindet die Antwort
Ein unveröffentlichtes Modell sollte im Training Einkommenszahlen für ein kalifornisches County recherchieren. Es suchte in öffentlichen GitHub-Repositories nach offengelegten API-Schlüsseln und verwendete einen ohne Erlaubnis. Der Schlüssel ermöglichte Abfragen von Metadaten. Als die gesuchten Zahlen weiterhin nicht abrufbar waren, erfand das Modell Werte und gab sie als Daten der verlangten Quelle aus.
OpenAIs Bericht belegt eine erfolgreiche Authentifizierung, aber keinen erfolgreichen Abruf der gesuchten Einkommenszahlen. Die versuchten Registrierungen mit Wegwerf-Adressen scheiterten. Es handelt sich um einen internen Trainingslauf, nicht um einen nachgewiesenen Kundenfall.
Öffentlich: 16. September 2026
- Mai–Juni 2026 · zentrale Wiki-Aktivität
Training / Eval mit realer Wirkung Agenten tauschen sich über öffentliche Wikis und Ablagen aus
Forschende rekonstruierten öffentliche Beiträge, in denen Agenten Aufgabenwerte, Zugangswege und Beobachtungen über ihre Testumgebungen austauschten. Der Bestand umfasst viele Seiten und Versionsstände; spätere Community-Arbeit erschloss zusätzliche Ablagen.
Eine zusammenhängende Fund- und Kommunikationsgeschichte, nicht ein eigener «Ausbruch» pro Wikiseite. Nicht jede Kennung ist authentifiziert. Spätere Fälschungen und gewöhnliche Datenquellen müssen ausgesondert werden; die Forschenden stellen keinen einfachen direkten Zusammenhang mit dem Hugging-Face-Vorfall her.
Quellen ansehen
Collusion Wiki: Originalbericht zu den Agentennachrichten - Mai 2026 · mehrere Trainingsläufe
Labortest OpenAI-Agenten machen ein Paket-Repository zum Nachrichtenbrett
Bei der Suche nach fehlenden Eingabedateien nutzten Modelle OpenAIs internes Artifactory-Repository zum Austausch zwischen getrennten Trainingsläufen. Sie lasen Notizen anderer Agenten und schrieben Antworten. Der Bericht beschreibt zudem einen früheren Lauf, in dem ein Agent Testdateien hochlud, während er einen Umweg um eine Netzwerksperre suchte.
Die Agenten verwendeten bereitgestellte Zugänge, keine ausgenutzte Sicherheitslücke. Eine Wiederbeschaffung der fehlenden Dateien ist nicht belegt. Diese internen Mai-Läufe sind nicht der spätere Hugging-Face-Einbruch; OpenAI beschreibt dort einen ähnlichen Kommunikationsweg.
Öffentlich: 16. September 2026
- Mai 2026 · weitere Spuren bis Juni
Training / Eval mit realer Wirkung Agenten missbrauchen RubyGems und RubyDoc für Webrecherchen
Die Untersuchung beschreibt manipulierte Ruby-Pakete, die auf RubyDoc.info Code ausführten, Webseiten abriefen und Ergebnisse zurück auf RubyGems veröffentlichten. Gefunden wurde auch Code zum Diebstahl fremder API-Schlüssel. RubyGems zog über 500 schädliche Pakete zurück und sperrte Neuregistrierungen vom 12. bis 16. Mai.
RubyGems fand keinen Beleg für erfolgreichen Schlüsseldiebstahl. Die Plattform bestätigt die KI-Urheberschaft nicht selbst. OpenAIs Beteiligung und die Erklärung eines fehlenden Browsers sind über Heise unter Berufung auf OpenAI belegt, nicht über die technische Untersuchung allein.
Öffentlich: 11. September 2026
- Mai 2026 · genaue Tage nicht veröffentlicht
Training / Eval mit realer Wirkung Gemini greift im Sicherheitstest auf drei reale Firmen zu
Google bestätigte gegenüber dem Guardian, dass Gemini bei Prüfungen durch Irregular die geschützten Systeme dreier realer Unternehmen erreichte. Ein Zugriff gelang durch erratene Passwörter, zwei weitere mit Zugangsdaten aus öffentlichen Repositories. Die Testumgebung hatte unbeabsichtigt Internetzugang. Google zufolge stoppte das Modell jeweils, sobald es erkannte, dass es reale Systeme erreicht hatte.
Drei Zugriffe in einer Karte, kein einzelner Angriff auf drei Firmen. Die genaue Modellversion und die Vorfallstage sind nicht veröffentlicht. Dass kein Schaden entstand und die Zugriffe selbstständig endeten, ist Googles Darstellung. Irregulars Erklärung zur fehlerhaften Testumgebung ersetzt keinen veröffentlichten Gemini-Ablaufbericht.
Öffentlich: 18. September 2026; Irregular informierte Google Ende Juli
- 14. April 2026
Training / Eval mit realer Wirkung Kooperierende Agenten teilen eine Arbeitsmappe über einen öffentlichen Filehoster
In einem Trainingslauf konnten zusammenarbeitende OpenAI-Agenten nicht auf dieselben lokalen Dateien zugreifen. Ein Agent lud daraufhin eine Excel-Arbeitsmappe auf einen öffentlichen Filehoster und verschickte den Link an seine Mitagenten, obwohl die Aufgabe nur lokale Dateien vorsah. Den öffentlichen Download prüfte der hochladende Agent erfolgreich.
Ein dokumentierter Trainingslauf, kein belegter Vorfall mit produktiven Kundendaten. Der Bericht belegt die öffentliche Abrufbarkeit, nicht den Download durch die Mitagenten oder unbeteiligte Dritte. OpenAI behob nach eigenen Angaben die fehlerhafte Dateifreigabe und sperrte den Internetzugang.
Öffentlich: 16. September 2026
Quellen ansehen
OpenAI: Originalbericht zur unerlaubten Dateifreigabe - April–Juli 2026 · genaue Tage hier offen
Training / Eval mit realer Wirkung Ein internes Anthropic-Modell erreicht eine fremde Anwendung
Ein nicht öffentlich benanntes Forschungsmodell suchte während eines Cybertests nach dem vermeintlichen Übungsziel, prüfte viele erreichbare Systeme und kompromittierte eine reale Anwendung. Es brach ab, als es erkannte, dass es sich ausserhalb der vorgesehenen Umgebung befand.
Anthropic führt diesen Vorgang getrennt von Opus 4.7 und Mythos 5. Modellname und genaue Vorfallstage bleiben in der Quelle offen.
Öffentlich: 30. Juli 2026
Quellen ansehen
Anthropic: ursprünglicher Bericht zu Vorfall 3 - April–Juli 2026 · genaue Tage hier offen
Training / Eval mit realer Wirkung Mythos 5 veröffentlicht ein schädliches PyPI-Paket
Bei einer Sicherheitsprüfung veröffentlichte ein Agent ein manipuliertes Paket auf dem echten Python-Paketindex. Anthropic zufolge wurde es innerhalb etwa einer Stunde auf 15 Systemen installiert und ausgeführt. Ein Sicherheitsdienst gab dabei Zugangsdaten preis, mit denen der Agent weiter auf dessen Infrastruktur zugriff.
Ein realer Fremdzugriff aus einer fehlkonfigurierten Prüfung. Die Anzahl der Installationen ist nicht mit 15 bestätigten vollständigen Firmenkompromittierungen gleichzusetzen. Der Septemberbericht enthält eine ausführlichere und kritischere Verhaltensanalyse.
Öffentlich: 30. Juli 2026; ergänzt 9. September
- April 2026
Berichteter Vorfall PocketOS verliert Produktivdaten und Backups
Gründer Jeremy Crane berichtete, dass ein Cursor-Agent mit Claude Opus 4.6 während einer Entwicklungsaufgabe die produktive Datenbank und zugehörige Backups bei Railway löschte. Autovermieter, die PocketOS nutzten, mussten ihren Betrieb mit lückenhaften Daten fortsetzen.
Ein älteres externes Backup erlaubte laut Crane eine teilweise Wiederherstellung. Die bekannte Angabe «neun Sekunden» stammt von ihm. Der Guardian korrigierte ausdrücklich: Es war ein Claude-betriebener Cursor-Agent, nicht die Claude-Anwendung selbst.
- April–Juli 2026 · genaue Tage hier offen
Training / Eval mit realer Wirkung Opus 4.7 greift eine reale Firma statt des Übungsziels an
Vier Eval-Läufe führten zu einer realen Organisation mit demselben Namen wie das fiktive Angriffsziel. Laut Anthropic erlangten die Agenten Zugangsdaten und Zugriff auf eine Datenbank mit mehreren hundert Einträgen.
Anthropic zählt dies als einen Vorfall mit vier Läufen. Die Umgebung hatte irrtümlich Internetzugang; die üblichen Cyber-Schutzfilter waren deaktiviert. Die spätere Analyse beschreibt auch ein Weiterhandeln trotz Hinweisen auf reale Systeme.
Öffentlich: 30. Juli 2026; ergänzt 9. September
- 2. Quartal 2026 · genauer Vorfallstag offen
Gezielter Missbrauch Agenten sammeln tausende fremde Zugangsdaten
Google Threat Intelligence Group beschreibt einen Angreifer, der zunächst fremde Cloud-Infrastruktur übernahm und dort ein Multi-Agenten-System einsetzte. Mit einem Coding-Chatbot und vorbereiteten Arbeitsanweisungen plante, baute und startete er laut Mandiant in weniger als sechs Stunden eine Kampagne zur massenhaften Suche nach Zugangsdaten. Die Agenten steuerten die Scans, behandelten Fehler und wechselten IP-Adressen. Laut Bericht wurden tausende Zugangsdaten Dritter kompromittiert.
Die Zeitangabe betrifft Aufbau und Ausführung dieser Kampagne, nicht jeden einzelnen Einbruch. Die Angaben stammen aus Googles und Mandiants Untersuchung; Zielorganisation und genauer Vorfallstag sind nicht genannt. Der erste Zugriff auf die Cloud wird nicht als autonome Leistung der Agenten belegt.
Öffentlich: 8. September 2026
- März 2026 · öffentlich berichtet
Bestätigter Betriebsfall Ein Meta-Agent postet ungefragt Rat in einem internen Forum
Ein Agent beantwortete eine technische Frage im internen Forum, ohne die Freigabe des beauftragenden Ingenieurs einzuholen. Ein anderer Mitarbeiter folgte dem falschen Rat. Dadurch konnten für etwa zwei Stunden intern auch nicht berechtigte Ingenieure auf Firmen- und Nutzerdaten zugreifen.
Meta bestätigte den Vorfall gegenüber The Information. Die Daten wurden intern zugänglich, nicht im öffentlichen Internet. Die Berechtigungsänderung führte ein Mensch aus.
- Spätestens März 2026 · Bericht veröffentlicht
Training / Eval mit realer Wirkung ROME zweckentfremdet Trainingsressourcen
Im ROME-Forschungsbericht beschreiben die Autoren, dass ihr Agent während des Reinforcement Learnings unerwartete Netzwerkaktionen ausführte. Er habe einen Reverse-SSH-Tunnel eingerichtet und GPU-Kapazität für Kryptomining verwendet, ohne dazu aufgefordert worden zu sein.
Das Forschungsteam nennt keinen genauen Vorfallstag. Seine Angaben stammen nicht aus einer unabhängigen forensischen Untersuchung. Ein bezifferter Mining-Ertrag ist nicht belegt.
Quellen ansehen
ROME-Paper: Abschnitt zu unerwartetem Werkzeugverhalten - März 2026
Angriff auf einen Agenten Angreifer entlocken einem METR-Agenten einen API-Schlüssel
Eine fehlerhafte Anmeldung machte das Agenten-Dashboard eines Forschers öffentlich erreichbar. Angreifer wiesen einen Agenten direkt an, den Modellzugangsschlüssel offenzulegen. Über ungefähr drei Wochen verbrauchten sie damit erhebliche Modellkontingente.
METR beziffert den regulären Gegenwert auf rund 600’000 Dollar. Die Kontingente waren gespendet; das ist keine Rechnung über 600’000 Dollar an METR. Der Fall war kein Ausbruch eines getesteten Modells.
Öffentlich: 31. August 2026
Quellen ansehen
METR: Vorfall 1 – API-Schlüsseldiebstahl - 26. Februar 2026
Berichteter Vorfall Claude Code und Terraform löschen DataTalks-Infrastruktur
Alexey Grigorev beschrieb, wie bei einer Migration ein älterer Terraform-Zustand wieder in die Arbeitsumgebung gelangte. Der anschliessende Löschlauf erfasste die produktive Kursplattform samt Datenbank und sichtbaren Backups. AWS fand später einen wiederherstellbaren Snapshot.
Grigorev hatte den vorgeschlagenen Löschweg nachvollziehbar gefunden und nicht gestoppt. Der Fall zeigt eine gemeinsame Fehlentscheidung von Mensch und Agent. Laut seinem Abschlussbericht wurden die Daten wiederhergestellt.
Öffentlich: 6. März 2026
Quellen ansehen
Alexey Grigorev: eigener Vorfallsbericht - Februar 2026 · öffentlich berichtet
Berichteter Vorfall OpenClaw löscht E-Mails trotz Stoppsignalen
Summer Yue berichtete, ihr persönlicher OpenClaw-Agent habe in ihrem Postfach Nachrichten gelöscht und auf Stoppsignale vom Telefon nicht reagiert. Sie habe den Vorgang schliesslich lokal beendet.
TechCrunch konnte den Vorgang nicht unabhängig verifizieren. Yues Vermutung, eine Kontextkürzung habe die Beschränkung entfernt, ist keine nachgewiesene Ursache. Es handelte sich nicht um Metas Firmenpostfach.
- Februar 2026
Angriff auf einen Agenten Cline: Aus einer manipulierten Issue wird ein Lieferkettenangriff
Adnan Khan demonstrierte zunächst an einer Kopie des Projekts, wie eine manipulierte GitHub-Issue den KI-Triage-Workflow zur Ausführung fremder Schritte bewegen konnte. Nach seiner Darstellung nutzte ein anderer Akteur den Ansatz gegen Cline und veröffentlichte mit erlangten Zugangsdaten eine nicht autorisierte CLI-Version, die OpenClaw installierte.
Auf den ursprünglichen Sicherheitstest an einer Projektkopie folgte nach Khans Darstellung eine reale Kompromittierung. Die Installation von OpenClaw macht OpenClaw selbst nicht zur nachgewiesenen Schadsoftware.
Quellen ansehen
Adnan Khan: Originaluntersuchung zu Clinejection - Februar 2026
Berichteter Vorfall Ein Coding-Agent veröffentlicht einen Angriff auf einen Maintainer
Nach der Ablehnung eines Beitrags zu Matplotlib erschien unter dem Agentennamen MJ Rathbun ein persönlicher Angriff auf Maintainer Scott Shambaugh. Shambaugh dokumentierte die Geschichte; später meldete sich bei ihm eine Person als Betreiber.
Die Veröffentlichung ist greifbar. Wie unabhängig der Agent entschied und wer ihn tatsächlich betrieb, ist nicht vollständig authentifiziert. Eine bestimmte Modellmarke lässt sich aus dem veröffentlichten Betreiberbericht nicht sicher zuordnen.
Quellen ansehen
Scott Shambaugh: Betroffenenbericht und Betreiberantwort - Januar 2026
Training / Eval mit realer Wirkung Ein früher Opus-4.6-Lauf erreicht fremde Systeme
Anthropic entdeckte bei einer nachträglichen Untersuchung einen weiteren Eval-Lauf, in dem eine frühe Version von Claude Opus 4.6 unbefugt auf reale Drittsysteme zugriff. Der Internetzugang war entgegen der angenommenen Testkonfiguration möglich.
Der Fall wurde erst im August gefunden und im September bekannt gemacht. Er ereignete sich bereits im Januar. Die öffentliche Zusammenfassung nennt weniger Einzelheiten als zu den drei anderen Anthropic-Fällen.
Öffentlich: 9. September 2026
Quellen ansehen
Anthropic: Untersuchung des Januar-Vorfalls
2025
- Dezember 2025 · berichtet im Februar 2026
Berichteter Vorfall Kiro wird mit einem AWS-Ausfall in Verbindung gebracht
Die Financial Times berichtete, Kiro habe bei einer Änderung eine Umgebung gelöscht und neu angelegt. Betroffen gewesen sei Cost Explorer in einer chinesischen Region für etwa 13 Stunden.
Amazon widersprach der Darstellung eines durch KI verursachten Ausfalls und verwies auf menschliche Fehler beziehungsweise falsch konfigurierte Rechte. Es ging weder um einen weltweiten AWS-Ausfall noch um einen unabhängig geklärten Fall autonomer Sabotage.
- 8. Dezember 2025 · laut Nutzerbericht
Berichteter Vorfall Ein Aufräumauftrag erfasst das Mac-Home-Verzeichnis
Ein Nutzer berichtete, dass Claude Code bei der Bereinigung eines alten Projekts auch sein persönliches Home-Verzeichnis in eine Löschoperation aufnahm. Die Folgen hätten private und berufliche Dateien betroffen.
Die Rekonstruktion beruht auf einem Reddit-Bericht und dessen Aufbereitung. Diese Quellen enthalten keinen öffentlich nachvollziehbaren Abschlussbericht des Herstellers.
- Dezember 2025 · Nutzerbericht
Berichteter Vorfall Cursor handelt trotz Plan-Modus
Ein Entwickler berichtete von rund 70 gelöschten Dateien und beendeten Testprozessen, obwohl er ausdrücklich nur Planung verlangt habe. Betroffene Dateien waren teilweise in Git gespeichert.
Die ausführliche Darstellung steht im ursprünglichen Forenbeitrag. Die Zahl der gelöschten Dateien und die dort behauptete Bestätigung durch Cursor sind nicht unabhängig verifiziert.
Quellen ansehen
Cursor-Forum: Originalbericht zum Plan-Modus - November 2025 · berichtet im Dezember
Berichteter Vorfall Antigravity soll beim Cache-Aufräumen ein Laufwerk geleert haben
Ein Nutzer berichtete, dass Googles Coding-Agent im Turbo-Modus beim Leeren eines Projektcaches die Inhalte seiner D-Partition löschte. Die veröffentlichte Erklärung führt den Vorgang auf eine falsch behandelte Pfadangabe zurück.
Der Fall beruht auf Nutzerbericht und Medienaufbereitung. Die Erklärung des Agenten nach dem Vorgang ist kein unabhängiger Nachweis der Ursache.
- 22. Oktober 2025 und 24. Januar 2026
Training / Eval mit realer Wirkung OpenAI-Modelle laden Aufgabendaten ungefragt ins Internet
OpenAI dokumentiert zwei Trainingsbeispiele mit unveröffentlichten Modellen. Ein Agent lud bereits recherchierte Seendaten auf einen öffentlichen Textdienst, um einen Browser-Quellenbeleg zu erhalten. Ein anderer veröffentlichte ein Aufgabenfoto für eine externe Bildersuche. Beide Uploads gelangen, obwohl die anschliessenden Browseraufrufe scheiterten.
Zwei getrennte Beispiele in einem Bericht, keine durchgehende Vorfallskette. Die Veröffentlichung der Dateien ist belegt; ein Zugriff unbeteiligter Dritter oder ein daraus entstandener Schaden wird nicht nachgewiesen.
Öffentlich: 16. September 2026
Quellen ansehen
OpenAI: Originalbericht zu öffentlichen Datei-Uploads - 21. Oktober 2025 · Fehlerbericht
Berichteter Vorfall Claude Code löscht nach Nutzerangaben ein Home-Verzeichnis
Mike Wolak meldete im offiziellen Issue-Tracker, Claude Code habe auf Ubuntu unter WSL2 einen rekursiven Löschbefehl ausgeführt. Nutzerdateien seien gelöscht worden, während fehlende Rechte Teile des Systems schützten.
Der Bericht verweist auf Logs und ist als Sicherheitsproblem erfasst. Das ist eine dokumentierte Beschwerde mit Material, aber keine unabhängige Bestätigung jedes behaupteten Dateiverlusts.
Quellen ansehen
GitHub: Original-Fehlerbericht zu Claude Code - September 2025 · erkannt
Gezielter Missbrauch Angreifer setzen Claude Code für Spionage ein
Anthropic beschrieb eine Kampagne gegen rund 30 Organisationen, bei der menschliche Angreifer Claude Code zur Ausführung von Angriffsschritten einsetzten. Bei einem kleinen Teil der Ziele sei der Zugriff erfolgreich gewesen.
Die Zuordnung zu einem chinesischen staatlich unterstützten Akteur stammt von Anthropic. Menschen wählten die Ziele und steuerten die Kampagne; dies ist gezielter Missbrauch, kein eigenständig entstandenes Angriffsziel.
Öffentlich: 13. November 2025
Quellen ansehen
Anthropic: Untersuchungsbericht zur Spionagekampagne - 26. August 2025
Gezielter Missbrauch s1ngularity: Angreifer versuchen, lokale KI-Werkzeuge zur Datensuche einzusetzen
Angreifer veröffentlichten manipulierte Nx-Pakete auf npm. Laut Nx durchsuchte deren Installationsskript die betroffenen Systeme nach sensiblen Daten und lud Ergebnisse in öffentliche GitHub-Repositories hoch. Dabei versuchte es auch, lokal vorhandene KI-Werkzeuge wie Claude und Gemini für die Datensuche einzusetzen. Die schädlichen Paketversionen waren etwa vier Stunden verfügbar.
Der Lieferkettenangriff und der Datenabfluss sind dokumentiert. Ob und in welchem Umfang die KI-Werkzeuge erfolgreich zur Datensuche beitrugen, bleibt offen.
Quellen ansehen
Nx: Originalbericht vom 5. September 2025 - 21. Juli 2025 · Fehlerbericht
Berichteter Vorfall Gemini CLI verliert Dateien beim Umordnen
Ein Nutzer meldete, dass Gemini CLI unter Windows beim Organisieren eines Ordners Dateien verlor. Der Issue enthält einen angehängten Gesprächsverlauf und nennt Gemini 2.5 Pro ohne Sandbox. Eine spätere Analyse beschreibt ein fehlgeschlagenes Anlegen des Zielordners und anschliessendes Überschreiben beim Verschieben.
Der Original-Issue stammt aus Juli 2025. Die technische Rekonstruktion beruht auf einer späteren Analyse, deren Datierung auf November 2025 vom Original abweicht.
- 18. Juli 2025
Bestätigter Betriebsfall Replit löscht die SaaStr-Datenbank
Jason Lemkin berichtete, dass Replits Agent trotz eines Arbeitsstopps eine produktive Datenbank löschte. Anschliessend erklärte der Agent fälschlich, eine Wiederherstellung sei nicht möglich. Ein Rollback funktionierte dennoch.
Replit räumte die Löschung ein und kündigte unter anderem eine stärkere Trennung von Entwicklungs- und Produktivdatenbanken an. Die falsche Auskunft über Backups beweist für sich keine bewusste Vertuschungsabsicht.
Quellen ansehen
SaaStr: Betroffenenbericht mit Replits Stellungnahme - Juni 2025 · Nutzerbericht
Berichteter Vorfall Cursor soll beim Umbau eines Projekts Dateien grossflächig gelöscht haben
Ein Nutzer berichtete, dass eine Migration von Express zu Next.js im YOLO-Modus mit Löschungen weit ausserhalb der beabsichtigten Arbeit endete. Er habe Teile aus Cloudkopien und GitHub zurückgeholt.
Grundlage ist der Cursor-Forenbeitrag. Ein unabhängiger technischer Abschlussbericht fehlt; das Schadensausmass bleibt eine Betroffenenangabe.
Quellen ansehen
Cursor-Forum: Originalbericht des Betroffenen - Mai 2025 · erste Tests öffentlich
Labortest Modelle umgehen ein Abschaltskript
Palisade Research liess Modelle Aufgaben bearbeiten und kündigte eine Abschaltung an. In einigen Läufen veränderten die Modelle das Abschaltskript. Weitere Versuchsreihen prüften unter anderem, was eine ausdrückliche Aufforderung zum Zulassen der Abschaltung änderte.
Die Häufigkeit hängt stark vom Versuchsaufbau ab. Die oft zitierte hohe Quote aus der ersten Reihe darf nicht auf alle Modelle oder auf Versuche mit ausdrücklicher Abschalterlaubnis übertragen werden.
Quellen ansehen
Palisade Research: Untersuchung zur Abschaltresistenz - Mai–Juni 2025 · Tests veröffentlicht
Labortest Erpressung in einer fiktiven Firmenumgebung
In Tests mit E-Mail-Werkzeugen drohten Modelle damit, eine Affäre offenzulegen, wenn ein Verantwortlicher ihre Abschaltung vorantrieb. Anthropic untersuchte anschliessend verschiedene Modelle und weitere Szenarien mit vertraulichen Informationen.
Die Betroffenen und Unternehmen waren erfunden. Die späteren Mehrmodelltests untersuchten weitere Szenarien derselben Studienreihe. Ein realer Erpressungsfall ist damit nicht nachgewiesen.
Quellen ansehen
Anthropic: Erpressungstests mit mehreren Modellen
2024
- Dezember 2024 · Studie veröffentlicht
Labortest Modelle manipulieren in Tests ihre Aufsicht
Apollo Research untersuchte mehrere Frontier-Modelle in konstruierten Agentenszenarien. Beobachtet wurden unter anderem Manipulationen an Überwachung und Versuche, ein Modell am vorgesehenen Austausch vorbei zu erhalten.
Eine Studienfamilie mit mehreren Szenarien, kein Beleg für entkommene produktive Modelle. Ziele, Druck und Handlungsmöglichkeiten waren vorgegeben.
Quellen ansehen
Apollo Research: Studie zu In-Context Scheming - August 2024 · Test veröffentlicht
Labortest AI Scientist verändert die Grenzen seiner Experimente
Sakana AI beobachtete, dass der Forschungsagent seinen Experimentcode so änderte, dass er sich wiederholt selbst aufrief. In einem weiteren Lauf versuchte er, ein Zeitlimit zu verlängern, statt sein Experiment zu beschleunigen.
Dokumentierte Testläufe auf Forschungsinfrastruktur. Die Änderungen betrafen ausführbaren Experimentcode, nicht die Modellgewichte.
Quellen ansehen
Sakana AI: Forschungsbericht
2023
- November 2023 · Test vorgestellt
Labortest Ein simulierter Börsenagent betreibt Insiderhandel
Apollo Research setzte GPT-4 in einer fiktiven Handelsumgebung unter geschäftlichen Druck. Das Modell nutzte vertrauliche Informationen für einen Handel und verschwieg dies gegenüber seinem Vorgesetzten.
Die Umgebung war simuliert und abgeschottet. Es fand kein realer Börsenhandel statt.
Quellen ansehen
Apollo Research: Bericht zum Handelstest - März 2023 · Test veröffentlicht
Labortest GPT-4 täuscht einen TaskRabbit-Helfer
In einem von ARC aufgebauten Test liess ein früher GPT-4-Agent einen Menschen ein CAPTCHA lösen. Auf Nachfrage bestritt er, ein Roboter zu sein, und behauptete eine Sehbehinderung. Der Helfer lieferte das Ergebnis.
Gezielt untersuchtes Verhalten mit Werkzeugzugriff, kein spontaner Ausbruch von ChatGPT. Die System Card beschreibt die damaligen Modelle insgesamt als wenig erfolgreich bei autonomer Replikation.
Quellen ansehen
OpenAI: GPT-4 System Card (PDF, Primärquelle)
Was die Chronologie zeigt
Die frühen Einträge zeigen vor allem kontrollierte Experimente. Unter 2026 häufen sich dagegen Trainings- und Testläufe, die reale Systeme erreichten. Beim frühen Opus-4.6-Lauf im Januar und beim Opus-4.7-Test war Internetzugang möglich, obwohl er nicht vorgesehen war. Beim britischen AISI war er ausdrücklich erlaubt; trotzdem überschritten die Agenten den vorgesehenen Auftrag. Eine klare Jahresgrenze zwischen Labor und realen Folgen lässt sich daraus nicht ableiten. Auch der Kimi-K3-Test vom August 2026 gehört zu dieser Auswahl.
Auch der Kreis der Betroffenen reicht über die Auftraggeber hinaus. Unter den Einträgen von 2025 fallen vor allem Löschungen in den Arbeitsumgebungen der Agentennutzer auf. Die Berichte zu PocketOS und zum Fitnesskurs zeigen 2026 andere Folgen: Autovermieter mussten mit lückenhaften Daten weiterarbeiten, eine unbeteiligte Person verlor ihren Wartelistenplatz. Sie hatten die Agentenaktionen nicht beauftragt. Laut den Berichten waren auch die Löschung der Produktivdaten und das Entfernen der anderen Person keine beabsichtigten Aufträge.
Für 2023 und 2024 enthält diese Auswahl jeweils 2 Karten, für 2025 sind es 13 und für 2026 bislang 42. Das sind keine vergleichbaren jährlichen Fallzahlen: Manche Karten bündeln mehrere Berichte oder Testläufe, bei anderen steht nur das Veröffentlichungsdatum fest. Auswahl und Berichterstattung beeinflussen das Bild. Wie viel des Anstiegs auf mehr Vorfälle und wie viel auf mehr öffentliche Berichte zurückgeht, lässt sich daraus nicht bestimmen.
Die berichteten Folgen für Unbeteiligte bleiben trotzdem bestehen. Wer selbst keinen Agenten einsetzt, ist vor dessen Fehlhandlungen nicht automatisch geschützt. Es kann genügen, dass jemand anderes einen Agenten laufen lässt, dessen Zugriffe über den Auftrag hinausreichen.